← voltar para vagas

pleno em engenharia de software - open source e avaliação swe-bench

@ ANYONE AI · ·REMOTO · BUENOS AIRES, URUGUAI, SANTIAGO, QUITO, LISBOA, CIDADE DO MÉXICO, BOGOTÁ, MADRID OU SÃO PAULO

Sobre a vaga

Buscamos uma pessoa engenheira de software pleno para se juntar ao time e contribuir com projetos open source, focando na avaliação e melhoria de agentes de IA no benchmark SWE-Bench. O trabalho é totalmente remoto, com time distribuído.

Responsabilidades

  • Desenvolver e manter ferramentas e scripts em Python para avaliação de modelos de linguagem no SWE-Bench.
  • Contribuir com projetos open source (como SymPy, matplotlib, requests) para gerar dados de avaliação.
  • Criar e gerenciar pipelines CI/CD usando Docker e GitHub Actions.
  • Analisar métricas de desempenho de agentes e propor melhorias.
  • Colaborar com o time de pesquisa para refinar benchmarks e metodologias.

Requisitos

  • Experiência sólida em Python (Django ou Flask, pytest, scikit-learn).
  • Familiaridade com Git e GitHub para desenvolvimento open source.
  • Conhecimento em Docker e práticas de CI/CD.
  • Inglês técnico para leitura e escrita de documentação.
  • Capacidade de trabalhar de forma autônoma e remota.

Diferenciais

  • Experiência com avaliação de modelos de linguagem (RLHF, benchmarks).
  • Contribuições anteriores em projetos open source.
  • Conhecimento em ferramentas como conda, pip e SymPy.

Benefícios

  • Trabalho 100% remoto.
  • Horário flexível.
  • Salário compatível com o mercado.
  • Oportunidade de contribuir com projetos open source relevantes.
§

>> antes de aplicar