← voltar para vagas

pleno em machine learning - inferência

@ INFERACT · ·REMOTO · REMOTO (MUNDIAL)

Sobre a vaga

Buscamos um(a) engenheiro(a) de Machine Learning de nível pleno para atuar na otimização e desenvolvimento de sistemas de inferência para grandes modelos de linguagem. Você fará parte de um time especializado em performance e escalabilidade.

Responsabilidades

  • Desenvolver e otimizar pipelines de inferência para LLMs utilizando ferramentas como vLLM, TensorRT-LLM e SGLang.
  • Implementar técnicas de quantização e pruning para reduzir latência e custos.
  • Colaborar com a equipe de pesquisa para integrar novos modelos ao ambiente de produção.
  • Monitorar e melhorar a estabilidade e eficiência dos sistemas de inferência.

Requisitos

  • Experiência em Python e PyTorch.
  • Conhecimento em frameworks de inferência como vLLM, TensorRT-LLM, TGI ou similares.
  • Familiaridade com técnicas de aceleração de inferência (quantização, batching, atenção otimizada).
  • Capacidade de trabalhar em ambiente remoto e global.

Diferenciais

  • Experiência com verl, OpenRLHF, Unsloth ou LlamaFactory.
  • Contribuições para projetos open source na área de inferência.
  • Conhecimento em CUDA ou otimização em GPU.

Benefícios

  • Salário competitivo em dólar.
  • Ferramentas e equipamentos de trabalho.
  • Cultura de trabalho remoto assíncrono.
  • Oportunidades de crescimento e aprendizado.
§

>> antes de aplicar