← voltar para vagas
pleno em machine learning - inferência
Sobre a vaga
Buscamos um(a) engenheiro(a) de Machine Learning de nível pleno para atuar na otimização e desenvolvimento de sistemas de inferência para grandes modelos de linguagem. Você fará parte de um time especializado em performance e escalabilidade.
Responsabilidades
- Desenvolver e otimizar pipelines de inferência para LLMs utilizando ferramentas como vLLM, TensorRT-LLM e SGLang.
- Implementar técnicas de quantização e pruning para reduzir latência e custos.
- Colaborar com a equipe de pesquisa para integrar novos modelos ao ambiente de produção.
- Monitorar e melhorar a estabilidade e eficiência dos sistemas de inferência.
Requisitos
- Experiência em Python e PyTorch.
- Conhecimento em frameworks de inferência como vLLM, TensorRT-LLM, TGI ou similares.
- Familiaridade com técnicas de aceleração de inferência (quantização, batching, atenção otimizada).
- Capacidade de trabalhar em ambiente remoto e global.
Diferenciais
- Experiência com verl, OpenRLHF, Unsloth ou LlamaFactory.
- Contribuições para projetos open source na área de inferência.
- Conhecimento em CUDA ou otimização em GPU.
Benefícios
- Salário competitivo em dólar.
- Ferramentas e equipamentos de trabalho.
- Cultura de trabalho remoto assíncrono.
- Oportunidades de crescimento e aprendizado.