HEXAWARE
Workana
Engenheiro(a) de Aplicações de IA (Meio Período)
Sobre a oportunidade
Cliente: medxprts.ai
Localização: Remoto
Tipo: Meio período, com potencial para transição para período integral
Horário: Sobreposição com o fuso horário dos EUA é necessária
Descrição
A Medxprts.ai está construindo uma plataforma com IA para as áreas jurídica e de saúde, utilizando LLMs, fluxos de trabalho agentivos e automação para criar aplicações em nível de produção.
Estamos buscando um(a) Engenheiro(a) de IA - Fine-Tuning de LLM: um(a) engenheiro(a) prático(a) que treinou e ajustou pessoalmente modelos de pesos abertos, construiu infraestrutura de treinamento, projetou conjuntos de dados a partir de documentos complexos e estabeleceu pipelines rigorosos de avaliação e treinamento de preferência/feedback. Esta função trabalha em estreita colaboração com as equipes de engenharia para entregar modelos e funcionalidades integradas em produção.
Responsabilidades
- Projetar, implementar e executar experimentos de fine-tuning de LLM (LoRA/QLoRA e SFT completo) em modelos de pesos abertos (ex: Llama, Mistral, Qwen) e entregar modelos treinados em fluxos de trabalho de produto.
- Construir e manter infraestrutura de treinamento usando PyTorch e ferramentas Hugging Face (Transformers, PEFT, TRL/Axolotl), incluindo orquestração de treinamento multi-GPU (DeepSpeed/FSDP) em AWS ou GCP.
- Projetar conjuntos de dados a partir de fontes não estruturadas do mundo real (PDFs longos, registros médicos/legais), realizando deduplicação, filtragem, verificações de contaminação e divisões de treino/avaliação.
- Criar sistemas de avaliação adaptados às necessidades do domínio: conjuntos de teste reservados, LLM como juiz com calibração humana, testes de regressão entre versões de modelos e monitoramento automatizado para desvio do modelo.
- Implementar fluxos de trabalho de treinamento de preferência/feedback (estilo DPO/RLHF ou similar) para aprender com correções de especialistas (médico no loop) e integrar loops de feedback em pipelines de retreinamento de modelos.
- Colaborar com engenheiros de backend/frontend para integrar modelos ajustados em serviços, otimizar latência/custo de inferência e suportar implantações em produção.
- Participar de revisões de PR, processos de lançamento, depuração de incidentes e melhoria contínua das ferramentas de treinamento e implantação.
- Garantir o manuseio seguro e em conformidade de dados sensíveis (conhecimento de HIPAA é altamente desejável) durante a preparação de conjuntos de dados e o treinamento de modelos.
Requisitos mínimos
- Experiência prática em fine-tuning de LLMs: treinou ou ajustou pessoalmente modelos de pesos abertos usando LoRA/QLoRA e SFT completo; capaz de explicar trade-offs e fornecer pelo menos um exemplo entregue.
- Experiência em infraestrutura de treinamento: PyTorch + ecossistema Hugging Face (Transformers, PEFT, TRL/Axolotl), conhecimento de treinamento multi-GPU (DeepSpeed ou FSDP) e execução de cargas de trabalho de treinamento em AWS ou GCP.
- Experiência em engenharia de conjuntos de dados: construiu conjuntos de dados de instrução/preferência a partir de documentos complexos e não estruturados; conhecimento prático de deduplicação, filtragem, divisões de treino/avaliação e prevenção de contaminação.
- Forte disciplina de avaliação: projetou sistemas de avaliação específicos do domínio além de benchmarks padrão, incluindo configurações de juiz calibrado por humanos e testes de regressão.
- Experiência prática com métodos de aprendizado de preferência/feedback (DPO, fluxos de trabalho estilo RLHF ou equivalente) e integração de feedback de especialistas em atualizações de modelos.
- Sólidos fundamentos de engenharia de software: fluxos de trabalho de produção (Git, PRs), depuração, testes, experiência de implantação e código de fácil manutenção.
- Experiência com APIs, bancos de dados e integração de serviços para inferência de modelos.
- Capacidade de trabalhar de forma independente, aprender rapidamente e seguir direção técnica.
- Boas habilidades de comunicação em inglês e disponibilidade para sobreposição com o horário de trabalho dos EUA.
Diferenciais
- Experiência com estratégias de manipulação de contexto longo para documentos muito grandes (treinamento ciente de recuperação, extensão de contexto, RAG para fontes de milhares de páginas).
- Implantação de modelos e otimização de inferência: quantização (GPTQ/AWQ), serviço vLLM/TGI, ajuste de throughput/batching, otimização de latência e custo.
- Familiaridade com bancos de dados vetoriais, pipelines RAG avançados, MCPs ou ferramentas de automação de fluxo de trabalho estilo n8n.
- Conhecimento de Docker, CI/CD, Kubernetes/EKS ou infraestrutura serverless.
- Experiência prévia em saúde, legaltech, processos com conhecimento de HIPAA ou outros ambientes regulamentados/sensíveis a dados.
- Portfólio público, GitHub ou exemplos de aplicações de LLM/agentivas entregues e projetos de fine-tuning.
- Função totalmente remota.
- Oportunidade de trabalhar em produtos de IA reais nas áreas jurídica e de saúde.
- Alta autonomia e responsabilidade.
- Incentivos baseados em desempenho e bônus orientados a resultados.
- Potencial para crescer para uma função de longo prazo e em período integral.
