Solaris
Yuno
Site Reliability Engineer
Sobre a oportunidade
Remoto · Tempo Integral · Contribuidor Individual · +7 Anos de Experiência
Aviso Legal
Podemos usar ferramentas de inteligência artificial (IA) para apoiar partes do processo de contratação, como revisão de candidaturas, análise de currículos ou avaliação de respostas. Essas ferramentas auxiliam nossa equipe de recrutamento, mas não substituem o julgamento humano. As decisões finais de contratação são, em última análise, tomadas por humanos. Se você gostaria de mais informações sobre como seus dados são processados ou deseja exercer seus direitos de proteção de dados, entre em contato conosco em [email protected]. \n\n\n
Site Reliability Engineer
Sobre a Vaga
Yuno está procurando um Staff Site Reliability Engineer para definir a direção técnica de confiabilidade em nossa infraestrutura — começando pela plataforma que provisiona, implanta e gerencia agentes de IA em escala na AWS, o sistema que impulsiona pagamentos em mais de 190 países. A plataforma está em produção e crescendo, e precisamos da voz de confiabilidade mais sênior na sala para evoluir a arquitetura e garantir que ela permaneça confiável, observável e pronta para escalar.
Esta não é uma função de "manter o que existe", nem uma função de sistema único. Você será o responsável pela estratégia de confiabilidade — impulsionando decisões arquiteturais, projetando comunicação orientada a eventos, definindo como medimos e defendemos a confiabilidade, e estabelecendo os padrões nos quais outras equipes de engenharia se baseiam.
Como a IA se Manifesta Nesta Função
A plataforma que você gerencia é a infraestrutura de agentes de IA da Yuno — provisionando e implantando agentes de IA em escala, além dos agentes que roteiam pagamentos e previnem fraudes. Manter a camada nativa de IA confiável é o cerne da função.
IA é nossa camada de execução padrão: você é encorajado a usar ferramentas assistidas por IA em automação, runbooks, análise de incidentes e investigações de causa raiz, e a ajudar a definir como a organização de engenharia mais ampla a adota. Nós nos importamos com como você a usa, não se você a usa.
O Que o Sucesso Parece
Dentro dos seus primeiros 6–12 meses, você terá definido a estratégia de confiabilidade para a plataforma, impulsionado pelo menos uma evolução arquitetural importante (mensageria orientada a eventos, confiabilidade de streaming ou observabilidade), e as equipes de engenharia terão adotado o framework de SLO e orçamento de erros que você definiu. Você será a pessoa em quem a Yuno confia para as decisões de confiabilidade mais difíceis.
Quem Somos
Yuno é o sistema operacional nativo de IA do comércio global, impulsionando a infraestrutura financeira de comerciantes corporativos, bancos e carteiras. Através de uma única API, Yuno os conecta a pagamentos, recebimentos, prevenção de fraudes, KYC/KYB e stablecoins globalmente, para que possam operar em todos os lugares. Agnóstico por design e conectado a mais de 1,000 métodos de pagamento e mais de 460 integrações em mais de 190 países, Yuno otimiza as taxas de aceitação, reduz custos e fortalece a segurança por meio de agentes de IA especializados que aprendem com cada transação. Marcas globais como McDonald's, NetEase Games, GoFundMe e Rappi operam seus pagamentos em Yuno.
Sua Contribuição Será
- Estratégia e padrões de confiabilidade — definir a cultura de SLO, a política de orçamento de erros e as práticas de incidentes que escalam entre as equipes de engenharia, transformando a confiabilidade de combate a incêndios em uma disciplina mensurável em toda a organização.
- Arquitetura e evolução da plataforma — impulsionar decisões arquiteturais à medida que a plataforma amadurece; a voz decisiva na escolha de tecnologias, projeto de sistemas e quando evoluir a infraestrutura.
- Mensageria e arquitetura orientada a eventos — projetar e gerenciar a camada de mensageria para comunicação entre serviços, substituindo padrões síncronos por mensageria assíncrona durável e confiável.
- Infraestrutura e implantação — gerenciar a infraestrutura de nuvem, automatizar o provisionamento com IaC e garantir que a plataforma escale de forma confiável à medida que o volume de transações cresce.
- Observabilidade — construir o monitoramento, rastreamento e alertas que mantêm a plataforma saudável; quando algo quebrar às 3 da manhã, seus dashboards e alertas devem explicar o porquê antes que alguém precise investigar.
- Liderança de incidentes e mentoria — atuar como ponto de escalonamento sênior para os problemas de produção mais difíceis, realizar postmortems sem culpa e análises de causa raiz que se transformam em correções permanentes, e elevar o nível de confiabilidade mentorando engenheiros seniores e de nível médio.
- Mentalidade de engenharia de caos — injeção contínua de falhas e experimentos de resiliência que expõem fraquezas antes que se tornem incidentes, além de identificar e propor padrões de resiliência para evitar que essas falhas cheguem à produção.
Qualificações Mínimas
Habilidades Que Você Precisa
Qualificações Mínimas
- Arquitetura orientada a eventos e sistemas de mensageria — você projetou e gerenciou sistemas em torno de filas de mensagens (Kafka, NATS, RabbitMQ) e entende entrega at-least-once, grupos de consumidores, dead letters e backpressure; você migrou um sistema de síncrono para assíncrono.
- Profundo conhecimento de AWS — EC2, VPC, IAM, S3 e RDS — com fortes fundamentos de rede, já que a comunicação entre serviços ocorre pela VPC interna.
- Infraestrutura como Código — Terraform ou Pulumi, revisado em PRs em vez de clicado em consoles.
- Kubernetes e Docker em produção — ciclo de vida de contêineres, limites de recursos, health checks e orquestração em escala.
- Observabilidade e SLOs — fluência em Datadog ou equivalente (dashboards, monitores, APM, rastreamento distribuído), e um histórico de definição e operação de SLOs, SLIs e orçamentos de erros entre serviços.
- Engenharia de caos e testes de resiliência — experiência prática com injeção de falhas, game days ou experimentos de caos (Gremlin, Chaos Mesh, AWS FIS ou similar) para fortalecer sistemas de produção.
- Depuração de sistemas distribuídos — você diagnosticou fluxos assíncronos e falhas em cascata em produção e pode explicar o que quebrou e como você consertou; confortável codificando para automação e ferramentas (Go, Python ou similar).
- Bancos de dados — sólidos conhecimentos de SQL (PostgreSQL) e NoSQL (MongoDB, Redis): quando usar cada um, indexação, replicação e ajuste de desempenho.
- Liderança técnica comprovada — você definiu padrões de confiabilidade, influenciou a arquitetura entre equipes e mentorou engenheiros, não apenas gerenciou seu próprio escopo.
- Inglês — proficiência avançada, escrita e falada.
Qualificações Preferenciais
- Infraestrutura de IA / MLOps — execução de cargas de trabalho de IA em produção (serviço de modelos, inferência de LLM, gerenciamento de GPU/recursos e ferramentas de avaliação/observabilidade de agentes como LangFuse, LangSmith, Braintrust ou MLflow).
- Plataformas de contêineres multi-tenant — execução de cargas de trabalho de clientes ou usuários em contêineres (Replit, Railway, Fly.io ou PaaS interno).
- Pipelines de dados e orquestração — Airflow, Prefect ou similar; data warehouses como Databricks, Snowflake ou BigQuery são um plus.
- Ferramentas de gerenciamento de incidentes e on-call — PagerDuty, Opsgenie ou incident.io.
- Experiência na indústria de pagamentos.
Diferenciais
- Experiência com ECS.
- s6-overlay para supervisão de processos de contêineres.
- Experiência com ecossistemas de frameworks de agentes de IA.
- Proficiência em espanhol.
O Que Oferecemos na Yuno
- Remuneração Competitiva
- Trabalho Remoto — você pode trabalhar de qualquer lugar.
- Bônus de Home Office — um subsídio único para montar seu home office ideal.
- Equipamento de Trabalho
- Opções de Ações (Stock Options)
- Plano de Saúde onde você estiver
- Dias de Folga Flexíveis
- Cursos de Idiomas, Profissional e Pessoal.
