ISS
Intermedia Intelligent Communications
Engenheiro(a) de Confiabilidade de Site
Sobre a oportunidade
Engenheiro(a) de Confiabilidade de Site
Sobre a Função
Estamos procurando um(a) Engenheiro(a) de Confiabilidade de Site (SRE) para melhorar a confiabilidade de nossas plataformas de IA e análise e dos serviços que dependem delas. À medida que a Intermedia expande suas implantações globais de produtos, esta função fortalecerá as práticas de SRE em infraestrutura de produção, pipelines de dados, serviços de machine-learning, análises voltadas para o cliente e recursos de Voz e Comunicações Unificadas baseados em IA. Você fará parceria com equipes de IA, dados, produto e plataforma para construir sistemas escaláveis e observáveis que ofereçam insights confiáveis e experiências resilientes ao cliente.
Departamento: Dev & Engenharia
Tipo de Emprego: Tempo Integral
Localização: Portugal
Embora primariamente remota, esta função exige visitas ocasionais ao escritório em Coimbra ou em Aveiro. Planejamos abrir um escritório no Porto no futuro. Essa abordagem oferece aos membros da equipe a flexibilidade de trabalhar remotamente, ao mesmo tempo em que se reúnem no escritório para colaboração e trabalho em equipe.
Você está pronto para deixar sua marca?
Diversidade, Inclusão e Igualdade de Oportunidades
Contratamos, promovemos e remuneramos funcionários com base em sua capacidade de desempenhar suas responsabilidades de trabalho, sem levar em conta raça, cor, credo, religião, sexo, gênero, estado civil, origem nacional, ancestralidade, idade, cidadania, deficiência física ou mental, orientação sexual ou qualquer outra base protegida pela lei aplicável (coletivamente referidos em nosso Código de Conduta como “Classes Protegidas”).
Não toleramos discriminação de emprego no local de trabalho e estamos comprometidos em fazer acomodações razoáveis para deficiências identificadas ou outras limitações, conforme exigido por todas as leis aplicáveis.
Somos um empregador com igualdade de oportunidades e valorizamos a diversidade em nossa empresa.
Não discriminamos com base em raça, religião, cor, origem nacional, gênero, orientação sexual, idade, estado civil, status de veterano ou status de deficiência.
Descrição
*TODOS OS CANDIDATOS DEVEM RESIDIR EM PORTUGAL*
O que você trará para a função
- Bacharelado em ciência da computação, engenharia de dados, engenharia de software ou outra disciplina técnica ou científica, ou experiência prática equivalente.
- 4-7 anos de experiência em operações de produção, engenharia de sistemas, SRE ou DevOps, implantação de software e manutenção de sistemas de produção distribuídos.
- Experiência com infraestrutura em nuvem, contêineres, Kubernetes, sistemas distribuídos e serviços escaláveis de computação e armazenamento.
- Experiência operando tecnologias de processamento de dados, orquestração, armazenamento ou análise, como Kafka, Spark, Airflow, dbt, data warehouses ou serviços em nuvem comparáveis.
- Capacidade de usar métricas, logs, traces, verificações de qualidade de dados, indicadores de atualização, linhagem e indicadores de nível de serviço para diagnosticar problemas complexos de produção.
- Experiência com práticas de CI/CD, DataOps ou MLOps, testes automatizados, implantação controlada e reversão de alterações em serviços de dados e IA.
- Fortes habilidades de solução de problemas em Linux, aplicações, redes, APIs, pipelines de dados e dependências de serviços distribuídos, com atenção a controles de segurança e acesso.
- Fortes habilidades analíticas de resolução de problemas e comunicação multifuncional, com uma abordagem proativa para confiabilidade, desempenho e melhoria contínua.
Sobre a Intermedia
Você está procurando uma empresa onde SUA VOZ é ouvida? Onde você pode FAZER A DIFERENÇA? Você se DESENVOLVE em um ambiente de trabalho DINÂMICO? Você acorda toda manhã EMPOLGADO para trabalhar com ÓTIMAS PESSOAS e criar SUCESSO JUNTOS? Então a Intermedia é o lugar para você.
A Intermedia se estabeleceu como uma provedora líder de tecnologia de comunicação e colaboração em nuvem que permite que as empresas se conectem melhor. Temos um forte histórico de crescimento, lucratividade e criação de um ambiente onde todos importam. Todos. Embora sejamos dinâmicos e admitidamente um pouco intensos, prometemos que você não ficará entediado. Você descobrirá que a Intermedia é um lugar onde pode satisfazer sua paixão por criar e dar suporte a ótimas tecnologias em nuvem. Além disso, sempre buscamos promover internamente e temos muitos funcionários que estão conosco há 10, 15 e 20+ anos!
A cultura na Intermedia é construída sobre trabalho em equipe e transparência. Nós nos responsabilizamos uns pelos outros e sempre nos apoiamos!
O que você fará
- Gerenciar e aprimorar ambientes de produção que suportam cargas de trabalho de IA e IA, pipelines de dados, aplicações de análise e serviços voltados para o cliente.
- Construir software e automação para gerenciar infraestrutura em nuvem, plataformas de dados, infraestrutura de serviço de modelos e serviços de aplicação.
- Definir e medir indicadores de nível de serviço, objetivos de nível de serviço e orçamentos de erro para serviços de IA e análise, incluindo disponibilidade, atualização de dados, conclusão de pipeline e latência de inferência.
- Construir observabilidade de ponta a ponta que correlaciona métricas, logs e traces com sinais de qualidade de dados, desempenho de serviço de IA e impacto no cliente.
- Monitorar e otimizar a confiabilidade, desempenho, capacidade e custo de cargas de trabalho em lote e de streaming, consultas de análise e serviços de inferência.
- Colaborar com equipes de engenharia de dados e machine-learning para tornar os fluxos de trabalho de ingestão, transformação, recursos, treinamento, implantação e relatórios prontos para produção.
- Automatizar verificações de CI/CD e prontidão de produção para pipelines de dados, lançamentos de modelos e prompts, alterações de esquema, aplicações de análise e dashboards.
- Detectar e resolver incidentes de qualidade de dados envolvendo dados ausentes, desatualizados, atrasados ou anômalos, desvios de esquema e linhagens ou dependências quebradas.
- Projetar e testar degradação graciosa, isolamento de dependências, padrões de retentativa e fallback, e procedimentos de recuperação para serviços de IA, dados ou downstream prejudicados.
- Melhorar a confiabilidade de recursos de Voz e Comunicações Unificadas baseados em IA, como reconhecimento de fala, transcrição, sumarização, roteamento inteligente, assistência conversacional e text-to-speech.
- Estabelecer monitoramento operacional para o comportamento de modelos e serviços de IA, incluindo latência, taxa de transferência, taxas de erro, indicadores de desvio e alterações na qualidade da saída.
- Planejar capacidade e executar testes de desempenho, carga e resiliência em cargas de trabalho de IA com uso intensivo de computação, processamento de dados distribuído e serviços de análise.
- Liderar resposta a incidentes e melhorias pós-incidente para serviços de IA e análise, usando ações mensuráveis para reduzir a recorrência e o tempo de recuperação.
- Suportar acesso seguro e confiável a serviços de armazenamento em nuvem, processamento e consulta usados por produtos de análise e tomada de decisão interna.
- Reduzir o trabalho operacional repetitivo e melhorar a produtividade da engenharia por meio de ferramentas de plataforma, runbooks, automação de autoatendimento e padrões operacionais claros.
