Launch Legends
Thunder Compute
Engenheiro(a) de Software (Infraestrutura)
Empresa
O mundo está construindo uma quantidade massiva de capacidade de GPU. Enquanto isso, as GPUs implantadas são utilizadas em apenas 20%.
Isso ocorre porque as GPUs não são virtualizadas, enquanto todos os outros tipos de hardware são. Por exemplo, CPUs e armazenamento são alocados através de abstrações virtuais que gerenciam eficientemente o hardware físico, enquanto as GPUs são alocadas estaticamente de forma um-para-um.
Thunder Compute está construindo essa camada de virtualização para GPUs. Levantamos mais de US$17.5 milhões de Matrix Partners, Y Combinator e investidores anjo líderes de Coreweave, Microsoft, Cognition e Anthropic.
As principais soluções para subutilização residem na camada de workload e, portanto, só conseguem otimizar casos de uso específicos. Acreditamos que a solução ideal de otimização de cluster deve ser invisível para os desenvolvedores e compatível com todos os workloads; portanto, deve residir na camada de sistemas.
Somos uma equipe de pesquisadores de sistemas produzindo pesquisa de ponta em virtualização de GPU para construir essa camada de otimização de propósito geral.
Concretamente, nossa biblioteca de virtualização abstrai GPUs através de rede TCP. Usamos uma biblioteca shim em userspace, carregada via LD_PRELOAD, para interceptar chamadas CUDA e enviá-las via gRPC para um servidor host conectado a uma GPU física em outro lugar no data center.
Isso permite algo como "Ceph para GPUs": GPUs se tornam recursos de rede que podem ser abstraídos, agrupados e alocados dinamicamente em um cluster para melhorar a utilização sem exigir que os desenvolvedores modifiquem seus workloads.
Função
Seu trabalho se concentrará na construção da infraestrutura de nuvem que circunda nossa camada de virtualização de GPU. Isso inclui o backbone Go de nossa plataforma de nuvem, orquestração baseada em Kubernetes, confiabilidade de produção, rede, armazenamento, infraestrutura de faturamento e os sistemas usados para implantar e operar capacidade de GPU em escala.
Você assumirá a responsabilidade por infraestruturas complexas, desde o design inicial até a implantação em produção. Exemplos de projetos podem incluir:
- Construção de serviços de plano de controle para provisionamento e gerenciamento de instâncias virtuais de GPU
- Projeto de sistemas confiáveis para alocação, agendamento e gerenciamento de ciclo de vida de GPU
- Melhoria de nossa implantação não convencional de Kubernetes, que atua como uma forma de hypervisor para workloads de clientes
- Construção de infraestrutura para rede, armazenamento, autenticação, faturamento e medição de uso
- Automação da implantação e operação de hosts de GPU em provedores de nuvem e data centers de clientes
- Depuração de falhas em workloads de clientes, Kubernetes, nosso plano de controle, a rede e a infraestrutura física de GPU
- Projeto de sistemas para recuperação de falhas, gerenciamento de capacidade, observabilidade e resposta a incidentes
- Melhoria da segurança, confiabilidade e simplicidade operacional da plataforma à medida que ela escala
- Trabalhar diretamente com clientes para diagnosticar problemas e implantar Thunder Compute em novos ambientes
Você passará seus dias alternando entre os detalhes de infraestrutura de produção complicada que está ativa e sendo usada por clientes. Em uma semana, você pode estar depurando uma falha de rede em um cluster Kubernetes; na outra, pode estar redesenhando o sistema de provisionamento para tornar as implantações mais rápidas e confiáveis.
Este trabalho não é fácil. Ele combina as partes mais difíceis de infraestrutura de nuvem, sistemas distribuídos e engenharia de produção.
Requisitos mínimos
Procuramos talentos excepcionais em engenharia, forte ética de trabalho e atenção extrema aos detalhes. Precisamos nos mover rapidamente enquanto entregamos infraestrutura confiável e de alta qualidade.
Habilidades Técnicas Essenciais
- Habilidade excepcional em Go, incluindo concorrência, design de sistemas distribuídos, design de API e desenvolvimento de serviços de produção
- Profundo entendimento de Kubernetes, contêineres, Linux, redes, armazenamento ou infraestrutura de nuvem
- Experiência na construção e operação de sistemas de produção críticos
- Forte habilidade de depuração de sistemas e capacidade operacional
- Capacidade de raciocinar através de sistemas desconhecidos em múltiplas camadas da stack
- Conhecimento prático de Python; familiaridade com TypeScript ou Next.js é útil
Requisitos Indispensáveis
- Forte ética de trabalho e a capacidade de impulsionar independentemente um projeto de um protótipo experimental até a conclusão 100% sob prazos apertados
- Atenção aos detalhes e a capacidade de entregar código pronto para produção, exaustivamente testado, sem supervisão significativa
- Forte senso de propriedade sobre correção, confiabilidade, desempenho e resultados operacionais
- Capacidade de depurar problemas ambíguos sem uma reprodução clara, playbook existente ou proprietário óbvio
- Disposição para trabalhar diretamente com clientes e investigar falhas de produção difíceis
- Fortes habilidades de comunicação e a capacidade de coordenar entre engenharia, clientes e provedores de infraestrutura externos
Diferenciais
- Experiência com internals de Kubernetes, runtimes de contêineres, redes de nuvem, armazenamento distribuído, segurança de infraestrutura ou planos de controle de larga escala
- Experiência na construção de infraestrutura de produção de alto risco em uma empresa de trading como Citadel Securities ou Jane Street; um provedor de nuvem como AWS, Coreweave ou Lambda; uma empresa de infraestrutura de IA; ou um ambiente de engenharia igualmente exigente
- Fortes fundamentos de ciência da computação demonstrados através de trabalho acadêmico, pesquisa em sistemas distribuídos, contribuições open-source ou experiência profissional excepcional
- Experiência no projeto e operação de infraestrutura em múltiplos provedores de nuvem ou ambientes on-premise
- Experiência em levar um novo sistema de infraestrutura de um protótipo inicial para uma plataforma de produção confiável
Por que se juntar
Você se juntará cedo o suficiente para moldar significativamente a arquitetura, os padrões de engenharia e a direção técnica da empresa.
Você trabalhará diretamente com os fundadores em um problema de sistemas que define uma categoria, com um caminho curto entre escrever código e vê-lo rodando em produção. A infraestrutura que você construir operará uma nova camada fundamental para computação de GPU.
Ao contrário de uma grande empresa, você não será restrito a um pequeno componente de um sistema muito maior. Você será responsável por áreas amplas e tecnicamente difíceis da plataforma e terá a oportunidade de crescer para liderança técnica e de engenharia sênior à medida que a empresa escala.
Outros
- Você se reportará ao cofundador e CTO Brian Model, anteriormente Desenvolvedor Quantitativo na Citadel Securities
- Esta função é em tempo integral e presencial, cinco dias por semana, em nosso escritório no centro de San Francisco
- Suporte para realocação e patrocínio de visto estão disponíveis
Benefícios
- Salário competitivo e participação acionária significativa
- Almoço diário, lanches e café
- Jantares e eventos da equipe
- 401(k)
- Seguro de saúde, odontológico e oftalmológico
