Roku
Thunder Compute
Ingeniero/a de Software (Infraestructura)
Empresa
El mundo está construyendo una cantidad masiva de capacidad de GPU. Mientras tanto, las GPU desplegadas solo se utilizan en un 20%.
Esto se debe a que las GPU no están virtualizadas, mientras que todo otro tipo de hardware sí lo está. Por ejemplo, las CPU y el almacenamiento se asignan a través de abstracciones virtuales que gestionan eficientemente el hardware físico, mientras que las GPU se asignan estáticamente de forma individual.
Thunder Compute está construyendo esta capa de virtualización para GPU. Hemos recaudado más de 17.5 millones de dólares de Matrix Partners, Y Combinator y ángeles inversores líderes de Coreweave, Microsoft, Cognition y Anthropic.
Las soluciones líderes para la infrautilización se encuentran en la capa de carga de trabajo y, por lo tanto, solo pueden optimizar casos de uso específicos. Creemos que la solución ideal de optimización de clúster debe ser invisible para los desarrolladores y compatible con todas las cargas de trabajo; por lo tanto, debe residir en la capa de sistemas.
Somos un equipo de investigadores de sistemas que producen investigación de vanguardia en virtualización de GPU para construir esta capa de optimización de propósito general.
Concretamente, nuestra biblioteca de virtualización abstrae las GPU a través de redes TCP. Utilizamos una biblioteca shim en el espacio de usuario, cargada a través de LD_PRELOAD, para interceptar llamadas CUDA y enviarlas a través de gRPC a un servidor host conectado a una GPU física en otro lugar del centro de datos.
Esto permite algo así como "Ceph para GPU": las GPU se convierten en recursos de red que pueden abstraerse, agruparse y asignarse dinámicamente en un clúster para mejorar la utilización sin requerir que los desarrolladores modifiquen sus cargas de trabajo.
Rol
Tu trabajo se centrará en construir la infraestructura en la nube que rodea nuestra capa de virtualización de GPU. Esto incluye la columna vertebral Go de nuestra plataforma en la nube, la orquestación basada en Kubernetes, la fiabilidad de producción, la red, el almacenamiento, la infraestructura de facturación y los sistemas utilizados para desplegar y operar capacidad de GPU a escala.
Asumirás la propiedad de infraestructuras complejas desde el diseño inicial hasta el despliegue en producción. Los proyectos de ejemplo pueden incluir:
- Construcción de servicios de plano de control para el aprovisionamiento y la gestión de instancias de GPU virtuales
- Diseño de sistemas fiables para la asignación, planificación y gestión del ciclo de vida de las GPU
- Mejora de nuestro despliegue no convencional de Kubernetes, que actúa como una forma de hipervisor para las cargas de trabajo de los clientes
- Construcción de infraestructura para redes, almacenamiento, autenticación, facturación y medición de uso
- Automatización del despliegue y operación de hosts de GPU en proveedores de nube y centros de datos de clientes
- Depuración de fallos en cargas de trabajo de clientes, Kubernetes, nuestro plano de control, la red y la infraestructura física de GPU
- Diseño de sistemas para recuperación de fallos, gestión de capacidad, observabilidad y respuesta a incidentes
- Mejora de la seguridad, fiabilidad y simplicidad operativa de la plataforma a medida que escala
- Trabajar directamente con los clientes para diagnosticar problemas y desplegar Thunder Compute en nuevos entornos
Pasarás tus días alternando entre los detalles de una compleja infraestructura de producción que está activa y es utilizada por los clientes. Una semana, podrías estar depurando un fallo de red en un clúster de Kubernetes; la siguiente, podrías estar rediseñando el sistema de aprovisionamiento para hacer los despliegues más rápidos y fiables.
Este trabajo no es fácil. Combina las partes más difíciles de la infraestructura en la nube, los sistemas distribuidos y la ingeniería de producción.
Requisitos mínimos
Buscamos talento de ingeniería excepcional, una sólida ética de trabajo y una extrema atención al detalle. Debemos movernos rápido mientras entregamos infraestructura fiable y de alta calidad.
Habilidades Técnicas Clave
- Excepcional habilidad en Go, incluyendo concurrencia, diseño de sistemas distribuidos, diseño de API y desarrollo de servicios de producción
- Profundo conocimiento de Kubernetes, contenedores, Linux, redes, almacenamiento o infraestructura en la nube
- Experiencia en la construcción y operación de sistemas de producción críticos
- Sólida capacidad de depuración de sistemas y operación
- Capacidad para razonar a través de sistemas desconocidos en múltiples capas de la pila
- Conocimiento práctico de Python; la familiaridad con TypeScript o Next.js es útil
Requisitos Indispensables
- Sólida ética de trabajo y la capacidad de llevar un proyecto de forma independiente desde un prototipo experimental hasta su finalización 100% bajo plazos ajustados
- Atención al detalle y la capacidad de entregar código listo para producción, completamente probado, sin supervisión significativa
- Fuerte sentido de la propiedad sobre la corrección, fiabilidad, rendimiento y resultados operativos
- Capacidad para depurar problemas ambiguos sin una reproducción clara, un playbook existente o un propietario obvio
- Disposición para trabajar directamente con los clientes e investigar fallos de producción difíciles
- Sólidas habilidades de comunicación y la capacidad de coordinarse entre ingeniería, clientes y proveedores de infraestructura externos
Preferible
- Experiencia con internos de Kubernetes, runtimes de contenedores, redes en la nube, almacenamiento distribuido, seguridad de infraestructura o planos de control a gran escala
- Experiencia en la construcción de infraestructura de producción de alto riesgo en una firma de trading como Citadel Securities o Jane Street; un proveedor de nube como AWS, Coreweave o Lambda; una empresa de infraestructura de IA; o un entorno de ingeniería similarmente exigente
- Sólidos fundamentos de informática demostrados a través de trabajo académico, investigación en sistemas distribuidos, contribuciones a código abierto o experiencia profesional excepcional
- Experiencia en el diseño y operación de infraestructura en múltiples proveedores de nube o entornos on-premise
- Experiencia en llevar un nuevo sistema de infraestructura desde un prototipo temprano a una plataforma de producción fiable
Por qué unirse
Te unirás lo suficientemente pronto como para dar forma significativa a la arquitectura, los estándares de ingeniería y la dirección técnica de la empresa.
Trabajarás directamente con los fundadores en un problema de sistemas que define una categoría, con un camino corto entre escribir código y verlo ejecutarse en producción. La infraestructura que construyas operará una nueva capa fundamental para la computación con GPU.
A diferencia de una gran empresa, no estarás limitado a un pequeño componente de un sistema mucho más grande. Serás propietario de áreas amplias y técnicamente difíciles de la plataforma y tendrás la oportunidad de crecer hacia un liderazgo técnico y de ingeniería senior a medida que la empresa escale.
Logística
- Reportarás al cofundador y CTO Brian Model, anteriormente Desarrollador Cuantitativo en Citadel Securities
- Este puesto es a tiempo completo y presencial, cinco días a la semana, en nuestra oficina en el centro de San Francisco
- Se ofrece apoyo para la reubicación y patrocinio de visados
Beneficios
- Salario competitivo y acciones significativas
- Almuerzo diario, snacks y café
- Cenas y eventos de equipo
- 401(k)
- Seguro médico, dental y de visión
