Together AI

Ingeniero/a Backend Senior, Plataforma de Inferencia

TypeScriptPythonKubernetesRustGo
Traducción automática. Consulta el original.

SOBRE EL PUESTO

Together AI está construyendo la Plataforma de Inferencia que acerca los modelos de IA generativa más avanzados al mundo. Nuestra plataforma impulsa cargas de trabajo serverless multi-inquilino y endpoints dedicados, permitiendo a desarrolladores, empresas e investigadores aprovechar los últimos LLMs, modelos multimodales, de imagen, audio, vídeo y voz a gran escala.

Si te apasiona optimizar la latencia hasta el último milisegundo, este es tu lugar. Trabajarás directamente con decenas de miles de GPUs (H100s, H200s, GB200s y más allá), descubriendo cómo aprovechar al máximo cada FLOP y cada gigabyte de memoria.

Colaborarás directamente con equipos de investigación para llevar modelos de vanguardia a producción, haciendo que los avances sean utilizables en el mundo real. Nuestro equipo también trabaja estrechamente con la comunidad de código abierto, contribuyendo y aprovechando proyectos como SGLang, vLLM y NVIDIA Dynamo para superar los límites del rendimiento y la eficiencia de la inferencia.

RESPONSABILIDADES

  1. Dar forma a la columna vertebral de inferencia central que impulsa los modelos de vanguardia de Together AI.
  1. Resolver desafíos críticos de rendimiento en el enrutamiento global de solicitudes, equilibrio de carga y asignación de recursos a gran escala.
  1. Trabajar con aceleradores de última generación (H100s, H200s, GB200s) a escala global.
  1. Colaborar con investigadores de clase mundial para llevar nuevas arquitecturas de modelos a producción.
  1. Colaborar y contribuir a la comunidad de código abierto, dando forma a las herramientas que hacen avanzar la industria.
  1. Construir y optimizar el enrutamiento de solicitudes global y local, garantizando un equilibrio de carga de baja latencia en centros de datos y pods de motores de modelos.
  1. Desarrollar sistemas de auto-escalado para asignar recursos dinámicamente y cumplir con estrictos SLOs en docenas de centros de datos.
  1. Diseñar sistemas para la conformación de tráfico multi-inquilino, ajustando tanto la asignación de recursos como el manejo de solicitudes, incluyendo limitación de tasa inteligente y regulación, para garantizar la equidad y una experiencia consistente para todos los usuarios.
  1. Diseñar compromisos entre latencia y rendimiento para servir diversas cargas de trabajo de manera eficiente.
  1. Optimizar el almacenamiento en caché de prefijos para reducir el cómputo del modelo y acelerar las respuestas.
  1. Colaborar con investigadores de ML para llevar nuevas arquitecturas de modelos a producción a escala.
  1. Perfilar y analizar continuamente el rendimiento a nivel de sistema para identificar cuellos de botella e implementar optimizaciones.

COMPENSACIÓN

  • Una cultura de profunda propiedad técnica y alto impacto, donde tu trabajo hace que los modelos sean más rápidos, económicos y accesibles.
  • Compensación competitiva, capital (equity) y beneficios.

Ofrecemos una compensación competitiva, capital de startup, seguro médico y otros beneficios competitivos. El rango salarial base en EE. UU. para este puesto a tiempo completo es:

$200,000 - $290,000 + capital + beneficios.

Nuestros rangos salariales están determinados por la ubicación, el nivel y el puesto. La compensación individual se determinará según la experiencia, las habilidades y el conocimiento relacionado con el trabajo.

REQUISITOS

  1. 5+ años de experiencia demostrada construyendo sistemas distribuidos a gran escala, tolerantes a fallos y microservicios API.
  1. Sólida experiencia en el diseño, análisis y mejora de la eficiencia, escalabilidad y estabilidad de sistemas complejos.
  1. Excelente comprensión de conceptos de SO de bajo nivel: multi-threading, gestión de memoria, redes y rendimiento de almacenamiento.
  1. Programación a nivel experto en uno o más de los siguientes: Rust, Go, Python o TypeScript.
  1. Grado o Máster en Informática, Ingeniería Informática o campo relacionado, o experiencia práctica equivalente.
  1. El conocimiento de LLMs modernos y modelos generativos, y cómo se sirven en producción, es una ventaja.
  1. La experiencia trabajando con el ecosistema de código abierto en torno a la inferencia es altamente valiosa; la familiaridad con SGLang, vLLM o NVIDIA Dynamo será especialmente útil.
  1. La experiencia con Kubernetes u orquestación de contenedores es una ventaja importante.
  1. La familiaridad con pilas de software de GPU (CUDA, Triton, NCCL) y tecnologías HPC (InfiniBand, NVLink, MPI) es una ventaja.

SOBRE TOGETHER AI

Together AI, la Nube Nativa de IA, está diseñada específicamente para ingenieros de IA. Los desarrolladores de aplicaciones de IA obtienen una inferencia de alto rendimiento que escala de manera fiable, ajuste fino y aprendizaje por refuerzo para crear modelos especializados de nivel de vanguardia, y pre-entrenamiento a escala masiva para una inteligencia totalmente personalizada, todo ello alrededor de un mercado de modelos abiertos líderes que los equipos pueden ejecutar, adaptar y poseer.

Con la confianza de Cursor, Decagon, ElevenLabs, Salesforce y Zoom, Together sirve 400+ billones de tokens al mes.

IGUALDAD DE OPORTUNIDADES

Together AI es un empleador que ofrece igualdad de oportunidades y se enorgullece de ofrecer igualdad de oportunidades de empleo a todos, independientemente de la raza, color, ascendencia, religión, sexo, origen nacional, orientación sexual, edad, ciudadanía, estado civil, discapacidad, identidad de género, estado de veterano y más.

Por favor, consulte nuestra política de privacidad en together.ai/privacy

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores