Prior Labs

Ingeniero/a ML, Infraestructura

PythonGCPDockerGo
Traducción automática. Consulta el original.

Sobre el puesto

Quiénes somos

Los modelos fundacionales han transformado el texto y las imágenes. Los datos estructurados —el formato de datos más grande y relevante del mundo— permanecieron intactos, hasta ahora. Lo que LLMs hizo por el lenguaje, nosotros lo estamos haciendo por las tablas.

Fuimos pioneros en modelos fundacionales tabulares: TabPFN v2 fue portada de Nature, ha superado los 3.5M+ descargas y las 7,500+ estrellas de GitHub, y se ejecuta en producción desde la detección de enfermedades pulmonares con Oxford Cancer Analytics hasta la prevención de fallos en trenes con Hitachi. Los problemas más difíciles —millones de filas, inferencia en tiempo real, modalidades completamente nuevas— siguen abiertos, y nadie más está trabajando en ellos a este nivel.

Somos un equipo pequeño y muy selecto de más de 40 personas con experiencia en Google, DeepMind, Meta, Apple, Amazon, Jane Street y CERN, liderado por Frank Hutter, Noah Hollmann y Sauraj Gambhir, y asesorado por Bernhard Schölkopf y el ganador del Premio Turing Yann LeCun.

En julio de 2026, menos de 18 meses después de nuestra ronda pre-seed de €9M, nos unimos a SAP como un laboratorio independiente de IA de vanguardia: el mismo equipo, misión y modelos de pesos abiertos, ahora respaldados por más de €1 mil millones durante cuatro años.

Sobre el puesto

Gastamos decenas de millones al año en cómputo de GPU para entrenar modelos fundacionales tabulares. Ese no es un objetivo, es lo que estamos ejecutando hoy, y está creciendo. La persona que gestione esta infraestructura toma decisiones por valor de millones de dólares: arquitectura del clúster, eficiencia de la planificación, estrategia del proveedor, selección de hardware. Una decisión equivocada cuesta seis cifras.

Hoy ejecutamos Slurm en GCP en múltiples clústeres. Estamos escalando a infraestructura multi-clúster y multi-proveedor y evaluando nuevas generaciones de hardware a medida que salen al mercado. Tú te encargas de la infraestructura full stack, desde las operaciones del clúster y la optimización de costes hasta el rendimiento del entrenamiento distribuido y la capa de herramientas que mantiene a los investigadores avanzando rápidamente. Trabajas directamente con el equipo de investigación y entiendes lo que están haciendo lo suficientemente bien como para tomar decisiones de infraestructura que realmente les ayuden. Y esto no es un rol puramente de soporte. Operamos un entorno abierto. Si tienes la próxima arquitectura tabular SOTA en la manga, adelante y entrénala.

Vida en Prior Labs

Trabajarás junto a investigadores y constructores que se exigen un alto nivel, tanto en la calidad de su trabajo como en la forma en que colaboran entre sí. Avanzamos rápido y aun así nos tomamos el tiempo necesario para hacer las cosas bien.

Nuestros equipos tienen su sede en Berlín, Friburgo y Nueva York; cuando trabajas en algo tan difícil como TabPFN, estar en la misma sala importa. Pero las grandes personas provienen de todas partes, y en casos excepcionales estamos abiertos al trabajo remoto, lo que generalmente implica viajes frecuentes a una de nuestras oficinas. Dondequiera que te encuentres, toda la empresa se reúne regularmente para eventos fuera de la oficina para construir y celebrar juntos.

Nuestros Compromisos

Los mejores productos y equipos se construyen con personas de una amplia gama de perspectivas y orígenes. Damos la bienvenida a solicitudes de todas las identidades y orígenes, especialmente si alguna vez te has sentido desanimado por "no cumplir todos los requisitos", y ofrecemos igualdad de oportunidades independientemente del género, orientación sexual, origen, discapacidad o cualquier otro rasgo que te haga ser quien eres.

Nos preocupa cómo se manejan tus datos: consulta nuestra página de Privacidad de Datos de Reclutamiento

En qué trabajarás

  1. Gestionar y evolucionar la infraestructura multi-clúster de GPU. Slurm en GCP hoy, multi-proveedor y hardware nuevo mañana. Arquitectura, planificación, fiabilidad, optimización de costes
  1. Impulsar la utilización de GPU y el rendimiento del entrenamiento: perfilado, optimización de memoria, cuellos de botella de comunicación, depuración a nivel de sistema de entrenamiento distribuido en ejecuciones a gran escala
  1. Diseñar la próxima generación de nuestra infraestructura: orquestación multi-clúster, nuevas generaciones de GPU, diversificación de proveedores, planificación de capacidad frente a las crecientes demandas de cómputo
  1. Construir la capa de productividad del desarrollador: pipelines de CI, seguimiento de experimentos, registro de modelos, procesamiento de datos y herramientas internas que mantienen alta la velocidad de iteración de la investigación
  1. Gestionar el presupuesto de cómputo. Entiendes el coste por FLOP entre proveedores y hardware, y odias el cómputo desperdiciado
  1. Pila tecnológica: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton

Requisitos mínimos

Podrías encajar si tienes:

  1. 3+ años construyendo y operando infraestructura de GPU en producción o sistemas de entrenamiento distribuido a escala. En un laboratorio de IA importante, una startup de ML bien financiada o un entorno HPC
  1. Profunda experiencia práctica con Slurm y gestión de clústeres. Has depurado fallos de planificación, optimizado la utilización en cargas de trabajo de GPU multi-inquilino y operado infraestructura donde el tiempo de inactividad tiene un coste real
  1. Pensamiento de sistemas a nivel experto: perfilado de GPU, ancho de banda de memoria. Razonas sobre hardware, no sobre configuraciones
  1. Sólido conocimiento de Python y fluidez genuina con los entresijos de PyTorch. Suficiente para perfilar una ejecución de entrenamiento y decir si el cuello de botella es la carga de datos, la comunicación o el cómputo
  1. Historial de toma de decisiones de infraestructura que han mejorado mediblemente el rendimiento del entrenamiento o la eficiencia de costes
  1. Sólidas habilidades en herramientas de IA. Utilizas Claude Code, Cursor o similares con fluidez para avanzar rápidamente sin sacrificar la calidad

Puntos extra

  1. Experiencia operando con gastos de GPU de decenas de millones de euros
  1. Experiencia en infraestructura multi-nube o híbrida HPC/nube
  1. Experiencia con Triton, CUDA o kernels personalizados
  1. Experiencia escalando de un solo clúster a orquestación multi-clúster
  1. Experiencia en la creación de herramientas de seguimiento de experimentos, registro de modelos o pipelines de ML

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores