OpenAI

Ingeniero/a de Software, Infraestructura de Cómputo

KubernetesGo
Traducción automática. Consulta el original.

Sobre el equipo

Compute Infrastructure construye la plataforma que convierte enormes cantidades de cómputo en un motor fiable para la IA de vanguardia. Diseñamos, aprovisionamos, programamos, operamos y optimizamos los sistemas que conectan aceleradores, CPUs, redes, almacenamiento, centros de datos, software de orquestación, infraestructura de agentes, herramientas para desarrolladores y observabilidad en una experiencia coherente para investigadores y equipos de producto.

Nuestro trabajo abarca toda la pila: planificación de capacidad y ciclo de vida de clústeres, automatización de hardware físico, sistemas distribuidos, Kubernetes y programación, optimización profunda de sistemas, redes de alto rendimiento, almacenamiento, salud de la flota, fiabilidad, perfilado de cargas de trabajo, benchmarking y la experiencia del desarrollador que permite a los equipos utilizar enormes sistemas de cómputo con confianza. A esta escala, las pequeñas mejoras en la comunicación, la programación, la eficiencia del hardware o los flujos de trabajo de depuración pueden acumularse y traducirse en una velocidad de investigación significativa. Estamos contratando en toda Compute Infrastructure en lugar de para un único equipo específico, y utilizamos esta oferta para asignar ingenieros sólidos a los problemas donde puedan tener un mayor impacto.

Sobre el puesto

Buscamos ingenieros/as que quieran construir la plataforma de cómputo detrás de la investigación y los productos de OpenAI. Puede que no seas el/la más fuerte en sistemas de bajo nivel, computación de alto rendimiento, infraestructura distribuida, fiabilidad, CaaS, infraestructura de agentes, plataformas para desarrolladores, herramientas o la experiencia de usuario en torno a la infraestructura. Lo que importa es que puedas razonar cuidadosamente sobre sistemas complejos, escribir software duradero y elevar la calidad y la velocidad de las personas que te rodean.

Dependiendo de tu experiencia e intereses, podrías trabajar cerca del hardware, cerca de los usuarios, en CaaS e infraestructura de agentes, o en los planos de control y datos intermedios. Podrías ayudar a poner en línea nueva capacidad de supercomputación, optimizar cargas de trabajo de entrenamiento a partir de trazas de perfilado y benchmarks, mejorar el comportamiento de NCCL y la comunicación colectiva, razonar sobre GPUs, NICs, topología, firmware, térmicas y modos de fallo, o diseñar abstracciones que hagan que los clústeres heterogéneos se sientan como una plataforma coherente.

No esperamos que todos los candidatos/as hayan trabajado en todas las capas. Algunos ingenieros/as se centrarán en el rendimiento de los sistemas, el comportamiento del kernel o del runtime, los protocolos de red a gran escala, RDMA, NCCL, el comportamiento del hardware de GPU, el benchmarking, la programación o la fiabilidad del hardware; otros/as harán la plataforma más utilizable a través de APIs, herramientas, flujos de trabajo y experiencia del desarrollador. El hilo conductor es un sólido juicio de ingeniería y entusiasmo por hacer que los enormes sistemas de cómputo sean más rápidos, más fiables y más fáciles de usar.

Esta es una oferta general para Compute Infrastructure. Consideraremos candidatos/as para equipos en toda Compute Infrastructure y te asignaremos en función de tus fortalezas, los problemas que te motiven y dónde las necesidades de infraestructura sean mayores.

Dónde podrías trabajar

  1. Compute Foundations: Construir los primitivos de plataforma de bajo nivel que hacen que el hardware heterogéneo, los proveedores y los centros de datos sean repetibles, automatizables y operables a escala.
  1. Fleet / Orchestration: Convertir la capacidad bruta en clústeres y sistemas de programación fiables y eficientes que los investigadores y equipos de producto puedan utilizar con una fricción mínima y una gran experiencia.
  1. Core Network Engineering: Construir y operar las redes de alto rendimiento, protocolos y observabilidad necesarios para las cargas de trabajo de entrenamiento y servicio más grandes.
  1. Hardware Health and Observability: Detectar, diagnosticar, remediar y prevenir problemas de salud del hardware y de la flota para mantener un cómputo utilizable alto en todos los proveedores y generaciones de aceleradores.
  1. Storage: Construir abstracciones de almacenamiento escalables, de alto rendimiento y duraderas que eviten que el movimiento de datos y el acceso al almacenamiento se conviertan en un cuello de botella para la investigación o los productos.
  1. Agent Infrastructure: Construir infraestructura de ejecución en sandbox para cargas de trabajo agénticas en investigación y producción, con un fuerte aislamiento, fiabilidad y escala.

En este puesto, tú:

  1. Construirás y optimizarás profundamente software de sistema fiable para sistemas de cómputo a gran escala que ejecutan algunas de las cargas de trabajo de IA más exigentes del mundo.
  1. Diseñarás y operarás infraestructura en aceleradores, CPUs, NICs, switches, protocolos de red, almacenamiento, centros de datos, orquestación de clústeres, programación y salud de la flota.
  1. Perfilarás, benchmarkearás y optimizarás cargas de trabajo de entrenamiento en cuellos de botella de cómputo, memoria, almacenamiento, red, NCCL y comunicación colectiva, y programación de clústeres.
  1. Crearás automatización consciente del hardware que haga que el aprovisionamiento, las actualizaciones de firmware y controladores, la respuesta a incidentes y las operaciones diarias sean más rápidas y menos propensas a errores.
  1. Construirás CaaS, infraestructura de agentes, herramientas de perfilado, observabilidad, benchmarking y plataformas que ayuden a investigadores, ingenieros de producto y operadores a lanzar, depurar y optimizar cargas de trabajo con menos fricción.
  1. Convertirás las lecciones operativas en mejores sistemas, abstracciones más sólidas y límites de propiedad más claros entre equipos.
  1. Colaborarás con equipos de investigación, ingeniería, seguridad, redes, hardware y centros de datos para hacer que la capacidad de cómputo sea más capaz y fácil de usar.

Cualificaciones

Podrías prosperar en este puesto si:

  1. Has construido u operado sistemas distribuidos, plataformas de infraestructura, entornos de computación de alto rendimiento, sistemas de red a gran escala, clústeres de Kubernetes, herramientas para desarrolladores o sistemas de producción con requisitos de fiabilidad exigentes.
  1. Disfrutas trabajando en diferentes capas de la pila y te sientes cómodo/a moviéndote entre software, hardware, redes, rendimiento de sistemas, fiabilidad y necesidades del usuario.
  1. Te preocupa hacer que la infraestructura compleja sea comprensible, observable y utilizable para las personas que dependen de ella.
  1. Puedes diagnosticar problemas difíciles bajo presión operativa real mientras sigues invirtiendo en calidad de ingeniería a largo plazo.
  1. Te gusta crear apalancamiento para otros, ya sea a través de APIs, automatización, herramientas de depuración, primitivos de CaaS e infraestructura de agentes, mejoras de flujo de trabajo o mejores abstracciones de plataforma.
  1. Te motiva la escala, la eficiencia, la fiabilidad y la medición disciplinada a través de benchmarks, perfiles y evidencia de producción.
  1. Te comunicas con claridad, asumes la responsabilidad y trabajas bien con equipos cuyos límites y objetivos difieren de los tuyos.
  1. Sólidas habilidades de ingeniería de software y experiencia en la construcción, operación o mejora de sistemas de infraestructura de producción.
  1. Experiencia en una o más áreas relevantes como sistemas distribuidos, sistemas operativos, protocolos de red, RDMA, NCCL o comunicación colectiva, almacenamiento, Kubernetes, programación, observabilidad, ingeniería de fiabilidad, computación de alto rendimiento, infraestructura de GPU, CaaS, infraestructura de agentes, optimización de rendimiento consciente del hardware, benchmarking, experiencia del desarrollador o herramientas de infraestructura.
  1. Capacidad para depurar comportamientos complejos del sistema en capas de software, hardware, redes y cargas de trabajo, y luego convertir los hallazgos en mejoras robustas.
  1. Comodidad con la ambigüedad, fuerte sentido de la responsabilidad y preferencia por soluciones prácticas y duraderas.
  1. Interés en trabajar en infraestructura que habilite directamente la investigación de IA de vanguardia y el impacto del producto.

Sobre OpenAI

OpenAI es una empresa de investigación y despliegue de IA dedicada a garantizar que la inteligencia artificial de propósito general beneficie a toda la humanidad. Empujamos los límites de las capacidades de los sistemas de IA y buscamos desplegarlos de forma segura al mundo a través de nuestros productos. La IA es una herramienta extremadamente poderosa que debe crearse con la seguridad y las necesidades humanas en su núcleo, y para lograr nuestra misión, debemos abarcar y valorar las muchas perspectivas, voces y experiencias diferentes que forman el espectro completo de la humanidad.

Somos un empleador que ofrece igualdad de oportunidades y no discriminamos por motivos de raza, religión, color, origen nacional, sexo, orientación sexual, edad, condición de veterano, discapacidad, información genética u otra característica legalmente protegida aplicable.

Para más información, consulta la Declaración de Política de Acción Afirmativa y Igualdad de Oportunidades de Empleo de OpenAI.

Se realizarán verificaciones de antecedentes a los/as solicitantes de acuerdo con la ley aplicable, y se considerará a los/as solicitantes cualificados/as con antecedentes penales para el empleo de acuerdo con dichas leyes, incluida la Ordenanza de Oportunidades de Empleo Justo de San Francisco, la Ordenanza de Oportunidades de Empleo Justo del Condado de Los Ángeles para Empleadores y la Ley de Oportunidades de Empleo Justo de California, para candidatos/as con sede en EE. UU. Para trabajadores del Condado de Los Ángeles no incorporados: creemos razonablemente que los antecedentes penales pueden tener una relación directa, adversa y negativa con las siguientes funciones del puesto, lo que podría resultar en la retirada de una oferta de empleo condicional: proteger el hardware informático que se le confía contra robos, pérdidas o daños; devolver todo el hardware informático en su posesión (incluidos los datos que contiene) al finalizar el empleo o la asignación; y mantener la confidencialidad de la información propietaria, confidencial y no pública. Además, las funciones del puesto requieren acceso a sistemas de tecnología de la información seguros y protegidos y obligaciones relacionadas con la seguridad de los datos.

Para notificar a OpenAI que crees que esta oferta de empleo no cumple con las normativas, envía un informe a través de este formulario. No se proporcionará respuesta a consultas no relacionadas con el cumplimiento de la oferta de empleo.

Estamos comprometidos a proporcionar adaptaciones razonables a los/as solicitantes con discapacidades, y las solicitudes se pueden realizar a través de este enlace.

Política de Privacidad Global para Candidatos/as de OpenAI

En OpenAI, creemos que la inteligencia artificial tiene el potencial de ayudar a las personas a resolver inmensos desafíos globales, y queremos que los beneficios de la IA se compartan ampliamente. Únete a nosotros para dar forma al futuro de la tecnología.

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores