Nominal
Together AI
Ingeniero Staff, Almacenamiento Distribuido e Infraestructura HPC y IA
SOBRE EL PUESTO
En este puesto, operarás, escalarás y optimizarás sistemas de almacenamiento de varios petabytes diseñados específicamente para las cargas de trabajo de entrenamiento e inferencia de IA más grandes del mundo. Gestionarás y escalarás sistemas de archivos paralelos y almacenes de objetos de alto rendimiento, evaluarás e integrarás tecnologías de vanguardia como Vast, Weka, Ceph y Lustre, y resolverás los complejos desafíos de ingeniería de operar con un rendimiento extremo, rutas de datos de baja latencia y operaciones de almacenamiento a escala de clúster masivo.
También crearás operadores de almacenamiento nativos de Kubernetes y plataformas de autoservicio que proporcionen aprovisionamiento automatizado, multi-tenencia estricta, aislamiento de rendimiento y aplicación de cuotas a escala de clúster. En el día a día, optimizarás las rutas de datos de extremo a extremo para 10-50 GB/s por nodo, diseñarás arquitecturas de caché multinivel, implementarás prelectura inteligente y distribución de pesos de modelos, y ajustarás sistemas de archivos paralelos para cargas de trabajo de IA.
RESPONSABILIDADES
- Diseñar e implementar la estrategia técnica y la hoja de ruta de almacenamiento para Together AI, impulsando decisiones arquitectónicas de alto rendimiento a medida que escalamos nuestra flota de GPU.
- Diseñar y escalar sistemas de almacenamiento de IA/ML de varios petabytes integrando Vast, Weka y Ceph, mientras se ejecuta una optimización profunda de costes a través de políticas automatizadas de niveles y ciclo de vida.
- Desarrollar arquitecturas inteligentes de caché y almacenamiento por niveles para lograr IOPS extremos y rendimiento en todo el clúster a escala de GPU para cargas de trabajo de entrenamiento e inferencia.
- Ajustar el aislamiento del almacenamiento en las capas de red L2/L3 para garantizar una multi-tenencia segura y de grado de producción para los clientes de almacenamiento.
- Codificar operadores y controladores de almacenamiento Kubernetes para permitir el aprovisionamiento automatizado, abstracciones de autoservicio y la aplicación de cuotas.
- Diseñar rutas de datos de extremo a extremo para lograr 10+ GB/s por nodo GPU; diseñar caché multinivel para pesos de modelos y conjuntos de datos; ajustar sistemas de archivos paralelos utilizando perfiles avanzados; y escalar la infraestructura de almacenamiento en miles de nodos.
- Optimizar las rutas de datos de extremo a extremo a través de benchmarking y perfiles avanzados, contribuyendo con código de alto impacto a proyectos de almacenamiento de código abierto y herramientas internas.
REQUISITOS
- 8+ años en ingeniería de almacenamiento, gestionando almacenamiento distribuido a escala de varios petabytes.
- Historial probado de implementación y operación de almacenamiento de alto rendimiento para clústeres GPU/HPC.
- Profunda experiencia en almacenamiento nativo de Kubernetes y en la nube en entornos de producción.
- Sólidas habilidades de codificación en Go y Python con capacidad demostrada para construir sistemas y herramientas de grado de producción.
- BS/MS en Ciencias de la Computación, Ingeniería o experiencia práctica equivalente.
- Historial de liderazgo técnico: diseño de sistemas que mejoraron significativamente el rendimiento, la fiabilidad (disponibilidad 99.999%+) o la eficiencia de costes.
- Sistemas de Almacenamiento Distribuido: Profunda experiencia en Ceph, WekaFS, Lustre, Vast, GPFS o sistemas de archivos paralelos similares a escala de varios petabytes.
- Almacenamiento de Objetos: Experiencia en producción con S3, MinIO, Ceph o R2 incluyendo optimización de rendimiento y gestión de costes.
- Almacenamiento Kubernetes: Controladores CSI, StatefulSets, PersistentVolumes, operadores de almacenamiento y controladores personalizados.
- Optimización de almacenamiento para cargas de trabajo de GPU, redes RDMA/InfiniBand, optimización de sistemas de archivos paralelos (rendimiento agregado del clúster de TB/s - saturación de línea).
- Programación: Go y Python para automatización, operadores y herramientas.
- Infraestructura como Código: Terraform, Ansible, Helm, GitOps (ArgoCD).
- Pila de Almacenamiento Linux: Conocimiento avanzado de sistemas de archivos (ext4, xfs), LVM, optimización NVMe, configuraciones RAID.
- Observabilidad: Arquitectura y operaciones de Prometheus, Grafana, Thanos.
HABILIDADES DESEABLES
- GPU Direct Storage (GDS), NVMe-oF, redes de almacenamiento, implementaciones RDMA.
- Patrones de almacenamiento de ML/IA (pesos de modelos, checkpointing, caché de conjuntos de datos).
- Herramientas de benchmarking y perfiles de almacenamiento (fio, iperf3, iostat, blktrace).
SOBRE TOGETHER AI
Together AI, la Nube Nativa de IA, está diseñada específicamente para ingenieros de IA. Los desarrolladores de aplicaciones de IA obtienen inferencia de alto rendimiento que escala de manera fiable, ajuste fino y aprendizaje por refuerzo para crear modelos especializados de vanguardia, y preentrenamiento a escala masiva para inteligencia totalmente personalizada, todo ello en torno a un mercado de modelos abiertos líderes que los equipos pueden ejecutar, adaptar y poseer.
Con la confianza de Cursor, Decagon, ElevenLabs, Salesforce y Zoom, Together sirve a más de 400 billones de tokens al mes.
COMPENSACIÓN
Ofrecemos una compensación competitiva, acciones de startup, seguro médico y otros beneficios, así como flexibilidad en términos de trabajo remoto. El rango salarial base en EE. UU. para este puesto a tiempo completo es: $250,000 - $300,000 + acciones + beneficios.
Nuestros rangos salariales se determinan por ubicación, nivel y puesto. La compensación individual se determinará por experiencia, habilidades y conocimiento relacionado con el puesto.
IGUALDAD DE OPORTUNIDADES
Together AI es un Empleador con Igualdad de Oportunidades y se enorgullece de ofrecer igualdad de oportunidades de empleo a todas las personas, independientemente de su raza, color, ascendencia, religión, sexo, origen nacional, orientación sexual, edad, ciudadanía, estado civil, discapacidad, identidad de género, condición de veterano y más.
Por favor, consulta nuestra política de privacidad en together.ai/privacy
