RemoteStar

Ingeniero de Sistemas Senior (Múnich, Alemania)

PythonKubernetesTerraform
Traducción automática. Consulta el original.

Sobre el cliente

Empresa de tecnología profunda (deep-tech) bien financiada y en rápido crecimiento, fundada en 2019. Somos la mayor empresa de software cuántico de la UE. También somos una de las 100 empresas más prometedoras en IA del mundo (según CB Insights, 2023) con más de 150 empleados y en crecimiento, totalmente multicultural e internacional.

Requisitos

  1. Experiencia en Programación de Sistemas: Más de 10 años de experiencia en ingeniería de software con gran dominio de Python. Debes sentirte cómodo creando agentes de sistema, APIs y herramientas CLI.
  1. Conocimiento profundo de Kubernetes: Entiendes los aspectos internos de K8s más allá de un simple despliegue. Experiencia con Definiciones de Recursos Personalizados (CRDs), Operadores y la arquitectura del servidor API de Kubernetes.
  1. Experiencia en el Ecosistema de GPU: Experiencia práctica en la gestión de clústeres de GPU NVIDIA. Familiaridad con los controladores NVIDIA, el kit de herramientas CUDA y el tiempo de ejecución de contenedores (NVIDIA Container Toolkit).
  1. Entresijos de Linux: Comprensión profunda del kernel de Linux, cgroups, namespaces y optimización del rendimiento del sistema.
  1. Infraestructura como Código: Dominio de herramientas de infraestructura declarativa (Terraform, Ansible), pero con un enfoque en el aprovisionamiento de hardware físico en lugar de solo VMs en la nube.
  1. Resolución de Problemas: Un historial probado de depuración de sistemas distribuidos complejos donde la causa raíz podría ser código, red o silicio.

Ubicación: Los candidatos deben tener autorización legal para trabajar en el país donde se encuentra el puesto.

Cualificaciones preferidas

  1. Experiencia en HPC: Experiencia trabajando con planificadores de supercomputación tradicionales (Slurm, PBS) o planificadores de lotes modernos (Volcano, Kueue, Ray).
  1. Aprovisionamiento Bare Metal: Experiencia con herramientas como Cluster API (CAPI), Metal3, Tinkerbell, Canonical MaaS u OpenStack Ironic.
  1. Redes de Alta Velocidad: Conocimiento de RDMA, InfiniBand, GPUDirect y cómo exponer estas tecnologías a cargas de trabajo contenerizadas.
  1. Familiaridad con IA/ML: Comprensión de cómo funciona el entrenamiento distribuido (por ejemplo, PyTorch Distributed, Megatron-LM, DeepSpeed) y los requisitos de infraestructura de los Modelos de Lenguaje Grandes (LLMs).
  1. Observabilidad: Experiencia en la creación de monitorización para la salud del hardware (DCGM) y trazado distribuido para trabajos de larga duración.

Qué harás

  1. Construcción del Plano de Control: Diseño y desarrollo de la capa de software (APIs, Controladores, Agentes) que automatiza el ciclo de vida de la infraestructura de IA bare-metal.
  1. Orquestación de Cómputo a Gran Escala: Arquitectura de soluciones de planificación para trabajos de entrenamiento distribuidos a gran escala en clústeres masivos de GPUs (NVIDIA H200/B200/B300), asegurando un bin-packing eficiente y gang scheduling.
  1. Optimización del Tejido (Fabric): Ajuste de la capa de red definida por software para soportar interconexiones de baja latencia (InfiniBand/RDMA/RoCEv2) esenciales para el entrenamiento multi-nodo.
  1. Desarrollo de Extensiones de Kubernetes: Escritura de Operadores y CRDs personalizados de Kubernetes para abstraer realidades de hardware complejas (conciencia de topología, partición de GPU) en interfaces utilizables para nuestros Científicos de Datos.
  1. Depuración a Nivel de Hardware: Investigación y resolución de problemas profundos del sistema, desde errores del bus PCIe y tiempos de espera de comunicación NCCL hasta pánicos del kernel en nodos bare-metal.
  1. Definición de Estándares: Creación de la "Imagen Dorada" para cargas de trabajo de IA, gestionando controladores, firmware y optimizaciones del SO para exprimir el máximo rendimiento del hardware.

Ventajas y Beneficios

  • Contrato indefinido.
  • Igualdad salarial garantizada.
  • Bono variable por rendimiento.
  • Bono de incorporación.
  • Paquete de reubicación (si procede).
  • Seguro médico privado.
  • Elegibilidad para presupuesto educativo según política interna.
  • Oportunidad híbrida.
  • Horario de trabajo flexible.
  • Trabajar en un entorno de ritmo rápido, trabajando en tecnologías de vanguardia.
  • Plan de carrera. Oportunidad de aprender y enseñar.
  • Empresa Progresista. Cultura de gente feliz.

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores