Marks & Spencer
Cast AI
Ingeniero Senior de ML | Kimchi (Optimización de Inferencia de LLM)
¿POR QUÉ CAST AI?
Cast AI es una plataforma de automatización que opera infraestructura cloud-native y de IA a escala. Al integrar la toma de decisiones autónoma directamente en entornos de Kubernetes y en la nube, Cast AI optimiza continuamente el rendimiento, la fiabilidad y la eficiencia en producción.
La vieja forma no funciona. A medida que los entornos de Kubernetes y de IA crecen, las decisiones manuales no lo hacen. Cast AI reemplaza tickets, alertas y ajustes manuales con automatización continua que adapta la infraestructura a medida que cambian las condiciones.
La eficiencia y el ahorro de costes se derivan de forma natural de esa automatización.
Más de 2,100 empresas ya confían en Cast AI, incluidas Akamai, BMW, Cisco, FICO, HuggingFace, NielsenIQ, Swisscom y TGS.
Equipo global, perspectivas diversas
Tenemos nuestra sede en Miami, pero nuestro impacto es internacional. Adoptamos un enfoque global e intencional hacia la diversidad. Actualmente, Cast AI opera en 34 países de Europa, América del Norte, América Latina y APAC, aportando una amplia gama de perspectivas a cómo construimos y lideramos.
Impulso de unicornio
En enero de 2026, alcanzamos el estatus de unicornio con una inversión estratégica de Pacific Alliance Ventures, el brazo de capital riesgo corporativo de Shinsegae Group (un conglomerado coreano de más de $50+ mil millones). Nuestra valoración supera ahora los $1 mil millones, y esto es solo el principio.
Únete a nosotros mientras construimos el futuro de la infraestructura autónoma.
SOBRE EL PUESTO
Rendimiento. Latencia. Utilización de la caché KV. Mueve esos tres números en la dirección correcta y ocurren dos cosas: los clientes obtienen una inferencia más rápida y económica, y nuestros márgenes mejoran. Esa es toda la tesis de este puesto. Cada kernel que optimizas, cada esquema de cuantización que implementas, cada ajuste del planificador que aplicas se refleja directamente en el p99 de un cliente y en nuestro P&L.
Este es un puesto de alto impacto. También es un puesto de alta autonomía, ya que se te dará el espacio para liderar la dirección técnica de la optimización de inferencia en Kimchi, no para ejecutar el plan de otra persona.
El problema: ejecutar LLMs en producción es un objetivo en movimiento. El modelo y la configuración de servicio "correctos" para una carga de trabajo dependen de la forma del tráfico, la distribución de la longitud de la secuencia, la dinámica del lote, el SKU de la GPU, el ancho de banda de la memoria, la tolerancia a la cuantización y una docena de otras variables que cambian semana a semana. La mayoría de los equipos eligen un modelo una vez, sobreprovisionan GPUs y absorben el coste. Kimchi es el sistema que toma esa decisión automáticamente, emparejando continuamente las cargas de trabajo con la configuración de inferencia y el modelo de LLM más eficiente en costes y de mejor rendimiento en la infraestructura de un cliente. Estamos construyendo la capa de optimización entre el modelo y el hardware, y necesitamos ingenieros que entiendan ambas partes profundamente.
Stack
Python; vLLM; SGLang; TensorRT-LLM; PyTorch; herramientas adyacentes a CUDA; Kubernetes; gRP; ClickHouse; PostgreSQL; GCP Pub/Sub; AWS / GCP / Azure; CI de GitLab; ArgoCD; Prometheus; Grafana; Loki; Tempo.
REQUISITOS
- 5+ años construyendo sistemas de ML reales, con un portafolio que muestre profundidad en infraestructura de inferencia o entrenamiento (no solo notebooks de entrenamiento de modelos).
- Sólido conocimiento de Python - servicios de producción, no scripts.
- Experiencia práctica con al menos uno de vLLM, SGLang o TensorRT-LLM, y un modelo mental funcional de por qué un motor de inferencia funciona como lo hace en una GPU determinada.
- Fluidez con las compensaciones de cuantización: has medido regresiones de calidad, no solo ratios de compresión.
- Comodidad con sistemas distribuidos: comunicación colectiva, estrategias de fragmentación y los modos de fallo prácticos de configuraciones multi-GPU y multi-nodo.
- Una inclinación por la medición. Instrumentas antes de optimizar, y puedes diferenciar entre una victoria real y un artefacto de benchmark.
- Autodirección. Este puesto viene con un amplio mandato; deberías estar entusiasmado por ello, no inquieto.
RESPONSABILIDADES
- Impulsar el rendimiento. Batching continuo, decodificación especulativa, prefill fragmentado, ajuste a nivel de kernel en vLLM, SGLang y TensorRT-LLM. Encuentra el límite en cada SKU de GPU, luego auméntalo.
- Reducir la latencia. Ataca TTFT y TPOT por separado. Perfila, identifica el cuello de botella real (cómputo, ancho de banda de memoria, planificación, red) y arréglalo, no el cuello de botella que asumiste.
- Sacar más provecho de la caché KV. Atención paginada, caché de prefijos, políticas de desalojo, reutilización de caché entre solicitudes, KV cuantizado. Aquí es donde reside gran parte del rendimiento no realizado, y es un área que dominarás.
- Cuantizar sin regresión de calidad. INT8, INT4, FP8 en pesos, activaciones y KV. Trabajo empírico: mide la calidad en cargas de trabajo reales, no solo en benchmarks de perplejidad.
- Reducir los arranques en frío y la huella de memoria. Inicialización más rápida, carga de pesos más inteligente, contabilidad de memoria más ajustada: la diferencia entre un modelo que escala y uno que no.
- Escalar entre nodos. Topologías de inferencia distribuidas, colocación consciente de la red, estrategias de checkpointing que no se estrangulan en almacenamiento o interconexión.
- Establecer la dirección técnica. Decide qué medimos, qué adoptamos y qué construimos nosotros mismos. Involucra al equipo con informes sólidos y experimentos reproducibles.
¿QUÉ HAY PARA TI?
- Salario competitivo (dependiendo del nivel de experiencia).
- Disfruta de un entorno global flexible y remoto.
- Colabora con un equipo global de expertos e innovadores en la nube, apasionados por superar los límites de la tecnología de Kubernetes.
- Opciones de acciones (equity).
- Obtén feedback rápido con un flujo de trabajo ágil. La mayoría de los proyectos de funcionalidades se completan en 1 a 4 semanas.
- Dedica un 10% de tu tiempo de trabajo a proyectos personales o automejora.
- Presupuesto de aprendizaje para desarrollo profesional y personal, incluido el acceso a conferencias y cursos internacionales que eleven tus habilidades.
- Hackathon anual para generar nuevas ideas y fortalecer los lazos del equipo.
- Presupuesto para actividades de equipo y eventos de la empresa para conectar con tus compañeros.
- Presupuesto para equipamiento para asegurar que tengas todo lo que necesitas.
- Días libres adicionales para ayudar a mantener un equilibrio saludable entre la vida laboral y personal.
PROCESO DE CONTRATACIÓN
- Llamada de selección con Reclutador
- Entrevista con el Hiring Manager
- Entrevista técnica (diseño de sistemas)
- Codificación en vivo
- Entrevista de cultura con un ejecutivo
Como parte de nuestro proceso de contratación estándar, nos gustaría informarte que se puede realizar una verificación de antecedentes en la etapa final del reclutamiento a través de nuestro proveedor externo, Checkr.
Ten en cuenta que Cast AI no proporciona ningún tipo de patrocinio de visa/permiso de trabajo.
#LI-Remote
