Nominal
Emergent Labs
Software Engineer - Infrastruktur
Über die Stelle
Emergent entwickelt autonome Coding-Agenten, die traditionelle Softwareentwicklung ersetzen, indem sie Produktionsanwendungen direkt aus Absichten in natürlicher Sprache generieren, testen und bereitstellen.
Unsere Systeme laufen in der Produktion im globalen Maßstab und werden zum Erstellen von Millionen echter Anwendungen verwendet.
Seit unserem öffentlichen Start haben wir einen ARR von über 100 Mio. $ erreicht und sind auf über 10 Mio. Nutzer in mehr als 190 Ländern gewachsen, die über 12 Mio. Anwendungen auf Emergent erstellt haben.
Wir werden unterstützt von Creaegis, Claypond, Sentinel Global, Khosla Ventures, SoftBank, Google, Lightspeed, Prosus, Together und Y Combinator.
Wir lösen den schwierigen Teil der KI-gesteuerten Softwareerstellung: Korrektheit, Zuverlässigkeit, Sicherheit und Skalierbarkeit in echten Produktionssystemen.
Das Team besteht aus Seriengründern, Olympiamedaillengewinnern, IIT- & IIM-Alumni sowie Führungskräften von Google, Amazon und Dropbox.
Wir stellen Entwickler ein, die Ownership, Geschwindigkeit und Wirkung im globalen Maßstab wünschen.
Lassen Sie uns gemeinsam die Zukunft der Software gestalten.
Was Sie tun werden
Plattform und Infrastruktur
- Aufrechterhaltung der Stabilität unserer Plattform, die aus verteilten Microservices besteht, die eng mit Kubernetes und Cloud-Anbietern (GCP, AWS) interagieren
- Verwaltung von Kubernetes-Workloads mit ArgoCD (GitOps), Bereitstellung, Überwachung und Fehlerbehebung von Anwendungssynchronisationen, Ressourcenbäumen und Rollouts
- Debugging und Behebung komplexer Kubernetes-Probleme über Cluster hinweg
- Verwaltung von CDN- und Edge-Infrastruktur (Cloudflare) für Leistung, Caching und Verkehrsmanagement
- Automatisierung von Infrastruktur-Lifecycle-Operationen und -Workflows
Observability und Incident Response
- Verantwortlich für den Observability-Stack: Grafana (Dashboards, Loki-Logs, Prometheus-Metriken) und New Relic (APM, Golden Metrics, Transaktionsanalyse)
- Verbesserung von Monitoring, Alerting und verteiltem Tracing über Dienste hinweg
- Teilnahme an der Bereitschaftsrotation über PagerDuty, Bearbeitung von Incident Response und Durchführung von Root-Cause-Analysen
- Proaktive Identifizierung von Zuverlässigkeitsrisiken, bevor sie zu Incidents werden
KI-Agenten-Infrastruktur
- Unterstützung der Plattform, die KI-Agenten-Workloads ausführt, einschließlich Job-Scheduling, Trajectory-Tracking, Umgebungsbereitstellung, Deployments und Kostenattribution
- Entwicklung von Kubernetes-Controllern und -Operatoren zur Erweiterung der Plattformfunktionen für die Agenten-Orchestrierung
Zusammenarbeit und interne Tools
- Enge Zusammenarbeit mit Produkt- und backend-Teams, um Skalierbarkeit und Zuverlässigkeit der Plattform zu gewährleisten
- Erstellung interner Tools, Automatisierung von Workflows und Integration von Systemen zur Verbesserung der Teamproduktivität
- Auf dem Laufenden bleiben mit Kubernetes-Releases, CNCF-Ökosystem-Updates und Cloud-nativen Best Practices
Wonach wir suchen
Kernanforderungen
- 3+ Jahre Erfahrung in Software-/Plattform-Engineering mit Produktionssystemen
- Starke Kenntnisse in Go oder Python, Sie schreiben täglich produktiven Code in mindestens einer Sprache
- Praktische Erfahrung im Erstellen und Bereitstellen von Diensten auf Kubernetes, nicht nur YAML, Sie haben etwas entwickelt, das auf K8s läuft
- Erfahrung mit GitOps-Tools (ArgoCD, Flux oder ähnlich)
Systemgrundlagen
- Starke Netzwerk- und DNS-Grundlagen: TCP/IP, HTTP, Load Balancing, DNS-Auflösung, TLS und Debugging von Konnektivitätsproblemen
- Solide Linux/OS-Grundlagen: Prozessmanagement, Dateisystem, Speicher, systemd und komfortables Debugging mit Tools wie strace, tcpdump und netstat
Daten- und Messaging-Infrastruktur
- Relationale Datenbanken: Erfahrung mit PostgreSQL, MySQL oder ähnlichem; Indizierung, Abfrageoptimierung, Replikation und Backup/Restore-Verfahren
- NoSQL-Datenbanken: Vertrautheit mit MongoDB, DynamoDB, Redis oder ähnlichem für Dokument-/Key-Value-Workloads
- Caching: Erfahrung mit Redis, Memcached oder ähnlichem für Anwendungs- und Infrastruktur-Caching
- Message Queues und Streaming: praktische Erfahrung mit Kafka, SQS, RabbitMQ oder ähnlichem für ereignisgesteuerte Architekturen
- Starke SQL-Kenntnisse für Debugging und operative Abfragen
Infrastruktur und Observability
- Vertrautheit mit dem CNCF-Ökosystem: Helm, Kustomize, cert-manager, Ingress-Controller, CNI/CSI-Schnittstellen
- Praktische Erfahrung mit mindestens einem Observability-Stack (Grafana/Prometheus/Loki, New Relic, Datadog oder ähnlich)
- Vertrautheit mit GCP und/oder AWS: verwaltete Kubernetes (GKE/EKS), Netzwerke, IAM, Speicher und Cloud-native Dienste (SES, SQS, S3, etc.)
- Erfahrung mit CDN/Edge-Plattformen (Cloudflare, CloudFront oder ähnlich)
Gut zu haben
- Erfahrung im Erstellen von Kubernetes-Operatoren (kubebuilder, operator-sdk, oder controller-runtime)
- Erfahrung in der Feinabstimmung von Kubernetes-Kernkomponenten (API-Server, kubelet, Scheduler)
- Vertrautheit mit KI/LLM-Infrastruktur: Token-Management, Kostenverfolgung, Agenten-Orchestrierung
- Erfahrung mit CI/CD-Pipelines (GitHub Actions, automatisierte Tests, Deployment-Pipelines)
- Infrastructure as Code-Erfahrung (Terraform, Pulumi oder ähnlich)
- Frühere Arbeit an groß angelegten verteilten Systemen oder Platform-as-a-Service
- Startup-Erfahrung, Sie gedeihen in schnelllebigen, mehrdeutigen Umgebungen
Wer Sie sind
- Ein Generalist, der zwischen dem Debugging eines K8s-Deployments, der Einrichtung eines Grafana-Alerts und der Konfiguration von CDN-Regeln am selben Tag wechseln kann
- Sie lösen gerne komplexe Infrastrukturprobleme und automatisieren mühsame Aufgaben
- Sie gehen der Sache auf den Grund. Wenn etwas kaputt geht, finden Sie die Ursache, nicht nur die Umgehungslösung.
- Sie kommunizieren klar und können effektiv in einem schnelllebigen, verteilten Team zusammenarbeiten
Technologie-Stack
Wir verlangen keine Vorkenntnisse in unserem gesamten Stack, aber Begeisterung für das Lernen ist entscheidend: Go, Python, Kubernetes, ArgoCD, Helm, GCP, AWS, Cloudflare, Grafana, Prometheus, Loki, New Relic, PagerDuty, PostgreSQL, MongoDB, Redis, Kafka und GitHub.
Vorteile und Vergünstigungen
- 401(k)
- Krankenversicherung (gesetzlich/privat)
- Unbegrenzte bezahlte Urlaubstage: Nehmen Sie sich die Zeit, die Sie brauchen, um sich zu erholen und erfrischt zurückzukommen
- Flexible Arbeitszeiten: Arbeitsmodelle, die zu Ihrem Leben und Ihren Verpflichtungen passen
