Workana

AI Application Engineer (Teilzeit)

AWSGCPDockerKubernetes
Automatische Übersetzung. Prüfe das Original.

Über die Stelle

Kunde: medxprts.ai

Standort: Remote

Art: Teilzeit, mit Potenzial zur Umwandlung in Vollzeit

Arbeitszeit: Überschneidung mit US-Zeitzonen erforderlich

Beschreibung

Medxprts.ai entwickelt eine KI-gestützte Plattform für den Rechts- und Gesundheitsbereich, die LLMs, agentenbasierte Workflows und Automatisierung nutzt, um produktionsreife Anwendungen zu erstellen.

Wir suchen einen KI-Ingenieur – LLM Fine-Tuning: einen praxisorientierten Ingenieur, der Open-Weight-Modelle persönlich trainiert und feinabgestimmt hat, Trainingsinfrastrukturen aufgebaut hat, Datensätze aus unstrukturierten Dokumenten erstellt und strenge Evaluations- sowie Präferenz-/Feedback-Trainingspipelines etabliert hat. Diese Rolle arbeitet eng mit den Engineering-Teams zusammen, um Modelle und integrierte Funktionen in die Produktion zu überführen.

Aufgaben

  1. Entwerfen, Implementieren und Durchführen von LLM Fine-Tuning-Experimenten (LoRA/QLoRA und Full SFT) auf Open-Weight-Modellen (z. B. Llama, Mistral, Qwen) und Überführen trainierter Modelle in Produkt-Workflows.
  1. Aufbau und Wartung der Trainingsinfrastruktur unter Verwendung von PyTorch und Hugging Face Tooling (Transformers, PEFT, TRL/Axolotl), einschließlich Multi-GPU-Trainingsorchestrierung (DeepSpeed/FSDP) auf AWS oder GCP.
  1. Erstellung von Datensätzen aus realen, unstrukturierten Quellen (lange PDFs, medizinische/juristische Akten), Durchführung von Deduplizierung, Filterung, Kontaminationsprüfungen und Train/Eval-Splits.
  1. Erstellung von Evaluations-Frameworks, die auf domänenspezifische Bedürfnisse zugeschnitten sind: zurückgehaltene Testdatensätze, LLM als Richter mit menschlicher Kalibrierung, Regressionstests über Modellversionen hinweg und automatisiertes Monitoring auf Modelldrift.
  1. Implementierung von Präferenz-/Feedback-Trainingsworkflows (DPO/RLHF-Stil oder ähnlich), um aus Expertenkorrekturen (Doctor-in-the-Loop) zu lernen, und Integration von Feedbackschleifen in Modell-Retraining-Pipelines.
  1. Zusammenarbeit mit backend/frontend-Ingenieuren zur Integration von feinabgestimmten Modellen in Dienste, Optimierung der Inferenzlatenz/-kosten und Unterstützung von Produktions-Deployments.
  1. Teilnahme an PR-Reviews, Release-Prozessen, Incident-Debugging und kontinuierlicher Verbesserung von Trainings- und Deployment-Tools.
  1. Sicherstellung des sicheren, konformen Umgangs mit sensiblen Daten (HIPAA-Kenntnisse sind sehr wünschenswert) während der Datenaufbereitung und des Modelltrainings.

Mindestanforderungen

  1. Praktische Erfahrung im Fine-Tuning von LLMs: persönlich trainierte oder feinabgestimmte Open-Weight-Modelle mit LoRA/QLoRA und Full SFT; Fähigkeit, Trade-offs zu erklären und mindestens ein ausgeliefertes Beispiel vorzuweisen.
  1. Erfahrung mit Trainingsinfrastruktur: PyTorch + Hugging Face Ökosystem (Transformers, PEFT, TRL/Axolotl), Kenntnisse im Multi-GPU-Training (DeepSpeed oder FSDP) und Ausführung von Trainings-Workloads auf AWS oder GCP.
  1. Expertise in der Datensatzentwicklung: Erstellung von Instruktions-/Präferenzdatensätzen aus unstrukturierten Dokumenten; praktische Kenntnisse in Deduplizierung, Filterung, Train/Eval-Splits und Kontaminationsvermeidung.
  1. Starke Evaluationsdisziplin: Entwurf domänenspezifischer Evaluations-Frameworks über Standard-Benchmarks hinaus, einschließlich menschlich kalibrierter Richter-Setups und Regressionstests.
  1. Praktische Erfahrung mit Präferenz-/Feedback-Lernmethoden (DPO, RLHF-ähnliche Workflows oder Äquivalente) und Integration von Expertenfeedback in Modellaktualisierungen.
  1. Solide Grundlagen in Software Engineering: Produktions-Workflows (Git, PRs), Debugging, Testing, Deployment-Erfahrung und wartbarer Code.
  1. Erfahrung mit APIs, Datenbanken und Service-Integration für Modellinferenz.
  1. Fähigkeit, selbstständig zu arbeiten, schnell zu lernen und technische Anweisungen zu befolgen.
  1. Gute Englischkenntnisse und Verfügbarkeit zur Überschneidung mit den Arbeitszeiten in den USA.

Wünschenswert

  1. Erfahrung mit Strategien zur Handhabung langer Kontexte für sehr große Dokumente (Retrieval-Aware Training, Kontext-Erweiterung, RAG für Quellen mit mehreren tausend Seiten).
  1. Modell-Deployment und Inferenzoptimierung: Quantisierung (GPTQ/AWQ), vLLM/TGI-Serving, Batching/Throughput-Tuning, Latenz- und Kostenoptimierung.
  1. Vertrautheit mit Vektordatenbanken, fortgeschrittenen RAG-Pipelines, MCPs oder n8n-ähnlichen Workflow-Automatisierungstools.
  1. Kenntnisse in Docker, CI/CD, Kubernetes/EKS oder serverloser Infrastruktur.
  1. Vorerfahrung im Gesundheitswesen, Legaltech, HIPAA-konformen Prozessen oder anderen regulierten/datenempfindlichen Umgebungen.
  1. Öffentliches Portfolio, GitHub oder Beispiele für ausgelieferte LLM/agentenbasierte Anwendungen und Fine-Tuning-Projekte.
  • Vollständig remote Position.
  • Möglichkeit, an echten KI-Produkten im Rechts- und Gesundheitsbereich zu arbeiten.
  • Hohe Eigenverantwortung und Autonomie.
  • Leistungsbezogene Anreize und ergebnisorientierte Boni.
  • Potenzial für eine langfristige Vollzeitstelle.

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026