Banco Mercantil del Norte, S.A.
Workana
AI Application Engineer (Teilzeit)
Über die Stelle
Kunde: medxprts.ai
Standort: Remote
Art: Teilzeit, mit Potenzial zur Umwandlung in Vollzeit
Arbeitszeit: Überschneidung mit US-Zeitzonen erforderlich
Beschreibung
Medxprts.ai entwickelt eine KI-gestützte Plattform für den Rechts- und Gesundheitsbereich, die LLMs, agentenbasierte Workflows und Automatisierung nutzt, um produktionsreife Anwendungen zu erstellen.
Wir suchen einen KI-Ingenieur – LLM Fine-Tuning: einen praxisorientierten Ingenieur, der Open-Weight-Modelle persönlich trainiert und feinabgestimmt hat, Trainingsinfrastrukturen aufgebaut hat, Datensätze aus unstrukturierten Dokumenten erstellt und strenge Evaluations- sowie Präferenz-/Feedback-Trainingspipelines etabliert hat. Diese Rolle arbeitet eng mit den Engineering-Teams zusammen, um Modelle und integrierte Funktionen in die Produktion zu überführen.
Aufgaben
- Entwerfen, Implementieren und Durchführen von LLM Fine-Tuning-Experimenten (LoRA/QLoRA und Full SFT) auf Open-Weight-Modellen (z. B. Llama, Mistral, Qwen) und Überführen trainierter Modelle in Produkt-Workflows.
- Aufbau und Wartung der Trainingsinfrastruktur unter Verwendung von PyTorch und Hugging Face Tooling (Transformers, PEFT, TRL/Axolotl), einschließlich Multi-GPU-Trainingsorchestrierung (DeepSpeed/FSDP) auf AWS oder GCP.
- Erstellung von Datensätzen aus realen, unstrukturierten Quellen (lange PDFs, medizinische/juristische Akten), Durchführung von Deduplizierung, Filterung, Kontaminationsprüfungen und Train/Eval-Splits.
- Erstellung von Evaluations-Frameworks, die auf domänenspezifische Bedürfnisse zugeschnitten sind: zurückgehaltene Testdatensätze, LLM als Richter mit menschlicher Kalibrierung, Regressionstests über Modellversionen hinweg und automatisiertes Monitoring auf Modelldrift.
- Implementierung von Präferenz-/Feedback-Trainingsworkflows (DPO/RLHF-Stil oder ähnlich), um aus Expertenkorrekturen (Doctor-in-the-Loop) zu lernen, und Integration von Feedbackschleifen in Modell-Retraining-Pipelines.
- Zusammenarbeit mit backend/frontend-Ingenieuren zur Integration von feinabgestimmten Modellen in Dienste, Optimierung der Inferenzlatenz/-kosten und Unterstützung von Produktions-Deployments.
- Teilnahme an PR-Reviews, Release-Prozessen, Incident-Debugging und kontinuierlicher Verbesserung von Trainings- und Deployment-Tools.
- Sicherstellung des sicheren, konformen Umgangs mit sensiblen Daten (HIPAA-Kenntnisse sind sehr wünschenswert) während der Datenaufbereitung und des Modelltrainings.
Mindestanforderungen
- Praktische Erfahrung im Fine-Tuning von LLMs: persönlich trainierte oder feinabgestimmte Open-Weight-Modelle mit LoRA/QLoRA und Full SFT; Fähigkeit, Trade-offs zu erklären und mindestens ein ausgeliefertes Beispiel vorzuweisen.
- Erfahrung mit Trainingsinfrastruktur: PyTorch + Hugging Face Ökosystem (Transformers, PEFT, TRL/Axolotl), Kenntnisse im Multi-GPU-Training (DeepSpeed oder FSDP) und Ausführung von Trainings-Workloads auf AWS oder GCP.
- Expertise in der Datensatzentwicklung: Erstellung von Instruktions-/Präferenzdatensätzen aus unstrukturierten Dokumenten; praktische Kenntnisse in Deduplizierung, Filterung, Train/Eval-Splits und Kontaminationsvermeidung.
- Starke Evaluationsdisziplin: Entwurf domänenspezifischer Evaluations-Frameworks über Standard-Benchmarks hinaus, einschließlich menschlich kalibrierter Richter-Setups und Regressionstests.
- Praktische Erfahrung mit Präferenz-/Feedback-Lernmethoden (DPO, RLHF-ähnliche Workflows oder Äquivalente) und Integration von Expertenfeedback in Modellaktualisierungen.
- Solide Grundlagen in Software Engineering: Produktions-Workflows (Git, PRs), Debugging, Testing, Deployment-Erfahrung und wartbarer Code.
- Erfahrung mit APIs, Datenbanken und Service-Integration für Modellinferenz.
- Fähigkeit, selbstständig zu arbeiten, schnell zu lernen und technische Anweisungen zu befolgen.
- Gute Englischkenntnisse und Verfügbarkeit zur Überschneidung mit den Arbeitszeiten in den USA.
Wünschenswert
- Erfahrung mit Strategien zur Handhabung langer Kontexte für sehr große Dokumente (Retrieval-Aware Training, Kontext-Erweiterung, RAG für Quellen mit mehreren tausend Seiten).
- Modell-Deployment und Inferenzoptimierung: Quantisierung (GPTQ/AWQ), vLLM/TGI-Serving, Batching/Throughput-Tuning, Latenz- und Kostenoptimierung.
- Vertrautheit mit Vektordatenbanken, fortgeschrittenen RAG-Pipelines, MCPs oder n8n-ähnlichen Workflow-Automatisierungstools.
- Kenntnisse in Docker, CI/CD, Kubernetes/EKS oder serverloser Infrastruktur.
- Vorerfahrung im Gesundheitswesen, Legaltech, HIPAA-konformen Prozessen oder anderen regulierten/datenempfindlichen Umgebungen.
- Öffentliches Portfolio, GitHub oder Beispiele für ausgelieferte LLM/agentenbasierte Anwendungen und Fine-Tuning-Projekte.
- Vollständig remote Position.
- Möglichkeit, an echten KI-Produkten im Rechts- und Gesundheitsbereich zu arbeiten.
- Hohe Eigenverantwortung und Autonomie.
- Leistungsbezogene Anreize und ergebnisorientierte Boni.
- Potenzial für eine langfristige Vollzeitstelle.
