
Hrishikesh Jadhav
AI Engineer
AI Engineer in Deutschland mit über 4 Jahren Erfahrung in der Entwicklung und produktiven Bereitstellung von AI- und Backend-Systemen. Ich baue LLM-Extraktionspipelines, RAG- und MCP-Systeme sowie die Evaluation Gates, die entscheiden, was in Produktion geht.
Ich bin Hrishi und habe bei Toku die LLM-Extraktionspipeline, den RAG-Assistenten und den MCP-Server gebaut, die innerhalb einer globalen Payroll-Plattform täglich produktiv im Einsatz sind. Davor war ich Data Scientist bei GfK / NIQ in Nürnberg, wo ich LLM-Klassifizierung, semantisches Retrieval und Vorhersagemodelle entwickelt und mit Python, AWS, Docker und GitLab CI/CD produktiv betrieben habe.
Projekte
Toku Help Center
Kundenseitiges Help Center mit AI-Assistenten für Payroll, Benefits, Richtlinien und Länderleitfäden.
Zwei getrennte Retrieval-Sammlungen, damit Fragen zur Einwanderung nie aus Payroll-Inhalten beantwortet werden. So funktioniert es
- Problem
- Kunden sollen Antworten zu Payroll, Benefits, Richtlinien und Länderleitfäden an einem Ort finden, mit einem Assistenten, der auf Grundlage dieser Inhalte antwortet.
- Architektur
- Ein Help Center auf Basis von Next.js und der Notion-Wissensdatenbank von Toku. Der Assistent ruft Inhalte aus zwei getrennten Sammlungen ab, allgemeine Hilfe und Visa-Support, mit Fallback über mehrere Modell-Provider.
- Schwierige Entscheidung
- Das Retrieval ist auf zwei Sammlungen aufgeteilt, damit Fragen zu Einwanderung und Arbeitserlaubnis nie aus allgemeinen Payroll-Inhalten beantwortet werden.
- Ergebnis
- Hat Kunden geholfen, Antworten aus der Notion-Wissensdatenbank von Toku zu erhalten.
Toku Statusseite
Öffentliche Statusseite für die Payroll-Plattform von Toku.
Durch die getrennte Prüfung von Edge und Origin lässt sich ein CDN-Ausfall von einem Anwendungsfehler unterscheiden, und Code-Fixes gehen direkt an einen Agent. So funktioniert es
- Problem
- Ausfälle der Payroll-Plattform erkennen, Fehler, die eine Codeänderung erfordern, automatisch an einen Agent übergeben und das Team zeitnah über Slack benachrichtigen.
- Architektur
- Die überwachten Komponenten werden in einem kurzen, festen Intervall vom Cloudflare Edge aus geprüft. Incidents werden automatisch erkannt und geschlossen, Abhängigkeiten laufen in einer Gesamtansicht zusammen, und der Status wird als JSON API und RSS-Feed veröffentlicht. Wird ein Incident eröffnet, erhält das Team eine Slack-Benachrichtigung, und Fehler, die eine Codeänderung erfordern, übernimmt ein Coding Agent.
- Schwierige Entscheidung
- Edge und Origin werden getrennt geprüft, sodass ein Fehler dem CDN oder der Anwendung zugeordnet ist, bevor sich jemand damit befasst.
Berufserfahrung
- 10/2025–09/2026
AI Engineer, Toku
Globale Employer-of-Record- und Payroll-Infrastrukturplattform, tätig in 46 Ländern.
- Brachte AI-Tools in den täglichen Produktivbetrieb von Product-, Engineering- und Sales-Teams: einen MCP-Server, der interne Systeme für LLM-Clients zugänglich macht, einen RAG-Assistenten (FastAPI, LangChain, pgvector) sowie n8n-Automatisierungen für Onboarding, die Verarbeitung von Gehaltsabrechnungen und Support-Triage. Verantwortete Deployment, Dokumentation, Onboarding und direkten Anwendersupport.
- Reduzierte die Erfassung produktiver Payroll-Daten von Stunden manueller Arbeit pro Abrechnungszyklus auf Minuten, mit einer selbst gehosteten LLM-Extraktionspipeline (Python, FastAPI, PostgreSQL, DigitalOcean), die personenbezogene Daten vor der Inferenz maskiert.Selbst gehostet, damit keine Mitarbeiterdaten die kontrollierte Infrastruktur verlassen.
- Sicherte eine feldbasierte Extraktionsgenauigkeit oberhalb des vereinbarten Schwellenwerts über alle extrahierten Felder, geprüft gegen ein umfangreiches Golden Evaluation Set; entwickelte dafür das Evaluation Framework und ein CI Regression Gate, das jedes Deployment unterhalb des Schwellenwerts blockiert.So kann keine Änderung, die die Extraktionsgenauigkeit verschlechtert, Payroll-Daten erreichen.
- Verlagerte Security Reviews für Tausende Pull Requests direkt in den Pull Request, indem automatisierte, LLM-gestützte Sicherheitsprüfungen in GitHub CI für Tokus Finanzplattform integriert wurden.
- Entwickelte status.toku.com, Tokus öffentliche Statusplattform: Produktionskomponenten werden in einem kurzen, festen Intervall vom Cloudflare Edge aus geprüft und Incidents automatisch erkannt und geschlossen, mit Dependency Rollups, Edge-vs.-Origin-Fehlerisolierung sowie JSON API und RSS-Feed. Neue Incidents lösen eine Slack-Benachrichtigung an das Team aus, und Fehler, die eine Codeänderung erfordern, übernimmt ein Coding Agent.Weil Edge und Origin getrennt geprüft werden, ist ein Fehler dem CDN oder der Anwendung zugeordnet, bevor sich jemand damit befasst.
- Entwickelte Tokus kundenseitiges Help Center mit AI-Assistenten (toku.com/help, Next.js) auf Basis der Notion-Wissensdatenbank von Toku, mit Artikeln zu Payroll, Benefits, Richtlinien und Länderleitfäden für Dutzende Länder; Inhalte für allgemeine Hilfe und Visa-Support liegen in getrennten Retrieval-Korpora, mit Multi-Model-Fallback über mehrere Provider.Getrennte Korpora, damit Fragen zu Einwanderung und Arbeitserlaubnis nie aus allgemeinen Payroll-Inhalten beantwortet werden.
- Senkte die LLM-Inferenzkosten auf einen Bruchteil der geschätzten Kosten vergleichbarer externer API-Nutzung durch den Betrieb von Open-Weight-Modellen auf selbst gehosteter GPU-Infrastruktur.
Personenbezogene Daten werden vor der Inferenz maskiert, und ein Gate auf Basis des Golden Sets entscheidet, was deployt wird. - 08/2022–09/2025
Data Scientist, GfK - An NIQ Company
Werkstudent, Data Science, 08/2022–07/2024
- Reduzierte den manuellen Aufwand bei der Produkt-Taxonomie-Klassifizierung um rund 30 % durch einen LLM-basierten Klassifikationsservice auf Amazon Bedrock mit Prompt Engineering und RegEx-basiertem Post-Processing.
- Reduzierte die Suchzeit in internen Produktkatalogen um rund 40 % gegenüber der bisherigen Keyword-Suche durch semantisches Retrieval auf Basis von Vector Embeddings.
- Verbesserte die Vorhersagegenauigkeit für simultane Zuschauer um rund 20 % gegenüber dem bisherigen Modell durch Training und Deployment eines CatBoost-Modells mit über 30 entwickelten Features aus Soziodemografie, zeitlichen Mustern und Programm-Metadaten.
- Gewährleistete den 24/7-Betrieb produktiver Scoring-Pipelines ohne manuelle Eingriffe durch die Orchestrierung von S3-Ingestion, Feature-Generierung, Model Scoring und automatisierten Integrationstests in GitLab CI/CD, containerisiert mit Docker unter Linux.
- Entwickelte eine Data-Fusion-Pipeline für TV-Zuschauerdaten mit K-Nearest Neighbors und einem genetischen Algorithmus, um Panel-Haushalte anhand umfangreicher Return-Path-Daten zuzuordnen und zu replizieren.
- 04/2020–08/2020
Softwareentwickler (Praktikum), Sapio Analytics Pvt. Ltd.
- Entwickelte COVID-19-Modelle zur Entscheidungsunterstützung in Python (SEIRD, scikit-learn, SciPy) und Prognose-Dashboards (Plotly, AWS), die als Grundlage für Entscheidungen der indischen Regierung zu Lockdowns und Teststrategien dienten, mit einem um 4,8 % niedrigeren RMSE gegenüber der vorherigen Baseline.
Publikationen
- 2025
- 2021
Auszeichnungen
- 2024
NIQ/GfK HACKFEST · Top 3, mit einem RAG-Lernassistenten, der in 24 Stunden gebaut und präsentiert wurde
- 2024
BMW Innovation Challenge · Ausgewählter Teilnehmer der 24-Stunden-Challenge in der BMW iFactory Dingolfing (Use Case: DocCheck)
- 2020
IEEE Machine Learning Hackathon · 1. Platz
- 2020
HackCovid-19 · Sieger unter 130 Teams
- 2017
Smart India Hackathon · Sieger (indisches Verteidigungsministerium)
Kontakt
Offen für AI-Engineering-Rollen in Deutschland ab Oktober 2026. Inhaber der Blauen Karte EU mit Arbeitserlaubnis für Deutschland.
GitHub · LinkedIn · Lebenslauf