Entwicklung individueller LLM-Anwendungen

Produktive LLM-Systeme auf Basis Ihrer Daten

Wir entwickeln Retrieval-Lösungen, werkzeuggestützte Abläufe und fokussierte KI-Anwendungen mit klaren Kriterien für Qualität, Kosten und Prüfung. Das Modell ist ein Teil des Systems – nicht das fertige Produkt.

  • Evaluation vor dem Rollout
  • Berechtigungsabhängiges Retrieval
  • Menschliche Prüfung bei relevanten Risiken
Evaluationsumgebung Freigabekandidat
„Welche Vertragsbedingungen gelten für diese Verlängerung und wo sind sie dokumentiert?“
01 · Umfang Zugriffsregeln
02 · Quellen Freigegebene Inhalte
03 · Ausführung Modell + Werkzeuge
04 · Prüfung Antwort + Belege
Quellenbezug
Erforderlich
Aktionsrechte
Nur Lesen
Prüfweg
Verantwortliche Person
Ein belastbares LLM-System kontrolliert Quellen, Berechtigungen und Fehlerwege – nicht nur den Prompt.

Mit der Entscheidung beginnen

Ein LLM ist nur sinnvoll, wenn das Problem eines benötigt

Wir prüfen zuerst, ob sprachliche Uneindeutigkeit, verteiltes Wissen oder die Koordination mehrerer Systeme tatsächlich der Engpass ist. Ein deterministischer Ablauf ist oft günstiger und verlässlicher.

Wenn ein LLM keinen messbaren Mehrwert bietet, sagen wir das, bevor ein Pilot Budget verbraucht.

Gut geeignet

  • Wissen ist verteiltAntworten hängen von mehreren Dokumenten, Systemen oder Berechtigungsstufen ab.
  • Eingaben sind unstrukturiertMenschen arbeiten mit Tickets, Verträgen, E-Mails oder frei formulierten Anfragen.
  • Beurteilung lässt sich begrenzenEine Prüfung, eine Regel oder ein Quellenbeleg kann relevante Fehler abfangen.

Ein einfacheres System genügt

  • Die Regel ist bereits eindeutigEin normaler Service, eine Abfrage oder ein Regelwerk liefert das korrekte Ergebnis.
  • Es gibt keine verlässliche QuelleDas System kann nicht zuverlässiger sein als die bereitgestellten Daten.
  • Fehler können nicht geprüft werdenAutonome Entscheidungen mit hoher Tragweite benötigen stärkere Kontrollen als eine Modellantwort.

Architekturentscheidungen

Den kleinsten passenden Lösungsansatz wählen

„Individuell“ bedeutet selten, ein Basismodell von Grund auf zu trainieren. Die richtige Lösung kann klassische Automatisierung, Retrieval, kontrollierte Werkzeugnutzung oder gezieltes Fine-Tuning sein.

Validierte Eingabe Geschäftsregel Systemaktion

Kein Modell erforderlich

Vorhersehbare Arbeit bleibt vorhersehbar

Regeln, Vorlagen und APIs sind die bessere Wahl, wenn Eingaben und erwartete Ergebnisse bereits strukturiert sind.

Sinnvoll, wenn
Dieselbe Eingabe immer dasselbe Ergebnis liefern soll.
Nicht geeignet, wenn
Bedeutung aus langen oder widersprüchlichen Texten abgeleitet werden muss.
Wichtigste Kontrolle
Validierung, typisierte Verträge und automatisierte Tests.

Beispielsysteme

Konkrete Abläufe mit sichtbarem Fehlerweg

Dies sind Lösungsansätze, keine erfundenen Fallstudien. Jeder beginnt mit einer begrenzten Aufgabe und macht den Kontrollpunkt sichtbar.

  1. 01
    Support

    Support-Copilot mit Quellenbelegen

    Ein Antwortentwurf aus Produktdokumentation, Kundenkontext und bekannten Störungen, ohne Inhalte offenzulegen, auf die der Mitarbeiter nicht zugreifen darf.

    Eingabe
    Ticket, Kundenberechtigung und Gesprächsverlauf
    System
    Berechtigungsabhängiges Retrieval mit Quellenbewertung
    Ausgabe
    Antwortvorschlag, Textbelege und Unsicherheitshinweise
    Kontrollpunkt
    Ein Support-Mitarbeiter bearbeitet und versendet die Antwort
  2. 02
    Dokumentenprozesse

    Vertragserfassung mit Ausnahmebehandlung

    Relevante Bedingungen extrahieren, mit Vorgaben vergleichen und uneindeutige Klauseln weiterleiten, statt eine sichere Antwort vorzutäuschen.

    Eingabe
    Vertrag, interne Vorgaben und Dokumenttyp
    System
    Strukturierte Extraktion mit deterministischer Validierung
    Ausgabe
    Felder, Fundstellen und ungeklärte Ausnahmen
    Kontrollpunkt
    Eine verantwortliche Person klärt markierte Klauseln
  3. 03
    Interne Abläufe

    Wissensassistent mit kontrollierten Aktionen

    Betriebliche Fragen beantworten und eine freigegebene Systemaktion vorbereiten, ohne dem Modell unbeschränkte Schreibrechte zu geben.

    Eingabe
    Anfrage, Benutzerrolle und aktueller Systemzustand
    System
    Retrieval, Werkzeugauswahl und Regelprüfung
    Ausgabe
    Belegte Antwort oder Vorschau der vorgesehenen Aktion
    Kontrollpunkt
    Sensible Änderungen erfordern eine ausdrückliche Bestätigung

Qualität vor dem Start

Abnahmekriterien definieren, bevor die Oberfläche entsteht

Ein repräsentativer Evaluationsdatensatz macht aus „Die Antworten sehen gut aus“ eine nachvollziehbare Freigabeentscheidung. Er zeigt auch Regressionen, wenn sich Prompts, Quellen oder Anbieter ändern.

Jede Zeile zeigt, was gemessen wird und warum es relevant ist.

MessgrößeFragestellungNachweis zur Freigabe
AufgabenqualitätErledigt das System die begrenzte Aufgabe korrekt?Geprüfte Beispiele mit vereinbartem Bewertungsschema
QuellenbezugLassen sich relevante Aussagen auf freigegebene Quellen zurückführen?Quellenabdeckung und Prüfung unbelegter Aussagen
FehlerbehandlungLöst Unsicherheit den richtigen Rückfallweg aus?Bekannte Fehlerfälle, Eskalations- und Ablehnungstests
BetriebIst die Antwort bei realem Volumen schnell und wirtschaftlich genug?Latenzverteilung und Kosten pro abgeschlossener Aufgabe

Daten und Betrieb

Verantwortung wird in das System eingebaut

Hosting und Anbieter können variieren. Klarheit über Zugriffe, Aufbewahrung, Modelländerungen und betriebliche Verantwortung darf nicht variieren.

Das Betriebsmodell bleibt bei jeder Bereitstellungsvariante eindeutig.

BereichEntscheidungBetrieblicher Nachweis
DatenzugriffWelche Quellen und Datensätze darf jede Rolle abrufen?Berechtigungstests und Zugriffsprotokolle
AufbewahrungWas dürfen Anbieter, Protokolle und Evaluationsdaten speichern?Dokumentierter Datenfluss und Aufbewahrungsregeln
ModelländerungenWer genehmigt einen neuen Prompt, ein Modell oder eine Retrieval-Strategie?Versionierte Releases und Regressionsergebnisse
StörungenWie wird eine falsche Antwort begrenzt und untersucht?Abschaltung, Ablaufprotokoll, Verantwortlicher und Runbook

Datenstandort, Modellrechte und Anbieterbedingungen werden für die gewählte Architektur dokumentiert, statt pauschal versprochen.

Umsetzungsmodell

Von einem Ablauf zum betriebenen System

Wir reduzieren Unsicherheit in einer klaren Reihenfolge. Der erste Meilenstein ist ein messbarer, durchgängiger Ausschnitt – keine breite KI-Plattform.

  1. 01

    Entscheidung eingrenzen

    Ablauf, Ausgangswert, Risiko, Verantwortlichen und einfachere Alternativen festlegen.

  2. 02

    Nachweise vorbereiten

    Repräsentative Beispiele, Quellenberechtigungen und Abnahmekriterien zusammenstellen.

  3. 03

    Durchgängigen Ausschnitt bauen

    Nur die Daten und Werkzeuge anbinden, die für den vollständigen Testweg benötigt werden.

  4. 04

    Evaluieren und betreiben

    Qualität, Kosten und Latenz messen und anschließend Monitoring, Prüfung und Rollback ergänzen.

Praktische Fragen

Was Teams üblicherweise klären müssen

Die Antwort hängt vom Ablauf und seinem Risiko ab. Die Entscheidung sollte jedoch vor der Umsetzung eindeutig sein.

Müssen wir ein eigenes Modell trainieren?

In der Regel nicht. Wir testen zuerst ein geeignetes Basismodell mit Retrieval, Werkzeugen und Anwendungskontrollen. Fine-Tuning kommt nur infrage, wenn Messungen eine stabile Lücke belegen.

Kann das System in unserer Infrastruktur laufen?

Das hängt vom gewählten Modell und den Betriebsanforderungen ab. Wir vergleichen verwaltete APIs, Private Cloud und Self-Hosting anhand von Datengrenzen, Kosten, Latenz und Wartungsaufwand.

Wie lange dauert ein Pilot?

Ein begrenzter Ablauf lässt sich oft innerhalb mehrerer Wochen bewerten, wenn Quelldaten, Verantwortliche und Prüfbeispiele verfügbar sind. Den Umfang bestätigen wir erst, nachdem Daten und Integrationsweg verstanden wurden.

Wie reduzieren Sie Halluzinationen?

Wir begrenzen die Aufgabe, verankern Antworten in freigegebenen Quellen, verlangen bei Bedarf Belege und definieren Rückfallwege für Unsicherheit. Die Evaluation misst verbleibende Fehlerarten; keine Kontrolle macht ein Modell unfehlbar.

Wem gehören Daten und Umsetzung?

Ihre Daten bleiben Ihre Daten. Rechte an Anwendungscode, Prompts, Evaluationsdaten, trainierten Gewichten und Modellen Dritter werden für den gewählten Technologie-Stack vertraglich festgehalten.