Ein KI-Agenten-Harness ist die Software-Infrastruktur, die ein Large Language Model (LLM) umgibt und es ihm ermöglicht, Aufgaben auszuführen, anstatt nur auf Prompts zu antworten. Das Modell analysiert ein Problem logisch und entscheidet, was als Nächstes zu tun ist. Das Harness verbindet es mit den Tools, Systemen, dem Speicher und den Ausführungsumgebungen, die für diese Aktionen erforderlich sind.
Agent = Modell + Harness
Stellen Sie sich das Modell als das „Gehirn“ vor, das logische Schlüsse zieht und Entscheidungen trifft. Das Harness ist alles drum herum, was dem Agenten hilft, sicher und zuverlässig zu arbeiten, einschließlich:
Ohne ein Harness kann ein Modell zwar Fragen beantworten, aber es kann nicht selbstständig Code ausführen, APIs aufrufen, auf Dateien zugreifen, sich an frühere Arbeitsschritte erinnern oder mehrstufige Workflows zuverlässig abschließen.
In diesem Leitfaden behandeln wir die Kernkomponenten eines KI-Agenten-Harness, warum Harnesses die Leistung von Agenten maßgeblich beeinflussen, wie produktive Agentensysteme aufgebaut sind und warum sich Harness-Engineering als eigene Disziplin etabliert.
KI-Agenten basieren auf zwei komplementären Ebenen: einem Modell, das logisch denkt, und einem Harness, das handelt.
Das Modell – ob GPT-5.5, Claude, Llama oder ein anderes LLM – liest den Kontext und entscheidet, was als Nächstes zu tun ist. Das Harness setzt diese Entscheidungen in Aktionen um, indem es das Modell mit Tools, dem Speicher und externen Systemen verbindet.
Moderne Agentensysteme basieren zunehmend auf dieser Trennung zwischen logischem Denken und Ausführung. Zusammen ermöglichen diese beiden Ebenen es Agenten, Aufgaben in realen Workflows zuverlässig zu erledigen.
Das Herzstück vieler KI-Agenten ist ein sich wiederholender Zyklus. Wenn man diese Schleife versteht, wird die Rolle des Harness deutlicher.
Dieses Muster wird oft als ReAct-Schleife bezeichnet (kurz für „Reasoning and Acting“, also logisches Denken und Handeln) und bildet heute das Fundament vieler produktiver Agentensysteme. Die ReAct-Schleife wurde 2022 in dem Paper ReAct: Synergizing Reasoning and Acting in Language Models von Shunyu Yao et al. vorgestellt.
Stellen Sie sich einen Coding-Agenten vor, der einen Fehler beheben soll. Das Modell schl ägt eine Codeänderung vor. Das Harness führt den Code in einer isolierten Sandbox aus, erfasst die Testergebnisse und gibt sie an das Modell zurück. Wenn die Tests fehlschlagen, analysiert das Modell die Fehlerursache und versucht es erneut. Das Harness verwaltet die Interaktion mit dem zugrunde liegenden System, während sich das Modell auf die Lösung der Aufgabe konzentriert.
Die Begriffe „Agent“, „Modell“ und „Harness“ werden oft synonym verwendet, beziehen sich jedoch auf unterschiedliche Teile des Systems. Diese Unterscheidung hilft Teams zu verstehen, was sie tatsächlich entwickeln, debuggen oder verbessern.
| Komponente | Funktion | Einfache Analogie |
|---|---|---|
| Modell | Denkt logisch, prognostiziert und generiert Text oder andere Ausgaben | Das „Gehirn“ des Systems |
| Harness | Führt Aktionen aus, verwaltet den Speicher, führt Tools aus und setzt Regeln durch | Der „Körper“ und der Arbeitsbereich um das Gehirn |
| Agent | Das vollständige, funktionierende System, das beide Komponenten kombiniert | Ein Mitarbeiter, der denken und handeln kann |
Die meisten produktiven Harnesses bestehen aus denselben grundlegenden Komponenten, die jeweils darauf ausgelegt sind, eine bestimmte Einschränkung des reinen Modells zu überwinden.
Ein System-Prompt ist eine feste Reihe von Anweisungen, die dem Modell bei jeder Ausführung übergeben werden. Sie legen fest, wer das Modell ist, was es erreichen soll und welche Regeln es befolgen muss. System-Prompts prägen das Verhalten, die Persönlichkeit und die Guardrails des Agenten, noch bevor eine Benutzereingabe erfolgt. Schlecht geschriebene Prompts sind eine der häufigsten Ursachen für inkonsistentes oder unvorhersehbares Verhalten.
Tools sind vordefinierte Funktionen, die das Modell aufrufen kann, um mit externen Systemen zu interagieren – beispielsweise für die Websuche, Datenbankabfragen, das Senden von E-Mails, das Ausführen von Code oder den Aufruf einer API. Das Modell entscheidet, welches Tool wann verwendet wird. Das Harness ist die Komponente, die das Tool tatsächlich ausführt und das Ergebnis an das Modell zurückgibt.
Entwickler rücken zunehmend von großen Sammlungen eng definierter Tools ab. Stattdessen statten sie Agenten mit einer universelleren Fähigkeit aus: der Fähigkeit, Code zu schreiben und auszuführen. Dadurch kann das Modell Workflows dynamisch erstellen, anstatt sich auf einen festen Satz vordefinierter Aktionen verlassen zu müssen.
Eine Sandbox ist ein isolierter Arbeitsbereich, in dem ein Agent Code ausführen oder Aktionen durchführen kann, ohne Auswirkungen auf die Umgebung außerhalb zu haben. Dies ist wichtig, da das direkte Ausführen von agentengeneriertem Code auf einem realen System riskant ist.
Durch die Isolierung der Umgebung ermöglichen Sandboxes es Agenten, sicher zu experimentieren. Zudem bieten sie Teams einen geschlossenen Arbeitsbereich, den sie überwachen, zurücksetzen oder bei Problemen sauber herunterfahren können. Sie ermöglichen es auch, viele Agenten parallel und in großem Maßstab auszuführen.
Ein Dateisystem bietet dem Agenten einen Ort zum Lesen und Schreiben von Dateien wie Code, Notizen, Plänen und Zwischenergebnissen, die über verschiedene Sitzungen hinweg erhalten bleiben.
Dauerhafter Speicher ermöglicht es Agenten, bei lang laufenden Aufgaben kontinuierlich Fortschritte zu erzielen und mit Menschen oder anderen Agenten über einen gemeinsamen Arbeitsbereich mit Dateien – und nicht nur über Chat-Nachrichten – zusammenzuarbeiten.
Basismodelle behalten keine Informationen über ihr aktuelles Kontextfenster hinaus. Das Harness verwaltet den Speicher sowohl innerhalb einer Aufgabe als auch sitzungsübergreifend. Wenn Konversationen länger werden, entscheidet das Harness, was aktiv bleibt und was zusammengefasst wird – ein Prozess, der als Kontextkompaktierung bezeichnet wird.
In der Praxis bedeutet dies, ältere Teile der Konversation zu kürzen, damit das Modell bei wachsendem Kontext nicht überfordert wird. Sitzungsübergreifend speichert das Harness den relevanten Verlauf und ruft ihn ab. So kann der Agent seine Arbeit fortsetzen und weiß genau, was er bereits getan hat.
Gute Harnesses lassen das Modell nicht einfach nur handeln – sie überprüfen auch das Ergebnis. Nach jeder Aktion kann das Harness Tests ausführen, Ergebnisse prüfen oder das Modell auffordern, seine eigene Ausgabe zu überprüfen, bevor es fortfährt.
Diese Feedback-Schleifen ermöglichen es Agenten, lange oder komplexe Aufgaben zuverlässig zu bewältigen, indem sie Arbeitsschritte wiederholt ausführen, Ergebnisse prüfen, Fehler abfangen und den Kurs automatisch korrigieren.
Guardrails sind in das Harness integrierte Regeln, die unsichere oder nicht genehmigte Aktionen blockieren. Beispiele hierfür sind die Anforderung einer menschlichen Freigabe, bevor ein Agent eine Datei löscht, eine Nachricht an einen Kunden sendet oder einen Kauf tätigt.
Eine gängige Art von Guardrail ist eine Human-in-the-Loop-Kontrolle, bei der eine Person bestimmte Aktionen überprüft oder genehmigt, bevor sie ausgeführt werden. In Unternehmensumgebungen sind diese Freigabeprozesse oft zwingend erforderlich.
Observability bedeutet, mithilfe von Logs, Traces und Dashboards nachvollziehen zu können, was der Agent getan hat, warum er die jeweilige Entscheidung getroffen hat und wo Fehler aufgetreten sind. Für Entwickler hilft Observability bei der Diagnose und dem Debugging des Agentenverhaltens. Für Unternehmensteams ist dies oft eine Compliance-Anforderung. Regulierte Branchen benötigen Audit-Trails, die genau zeigen, was ein Agent getan hat und wer dies autorisiert hat.
Im großen Maßstab speist Observability auch die Evaluierungsinfrastruktur – Systeme, die kontinuierlich messen, ob Agenten über Tausende von Durchläufen hinweg korrekt funktionieren, und nicht nur bei Demos.
Da sich die Modelle in ihrer reinen Leistungsfähigkeit immer weiter angleichen, bestimmt das Harness zunehmend die Gesamtleistung. Speicher, Tool-Orchestrierung, Feedback-Schleifen und Guardrails sorgen für Zuverlässigkeit. Bei öffentlichen Benchmarks kann dasselbe Modell je nach Aufbau des Harness deutlich besser oder schlechter abschneiden. Bei vielen workflowintensiven Aufgaben kann ein starkes Harness um ein Modell der Mittelklasse ein schwaches Harness um ein leistungsstärkeres Modell übertreffen.
Die Auswirkungen sind messbar. Als Databricks GPT-5.5 mit dem OfficeQA Pro Agent Harness kombinierte – entwickelt für komplexe, mehrteilige Dokumentenaufgaben in Unternehmen –, erzielte es 52,63 % im Vergleich zu 36,10 % mit GPT-5.4, was die Fehlerquote fast halbiert hat. Das Modell hat sich verbessert, aber erst das Harness hat diese Verbesserung in eine zuverlässige Leistung in der Produktionsumgebung übersetzt. Frameworks zur Evaluierung von AI-Agenten helfen Teams dabei, genau das zu messen: ob das Harness-Design die Modellfähigkeiten in konsistente, vertrauenswürdige Ergebnisse verwandelt.
Harness-Engineering ist die neueste Stufe eines umfassenderen Wandels in der Art und Weise, wie Entwickler mit AI-Systemen arbeiten. Da die Modelle immer leistungsfähiger geworden sind, hat sich der Fokus schrittweise nach außen verlagert. Er hat sich vom Schreiben besserer Prompts über die Kontrolle der Informationen, die das Modell sieht, bis hin zum Entwurf des gesamten Systems um das Modell herum verschoben.
| Disziplin | Fokus | Wichtigstes Artefakt | Typische Anwendungen |
|---|---|---|---|
| Prompt-Engineering | Formulierung der Eingabe für eine bessere Antwort | Ein präzise formulierter Prompt | Frühe LLM-Anwendungen |
| Context-Engineering | Kuratieren, welche Informationen das Modell wann sieht | Retrieval-Pipelines, Memory-Design | Anwendungen der RAG-Ära |
| Harness-Engineering | Entwicklung des gesamten Systems um das Modell herum – Tools, Sandboxes, Schleifen, Guardrails | Das Harness selbst | Agentenbasierte Systeme und autonome Workflows |
Sowohl Prompt- als auch Context-Engineering sind Teil des Harness-Engineerings. Das Harness ist das System um das Modell herum; Prompts und Kontext sind Teile dieses Systems.