Guillaume Duvernay

Ein KI-Agent tut nur zwei Dinge

agentsAI efficiencylearning

Über KI-Agenten wird gesprochen, als wären sie eine neue Art von Intelligenz, die selbstständig Dinge erledigt. Wenn ich sie in meinem Workshop oder einem Kollegen erkläre, fange ich viel grundlegender an.

In jedem Schritt tut ein Agent eines von zwei Dingen: Er schreibt dir eine Nachricht oder ruft ein Tool auf.

Das ist alles. Alles andere ist die Software drumherum.

Die Schleife

Du schickst eine Anfrage. Das Modell liest sie zusammen mit allem, was ihm sonst noch mitgegeben wurde, und entscheidet, was als Nächstes zu tun ist. Entweder antwortet es dir oder fordert ein Tool auf: im Web suchen, eine Datei lesen, deine E-Mails auflisten oder einen Kontakt in deinem CRM anlegen.

Das Modell führt das Tool nicht selbst aus. Es formuliert eine kurze Anfrage („Rufe dieses Tool mit diesen Eingaben auf“), und die umgebende Software führt sie aus. Das Ergebnis kommt zurück und wird zu dem hinzugefügt, was das Modell sieht. Dann entscheidet das Modell erneut: ein weiteres Tool oder eine Antwort.

Die Schleife endet, wenn das Modell eine Nachricht ohne Tool-Aufruf schreibt. Das ist deine endgültige Antwort.

Aus einer Anfrage können zehn Schritte werden, doch jeder einzelne besteht aus einem von denselben zwei Vorgängen. Die Tools unterscheiden sich je nach Produkt, die Schleife bleibt gleich.

Man könnte sogar sagen, dass es nur einen Vorgang gibt. Dem Nutzer zu schreiben ist ein Tool wie jedes andere, mit dem Namen „Nutzer benachrichtigen“. Ich finde zwei Vorgänge leichter zu erklären, weil du die Nachricht tatsächlich siehst.

Was das Modell tatsächlich sendet

Im Hintergrund besteht ein Schritt aus einer kleinen, strukturierten Antwort. Vereinfacht und ohne die Teile, die sich je nach Anbieter unterscheiden, sieht sie so aus:

{
  "message": "Klar, ich suche die neuesten Beiträge.",
  "tool_call": {
    "name": "search_profile",
    "input": { "name": "Jane Example" }
  }
}

Eine Antwort kann gleichzeitig eine kurze Statusmeldung und einen Tool-Aufruf enthalten. Das ist das „Klar, ich sehe mal nach“, das du im Chat siehst, während die Arbeit weiterläuft. Die abschließende Antwort enthält eine Nachricht, aber keinen Tool-Aufruf. Daran erkennt die Software, dass sie aufhören und dir wieder das Wort überlassen soll.

Der ganze Ablauf als Geschichte

Hier ein realistisch wirkender Auftrag, von Anfang bis Ende: „Finde die 5 neuesten LinkedIn-Beiträge von Jane Example und speichere sie in einer Datei.“ Das Modell ist der Roboter. Es kann nur schreiben. Jeder Tool-Aufruf ist ein Auftrag, den es an die App weitergibt. Die App ist hier als Laufbursche dargestellt: Er erledigt den Auftrag und bringt das Ergebnis zurück.

You at your desk ask: find Jane Example's 5 latest LinkedIn posts and save them to a file. The model, a blue robot, and the harness, a runner in a red cap, are waiting.The model thinks: two moves, which one? 1, write a message: text for you, nothing runs. 2, call a tool: a request for the harness to run.Step 1. The model says "Sure, let me find her profile first" and hands a red tool-call ticket, search_profile with the name Jane Example, to the runner. It writes the request; it cannot run it.Step 2. The runner dashes to the LinkedIn shop and brings back a result slip: her profile URL and her headline, Head of Ops.Steps 3 and 4. The model reads the result and decides again: another ticket, get_posts with a limit of 5, newest first. The runner hauls back five posts.Steps 5 and 6. A third ticket, write_file posts.md. The runner files it in the cabinet and comes back with a tiny result: ok, true.
Step 7. A message with no tool call: "Done. I saved her 5 latest posts in posts.md." You say thanks; the runner says: no ticket, break time. The loop ends.
Drei Tool-Aufrufe und zwei Nachrichten. Der Roboter verlässt seinen Schreibtisch nie: Er schreibt Aufträge, und der Laufbursche erledigt die Arbeit.

So kannst du es in n8n beobachten

Schon vor Claude Code gehörte n8n zu den ersten Tools, mit denen sich Agents einfach bauen ließen. Und noch immer lässt sich dort die Schleife am besten nachvollziehen, weil jeder einzelne Schritt angezeigt wird.

Hier ist ein Agent, der ungefähr so einfach ist, wie man ihn bauen kann. Ein Chat-Trigger, ein AI-Agent-Node, ein Modell, ein Speicher und zwei Tools: ein Taschenrechner und Wikipedia.

Modell und Speicher unterstützen den Agent. Die beiden Tools sind das Einzige, was er tatsächlich tun kann.

Ich habe den Agent gefragt, wie hoch die Gesamtbevölkerung von Frankreich und Deutschland ist. Bei den Zahlen ist er sich nicht sicher, also rät er nicht. So sieht der Ablauf Schritt für Schritt in den n8n-Protokollen aus:

Vier Tool-Aufrufe und eine Nachricht. In n8n kannst du jeden einzelnen anklicken und genau sehen, welche Eingabe gesendet wurde und welche Ausgabe zurückkam, einschließlich der Tokens und der benötigten Zeit. Diese Transparenz vermisse ich am meisten, wenn ich zu größeren Agents wechsle. Darum geht es auch bei der Neugier darauf, was dein Agent getan hat.

Claude Code funktioniert genauso, nur mit besseren Tools

Claude Code, Codex in der ChatGPT-App und OpenCode verwenden genau diese Schleife. Anders ist die Auswahl der Tools. Sie bringen die wichtigsten für die Arbeit am Computer mit: Dateien lesen, Dateien durchsuchen, Dateien bearbeiten, neue Dateien schreiben und Befehle im Terminal ausführen. Die meisten bieten außerdem eine Websuche. Eigene Tools kannst du über Connectoren hinzufügen.

Das Terminal macht den entscheidenden Unterschied. Über ein Terminal kann ein Agent fast alles tun, was auch dein Computer kann, ohne dass es für jede einzelne Aufgabe ein eigenes Tool braucht. Und Modelle sind darin sehr gut, weil Befehle und Skripte Code sind und diese Modelle sich mit Code am besten auskennen.

Das sehe ich auch bei Softr. Wenn wir einen Agent bitten, mit vielen speziellen Tools etwas zusammenzustellen, braucht er viele Aufrufe und macht oft Fehler. Bitten wir ihn stattdessen, für dieselbe Aufgabe etwas JavaScript zu schreiben, klappt es oft auf Anhieb.

Das ist ein wichtiger Grund, warum ich Leuten empfehle, mit Dateien zu arbeiten. So liegt deine Arbeit in dem Bereich, in dem der Agent am stärksten ist.

Warum es sich lohnt, das zu wissen

Klingt nach belanglosem Wissen. In der Praxis verändert es, was du tust, wenn etwas schiefläuft.

Wenn ein Agent eine schlechte Antwort gibt, kann das nur an wenigen Stellen liegen: Er hat das falsche Tool aufgerufen, das richtige Tool mit einer falschen Eingabe verwendet, das Tool hat ein unvollständiges Ergebnis geliefert oder der Agent hat ein gutes Ergebnis falsch interpretiert. Das kannst du Punkt für Punkt überprüfen. Ihn zu bitten, sich „mehr anzustrengen“, überprüft nichts davon.

Es zeigt dir auch, was ein Agent nicht kann. Wenn kein Tool in deinem Notion eine Seite löschen kann, bringt auch kein Prompt den Agenten dazu. Er kann nur aus der Liste der verfügbaren Tools auswählen.

Agenten-Apps machen das sichtbar, wenn du darauf achtest. Die Tool-Aufrufe sind die Zeilen, die sich von den Nachrichten unterscheiden, und du kannst jede einzelne öffnen.

Derselbe Durchlauf wie im Comic, dargestellt wie in Claude Code oder Codex. In der geöffneten Zeile siehst du, womit das Modell tatsächlich arbeiten musste.

Wenn dich ein Agent das nächste Mal überrascht, öffne die einzelnen Schritte. Suche die Tool-Aufrufe und sieh dir an, was hinein- und zurückkam. Meistens findest du die Antwort genau dort.