Guillaume Duvernay

Neugier ist der Schlüssel zum erfolgreichen Umgang mit KI

AI efficiencyagentslearning

Bevor es Agenten gab, habe ich KI-Automatisierungen in n8n gebaut. Man hatte keine andere Wahl, als zu verstehen, was genau passiert, weil man jeden einzelnen Schritt selbst gebaut hat.

Man zieht einen Node hinein. Man lässt ihn laufen. Man erhält ein JSON-Payload zurück. Man schaut sich diesen Payload an und mappt seine Keys in den nächsten Schritt: Dieses Feld kommt in den System-Prompt, jenes in die User-Message, und ein anderes definiert die Form des strukturierten Outputs, damit man seine Keys drei Schritte später nutzen kann.

Das Setup ist langsam, aber es lehrt einen alles. Man bekommt ein sehr visuelles Bild davon, was ein KI-Aufruf eigentlich ist: ein Schritt mit einem gewählten Input, einem selbst geschriebenen Prompt und einem Output, mit dem man etwas machen muss.

Was man dadurch lernen musste

Ein reales Beispiel: Ein Ticket mit Produktfeedback kommt über einen Webhook an. Man reicht den Text an ein Modell weiter, dessen einzige Aufgabe die Kategorisierung ist: Ist das ein Bug? Ist es dringend? Man liest die Antwort, und wenn es dringend ist, wird es als Slack-Benachrichtigung mit einer zwei Zeilen langen Zusammenfassung weitergeleitet, damit das Team Bescheid weiß.

Drei kleine Schritte. Jeder mit seinem eigenen Prompt. Jeder Prompt enthält nur das, was dieser spezifische Schritt benötigt.

Niemand übergibt dem Modell einfach die gesamte Firma in der Hoffnung, dass es funktioniert. Das ging nicht, das Tool ließ es nicht zu.

Agenten haben das alles abgeschafft

Heute öffne ich Claude Code und werfe dem Tool das Problem vor die Füße. Es liest meine Dateien, ruft meine verbundenen Tools auf und entscheidet selbst, was als Nächstes zu tun ist. Es funktioniert für fast alles, was es genau ist, warum es sich lohnt, es zu benutzen.

Gleichzeitig verbirgt es all die oben genannten Konzepte. In einigen Setups lädt es die Beschreibung jedes Tools jedes Connectors, noch bevor man überhaupt etwas gefragt hat, was viele Tokens für Funktionen kostet, die man heute gar nicht nutzen wird.

Hier steht nirgends, dass der alte Weg besser war. Er war langsamer und lehrreicher, und letzteres ist es wert, zurückgewonnen zu werden.

Warum das wichtig ist, auch wenn man kein Produkt veröffentlicht

Zwei Dinge gehen kaputt, wenn man nicht hinschaut.

Das Budget. Wenn man bis Mittwoch die Tokens für eine ganze Woche verbraucht hat, sind Donnerstag und Freitag ein Problem, das man am Montag selbst erschaffen hat.

Der Loop. Wenn jede Nachricht fünfzehn Minuten braucht, um zurückzukommen, hört man auf zu iterieren. Man schreibt eine Anweisung, macht etwas anderes, kommt zurück, stellt fest, dass es in die falsche Richtung gelaufen ist, und fängt von vorne an. Die Kosten sind nicht die fünfzehn Minuten, sondern die Tatsache, dass man nur vier Versuche am Tag hat.

Dann ist da noch das verwendete Modell. Die meisten von uns nutzen ein großes Modell für alles, obwohl bei mehr als der Hälfte der Aufgaben ein kleineres schneller, genauso gut und günstiger antworten würde. Die Faustregel gilt: Kleiner ist billiger und schneller, klüger ist langsamer und teurer. Zu wissen, welcher Teil der Arbeit welcher ist, ist echtes Geld wert.

Und wenn man doch ein Produkt veröffentlicht, ist es kein Detail

Wenn man selbst an der Tastatur sitzt, ist es (fast) egal, ob eine Aufgabe zehn oder zwölf Minuten dauert. Man prüft es später.

Setzt man dasselbe vor einen Kunden, ändern die Zahlen ihre Bedeutung. Jemand lädt eine Datei hoch, das automatische Mapping dauert fünfundzwanzig Sekunden, und man ist raus. Nicht vier Minuten. Fünfundzwanzig Sekunden.

Ich bin bei der Entwicklung von Lookio auf die harte Version davon gestoßen. Zwischen einer Antwort in fünf Sekunden und derselben Antwort in neun Sekunden liegt der Unterschied, ob etwas in ein Chat-Widget gehört oder nicht. Zwischen einem Cent pro Antwort und neun Cent liegt der Unterschied zwischen einer Marge von 85 % oder 40 %, und das entscheidet darüber, was ich berechnen kann.

Gleiches Modell, gleiches Produkt. Der Unterschied lag darin, wie es zusammengesetzt war.

Wie Neugier konkret aussieht

Man hat vielleicht nie die n8n-Version gebaut. Man kann trotzdem einen Großteil dieses Verständnisses aus dem Agenten herausholen, den man bereits nutzt.

Die Liste der Tools lesen, die ein Connector bietet

Wenn man etwas verbindet, zeigt die Plattform normalerweise jedes Tool an, das es exponiert, mit Namen und Beschreibung. Lesen Sie diese einmal. Man lernt in zwei Minuten mehr darüber, was diese Integration kann, als in einer Woche durch Ausprobieren.

Wenn der CRM-Connector kein Tool zum Löschen eines Kontakts hat und man zehn Minuten damit verbringt, einen Agenten zum Löschen zu drängen, ist dieser nicht faul. Die Funktion existiert schlichtweg nicht, und der Agent kann sie nicht erfinden.

Man kann auch einfach fragen:

Liste jedes Tool auf, das dieser Connector exponiert. Für jedes: den Namen,
was es tut und ob du es für das verwenden würdest, was ich gleich fragen werde.
Markiere alles, von dem ich scheinbar ausgehe, dass es vorhanden ist, obwohl es nicht ist.

Auf die Tool-Aufrufe klicken

Basierend auf der Nachricht wählt der Agent aus einigen Optionen: ein Tool aufrufen, eine Zwischennotiz schreiben, was er gleich tun wird, oder antworten und aufhören. Dann liest er, was zurückgekommen ist, und wählt erneut. Das ist der Loop.

In Claude Code kann man auf jeden dieser Aufrufe klicken und hineinsehen.

Beachten Sie die ID in der Antwort. Nichts hat dem Agenten gesagt, dass er sie sich merken soll. Er hat sie gelesen, so wie er alles andere liest.

Öffnet man einige dieser Aufrufe, verschwindet die Magie auf eine gute Weise. Der Agent erfindet nichts. Er liest, was ein Tool zurückgegeben hat, so wie er eine Datei liest, und entscheidet, was er damit macht.

Fragen, wie es vorgeht, bevor es passiert

Nehmen wir an, man wünscht sich ein MP4, das aus Code statt aus Videomaterial erstellt wurde. Fragen Sie, wie der Agent das angehen will.

Er wird Ihnen sagen, dass er HTML und CSS für die Animation schreibt, dies in einem Headless-Browser rendert, die Einzelbilder aufnimmt und diese in ein Video kodiert.

Jetzt wissen Sie etwas Nützliches. Sie haben bereits HTML, das von Ihrer Website verwendet wird, inklusive Ihrer Schriftarten und Farben. Also können Sie die nächste Frage stellen: Kannst du die Styles meiner Seite wiederverwenden, damit das Video so aussieht wie die Seite?

Das wären Sie eine Stunde zuvor nicht eingefallen. Das Verständnis des Pfades hat die Idee hervorgebracht.

Bevor du beginnst: Wie planst du das umzusetzen? Welche Tools, in welcher
Reihenfolge, und was produziert jeder Schritt? Schreibe noch keinen Code.

Nach drei Wegen fragen, nicht nach einem

Eine Lösung wird schnell zu bauen und starr sein. Eine wird langsam zu bauen sein, aber jeden beliebigen Input akzeptieren. Eine wird dazwischen liegen.

Überlassen an den Agenten, wählt dieser die einfachste funktionierende Lösung, was ein guter Standard ist, aber oft nicht das, was man eigentlich will. Ihn herauszufordern, kostet nur eine Nachricht.

Nenne mir drei Wege, dies umzusetzen, mit den jeweiligen Vor- und Nachteilen: wie lange
die Umsetzung dauert, wo es scheitern kann und was der Betrieb kostet. Sag mir,
welchen Weg du wählen würdest und warum.

Fragen, was am längsten gedauert hat und was gefehlt hat

Nach einem teuren Durchgang sollte man fragen, welche Schritte die Zeit gefressen haben und ob die richtigen Tools für die Aufgabe vorhanden waren.

Hier findet man heraus, wo der Agent kompensiert hat. Man bittet ihn, Unternehmensdaten von LinkedIn zu ziehen, und ohne das passende Tool improvisiert er etwas Langsames und nur halb Zuverlässiges. Gibt man ihm einen echten Scraping-Dienst wie Apify, reduziert sich das Ganze auf einen einzigen Aufruf.

Das habe ich bei meinem eigenen Video-Rendering gemacht. Ich habe gefragt, ob die Kodierung schneller gehen könnte. Sie ging von fünfzehn auf drei Minuten runter. Gleiches Ergebnis. Das hat meinen Tag verändert, weil fünf Iterationen plötzlich nicht mehr einen ganzen Nachmittag dauerten.

Das ist erledigt. Schau nun zurück auf deine Vorgehensweise: Welche Schritte haben am
längsten gedauert, wo musstest du ein fehlendes Tool umgehen und was würdest
du anders machen? Versuche die bessere Version und sag mir dann, was sich
verändert hat und um wie viel.

Drei versuchen, bevor man zweihundert versucht

Bevor man einen Agenten auf 200 Wettbewerber ansetzt, lässt man ihn es für 3 tun. Dann fragt man, was schwierig zu finden war, was langsam war und wo er geraten hat.

Man optimiert den Prozess, solange die Korrektur noch günstig ist. Manchmal bedeutet das, ihm ein Tool zu geben, das er nicht hatte. Manchmal bedeutet es nur, die Sache anders zu formulieren.

Bevor du das für alle 200 machst, erledige es für 3. Sag mir dann, was funktioniert
hat, was nicht und was du ändern würdest. Iteriere bei diesen 3 bis zu dreimal,
falls es hilft. Wenn du mit der Methode zufrieden bist, erkläre mir, wie sie
funktioniert, und warte auf meine Bestätigung, bevor du die restlichen 197 bearbeitest.

Das Ergebnis

Jeder dieser Schritte dauert eine Minute und gibt einem ein Stück des Bildes zurück, das die Tools nicht mehr zeigen.

Nach einer Weile hört man auf, das gesamte Problem zu übergeben und zu hoffen. Man weiß in etwa, was darunter liegt, fragt daher präziser, erkennt selbstbewusst falsche Antworten früher und erkennt Muster, die man bereits bei einer völlig anderen Aufgabe gesehen hat.

Letzteres war der Teil, den ich nicht erwartet habe. Die meisten meiner besseren Ideen im letzten Jahr kamen daher, dass ich verstanden habe, wie etwas funktioniert, und gemerkt habe, dass man es auf eine ganz andere Weise anwenden kann.

Einen Ort zum Ausprobieren behalten

Ich habe einen Ordner namens duv-lab. Die AGENTS.md darin erklärt in einer Zeile, was es ist: ein Labor, nichts darin ist produktionsreif, an den Rändern ist mit Chaos zu rechnen.

Einige Dinge liegen direkt im Root, damit ich sie nie wieder neu einrichten muss: ein OpenRouter-Key zum Testen von Modellen und Cloudflare-Zugangsdaten, damit alles in einer Minute online sein kann.

Dann gibt es einen Unterordner pro Idee, jeder in sich abgeschlossen, jeder mit rm -rf löschbar, ohne etwas anderes zu beschädigen. Bilder malen mit nichts als JavaScript. Ein Modell zerlegen, das Wahrscheinlichkeiten statt Text zurückgibt. Ein Video aus Code animieren.

Der Punkt ist, dass es nichts zu verlieren gibt. Nichts, was kaputtgehen kann, nichts, was gerechtfertigt werden muss. Letzte Woche habe ich eine Bildschirmaufnahme von etwas gemacht, das jemand gepostet hat, den Clip in einen neuen Ordner geworfen und gefragt: Wenn ich dich bitten würde, das zu bauen, wie würdest du es machen, und kannst du es auf drei verschiedene Arten versuchen?

Man braucht einen Ort wie diesen. Einen Ort, an dem man schnell falsch liegen kann, ohne dass es die Arbeit berührt, die man tatsächlich abliefern muss.