
KI-Agenten-Workflow-Muster: 7 Muster und wann jedes wirklich gewinnt (2026)
KI-Agenten-Workflow-Muster haben endlich Zahlen: Im Januar 2026 evaluierte Google Research 180 Agenten-Konfigurationen und stellte fest, dass dieselbe Koordinationsänderung parallelisierbares finanzielles Reasoning um 80,9 % hob, während sie sequenzielle Planung auf PlanCraft um bis zu 70 % drückte. Derselbe Hebel, entgegengesetzte Ergebnisse. Die entscheidende Variable ist die Zerlegbarkeit der Aufgabe, nicht die Anzahl der Agenten, und die sieben Muster unten werden an veröffentlichten Daten gemessen, nicht an Anbieter-Diagrammen.
- Sieben Muster zählen: sequenziell, Routing, Parallelisierung, Orchestrator-Workers, Reflection, ReAct, Plan-and-Execute.
- Die Zerlegbarkeit der Aufgabe entscheidet über den Sieger. Parallelisierbare Arbeit gewinnt; sequenzielle Arbeit verliert.
- Starten Sie mit einem Agenten. Fügen Sie einen zweiten erst hinzu, wenn ein einzelner Agent unter ~85 % Genauigkeit stagniert.
KI-Agenten-Workflow-Muster im Überblick: Was die Daten sagen
Die sieben KI-Agenten-Muster sind sequenziell (Prompt Chaining), Routing (Handoff), Parallelisierung (Fan-out/Fan-in), Orchestrator-Workers, Reflection (Evaluator-Optimizer), ReAct und Plan-and-Execute. Fünf Anbieter-Doks benennen sie unterschiedlich, aber diese sieben Formen decken jede Taxonomie ab, die Anthropic, OpenAI, Vercel, Microsoft und Google Cloud derzeit veröffentlichen. Human-in-the-Loop ist keines der sieben: Es ist eine Kontrollschicht, die sich um jedes davon legt.
| Muster | Was es ist | Einsetzen, wenn | Gemessene Kosten / Nutzen (Quelle) | LangGraph / OpenAI SDK / Anthropic / AI SDK |
|---|---|---|---|---|
| Sequenziell (Prompt Chaining) | Schritte laufen nacheinander | Der Pfad ist fest und jeder Schritt braucht den vorherigen | Kein öffentlicher Gewinn gemessen; Anthropic (2026-03-05) nennt es den Standard-Startpunkt | chain / code orchestration / sequential / sequential processing |
| Routing (Handoff) | Klassifizieren, dann an einen Spezialisten übergeben | Eingaben zerfallen in klare Domänen | Keine öffentliche Messung | router / handoff / routing / routing |
| Parallelisierung (Fan-out/Fan-in) | Teilaufgaben gleichzeitig ausführen, Ergebnisse zusammenführen | Teilaufgaben sind wirklich unabhängig | +80,9 % gegenüber einem einzelnen Agenten bei parallelisierbaren Finanzaufgaben (Google Research, 2026-01-28, 180 Konfigurationen) | Send fan-out / code orchestration / parallel / parallel processing |
| Orchestrator-Workers | Ein Leit-Agent zerlegt und delegiert | Kontextdomänen sind getrennt und groß | +90,2 % gegenüber Single-Agent Opus 4 auf Anthropics Research-Eval (2025-06-13); ~15× Chat-Tokens | supervisor / agents-as-tools / orchestrator-workers / orchestrator-worker |
| Reflection (Evaluator-Optimizer) | Generator plus Kritiker in einer Schleife | Ausgabequalität ist messbar | Keine öffentliche Messung | reflection / LLM orchestration / evaluator-optimizer / evaluator-optimizer |
| ReAct | Verzahntes Reasoning und Tool-Aufrufe | Schritte hängen von früheren Beobachtungen ab | +34 % absolut auf ALFWorld, +10 % auf WebShop (Yao et al., 2022) | ReAct agent / no named pattern / autonomous agent / no named pattern |
| Plan-and-Execute | Erst die ganze Route planen, dann ausführen | Die Route ist vorab vorhersehbar | Schlug Zero-Shot-CoT auf 10/10 Datensätzen (Wang et al., ACL 2023); keine Einzelzahl veröffentlicht | plan-and-execute / no primitive / autonomous agent / no named pattern |
Lesen Sie die Messwert-Spalte skeptisch. Drei Zeilen tragen echte Zahlen; vier tragen „keine öffentliche Messung", und das ist 2026 der ehrliche Zustand des Felds. Fünf Anbieter veröffentlichen fünf verschiedene Namen für das, was im Kern drei oder vier zugrunde liegende Formen sind. Die letzte Spalte existiert, damit Sie jeden dieser Namen auf die darunterliegende Form zurückübersetzen können; der Rest des Beitrags nimmt eine Familie nach der anderen auseinander.
Zwei Spalten, die niemand auf der SERP bespricht, sind Token-Kosten und Latenzbudget. Sequenziell und Routing verbrauchen von beiden am wenigsten; Orchestrator-Workers verbraucht von beiden am meisten; Parallelisierung tauscht Token-Ausgaben gegen Wall-Clock-Zeit. Wählen Sie das Muster nach der Ressource, die Ihre Aufgabe tatsächlich begrenzt, nicht nach dem Diagramm, das beeindruckend aussieht.
Was sind KI-Agenten-Workflow-Muster (und was sind die 4 Phasen eines KI-Workflows)?
KI-Agenten-Workflow-Designmuster sind wiederverwendbare Formen, um LLM-Aufrufe, Tool-Nutzung und Kontrolllogik zu einem System zu ordnen. Die sieben, die in jeder Anbieter-Taxonomie wiederkehren, sind sequenziell, Routing, Parallelisierung, Orchestrator-Workers, Reflection, ReAct und Plan-and-Execute. Jedes tauscht Token-Kosten, Latenz und Genauigkeit anders, daher hängt die richtige Wahl von der Struktur der Aufgabe ab, nicht vom Framework, das Sie zufällig benutzen.
Ein typischer KI-Agenten-Workflow durchläuft vier Phasen, in einer Schleife:
- Planen: Das Modell entscheidet angesichts von Ziel und bisherigem Verlauf, was als Nächstes zu tun ist.
- Handeln: Es ruft ein Tool auf, was 2026 meist einen MCP-Server oder einen Function Call bedeutet. Model Context Protocol (MCP) standardisiert diese Tool-Schicht modellübergreifend.
- Beobachten: Das Tool-Ergebnis geht als neue Nachricht zurück in den Kontext.
- Reflektieren / Schleife: Das Modell beurteilt, ob das Ergebnis gut genug ist, und wiederholt dann oder stoppt.
Jedes Muster in diesem Beitrag ist eine andere Art, diese vier Phasen zu verdrahten. Sequenziell fixiert die Reihenfolge im Code. ReAct lässt das Modell jede Runde die nächste Phase wählen. Orchestrator-Workers verteilt die Schleife auf mehrere Modelle.
Eine Unterscheidung zählt vor dem Katalog. Ein Workflow ist ein vorherbestimmter Code-Pfad; ein Agent gibt die Kontrolle an das Modell ab. Anthropic zieht die Grenze genau so in Building Effective Agents: „Workflows bieten Vorhersagbarkeit und Konsistenz für gut definierte Aufgaben, während Agenten die bessere Wahl sind, wenn Flexibilität und modellgetriebene Entscheidungen in großem Maßstab gefragt sind."
Falls Sie auf der Suche nach den klassischen Agententypen der KI hierherkamen (einfacher Reflex, modellbasiert, zielbasiert, lernend): Diese Taxonomie stammt aus der Zeit vor LLMs; die sieben Muster oben sind jene, die darüber entscheiden, ob Ihr Build ausgeliefert wird.
Die deterministischen Muster: sequenziell, Routing und Parallelisierung
Drei Muster behalten die Kontrolle in Ihrem Code statt im Modell. Sie sind die günstigsten im Betrieb und die einfachsten beim Debuggen, und die Empfehlung des Claude-Teams vom März 2026 ist unmissverständlich, wo man anfangen soll: „Starten Sie mit dem einfachsten Muster, das Ihr Problem löst. Standard ist sequenziell."
Sequenziell (Prompt Chaining)
Ein Aufruf speist den nächsten. Sie zerlegen eine schwere Aufgabe in geordnete Schritte, und jeder Schritt bekommt die Ausgabe des vorherigen als Eingabe. Der Gewinn ist Lesbarkeit: Sie können jedes Zwischenergebnis prüfen und jeden Schritt cachen. Vermeiden Sie es, wenn die Teilaufgaben unabhängig sind, denn Sie zahlen Latenz für eine Reihenfolge, die Sie nicht brauchen. Wenn Zustand zwischen Schritten oder über Sitzungen hinweg überleben muss, ist das ein Speicherproblem, kein Chaining-Problem; die Aufteilung erklärt unser Leitfaden zum Agenten-Gedächtnis. Die einzige veröffentlichte Empfehlung dafür ist ein Standardwert: Keine Studie misst einen Gewinn durch Chaining selbst, denn es ist die Baseline, die jedes andere Muster mit Extraaufwand schlagen muss.
from anthropic import Anthropic
client = Anthropic()
def chain(steps: list[str], context: str = "") -> str:
for step in steps:
msg = client.messages.create(
model="claude-sonnet-4-5",
max_tokens=1024,
messages=[{"role": "user", "content": f"{context}\n\n{step}"}],
)
context = msg.content[0].text
return context
summary = chain([
"Extract the five key claims from this report: {report}",
"Rewrite those claims as bullets an engineer would trust.",
])Routing (Handoff)
Ein günstiger Klassifizierer liest die Eingabe und übergibt sie an einen Spezialisten-Prompt oder ein Spezialmodell. OpenAI rahmt es in der Agents-SDK-Doku: „Ein Triage-Agent leitet das Gespräch an einen Spezialisten weiter, und dieser Spezialist wird zum aktiven Agenten für den Rest des Zugs." Vermeiden Sie Routing, wenn der Klassifizierer unzuverlässiger ist als einfach ein allgemeiner Pfad, denn jede Fehlleitung ist eine stille falsche Antwort. Der benannte Fehlermodus hier ist Kontextverlust über die Übergabe: Der Spezialist sieht nur, was der Router weiterleitet. Den vollen Trace mitzuführen ist eine Context-Engineering-Entscheidung, und sie falsch zu treffen ist der Grund, warum geroutete Systeme vergesslich wirken. Die Token-Rechnung spricht trotzdem für Routing: Der Klassifizierer läuft auf einem kleinen Modell (oben gpt-4o-mini), also fügt ein Router ein paar Hundert günstige Tokens pro Anfrage hinzu statt eines zweiten teuren Aufrufs.
from openai import OpenAI
client = OpenAI()
SPECIALISTS = {
"billing": "You answer billing and refund questions.",
"technical": "You debug API errors and integration issues.",
}
def route(question: str) -> str:
triage = client.responses.create(
model="gpt-4o-mini",
input=f"Reply with exactly one of {list(SPECIALISTS)}: {question}",
)
key = triage.output_text.strip().lower()
return client.responses.create(
model="gpt-4o",
instructions=SPECIALISTS.get(key, SPECIALISTS["technical"]),
input=question,
).output_textParallelisierung (Fan-out/Fan-in)
Unabhängige Teilaufgaben laufen gleichzeitig, dann führt ein Merge-Schritt sie zusammen. Anthropic teilt das in Sectioning (Arbeit aufteilen) und Voting (dieselbe Aufgabe mehrmals ausführen und vergleichen). Das ist die Form, die Google Research im Januar 2026 bei parallelisierbarem finanziellem Reasoning mit +80,9 % gegenüber einem einzelnen Agenten maß, genau weil die Aufgabe sich sauber zerlegte. Vermeiden Sie es in dem Moment, wo Schritt n+1 von der Ausgabe aus Schritt n abhängt; eine Abhängigkeitskette zu parallelisieren sortiert die falschen Antworten nur schneller um. Latenz ist die andere Hälfte des Gewinns: Unabhängige Aufrufe laufen nebenläufig, also sinkt die Wall-Clock-Zeit ungefähr mit der Zahl der Worker, während die gesamten Token-Ausgaben gleich bleiben.
from concurrent.futures import ThreadPoolExecutor
from anthropic import Anthropic
client = Anthropic()
def run(subtask: str) -> str:
msg = client.messages.create(
model="claude-sonnet-4-5",
max_tokens=1024,
messages=[{"role": "user", "content": subtask}],
)
return msg.content[0].text
def fan_out(subtasks: list[str]) -> list[str]:
with ThreadPoolExecutor(max_workers=len(subtasks)) as pool:
return list(pool.map(run, subtasks))
parts = fan_out([
"Summarize Q1 revenue drivers in two sentences.",
"Summarize Q1 churn drivers in two sentences.",
])
merged = run(f"Combine into one executive summary:\n{parts}")ReAct vs. Plan-and-Execute: Welches Reasoning-Muster sollten Sie nutzen?
ReAct verzahnt Reasoning mit Aktion: Das Modell denkt, ruft ein Tool auf, beobachtet das Ergebnis und entscheidet erst dann den nächsten Schritt. Plan-and-Execute schreibt den vollständigen Plan, bevor irgendein Tool läuft, und führt die Schritte dann der Reihe nach aus. ReAct passt sich Überraschungen mitten im Lauf an; Plan-and-Execute zahlt vorab für einen großen Planungsaufruf und vertraut der Route.
ReAct entscheidet den nächsten Schritt nach jeder Beobachtung; Plan-and-Execute legt die ganze Route vor dem ersten Tool-Aufruf fest.
ReAct stammt von Yao et al. (arXiv 2210.03629, v1 Oktober 2022, v3 März 2023) und berichtete +34 % absoluten Erfolg auf ALFWorld und +10 % auf WebShop gegenüber Imitations- und Reinforcement-Learning-Baselines, mit nur ein oder zwei In-Context-Beispielen. Es ist die Standardschleife hinter den meisten Tool-nutzenden Agenten, und es ist eine Lücke im SERP-Ergebnis auf Platz 3: Microsoft Learns 7.133-Wörter-Orchestrierungs-Doku lässt ReAct komplett aus. Dieser Beobachten-Entscheiden-Takt ist der Grund, warum ReAct offene Aufgaben („Suche, bis du X findest") besser bewältigt als jeder Vorab-Plan: Der Plan müsste raten, was die Seiten enthalten, bevor er sie liest.
Plan-and-Execute stammt von Wang et al., Plan-and-Solve Prompting (arXiv 2305.04091, ACL 2023), das zuerst einen Plan entwirft, der die Aufgabe in Teilaufgaben teilt, und diese dann ausführt. Die Arbeit berichtet, Zero-Shot-Chain-of-Thought auf allen zehn evaluierten Datensätzen zu schlagen; wir zitieren keine Einzelzahl, weil das Abstract der Arbeit keine veröffentlicht. Nutzen Sie es, wenn die Route vorhersehbar ist und Neuplanung nach jedem Schritt Tokens verschwenden würde. Der Kompromiss ist Sprödigkeit: Falls Schritt drei fehlschlägt, braucht eine Plan-and-Execute-Schleife einen expliziten Replan-Hook, während ReAct konstruktionsbedingt neu plant.
| ReAct | Plan-and-Execute | |
|---|---|---|
| Wie es entscheidet | Nach jeder Beobachtung | Einmal, vor jedem Tool-Aufruf |
| Plant es mittendrin neu? | Ja, jeden Schritt | Nein (Neuplanung nur bei Fehler) |
| Token-Profil | Viele kleine Aufrufe | Ein großer Planungsaufruf, dann Ausführung |
| Scheitert, wenn | Die Schleife keine Ausstiegsbedingung hat | Der Plan falsch ist und die Ausführung sich nicht erholt |
| Gemessene Evidenz | +34 % ALFWorld, +10 % WebShop (Yao et al., 2022) | Schlug Zero-Shot-CoT auf 10/10 Datensätzen (Wang et al., 2023) |
Die Zeile „Gemessene Evidenz" ist das ehrliche Merkmal. ReAct hat eine Arbeit von 2022 mit Zahlen auf Task-Ebene; Plan-and-Execute hat einen Zehn-Datensatz-Sweep und keine Schlagzeilen-Zahl, was ein Grund ist, warum es öfter zitiert als gebenchmarkt wird.
from anthropic import Anthropic
client = Anthropic()
def react(question: str, tools: list, max_steps: int = 8) -> str:
messages = [{"role": "user", "content": question}]
for _ in range(max_steps):
msg = client.messages.create(
model="claude-sonnet-4-5",
max_tokens=1024,
tools=tools,
messages=messages,
)
if msg.stop_reason == "end_turn":
return msg.content[0].text
messages.append({"role": "assistant", "content": msg.content})
messages.append({"role": "user", "content": dispatch(msg.content)})
return "Stopped: hit the iteration cap with no final answer."Diese Iterationsgrenze ist nicht optional. Eine ReAct-Schleife ohne Ausstieg verbrennt Tokens, bis Ihr Budget es tut; max_steps ist die günstigste Leitplanke im ganzen Beitrag. Plan-and-Execute braucht dieselbe Wache eine Ebene höher: Begrenzen Sie die Neuplanungen, nicht nur die Schritte, sonst regeneriert sich ein fehlschlagender Plan endlos selbst.
Die Qualitätsmuster: Reflection, Evaluator-Optimizer und Human-in-the-Loop
Qualitätsmuster geben zusätzliche Tokens aus, um die Ausgabequalität zu heben, und sie zahlen sich nur aus, wenn Qualität messbar ist. Reflection (Anthropic nennt es Evaluator-Optimizer) betreibt einen Generator und einen Kritiker in einer Schleife: Ein Modell entwirft, ein anderes kritisiert, der Entwurf wird besser. Wenn Sie die Ausgabe nicht mit einem Test, einem Raster oder einem Grader-Modell bewerten können, ist der Kritiker nur Extra-Tokens, die mit sich selbst streiten. Diesen Scorer zu bauen ist der schwere Teil; unser Leitfaden zum Evaluieren von Agenten in Produktion deckt ab, was eine tragfähige Score-Funktion braucht. Wo die Voraussetzung gilt, ist das Muster eine günstige Versicherung: Anthropic beschreibt Evaluator-Optimizer als zwei LLM-Aufrufe in einer Schleife, einer generiert und einer kritisiert, was einen messbaren Qualitätszuwachs für ein paar Sekunden Extra-Latenz kauft.
Der Fehlermodus, den niemand diagrammiert, ist ausufernde Reflection: Kritiker und Generator schleifen endlos, oder schlimmer, sie oszillieren. Die Lösung ist eine harte Iterationsgrenze plus ein Abbruch bei ausbleibender Verbesserung, im Code geschrieben statt im Prompt erbeten:
def refine(task: str, score_fn, max_rounds: int = 4) -> str:
best = generate(task)
best_score = score_fn(best)
for _ in range(max_rounds):
critique = critic(task, best)
candidate = generate(f"{task}\n\nCritique:\n{critique}")
score = score_fn(candidate)
if score <= best_score:
break # no improvement: stop spending tokens
best, best_score = candidate, score
return bestHuman-in-the-Loop ist eine Kontrollschicht, kein achtes Muster. Es umschließt jedes der sieben: Ein Mensch genehmigt, bevor ein irreversibler Schritt läuft. Nur 2 der 6 Top-SERP-Ergebnisse behandeln es überhaupt. Setzen Sie das Gate an irreversible Aktionen, echte Ausgaben und alles, was Ihr System als externe Kommunikation verlässt. Alles andere sollte unbeaufsichtigt laufen oder gar nicht. Das Gate selbst sollte simpler Code sein, nicht noch ein LLM: eine Genehmigungswarteschlange, eine Ausgabenschwelle, eine Domain-Allowlist. Ein Modell entscheiden zu lassen, ob ein Mensch hinschauen soll, hebt den Zweck auf.
Ist Multi-Agent das 15-Fache der Tokens wert? Was die Benchmarks wirklich sagen
Orchestrator-Workers ist das siebte Muster: Ein Leit-Agent zerlegt eine Aufgabe, delegiert Teile an Worker-Agenten und führt deren Rückgaben zusammen. „Multi-Agent" ist dieses Muster auf die Spitze getrieben, keine eigene Form, daher geht es eigentlich darum, wann der Orchestrator seinen Overhead verdient.
Wann sollten Sie Multi-Agent statt eines einzelnen Agenten einsetzen? Nur wenn ein einzelner Agent auf der Aufgabe unter etwa 85 % Genauigkeit stagniert. Diese Faustregel kursierte auf r/AI_Agents (2026-04-23) neben der Google-Research-Studie, und sie passt zu den Messdaten: Oberhalb dieser Marke fügen zusätzliche Agenten Kosten und Fehlerverstärkung hinzu, ohne Genauigkeit zu gewinnen.
Hier ist jede veröffentlichte Zahl, die wir verifizieren konnten, nebeneinander:
| Befund | Zahl | Quelle | Datum | Gemessen an |
|---|---|---|---|---|
| Multi-Agent schlug Single-Agent Opus 4 | +90,2 % | Anthropic | 2025-06-13 | Internes Research-Eval (Opus 4 Lead, Sonnet 4 Subagenten) |
| Zentrale Koordination schlug einen Agenten | +80,9 % | Google Research | 2026-01-28 | Parallelisierbares finanzielles Reasoning, 180 Konfigurationen |
| Multi-Agent bei sequenzieller Planung | −39 % bis −70 % | Google Research | 2026-01-28 | Sequenzielle Aufgaben (−70 % auf PlanCraft) |
| Fehlerverstärkung | 17,2× unabhängig vs. 4,4× zentral | Google Research | 2026-01-28 | 180 Konfigurationen |
| Token-Nutzung gegenüber Chat | 4× einzelner Agent, 15× Multi-Agent | Anthropic | 2025-06-13 | Research-Aufgaben |
| Architekturvorhersage | 87 % ungesehener Konfigurationen, R² = 0,513 | Google-Research-Blog (2026-01-28) | 2026-01-28 | Ungesehene Aufgabenkonfigurationen |
Ein Vorbehalt, bevor Sie durchklicken: Jede Google-Research-Zahl oben stammt aus dem Blogpost vom 2026-01-28, und die Arbeit dahinter (arXiv 2512.08296) wurde seitdem überarbeitet, daher berichtet die aktuelle Version 260 Konfigurationen und R² = 0,373 statt der 180 und 0,513 des Blogs. Die Richtung hält in beiden Fällen; die genauen Zahlen hängen davon ab, welche Version Sie lesen.
Zwei dieser Zeilen werden regelmäßig falsch zitiert, daher hier die Rechnung. Anthropics 15×-Zahl ist gegen eine Chat-Interaktion gemessen, und die Zahl für den einzelnen Agenten ist 4×. Also kostet Multi-Agent grob 15 / 4 = 3,75× die Tokens eines einzelnen Agenten, nicht 15×. Und Google Researchs Fehlerverstärkung von 17,2× für unabhängige Agenten gegenüber 4,4× für zentrale bedeutet, dass ein Orchestrator grob 17,2 / 4,4 = 3,9× weniger Fehlerverstärkung enthält, als Agenten unbeaufsichtigt laufen zu lassen.
Liest man Anthropics Bericht gegen die Google-Research-Zahlen, ist unsere Lesart, dass Zerlegbarkeit, nicht die Agentenzahl, die entscheidende Variable ist. Anthropics Research-Aufgabe zerfiel sauber in parallele Teil-Suchen, also halfen mehr Agenten. Googles sequenzielle Planungsaufgaben zerfielen nicht, also kamen mehr Agenten einander in die Quere.
Das deckt sich mit dem, was Praktiker sagen, sobald Systeme in Produktion gehen. Auf r/AI_Agents kam ein Thread mit dem Titel „Multi agent systems are a total nightmare in production" (2026-04-23, 56 Punkte, 68 Kommentare) von einem OP, der 20+ Kundensysteme ausgeliefert hat: „Die, die tatsächlich am Laufen bleiben … sind fast peinlich einfach", und „jedes Mal, wenn ein Agent mit einem anderen spricht, verliert man Kontext. Wie bei der stillen Post." Der Top-Kommentar brennt den ganzen Abschnitt ein: „Versucht euer Problem mit einem einzelnen Agenten zu lösen. Wenn dieser Agent >85 % Genauigkeit hat, wird ein Multi-Agent-System keinen Mehrwert mehr bringen."
Bevor Sie einen Agenten hinzufügen, probieren Sie die günstigen Korrekturen, die Anthropic gemessen hat: Eine verbesserte Tool-Beschreibung brachte 40 % weniger Task-Abschlusszeit, und parallele Tool-Aufrufe senkten die Research-Zeit um bis zu 90 %. Beides schlägt einen zweiten Agenten bei den Kosten. Wenn Sie doch Multi-Agent in einem echten Tool fahren, sind Claude-Code-Subagenten Orchestrator-Workers, die Sie Zeile für Zeile inspizieren können.
Dasselbe Muster, fünf Namen: eine Framework-Rosetta-Tabelle
Dieselben vier Formen erscheinen in jeder Anbieter-Doku unter anderen Namen, und die Benennung überträgt sich nicht zwischen Frameworks. Microsofts „magentic" und „group chat" bedeuten im OpenAI SDK nichts, bis man sie übersetzt, und diese Übersetzungssteuer ist ein echter Aufwand, den diese Tabelle entfernt.
| Zugrunde liegende Form | Anthropic (2024-12-19) | Claude-Blog (2026-03-05) | OpenAI Agents SDK | Vercel AI SDK | Microsoft Learn | Google Cloud |
|---|---|---|---|---|---|---|
| Verkettete Schritte | Prompt chaining | Sequential | Code orchestration | Sequential processing | Sequential | Sequential |
| Klassifizieren und weiterleiten | Routing | n/a | Handoff | Routing | Handoff | Custom logic |
| Fan-out / Fan-in | Parallelization (sectioning, voting) | Parallel (fan-out/fan-in) | Code orchestration | Parallel processing | Concurrent | Parallel |
| Leit-Agent plus Worker | Orchestrator-workers | n/a | Agents-as-tools | Orchestrator-worker | Magentic | Coordinator, hierarchical task decomposition |
| Generator plus Kritiker | Evaluator-optimizer | Evaluator-optimizer | LLM orchestration | Evaluator-optimizer | Group chat | Review-and-critique, iterative refinement |
| Reason-Act-Schleife | Autonomous agents | n/a | LLM orchestration | n/a | n/a | ReAct |
| Menschliches Gate | (Kontrollschicht) | n/a | n/a | n/a | n/a | Human-in-the-loop |
Fünf Anbieter, fünf Vokabulare, drei oder vier echte Formen. Die praktischen Kosten zeigen sich beim Framework-Wechsel: Ein Team, das von Microsofts Agent Framework zum OpenAI SDK wechselt, muss erst „magentic" auf Agents-as-Tools und „group chat" auf einen Handoff-Graphen ummappen, bevor eine einzige Zeile Code übergeht. Google Clouds Elf-Namen-Taxonomie ist die längste, Anthropics Sieben-Namen-Liste die meistzitierte, und die drei Namen des Claude-Blogs sind jene, die Sie zuerst implementieren werden. Lesen Sie die Form, dann lesen Sie das SDK. Die Spaltenüberschriften sind die Dokus selbst: Anthropic, der Claude-Blog, das OpenAI Agents SDK, das Vercel AI SDK, Microsoft Learn und Google Cloud. Sobald Sie die Formen sehen, ist die Framework-Wahl eine eigene Entscheidung; unser Überblick über die besten KI-Agenten-Frameworks 2026 und der Vergleich LangGraph vs. CrewAI vs. OpenAI Agents SDK decken diese ab.
Wann sollten Sie überhaupt keinen Agenten-Workflow einsetzen?
Oft sollten Sie nicht. Die meistgewählte Entscheidungsleiter auf r/AI_Agents (2026-03-09) sagt es klar: „Wenn Wenn-dann-Anweisungen funktionieren, nehmen Sie die. Wenn dann traditionelle Workflows funktionieren, nehmen Sie die. Sonst nehmen Sie agentische KI." Zwei der Top-3-SERP-Ergebnisse sind Cloud-Dokumentation, die Ihnen strukturell nicht raten kann, weniger zu bauen. Wir können es. Die Daten in diesem Beitrag weisen in dieselbe Richtung: Die zwei größten gemessenen Gewinne (+80,9 % und +90,2 %) kamen beide von Aufgaben, die sich sauber zerlegten, und der schlimmste gemessene Verlust (−70 %) kam daher, Agenten auf eine Aufgabe zu zwingen, die das nicht tat.
Die Fehlermodi sind benannt, und jeder trägt inzwischen eine Zahl:
- Kontextverlust über Übergaben: Jede Agent-zu-Agent-Nachricht verliert Zustand (die „Stille-Post"-Beschwerde auf r/AI_Agents, 2026-04-23).
- Fehlerverstärkung: 17,2× bei unabhängigen Agenten gegenüber 4,4× zentral (Google Research, 2026-01-28).
- Ausufernde Reflection-Schleifen: Iterationen begrenzen und bei ausbleibender Verbesserung abbrechen, wie im Code oben.
- Degradation sequenzieller Aufgaben: 39–70 % schlechter, wenn man Arbeit parallelisiert, die sich nicht zerlegt (Google Research, 2026-01-28).
- Kostenexplosion: grob 15× Chat-Tokens für ein Multi-Agent-System (Anthropic, 2025-06-13).
Jeder dieser Fehlermodi hat eine Grenze, die Sie in zehn Zeilen Code schreiben können, und die Grenze ist immer günstiger als der Agent, den Sie gerade hinzufügen wollten.
Cognitions Walden Yan machte denselben Punkt von der Builder-Seite in Don't Build Multi-Agents (2025-06-12): „Teilt Kontext, und teilt volle Agenten-Traces, nicht nur einzelne Nachrichten", und „Aktionen tragen implizite Entscheidungen, und widersprüchliche Entscheidungen bringen schlechte Ergebnisse." Der r/AI_Agents-Vergleich ist der, auf den wir immer wieder zurückkommen: „Multi-Agent fängt an, stark nach Microservices auszusehen. Mächtig, wenn die Grenzen echt sind, schmerzhaft, wenn sie erfunden sind."
Wie Techsy die Musterwahl angeht
Die Leiter unten ist unsere Lesart der Google-Research- und Anthropic-Befunde plus der Praktiker-Threads, kein eigenes Messergebnis. Wir fahren sie von oben nach unten und stoppen bei der ersten Zeile, die passt:
| Bedingung | Tun Sie das |
|---|---|
| Ist der Pfad deterministisch und bekannt? | Schreiben Sie Code, kein LLM |
| Erreicht ein Agent bereits ~85 % Genauigkeit? | Stoppen, ausliefern |
| Sind die Teilaufgaben wirklich unabhängig? | Parallelisieren |
| Ist die Ausgabequalität messbar? | Evaluator-Optimizer ergänzen |
| Sind die Kontextdomänen wirklich getrennt? | Erst jetzt: Orchestrator-Workers |
Drei Dinge folgen aus den Daten dieses Beitrags. Starten Sie sequenziell, denn Anthropic rät dazu und nichts auf der SERP widerlegt es. Parallelisieren Sie nur, was sich zerlegt, denn dieselbe Koordinationsänderung wurde mit +80,9 % und mit −70 % gemessen. Und behandeln Sie einen zweiten Agenten als letzten Ausweg, denn die Token-Rechnung ist real und die Fehlerverstärkung ist gemessen. Der rote Faden ist, dass das Hinzufügen von Agenten ein Skalierungszug ist, kein Qualitätszug: Die Benchmarks belohnen ihn nur dort, wo die Arbeit sich teilt, und die Praktiker-Threads bestätigen es überall sonst. Wenn Sie eine zweite Meinung zu einer Architektur wollen, bevor Sie sie bauen: Kostenlose Beratung anfragen.
Häufig gestellte Fragen
Was sind die 7 KI-Agenten-Muster?
Die sieben sind sequenziell (Prompt Chaining), Routing (Handoff), Parallelisierung (Fan-out/Fan-in), Orchestrator-Workers, Reflection (Evaluator-Optimizer), ReAct und Plan-and-Execute. Sie kehren unter verschiedenen Namen in jeder Anbieter-Taxonomie wieder, von Anthropic bis Google Cloud. Human-in-the-Loop wird daneben diskutiert, ist aber eine Kontrollschicht, die jedes der sieben umschließt, kein achtes Muster.
Was sind die 4 Phasen eines KI-Agenten-Workflows?
Planen, handeln, beobachten, reflektieren. Das Modell plant einen nächsten Schritt, handelt durch einen Tool-Aufruf, beobachtet, wie das Tool-Ergebnis in den Kontext eingeht, und reflektiert dann, ob das Ziel erreicht ist, und wiederholt oder stoppt. Jedes Muster in diesem Beitrag ist eine andere Art, diese vier Phasen zu verdrahten.
Was ist der Unterschied zwischen einem KI-Workflow und einem KI-Agenten?
Ein Workflow folgt vorherbestimmten Code-Pfaden; ein Agent lässt das Modell den eigenen Kontrollfluss steuern. Anthropics Regel: Workflows für Vorhersagbarkeit bei gut definierten Aufgaben, Agenten für Flexibilität, wenn modellgetriebene Entscheidungen in großem Maßstab gefragt sind. Die meisten Produktionssysteme sind Workflows mit ein paar Agenten-Schritten darin.
ReAct vs. Plan-and-Execute: Was soll ich nutzen?
Nutzen Sie ReAct, wenn der nächste Schritt davon abhängt, was das letzte Tool zurückgab, und die Route sich mittendrin ändern kann. Nutzen Sie Plan-and-Execute, wenn die Route vorab vorhersehbar ist und Neuplanung nach jedem Schritt Tokens verschwenden würde. ReAct maß +34 % auf ALFWorld (Yao et al., 2022); Plan-and-Execute schlug Zero-Shot-CoT auf zehn Datensätzen (Wang et al., 2023).
Brauche ich ein Framework wie LangGraph, um diese Muster zu nutzen?
Nein. Jeder Code-Block in diesem Beitrag ist ein simpler SDK-Aufruf, und die Muster sind älter als die Frameworks, die sie benennen. Ein Framework verdient seinen Unterhalt bei Zustandspersistenz, Retries und Tracing, nicht beim Muster selbst. Wenn Sie eines wählen, deckt unser Framework-Vergleich die Kompromisse ab.
Wie hindere ich eine Reflection-Schleife daran, endlos zu laufen?
Zwei Wachen, beide im Code: eine harte Iterationsgrenze (wir nutzen 4 Runden) und ein Abbruch bei ausbleibender Verbesserung, der stoppt, sobald der Rewrite des Kritikers nicht besser abschneidet als der aktuelle Entwurf. Vertrauen Sie dem Prompt nicht, die Schleife zu beenden; das Modell hat keine Ahnung, was Dinge kosten.
Wann reicht ein einzelner Agent?
Wenn er grob 85 % Genauigkeit auf der Aufgabe erreicht. Diese Heuristik kursierte auf r/AI_Agents (2026-04-23) neben der Google-Research-Studie und passt zu den Benchmarks: Oberhalb dieser Marke fügen zusätzliche Agenten Kosten und Fehlerverstärkung hinzu, ohne Genauigkeit zu gewinnen. Messen Sie die Single-Agent-Baseline, bevor Sie etwas Größeres entwerfen.
Wo finde ich Beispiele für KI-Agenten-Workflow-Muster mit Code?
Die fünf Python-Blöcke oben decken sequenziell, Routing, Parallelisierung, ReAct und Reflection ab, alle als simple SDK-Aufrufe, die Sie direkt übernehmen können. Für anbietergefärbte Beispiele liefert das Vercel AI SDK lauffähiges TypeScript pro Muster, und die OpenAI-Agents-SDK-Doku deckt Handoffs und Agents-as-Tools ab. Links zu beiden stehen in der Quellenliste unten.
Quellen
- Anthropic, Building Effective Agents (2024-12-19)
- Anthropic, How we built our multi-agent research system (2025-06-13)
- Google Research, Towards a science of scaling agent systems (2026-01-28); Arbeit: arXiv 2512.08296
- Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models (v3 2023-03-10)
- Wang et al., Plan-and-Solve Prompting (ACL 2023)
- Claude by Anthropic, Common workflow patterns for AI agents (2026-03-05)
- OpenAI Agents SDK, Orchestrating multiple agents
- Vercel AI SDK, Workflow Patterns
- Microsoft Learn, AI Agent Orchestration Patterns (aktualisiert 2026-05-12)
- Google Cloud, Choose a design pattern for your agentic AI system (2026-05-28)
- Cognition (Walden Yan), Don't Build Multi-Agents (2025-06-12)
- r/AI_Agents, Multi agent systems are a total nightmare in production (2026-04-23); Wait, are workflows actually better than multi-agent systems? (2026-03-09)