Techsy
Kontakt
Loslegen
Zurück zum Blog
ai-machine-learning

KI-Agenten-Workflow-Muster: 7 Muster und wann jedes wirklich gewinnt (2026)

Geschrieben von Mert Batur
Aug 7, 2026
17 Lesezeit
Inhaltsverzeichnis
KI-Agenten-Workflow-Muster: 7 Muster und wann jedes wirklich gewinnt (2026)

KI-Agenten-Workflow-Muster: 7 Muster und wann jedes wirklich gewinnt (2026)

KI-Agenten-Workflow-Muster haben endlich Zahlen: Im Januar 2026 evaluierte Google Research 180 Agenten-Konfigurationen und stellte fest, dass dieselbe Koordinationsänderung parallelisierbares finanzielles Reasoning um 80,9 % hob, während sie sequenzielle Planung auf PlanCraft um bis zu 70 % drückte. Derselbe Hebel, entgegengesetzte Ergebnisse. Die entscheidende Variable ist die Zerlegbarkeit der Aufgabe, nicht die Anzahl der Agenten, und die sieben Muster unten werden an veröffentlichten Daten gemessen, nicht an Anbieter-Diagrammen.

  • Sieben Muster zählen: sequenziell, Routing, Parallelisierung, Orchestrator-Workers, Reflection, ReAct, Plan-and-Execute.
  • Die Zerlegbarkeit der Aufgabe entscheidet über den Sieger. Parallelisierbare Arbeit gewinnt; sequenzielle Arbeit verliert.
  • Starten Sie mit einem Agenten. Fügen Sie einen zweiten erst hinzu, wenn ein einzelner Agent unter ~85 % Genauigkeit stagniert.

KI-Agenten-Workflow-Muster im Überblick: Was die Daten sagen

Die sieben KI-Agenten-Muster sind sequenziell (Prompt Chaining), Routing (Handoff), Parallelisierung (Fan-out/Fan-in), Orchestrator-Workers, Reflection (Evaluator-Optimizer), ReAct und Plan-and-Execute. Fünf Anbieter-Doks benennen sie unterschiedlich, aber diese sieben Formen decken jede Taxonomie ab, die Anthropic, OpenAI, Vercel, Microsoft und Google Cloud derzeit veröffentlichen. Human-in-the-Loop ist keines der sieben: Es ist eine Kontrollschicht, die sich um jedes davon legt.

MusterWas es istEinsetzen, wennGemessene Kosten / Nutzen (Quelle)LangGraph / OpenAI SDK / Anthropic / AI SDK
Sequenziell (Prompt Chaining)Schritte laufen nacheinanderDer Pfad ist fest und jeder Schritt braucht den vorherigenKein öffentlicher Gewinn gemessen; Anthropic (2026-03-05) nennt es den Standard-Startpunktchain / code orchestration / sequential / sequential processing
Routing (Handoff)Klassifizieren, dann an einen Spezialisten übergebenEingaben zerfallen in klare DomänenKeine öffentliche Messungrouter / handoff / routing / routing
Parallelisierung (Fan-out/Fan-in)Teilaufgaben gleichzeitig ausführen, Ergebnisse zusammenführenTeilaufgaben sind wirklich unabhängig+80,9 % gegenüber einem einzelnen Agenten bei parallelisierbaren Finanzaufgaben (Google Research, 2026-01-28, 180 Konfigurationen)Send fan-out / code orchestration / parallel / parallel processing
Orchestrator-WorkersEin Leit-Agent zerlegt und delegiertKontextdomänen sind getrennt und groß+90,2 % gegenüber Single-Agent Opus 4 auf Anthropics Research-Eval (2025-06-13); ~15× Chat-Tokenssupervisor / agents-as-tools / orchestrator-workers / orchestrator-worker
Reflection (Evaluator-Optimizer)Generator plus Kritiker in einer SchleifeAusgabequalität ist messbarKeine öffentliche Messungreflection / LLM orchestration / evaluator-optimizer / evaluator-optimizer
ReActVerzahntes Reasoning und Tool-AufrufeSchritte hängen von früheren Beobachtungen ab+34 % absolut auf ALFWorld, +10 % auf WebShop (Yao et al., 2022)ReAct agent / no named pattern / autonomous agent / no named pattern
Plan-and-ExecuteErst die ganze Route planen, dann ausführenDie Route ist vorab vorhersehbarSchlug Zero-Shot-CoT auf 10/10 Datensätzen (Wang et al., ACL 2023); keine Einzelzahl veröffentlichtplan-and-execute / no primitive / autonomous agent / no named pattern

Lesen Sie die Messwert-Spalte skeptisch. Drei Zeilen tragen echte Zahlen; vier tragen „keine öffentliche Messung", und das ist 2026 der ehrliche Zustand des Felds. Fünf Anbieter veröffentlichen fünf verschiedene Namen für das, was im Kern drei oder vier zugrunde liegende Formen sind. Die letzte Spalte existiert, damit Sie jeden dieser Namen auf die darunterliegende Form zurückübersetzen können; der Rest des Beitrags nimmt eine Familie nach der anderen auseinander.

Zwei Spalten, die niemand auf der SERP bespricht, sind Token-Kosten und Latenzbudget. Sequenziell und Routing verbrauchen von beiden am wenigsten; Orchestrator-Workers verbraucht von beiden am meisten; Parallelisierung tauscht Token-Ausgaben gegen Wall-Clock-Zeit. Wählen Sie das Muster nach der Ressource, die Ihre Aufgabe tatsächlich begrenzt, nicht nach dem Diagramm, das beeindruckend aussieht.

Was sind KI-Agenten-Workflow-Muster (und was sind die 4 Phasen eines KI-Workflows)?

KI-Agenten-Workflow-Designmuster sind wiederverwendbare Formen, um LLM-Aufrufe, Tool-Nutzung und Kontrolllogik zu einem System zu ordnen. Die sieben, die in jeder Anbieter-Taxonomie wiederkehren, sind sequenziell, Routing, Parallelisierung, Orchestrator-Workers, Reflection, ReAct und Plan-and-Execute. Jedes tauscht Token-Kosten, Latenz und Genauigkeit anders, daher hängt die richtige Wahl von der Struktur der Aufgabe ab, nicht vom Framework, das Sie zufällig benutzen.

Ein typischer KI-Agenten-Workflow durchläuft vier Phasen, in einer Schleife:

  1. Planen: Das Modell entscheidet angesichts von Ziel und bisherigem Verlauf, was als Nächstes zu tun ist.
  2. Handeln: Es ruft ein Tool auf, was 2026 meist einen MCP-Server oder einen Function Call bedeutet. Model Context Protocol (MCP) standardisiert diese Tool-Schicht modellübergreifend.
  3. Beobachten: Das Tool-Ergebnis geht als neue Nachricht zurück in den Kontext.
  4. Reflektieren / Schleife: Das Modell beurteilt, ob das Ergebnis gut genug ist, und wiederholt dann oder stoppt.

Jedes Muster in diesem Beitrag ist eine andere Art, diese vier Phasen zu verdrahten. Sequenziell fixiert die Reihenfolge im Code. ReAct lässt das Modell jede Runde die nächste Phase wählen. Orchestrator-Workers verteilt die Schleife auf mehrere Modelle.

Eine Unterscheidung zählt vor dem Katalog. Ein Workflow ist ein vorherbestimmter Code-Pfad; ein Agent gibt die Kontrolle an das Modell ab. Anthropic zieht die Grenze genau so in Building Effective Agents: „Workflows bieten Vorhersagbarkeit und Konsistenz für gut definierte Aufgaben, während Agenten die bessere Wahl sind, wenn Flexibilität und modellgetriebene Entscheidungen in großem Maßstab gefragt sind."

Falls Sie auf der Suche nach den klassischen Agententypen der KI hierherkamen (einfacher Reflex, modellbasiert, zielbasiert, lernend): Diese Taxonomie stammt aus der Zeit vor LLMs; die sieben Muster oben sind jene, die darüber entscheiden, ob Ihr Build ausgeliefert wird.

Die deterministischen Muster: sequenziell, Routing und Parallelisierung

Drei Muster behalten die Kontrolle in Ihrem Code statt im Modell. Sie sind die günstigsten im Betrieb und die einfachsten beim Debuggen, und die Empfehlung des Claude-Teams vom März 2026 ist unmissverständlich, wo man anfangen soll: „Starten Sie mit dem einfachsten Muster, das Ihr Problem löst. Standard ist sequenziell."

Sequenziell (Prompt Chaining)

Ein Aufruf speist den nächsten. Sie zerlegen eine schwere Aufgabe in geordnete Schritte, und jeder Schritt bekommt die Ausgabe des vorherigen als Eingabe. Der Gewinn ist Lesbarkeit: Sie können jedes Zwischenergebnis prüfen und jeden Schritt cachen. Vermeiden Sie es, wenn die Teilaufgaben unabhängig sind, denn Sie zahlen Latenz für eine Reihenfolge, die Sie nicht brauchen. Wenn Zustand zwischen Schritten oder über Sitzungen hinweg überleben muss, ist das ein Speicherproblem, kein Chaining-Problem; die Aufteilung erklärt unser Leitfaden zum Agenten-Gedächtnis. Die einzige veröffentlichte Empfehlung dafür ist ein Standardwert: Keine Studie misst einen Gewinn durch Chaining selbst, denn es ist die Baseline, die jedes andere Muster mit Extraaufwand schlagen muss.

python
from anthropic import Anthropic

client = Anthropic()

def chain(steps: list[str], context: str = "") -> str:
    for step in steps:
        msg = client.messages.create(
            model="claude-sonnet-4-5",
            max_tokens=1024,
            messages=[{"role": "user", "content": f"{context}\n\n{step}"}],
        )
        context = msg.content[0].text
    return context

summary = chain([
    "Extract the five key claims from this report: {report}",
    "Rewrite those claims as bullets an engineer would trust.",
])

Routing (Handoff)

Ein günstiger Klassifizierer liest die Eingabe und übergibt sie an einen Spezialisten-Prompt oder ein Spezialmodell. OpenAI rahmt es in der Agents-SDK-Doku: „Ein Triage-Agent leitet das Gespräch an einen Spezialisten weiter, und dieser Spezialist wird zum aktiven Agenten für den Rest des Zugs." Vermeiden Sie Routing, wenn der Klassifizierer unzuverlässiger ist als einfach ein allgemeiner Pfad, denn jede Fehlleitung ist eine stille falsche Antwort. Der benannte Fehlermodus hier ist Kontextverlust über die Übergabe: Der Spezialist sieht nur, was der Router weiterleitet. Den vollen Trace mitzuführen ist eine Context-Engineering-Entscheidung, und sie falsch zu treffen ist der Grund, warum geroutete Systeme vergesslich wirken. Die Token-Rechnung spricht trotzdem für Routing: Der Klassifizierer läuft auf einem kleinen Modell (oben gpt-4o-mini), also fügt ein Router ein paar Hundert günstige Tokens pro Anfrage hinzu statt eines zweiten teuren Aufrufs.

python
from openai import OpenAI

client = OpenAI()
SPECIALISTS = {
    "billing": "You answer billing and refund questions.",
    "technical": "You debug API errors and integration issues.",
}

def route(question: str) -> str:
    triage = client.responses.create(
        model="gpt-4o-mini",
        input=f"Reply with exactly one of {list(SPECIALISTS)}: {question}",
    )
    key = triage.output_text.strip().lower()
    return client.responses.create(
        model="gpt-4o",
        instructions=SPECIALISTS.get(key, SPECIALISTS["technical"]),
        input=question,
    ).output_text

Parallelisierung (Fan-out/Fan-in)

Unabhängige Teilaufgaben laufen gleichzeitig, dann führt ein Merge-Schritt sie zusammen. Anthropic teilt das in Sectioning (Arbeit aufteilen) und Voting (dieselbe Aufgabe mehrmals ausführen und vergleichen). Das ist die Form, die Google Research im Januar 2026 bei parallelisierbarem finanziellem Reasoning mit +80,9 % gegenüber einem einzelnen Agenten maß, genau weil die Aufgabe sich sauber zerlegte. Vermeiden Sie es in dem Moment, wo Schritt n+1 von der Ausgabe aus Schritt n abhängt; eine Abhängigkeitskette zu parallelisieren sortiert die falschen Antworten nur schneller um. Latenz ist die andere Hälfte des Gewinns: Unabhängige Aufrufe laufen nebenläufig, also sinkt die Wall-Clock-Zeit ungefähr mit der Zahl der Worker, während die gesamten Token-Ausgaben gleich bleiben.

python
from concurrent.futures import ThreadPoolExecutor
from anthropic import Anthropic

client = Anthropic()

def run(subtask: str) -> str:
    msg = client.messages.create(
        model="claude-sonnet-4-5",
        max_tokens=1024,
        messages=[{"role": "user", "content": subtask}],
    )
    return msg.content[0].text

def fan_out(subtasks: list[str]) -> list[str]:
    with ThreadPoolExecutor(max_workers=len(subtasks)) as pool:
        return list(pool.map(run, subtasks))

parts = fan_out([
    "Summarize Q1 revenue drivers in two sentences.",
    "Summarize Q1 churn drivers in two sentences.",
])
merged = run(f"Combine into one executive summary:\n{parts}")

ReAct vs. Plan-and-Execute: Welches Reasoning-Muster sollten Sie nutzen?

ReAct verzahnt Reasoning mit Aktion: Das Modell denkt, ruft ein Tool auf, beobachtet das Ergebnis und entscheidet erst dann den nächsten Schritt. Plan-and-Execute schreibt den vollständigen Plan, bevor irgendein Tool läuft, und führt die Schritte dann der Reihe nach aus. ReAct passt sich Überraschungen mitten im Lauf an; Plan-and-Execute zahlt vorab für einen großen Planungsaufruf und vertraut der Route.

ReAct entscheidet den nächsten Schritt nach jeder Beobachtung; Plan-and-Execute legt die ganze Route vor dem ersten Tool-Aufruf fest.

ReAct stammt von Yao et al. (arXiv 2210.03629, v1 Oktober 2022, v3 März 2023) und berichtete +34 % absoluten Erfolg auf ALFWorld und +10 % auf WebShop gegenüber Imitations- und Reinforcement-Learning-Baselines, mit nur ein oder zwei In-Context-Beispielen. Es ist die Standardschleife hinter den meisten Tool-nutzenden Agenten, und es ist eine Lücke im SERP-Ergebnis auf Platz 3: Microsoft Learns 7.133-Wörter-Orchestrierungs-Doku lässt ReAct komplett aus. Dieser Beobachten-Entscheiden-Takt ist der Grund, warum ReAct offene Aufgaben („Suche, bis du X findest") besser bewältigt als jeder Vorab-Plan: Der Plan müsste raten, was die Seiten enthalten, bevor er sie liest.

Plan-and-Execute stammt von Wang et al., Plan-and-Solve Prompting (arXiv 2305.04091, ACL 2023), das zuerst einen Plan entwirft, der die Aufgabe in Teilaufgaben teilt, und diese dann ausführt. Die Arbeit berichtet, Zero-Shot-Chain-of-Thought auf allen zehn evaluierten Datensätzen zu schlagen; wir zitieren keine Einzelzahl, weil das Abstract der Arbeit keine veröffentlicht. Nutzen Sie es, wenn die Route vorhersehbar ist und Neuplanung nach jedem Schritt Tokens verschwenden würde. Der Kompromiss ist Sprödigkeit: Falls Schritt drei fehlschlägt, braucht eine Plan-and-Execute-Schleife einen expliziten Replan-Hook, während ReAct konstruktionsbedingt neu plant.

ReActPlan-and-Execute
Wie es entscheidetNach jeder BeobachtungEinmal, vor jedem Tool-Aufruf
Plant es mittendrin neu?Ja, jeden SchrittNein (Neuplanung nur bei Fehler)
Token-ProfilViele kleine AufrufeEin großer Planungsaufruf, dann Ausführung
Scheitert, wennDie Schleife keine Ausstiegsbedingung hatDer Plan falsch ist und die Ausführung sich nicht erholt
Gemessene Evidenz+34 % ALFWorld, +10 % WebShop (Yao et al., 2022)Schlug Zero-Shot-CoT auf 10/10 Datensätzen (Wang et al., 2023)

Die Zeile „Gemessene Evidenz" ist das ehrliche Merkmal. ReAct hat eine Arbeit von 2022 mit Zahlen auf Task-Ebene; Plan-and-Execute hat einen Zehn-Datensatz-Sweep und keine Schlagzeilen-Zahl, was ein Grund ist, warum es öfter zitiert als gebenchmarkt wird.

python
from anthropic import Anthropic

client = Anthropic()

def react(question: str, tools: list, max_steps: int = 8) -> str:
    messages = [{"role": "user", "content": question}]
    for _ in range(max_steps):
        msg = client.messages.create(
            model="claude-sonnet-4-5",
            max_tokens=1024,
            tools=tools,
            messages=messages,
        )
        if msg.stop_reason == "end_turn":
            return msg.content[0].text
        messages.append({"role": "assistant", "content": msg.content})
        messages.append({"role": "user", "content": dispatch(msg.content)})
    return "Stopped: hit the iteration cap with no final answer."

Diese Iterationsgrenze ist nicht optional. Eine ReAct-Schleife ohne Ausstieg verbrennt Tokens, bis Ihr Budget es tut; max_steps ist die günstigste Leitplanke im ganzen Beitrag. Plan-and-Execute braucht dieselbe Wache eine Ebene höher: Begrenzen Sie die Neuplanungen, nicht nur die Schritte, sonst regeneriert sich ein fehlschlagender Plan endlos selbst.

Die Qualitätsmuster: Reflection, Evaluator-Optimizer und Human-in-the-Loop

Qualitätsmuster geben zusätzliche Tokens aus, um die Ausgabequalität zu heben, und sie zahlen sich nur aus, wenn Qualität messbar ist. Reflection (Anthropic nennt es Evaluator-Optimizer) betreibt einen Generator und einen Kritiker in einer Schleife: Ein Modell entwirft, ein anderes kritisiert, der Entwurf wird besser. Wenn Sie die Ausgabe nicht mit einem Test, einem Raster oder einem Grader-Modell bewerten können, ist der Kritiker nur Extra-Tokens, die mit sich selbst streiten. Diesen Scorer zu bauen ist der schwere Teil; unser Leitfaden zum Evaluieren von Agenten in Produktion deckt ab, was eine tragfähige Score-Funktion braucht. Wo die Voraussetzung gilt, ist das Muster eine günstige Versicherung: Anthropic beschreibt Evaluator-Optimizer als zwei LLM-Aufrufe in einer Schleife, einer generiert und einer kritisiert, was einen messbaren Qualitätszuwachs für ein paar Sekunden Extra-Latenz kauft.

Der Fehlermodus, den niemand diagrammiert, ist ausufernde Reflection: Kritiker und Generator schleifen endlos, oder schlimmer, sie oszillieren. Die Lösung ist eine harte Iterationsgrenze plus ein Abbruch bei ausbleibender Verbesserung, im Code geschrieben statt im Prompt erbeten:

python
def refine(task: str, score_fn, max_rounds: int = 4) -> str:
    best = generate(task)
    best_score = score_fn(best)
    for _ in range(max_rounds):
        critique = critic(task, best)
        candidate = generate(f"{task}\n\nCritique:\n{critique}")
        score = score_fn(candidate)
        if score <= best_score:
            break  # no improvement: stop spending tokens
        best, best_score = candidate, score
    return best

Human-in-the-Loop ist eine Kontrollschicht, kein achtes Muster. Es umschließt jedes der sieben: Ein Mensch genehmigt, bevor ein irreversibler Schritt läuft. Nur 2 der 6 Top-SERP-Ergebnisse behandeln es überhaupt. Setzen Sie das Gate an irreversible Aktionen, echte Ausgaben und alles, was Ihr System als externe Kommunikation verlässt. Alles andere sollte unbeaufsichtigt laufen oder gar nicht. Das Gate selbst sollte simpler Code sein, nicht noch ein LLM: eine Genehmigungswarteschlange, eine Ausgabenschwelle, eine Domain-Allowlist. Ein Modell entscheiden zu lassen, ob ein Mensch hinschauen soll, hebt den Zweck auf.

Ist Multi-Agent das 15-Fache der Tokens wert? Was die Benchmarks wirklich sagen

Orchestrator-Workers ist das siebte Muster: Ein Leit-Agent zerlegt eine Aufgabe, delegiert Teile an Worker-Agenten und führt deren Rückgaben zusammen. „Multi-Agent" ist dieses Muster auf die Spitze getrieben, keine eigene Form, daher geht es eigentlich darum, wann der Orchestrator seinen Overhead verdient.

Wann sollten Sie Multi-Agent statt eines einzelnen Agenten einsetzen? Nur wenn ein einzelner Agent auf der Aufgabe unter etwa 85 % Genauigkeit stagniert. Diese Faustregel kursierte auf r/AI_Agents (2026-04-23) neben der Google-Research-Studie, und sie passt zu den Messdaten: Oberhalb dieser Marke fügen zusätzliche Agenten Kosten und Fehlerverstärkung hinzu, ohne Genauigkeit zu gewinnen.

Hier ist jede veröffentlichte Zahl, die wir verifizieren konnten, nebeneinander:

BefundZahlQuelleDatumGemessen an
Multi-Agent schlug Single-Agent Opus 4+90,2 %Anthropic2025-06-13Internes Research-Eval (Opus 4 Lead, Sonnet 4 Subagenten)
Zentrale Koordination schlug einen Agenten+80,9 %Google Research2026-01-28Parallelisierbares finanzielles Reasoning, 180 Konfigurationen
Multi-Agent bei sequenzieller Planung−39 % bis −70 %Google Research2026-01-28Sequenzielle Aufgaben (−70 % auf PlanCraft)
Fehlerverstärkung17,2× unabhängig vs. 4,4× zentralGoogle Research2026-01-28180 Konfigurationen
Token-Nutzung gegenüber Chat4× einzelner Agent, 15× Multi-AgentAnthropic2025-06-13Research-Aufgaben
Architekturvorhersage87 % ungesehener Konfigurationen, R² = 0,513Google-Research-Blog (2026-01-28)2026-01-28Ungesehene Aufgabenkonfigurationen

Ein Vorbehalt, bevor Sie durchklicken: Jede Google-Research-Zahl oben stammt aus dem Blogpost vom 2026-01-28, und die Arbeit dahinter (arXiv 2512.08296) wurde seitdem überarbeitet, daher berichtet die aktuelle Version 260 Konfigurationen und R² = 0,373 statt der 180 und 0,513 des Blogs. Die Richtung hält in beiden Fällen; die genauen Zahlen hängen davon ab, welche Version Sie lesen.

Zwei dieser Zeilen werden regelmäßig falsch zitiert, daher hier die Rechnung. Anthropics 15×-Zahl ist gegen eine Chat-Interaktion gemessen, und die Zahl für den einzelnen Agenten ist 4×. Also kostet Multi-Agent grob 15 / 4 = 3,75× die Tokens eines einzelnen Agenten, nicht 15×. Und Google Researchs Fehlerverstärkung von 17,2× für unabhängige Agenten gegenüber 4,4× für zentrale bedeutet, dass ein Orchestrator grob 17,2 / 4,4 = 3,9× weniger Fehlerverstärkung enthält, als Agenten unbeaufsichtigt laufen zu lassen.

Liest man Anthropics Bericht gegen die Google-Research-Zahlen, ist unsere Lesart, dass Zerlegbarkeit, nicht die Agentenzahl, die entscheidende Variable ist. Anthropics Research-Aufgabe zerfiel sauber in parallele Teil-Suchen, also halfen mehr Agenten. Googles sequenzielle Planungsaufgaben zerfielen nicht, also kamen mehr Agenten einander in die Quere.

Das deckt sich mit dem, was Praktiker sagen, sobald Systeme in Produktion gehen. Auf r/AI_Agents kam ein Thread mit dem Titel „Multi agent systems are a total nightmare in production" (2026-04-23, 56 Punkte, 68 Kommentare) von einem OP, der 20+ Kundensysteme ausgeliefert hat: „Die, die tatsächlich am Laufen bleiben … sind fast peinlich einfach", und „jedes Mal, wenn ein Agent mit einem anderen spricht, verliert man Kontext. Wie bei der stillen Post." Der Top-Kommentar brennt den ganzen Abschnitt ein: „Versucht euer Problem mit einem einzelnen Agenten zu lösen. Wenn dieser Agent >85 % Genauigkeit hat, wird ein Multi-Agent-System keinen Mehrwert mehr bringen."

Bevor Sie einen Agenten hinzufügen, probieren Sie die günstigen Korrekturen, die Anthropic gemessen hat: Eine verbesserte Tool-Beschreibung brachte 40 % weniger Task-Abschlusszeit, und parallele Tool-Aufrufe senkten die Research-Zeit um bis zu 90 %. Beides schlägt einen zweiten Agenten bei den Kosten. Wenn Sie doch Multi-Agent in einem echten Tool fahren, sind Claude-Code-Subagenten Orchestrator-Workers, die Sie Zeile für Zeile inspizieren können.

Dasselbe Muster, fünf Namen: eine Framework-Rosetta-Tabelle

Dieselben vier Formen erscheinen in jeder Anbieter-Doku unter anderen Namen, und die Benennung überträgt sich nicht zwischen Frameworks. Microsofts „magentic" und „group chat" bedeuten im OpenAI SDK nichts, bis man sie übersetzt, und diese Übersetzungssteuer ist ein echter Aufwand, den diese Tabelle entfernt.

Zugrunde liegende FormAnthropic (2024-12-19)Claude-Blog (2026-03-05)OpenAI Agents SDKVercel AI SDKMicrosoft LearnGoogle Cloud
Verkettete SchrittePrompt chainingSequentialCode orchestrationSequential processingSequentialSequential
Klassifizieren und weiterleitenRoutingn/aHandoffRoutingHandoffCustom logic
Fan-out / Fan-inParallelization (sectioning, voting)Parallel (fan-out/fan-in)Code orchestrationParallel processingConcurrentParallel
Leit-Agent plus WorkerOrchestrator-workersn/aAgents-as-toolsOrchestrator-workerMagenticCoordinator, hierarchical task decomposition
Generator plus KritikerEvaluator-optimizerEvaluator-optimizerLLM orchestrationEvaluator-optimizerGroup chatReview-and-critique, iterative refinement
Reason-Act-SchleifeAutonomous agentsn/aLLM orchestrationn/an/aReAct
Menschliches Gate(Kontrollschicht)n/an/an/an/aHuman-in-the-loop

Fünf Anbieter, fünf Vokabulare, drei oder vier echte Formen. Die praktischen Kosten zeigen sich beim Framework-Wechsel: Ein Team, das von Microsofts Agent Framework zum OpenAI SDK wechselt, muss erst „magentic" auf Agents-as-Tools und „group chat" auf einen Handoff-Graphen ummappen, bevor eine einzige Zeile Code übergeht. Google Clouds Elf-Namen-Taxonomie ist die längste, Anthropics Sieben-Namen-Liste die meistzitierte, und die drei Namen des Claude-Blogs sind jene, die Sie zuerst implementieren werden. Lesen Sie die Form, dann lesen Sie das SDK. Die Spaltenüberschriften sind die Dokus selbst: Anthropic, der Claude-Blog, das OpenAI Agents SDK, das Vercel AI SDK, Microsoft Learn und Google Cloud. Sobald Sie die Formen sehen, ist die Framework-Wahl eine eigene Entscheidung; unser Überblick über die besten KI-Agenten-Frameworks 2026 und der Vergleich LangGraph vs. CrewAI vs. OpenAI Agents SDK decken diese ab.

Wann sollten Sie überhaupt keinen Agenten-Workflow einsetzen?

Oft sollten Sie nicht. Die meistgewählte Entscheidungsleiter auf r/AI_Agents (2026-03-09) sagt es klar: „Wenn Wenn-dann-Anweisungen funktionieren, nehmen Sie die. Wenn dann traditionelle Workflows funktionieren, nehmen Sie die. Sonst nehmen Sie agentische KI." Zwei der Top-3-SERP-Ergebnisse sind Cloud-Dokumentation, die Ihnen strukturell nicht raten kann, weniger zu bauen. Wir können es. Die Daten in diesem Beitrag weisen in dieselbe Richtung: Die zwei größten gemessenen Gewinne (+80,9 % und +90,2 %) kamen beide von Aufgaben, die sich sauber zerlegten, und der schlimmste gemessene Verlust (−70 %) kam daher, Agenten auf eine Aufgabe zu zwingen, die das nicht tat.

Die Fehlermodi sind benannt, und jeder trägt inzwischen eine Zahl:

  • Kontextverlust über Übergaben: Jede Agent-zu-Agent-Nachricht verliert Zustand (die „Stille-Post"-Beschwerde auf r/AI_Agents, 2026-04-23).
  • Fehlerverstärkung: 17,2× bei unabhängigen Agenten gegenüber 4,4× zentral (Google Research, 2026-01-28).
  • Ausufernde Reflection-Schleifen: Iterationen begrenzen und bei ausbleibender Verbesserung abbrechen, wie im Code oben.
  • Degradation sequenzieller Aufgaben: 39–70 % schlechter, wenn man Arbeit parallelisiert, die sich nicht zerlegt (Google Research, 2026-01-28).
  • Kostenexplosion: grob 15× Chat-Tokens für ein Multi-Agent-System (Anthropic, 2025-06-13).

Jeder dieser Fehlermodi hat eine Grenze, die Sie in zehn Zeilen Code schreiben können, und die Grenze ist immer günstiger als der Agent, den Sie gerade hinzufügen wollten.

Cognitions Walden Yan machte denselben Punkt von der Builder-Seite in Don't Build Multi-Agents (2025-06-12): „Teilt Kontext, und teilt volle Agenten-Traces, nicht nur einzelne Nachrichten", und „Aktionen tragen implizite Entscheidungen, und widersprüchliche Entscheidungen bringen schlechte Ergebnisse." Der r/AI_Agents-Vergleich ist der, auf den wir immer wieder zurückkommen: „Multi-Agent fängt an, stark nach Microservices auszusehen. Mächtig, wenn die Grenzen echt sind, schmerzhaft, wenn sie erfunden sind."

Wie Techsy die Musterwahl angeht

Die Leiter unten ist unsere Lesart der Google-Research- und Anthropic-Befunde plus der Praktiker-Threads, kein eigenes Messergebnis. Wir fahren sie von oben nach unten und stoppen bei der ersten Zeile, die passt:

BedingungTun Sie das
Ist der Pfad deterministisch und bekannt?Schreiben Sie Code, kein LLM
Erreicht ein Agent bereits ~85 % Genauigkeit?Stoppen, ausliefern
Sind die Teilaufgaben wirklich unabhängig?Parallelisieren
Ist die Ausgabequalität messbar?Evaluator-Optimizer ergänzen
Sind die Kontextdomänen wirklich getrennt?Erst jetzt: Orchestrator-Workers

Drei Dinge folgen aus den Daten dieses Beitrags. Starten Sie sequenziell, denn Anthropic rät dazu und nichts auf der SERP widerlegt es. Parallelisieren Sie nur, was sich zerlegt, denn dieselbe Koordinationsänderung wurde mit +80,9 % und mit −70 % gemessen. Und behandeln Sie einen zweiten Agenten als letzten Ausweg, denn die Token-Rechnung ist real und die Fehlerverstärkung ist gemessen. Der rote Faden ist, dass das Hinzufügen von Agenten ein Skalierungszug ist, kein Qualitätszug: Die Benchmarks belohnen ihn nur dort, wo die Arbeit sich teilt, und die Praktiker-Threads bestätigen es überall sonst. Wenn Sie eine zweite Meinung zu einer Architektur wollen, bevor Sie sie bauen: Kostenlose Beratung anfragen.

Häufig gestellte Fragen

Was sind die 7 KI-Agenten-Muster?

Die sieben sind sequenziell (Prompt Chaining), Routing (Handoff), Parallelisierung (Fan-out/Fan-in), Orchestrator-Workers, Reflection (Evaluator-Optimizer), ReAct und Plan-and-Execute. Sie kehren unter verschiedenen Namen in jeder Anbieter-Taxonomie wieder, von Anthropic bis Google Cloud. Human-in-the-Loop wird daneben diskutiert, ist aber eine Kontrollschicht, die jedes der sieben umschließt, kein achtes Muster.

Was sind die 4 Phasen eines KI-Agenten-Workflows?

Planen, handeln, beobachten, reflektieren. Das Modell plant einen nächsten Schritt, handelt durch einen Tool-Aufruf, beobachtet, wie das Tool-Ergebnis in den Kontext eingeht, und reflektiert dann, ob das Ziel erreicht ist, und wiederholt oder stoppt. Jedes Muster in diesem Beitrag ist eine andere Art, diese vier Phasen zu verdrahten.

Was ist der Unterschied zwischen einem KI-Workflow und einem KI-Agenten?

Ein Workflow folgt vorherbestimmten Code-Pfaden; ein Agent lässt das Modell den eigenen Kontrollfluss steuern. Anthropics Regel: Workflows für Vorhersagbarkeit bei gut definierten Aufgaben, Agenten für Flexibilität, wenn modellgetriebene Entscheidungen in großem Maßstab gefragt sind. Die meisten Produktionssysteme sind Workflows mit ein paar Agenten-Schritten darin.

ReAct vs. Plan-and-Execute: Was soll ich nutzen?

Nutzen Sie ReAct, wenn der nächste Schritt davon abhängt, was das letzte Tool zurückgab, und die Route sich mittendrin ändern kann. Nutzen Sie Plan-and-Execute, wenn die Route vorab vorhersehbar ist und Neuplanung nach jedem Schritt Tokens verschwenden würde. ReAct maß +34 % auf ALFWorld (Yao et al., 2022); Plan-and-Execute schlug Zero-Shot-CoT auf zehn Datensätzen (Wang et al., 2023).

Brauche ich ein Framework wie LangGraph, um diese Muster zu nutzen?

Nein. Jeder Code-Block in diesem Beitrag ist ein simpler SDK-Aufruf, und die Muster sind älter als die Frameworks, die sie benennen. Ein Framework verdient seinen Unterhalt bei Zustandspersistenz, Retries und Tracing, nicht beim Muster selbst. Wenn Sie eines wählen, deckt unser Framework-Vergleich die Kompromisse ab.

Wie hindere ich eine Reflection-Schleife daran, endlos zu laufen?

Zwei Wachen, beide im Code: eine harte Iterationsgrenze (wir nutzen 4 Runden) und ein Abbruch bei ausbleibender Verbesserung, der stoppt, sobald der Rewrite des Kritikers nicht besser abschneidet als der aktuelle Entwurf. Vertrauen Sie dem Prompt nicht, die Schleife zu beenden; das Modell hat keine Ahnung, was Dinge kosten.

Wann reicht ein einzelner Agent?

Wenn er grob 85 % Genauigkeit auf der Aufgabe erreicht. Diese Heuristik kursierte auf r/AI_Agents (2026-04-23) neben der Google-Research-Studie und passt zu den Benchmarks: Oberhalb dieser Marke fügen zusätzliche Agenten Kosten und Fehlerverstärkung hinzu, ohne Genauigkeit zu gewinnen. Messen Sie die Single-Agent-Baseline, bevor Sie etwas Größeres entwerfen.

Wo finde ich Beispiele für KI-Agenten-Workflow-Muster mit Code?

Die fünf Python-Blöcke oben decken sequenziell, Routing, Parallelisierung, ReAct und Reflection ab, alle als simple SDK-Aufrufe, die Sie direkt übernehmen können. Für anbietergefärbte Beispiele liefert das Vercel AI SDK lauffähiges TypeScript pro Muster, und die OpenAI-Agents-SDK-Doku deckt Handoffs und Agents-as-Tools ab. Links zu beiden stehen in der Quellenliste unten.

Quellen

  • Anthropic, Building Effective Agents (2024-12-19)
  • Anthropic, How we built our multi-agent research system (2025-06-13)
  • Google Research, Towards a science of scaling agent systems (2026-01-28); Arbeit: arXiv 2512.08296
  • Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models (v3 2023-03-10)
  • Wang et al., Plan-and-Solve Prompting (ACL 2023)
  • Claude by Anthropic, Common workflow patterns for AI agents (2026-03-05)
  • OpenAI Agents SDK, Orchestrating multiple agents
  • Vercel AI SDK, Workflow Patterns
  • Microsoft Learn, AI Agent Orchestration Patterns (aktualisiert 2026-05-12)
  • Google Cloud, Choose a design pattern for your agentic AI system (2026-05-28)
  • Cognition (Walden Yan), Don't Build Multi-Agents (2025-06-12)
  • r/AI_Agents, Multi agent systems are a total nightmare in production (2026-04-23); Wait, are workflows actually better than multi-agent systems? (2026-03-09)

Tags

ki-agenten-workflow-musteragentische-workflow-musterki-agenten-designmusterorchestrator-workersreactplan-and-executemulti-agenten-systemellm-tooling

Diesen Artikel teilen

Verwandte Artikel

Mehr in ai-machine-learning

ai-machine-learning
Aug 7, 2026

RAG-Chunking-Strategien: 7 Methoden, bewertet nach Retrieval-Daten (2026)

Chunking teilt Ihre Dokumente vor dem Embedding auf, und die Schnittstellen entscheiden, was Ihr Retriever finden kann und was nicht. Wir haben 7 RAG-Chunking-Strategien gegen Chroma's öffentliches 472-Query-Benchmark bewertet und jede dem Embedding-Modell zugeordnet, das Sie bereits einsetzen.

15 min Lesedauer Lesezeit
Lesen
ai-machine-learning
Aug 6, 2026

Bestes RAG-Framework 2026: LangChain vs. LlamaIndex vs. Haystack (und wann Sie keines brauchen)

LangChain 1.0 ist die Standardwahl für die meisten Teams, aber die ehrliche Antwort für eine Ein-Korpus-Q&A-App lautet: Sie brauchen womöglich gar kein Framework. Wir haben 8 Orchestrierungsschichten nebeneinander verglichen, mit Code, datierten Repo-Daten und einem Latenzbudget.

14 Min. Lesezeit Lesezeit
Lesen
ai-machine-learning
Aug 6, 2026

LLM-Quantisierung: 7 Methoden im Vergleich (mit Benchmark-Zahlen)

Ein 70B-Modell in FP16 belegt 140 GB VRAM. Quantisiert auf Q4_K_M sind es noch etwa 42 GB. Dieser Leitfaden vergleicht alle 7 Quantisierungsmethoden mit veröffentlichten Benchmark-Daten und einer Entscheidungstabelle pro Setup.

16 Min. Lesezeit Lesezeit
Lesen
Alle Beiträge ansehen
Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.

30-Minuten-Scoping-Call buchenUnsere Arbeit ansehen

Frisch aus der Bibliothek

Claude Skills

Alle ansehen
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

KI-Automatisierungen

Alle ansehen
  • Security-Auditor

    Wöchentlicher SCA- + IaC-Scan mit priorisierten Fix-PRs.

  • Cold-Email-Texter

    Erzeugt Erstkontakt-Mails, verankert in einem konkreten öffentlichen Detail.

  • Lead-Research-Agent

    Reichert eine E-Mail zum Profil an, bewertet den Fit, meldet in Slack.

Frisch aus der Bibliothek

Claude Skills

Alle ansehen
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

KI-Automatisierungen

Alle ansehen
  • Security-Auditor

    Wöchentlicher SCA- + IaC-Scan mit priorisierten Fix-PRs.

  • Cold-Email-Texter

    Erzeugt Erstkontakt-Mails, verankert in einem konkreten öffentlichen Detail.

  • Lead-Research-Agent

    Reichert eine E-Mail zum Profil an, bewertet den Fit, meldet in Slack.

Leistungen

  • Enterprise-Lösungen
  • Mobile Apps
  • Web-Anwendungen

Lösungen

  • CRM-Systeme
  • KI-Integration
  • ERP-Lösungen
  • Voice Agents
  • Prozessautomatisierung
  • Cybersicherheit

Bibliothek

  • Blog
  • Portfolio

Community

  • KI-Automatisierungen
  • Claude Skills

Tools

  • Mobile-App-Kostenrechner
  • OpenAI / LLM API-Kostenrechner
  • MVP-Kostenrechner
  • Voice-AI-Agent-Kostenrechner

Unternehmen

  • Über uns
  • Partner
  • Kontakt

Rechtliches

  • Datenschutz
  • Nutzungsbedingungen
  • Cookie-Richtlinie

Leistungen

  • Enterprise-Lösungen
  • Mobile Apps
  • Web-Anwendungen

Lösungen

  • CRM-Systeme
  • KI-Integration
  • ERP-Lösungen
  • Voice Agents
  • Prozessautomatisierung
  • Cybersicherheit

Bibliothek

  • Blog
  • Portfolio

Community

  • KI-Automatisierungen
  • Claude Skills

Tools

  • Mobile-App-Kostenrechner
  • OpenAI / LLM API-Kostenrechner
  • MVP-Kostenrechner
  • Voice-AI-Agent-Kostenrechner

Unternehmen

  • Über uns
  • Partner
  • Kontakt
RechtlichesDatenschutzNutzungsbedingungenCookie-Richtlinie
TECHSY
© 2026 Techsy. Alle Rechte vorbehalten.