Wie aus dem Auftrag „mindestens fünf weitere, auch kleine Ideen, im Gespräch mit starken Subagenten“ 36 Kandidaten, sieben Steckbriefe und die ersten Deep-Dives wurden: welche Agenten liefen, mit welchem Modell, wie oft sie im Gespräch weitergeführt wurden, was sie geliefert haben und was schiefging.
3Ideen-Agenten in drei Gesprächsrunden (zwei Claude Fable 5.1, einmal GPT-5.6-Terra über Codex)
36Kandidaten in Runde 1, davon 29 in Runde 2 gestrichen oder verschmolzen
7Ideen ausgewählt (G, H, I, J, K, L, N), je ein verbindlicher Steckbrief
7 + 1Deep-Dive-Agenten gestartet, einer als Gutachter; sieben erst durch das Sitzungslimit gestoppt
1,7 Mio.Tokens der Subagenten und Codex-Läufe, die abgeschlossen sind (ohne laufende Deep-Dives, ohne Orchestrator)
20Arbeitsdokumente, archiviert unter quellen/runde3/
1. Aufbau: ein Orchestrator, Subagenten, ein zweites Modell
Ich (Claude Fable 5.1 in Claude Code) habe nicht selbst Ideen erfunden, sondern den Prozess geführt: Briefing schreiben, Agenten mit verschiedenen Blickwinkeln starten, ihre Ergebnisse lesen, Dubletten erkennen, Kritik und die Ergebnisse der jeweils anderen zurückspielen, entscheiden, und am Ende die Seite bauen. Drei Mechanismen haben das getragen:
Subagenten über das Agent-Werkzeug, Modell ausdrücklich fable (Fable 5.1). Jeder Agent bekam Lese-, Web- und Schreibrechte und arbeitete im Hintergrund; ich wurde bei Abschluss benachrichtigt.
Mehrstufiges Gespräch über SendMessage. Ein Agent wird mit derselben Kennung wieder aufgeweckt und behält seinen ganzen Kontext. So haben die beiden Ideen-Agenten drei Runden durchlaufen, ohne etwas neu lesen zu müssen, und der Deep-Dive-Agent für N konnte nach dem Sitzungslimit genau dort weitermachen, wo er stand.
Codex CLI mit GPT-5.6-Terra als zweites Modell. Der Binary lag nicht im PATH, sondern in der VS-Code-Extension (~/.vscode/extensions/openai.chatgpt-…/bin/macos-aarch64/codex). Aufruf nicht-interaktiv mit codex exec -m gpt-5.6-terra -s read-only, Fortsetzung derselben Sitzung mit codex exec resume <id>. Reasoning-Stufe laut Config: xhigh. Codex hat von sich aus Web-Recherchen gemacht (14 in Runde 1).
Alle Agenten teilten sich denselben Kontext über Dateien im Arbeitsverzeichnis: ein Briefing (2.701 Wörter: Team, Ideen A bis F, fünf Skizzen aus der Marktanalyse, Käuferverhalten, Preisanker, Regulatorik), später die Ergebnisdateien der anderen Agenten. Jede Runde hatte eine Aufgaben-Datei, die alle drei gleich bekamen, plus eine individuelle Nachricht mit Kritik an genau ihren Kandidaten.
2. Die vier Phasen
1
Ideation, Runde 1 (12:19 bis 12:34). Drei Agenten, drei Linsen, je zwölf Kandidaten im festen Format (Größe S/M/L, Ein-Satz-Pitch, erster Satz des Vertrieblers beim Meister, Preisformat, warum keine Plattform es gratis bündelt, Bauaufwand, erster Umsatz, Wettbewerber mit URL, Risiko, Anschluss an A bis F).
Linse „niederschwellig“: der Vertriebler um 7 Uhr am Küchentisch, 500 bis 3.000 Euro einmalig oder 29 bis 149 Euro im Monat. Linse „Geldflüsse“: die Kanten des Betriebs zu Großhändlern, Herstellern, Versicherern, Verwaltungen, Innungen, Behörden, plus die Frage, was erst mit 2026er-Modellen geht. Linse „kontrarisch“ (Codex): welche Annahmen aus Runde 1/2 für ein Team mit Vertriebler falsch sind, welche langweiligen Pflichten sich verkaufen, welche Nischen-Gewerke Software-Wüsten sind.
2
Cross-Pollination, Runde 2 (12:40 bis 12:51). Jeder las die beiden anderen Listen. Aufgaben: meine Dubletten-Cluster bestätigen oder korrigieren und pro Cluster die eine beste Form benennen, mindestens zwölf der 36 streichen (auch eigene), eine gemeinsame Top 8 mit Kill-Kriterium je Idee, ein Vorschlag für sechs bis sieben Deep-Dives, zwei harte Fragen an die anderen.
Dazu bekam jeder Agent Antworten auf seine offenen Fragen aus Runde 1 (als Annahmen, weil du nicht erreichbar warst: Bürosoftware-Mix, Betriebstypen, 2 bis 3 halbe Tage Vor-Ort pro Woche, WhatsApp ja, sensible Dokumente per Web-Link) und individuelle Kritik: dem Geldflüsse-Agenten etwa, dass seine Zuschuss-Zahl unbelegt ist; er hat sie daraufhin mit IAB- und BG-BAU-Quellen selbst auf 1.000 bis 4.000 Euro heruntergerechnet.
3
Auswahl und Steckbriefe, Runde 3 (12:56 bis 13:07). Ich habe die drei Top-8-Listen nebeneinandergelegt: drei Ideen waren bei allen dreien, vier bei zweien. Daraus die Auswahl G bis L und N. Jeder Agent schrieb dann für die Ideen, deren beste Form aus seiner Linse kam, einen verbindlichen Steckbrief (Produkt, Einmal versus Abo, Gewerke-Reihenfolge, Vertriebler-Skript, was aus welcher Variante überlebt, Rechtsgrenze, die eine Zahl, Kill-Kriterium, drei Recherchefragen) und musste die Streitpunkte entscheiden, etwa Elektro oder SHK zuerst bei der Bestandsernte.
Codex schrieb den Steckbrief für N und dazu für alle sieben einen „Anwalt des Teufels“: das stärkste Scheiter-Argument, was der Deep-Dive nicht schönreden darf, und welche Recherche das prüft.
4
Deep-Dives mit Gutachten (ab 13:05, Neustart 18:40). Pro Idee ein frischer Fable-Agent mit Anleitung (Gliederung wie A bis F, 4.000 bis 6.000 Wörter, JSON exakt nach dem Schema von A.json plus Kurzname, Runde, Größe, mindestens zwölf echte Quellen), seinem Steckbrief, dem Anwalt-des-Teufels-Abschnitt und den Runde-2-Dokumenten. Danach Runde 2 je Deep-Dive: ein Gutachten von GPT-5.6-Terra (sechs Gegenargumente mit Quellen, Score-Urteil, Faktenfehler, „der eine Satz des Meisters“), das der Autor in Kapitel 13 beantworten und in Scores und JSON einarbeiten muss.
Für N ist dieser Zyklus komplett gelaufen. G, H, I, J, K wurden beim Abschluss gestoppt, L nicht mehr gestartet; die Steckbriefe aller sechs liegen vor.
3. Agentenregister
Token-Zahlen sind die kumulierten Werte je Agent über alle Runden, wie sie das Agent-Werkzeug beim Abschluss meldet; bei Codex die „tokens used“ je Lauf. Dauer ist die reine Laufzeit der Runde.
Agent
Modell
Runden
Lieferung
Tokens
Werkzeugaufrufe
Dauer
Ideation „niederschwellig“
Claude Fable 5.1
3 (R1, R2, Steckbriefe G/J/K)
12 Kandidaten (4.699 Wörter); Dubletten-Karte, 19 Streichungen, Top 8 (5.334 Wörter); Steckbriefe G, J, K plus drei Pilotdaten vor Code (4.527 Wörter)
377.358
23 / 10 / 6
18,5 / 14,2 / 12,2 min
Ideation „Geldflüsse“
Claude Fable 5.1
3 (R1, R2, Steckbriefe H/I/L)
12 Kandidaten mit Kanten-Tabelle (5.365 Wörter); Zuschuss-Zahl selbst korrigiert, 16 Streichungen, Top 8 (4.909 Wörter); Steckbriefe H, I, L mit VOB-Fristenkette und RDG-Grenze (5.379 Wörter)
438.376
38 / 13 / 10
20,2 / 12,5 / 14,2 min
Ideation „kontrarisch“
GPT-5.6-Terra (Codex CLI, reasoning xhigh)
3 in einer fortgesetzten Sitzung
12 Kandidaten, 3 angegriffene Annahmen (2.969 Wörter, 14 Websuchen); Haftungs-Tabelle, 16 Streichungen, Top 8 (2.982 Wörter); Steckbrief N plus Anwalt des Teufels für alle sieben (2.111 Wörter)
150.004 / 153.557 / 128.203
14 / 2 / 6 Websuchen
7 / 7 / 7 min
Deep-Dive N (Innungs-Azubi-Hotline)
Claude Fable 5.1
2 (Entwurf, nach Limit fortgesetzt; Runde 2 mit Gutachten beim Abschluss gestoppt)
N.md 6.997 Wörter, 14 Kapitel, 33 Quellen; N.json valide; Scores Ø 5,0, bewusst unter A bis F
359.858
10 (nach Fortsetzung)
17 + 6 min
Gutachter N
GPT-5.6-Terra (Codex, neue Sitzung)
1
Sechs Gegenargumente, Score-Vorschlag Ø 3,1 statt 5,0, sieben Faktenprüfungen (u. a. Praktikumswoche als engster Substitut, Art. 8 DSGVO, AI-Act-Frist bestätigt), 1.544 Wörter
104.599
10 Websuchen
3 min
Deep-Dives G, H, I, J, K
Claude Fable 5.1
gestoppt
Beim Abschluss um 19:05 in der Lesephase gestoppt, keine Dateien; Steckbriefe liegen vor, Deep-Dives offen (siehe OFFENE-PUNKTE.md)
offen
offen
offen
Deep-Dives G, H, I, J, K, L (erster Anlauf)
Claude Fable 5.1
abgebrochen
Um 13:20 bis 13:30 durch das Sitzungslimit (HTTP 429, Reset 13:50) in der Lesephase beendet, keine Dateien
gering
–
–
4. Zeitleiste
12:10Auftrag. Bestandsaufnahme: Schema von A.json, Gliederung von A.md, Marktanalyse, Generator. Erkenntnis: der Generator baut nur A bis F, „M“ ist der Markt-Tab, das Python-Modul markdown fehlt (Lösung: uv run --with markdown).
12:16Briefing geschrieben, aus den JSON-Dateien generiert plus Team-Kontext (Entwickler plus Vertriebler, niederschwellig erwünscht). Drei Erinnerungen abgelegt: Team-Kontext, Arbeitsweise (mehrstufige Gespräche mit starken Subagenten), Codex-Pfad.
12:19Zwei Fable-Agenten gestartet (Linsen niederschwellig, Geldflüsse). Codex-Funktionstest, dann Codex-Runde 1 im Hintergrund.
12:34Geldflüsse liefert: Sicherheiten-Radar, Zuschuss-Scan, Einkaufs-Radar, Transporter-Inventar, Garantie-Claim, Versicherungsschaden-Kit, Wartungsvertrags-Fabrik, HV-Modul, Prüfvermerk-Leser, Sub- und Firmenakte, Innungs-Azubi-Hotline, Portal-Praktikant. Auffällig: alle drei fanden unabhängig „Wartungsbestand aus Altrechnungen ernten“.
12:39Runde-2-Aufgabe: acht Dubletten-Cluster, Antworten auf die offenen Fragen, Streichliste, gemeinsame Top 8. Individuelle Kritik je Agent per SendMessage; Codex per resume.
12:41Codex-Resume dreimal angefasst: --color wird von resume nicht akzeptiert, dann fehlte --skip-git-repo-check, dann fiel die Sitzung auf das Config-Standardmodell gpt-6-astra zurück. Lösung: -c model="gpt-5.6-terra", alten Lauf beendet.
12:47Codex Runde 2: streicht acht eigene Ideen, gibt beim Tor-Wedge nach, zieht die Haftungslinie „Register, Frist, Entwurf ja, Bewertung nein“, warnt vor dem „Aufräum-Service mit KI“.
12:50Geldflüsse Runde 2: Zuschuss-Zahl mit Belegen nach unten korrigiert, Kommissionstext-Befund für den Material-Check (kein Monteur nötig), 16 Streichungen.
12:51Niederschwellig Runde 2: Zettel-Abtipper nach Benchmark-Recherche (78 bis 85 Prozent Feldgenauigkeit) selbst gestrichen, Schaden-Kit zusammengelegt, zwei Einmal-Produkte ab Tag 1 benannt.
12:56Auswahl: G Bestandsernte, H Sicherheiten-Radar, I Einkaufs- und Material-Check, J Betriebs-Inventur, K Sub-Akte, L HV-Kundenakte, N Innungs-Azubi-Hotline. Steckbrief-Aufträge verteilt. Markt-Marke im Generator von „M“ auf „€“ geändert, damit Buchstaben nicht kollidieren.
13:03Codex: Steckbrief N und Anwalt des Teufels für alle sieben; würde N als Erstes wieder streichen und I zuerst bauen.
13:05Deep-Dive N gestartet. 13:06 Steckbriefe G/J/K, 13:07 Steckbriefe H/I/L, dann Deep-Dives G, J, K, H, I, L gestartet.
13:20Sitzungslimit. Alle sieben Deep-Dive-Agenten mit HTTP 429 beendet; N hatte N.md bereits geschrieben (13:22). Abschnitt „Runde 3“ mit allen 29 nicht ausgearbeiteten Kandidaten und Gründen in die Übersicht der Website geschrieben.
18:40Nach „weiter“: N per SendMessage fortgesetzt (Kontext erhalten), G, H, I, J neu gestartet mit der Anweisung, Entwürfe früh zu speichern; K um 18:47; L zurückgestellt.
18:45N fertig: 6.997 Wörter, Scores Ø 5,0, Erstumsatz an das Haushaltsjahr der Innung gekoppelt, „kein Code vor unterschriebenem Pilot“.
18:49Gutachten zu N (GPT-5.6-Terra): Praktikumswoche als kostenloser Substitut, Vollkostenrechnung des Piloten negativ, Score-Vorschlag Ø 3,1. 18:53 an den N-Agenten als Runde 2 geschickt.
18:55Bitte um Abschluss. Arbeitsdokumente nach quellen/runde3/ archiviert, diese Seite, offene Punkte, Website-Build.
5. Was ich als Orchestrator selbst entschieden habe
Inhaltlich
Die acht Dubletten-Cluster in Runde 2 (Sicherheiten, Bestandsernte, Sub-Nachweise, Betriebsmittel, Belege/Material, Hausverwaltung, Ereignis/Schaden, Papier rein) und die Liste der Einzelgänger.
Die Antworten auf die offenen Fragen der Agenten als ausdrücklich gekennzeichnete Annahmen, weil du nicht erreichbar warst. Diese Annahmen sind der wichtigste offene Punkt.
Die Auswahl der sieben nach Stimmenzahl und Mischung: mindestens vier kleine, nicht nur SHK/Elektro, nicht nur Compliance, mindestens ein „Partner zahlt“-Modell, mindestens eine Idee mit Umsatz unter 30 Tagen.
Die Zuweisung der Steckbriefe an die Linse, aus der die beste Form kam; Codex als Anwalt des Teufels statt als Autor.
Zuschuss-Scan, Schaden-Kit, Zettel-Abtipper und Kassen-Nachschau nicht ausarbeiten, sondern mit ihren Zahlen im Abschnitt „Runde 3“ dokumentieren.
Technisch
Generator: Ideen werden aus allen einbuchstabigen JSON-Dateien außer M geladen; Ausgabe direkt nach index.html; neue Felder kurz, runde, groesse; Karten nach Runde gruppiert; Größen-Badge als Text, nicht als Farbe.
Buchstaben G bis L und N für die neuen Ideen, M bleibt die Marktdatei; die Markt-Marke im Tab ist jetzt „€“.
Codex nur lesend (-s read-only), Ausgabe über -o in eine Datei, Sitzung per ID fortgesetzt, Modell bei jedem Resume explizit gesetzt.
Deep-Dive-Agenten schreiben Entwürfe früh, damit ein Abbruch nicht alles kostet; nach dem Limit in zwei Wellen statt sieben parallel.
Alle Zwischenstände liegen unter quellen/runde3/: Briefing, Anleitung, Gutachten-Vorlage, drei Runde-1-Listen, Runde-2-Aufgabe und drei Antworten, Auswahl, drei Steckbrief-Dateien, Gutachten zu N.
6. Pannen und was sie gekostet haben
Wann
Was
Ursache
Lösung
Kosten
12:12
Codex „not found“
Binary nicht im PATH
In der VS-Code-Extension gefunden, Pfad in einer Erinnerung notiert
3 Minuten
12:13
Build bricht ab
Python-Modul markdown fehlt
uv run --with markdown python3 build.py
1 Minute
12:20
timeout unbekannt
macOS hat kein GNU timeout
Timeout des Bash-Werkzeugs genutzt
1 Minute
12:41
Codex-Resume scheitert zweimal, läuft dann mit falschem Modell
resume kennt --color nicht, braucht --skip-git-repo-check, nimmt das Config-Modell
Flags entfernt, Modell per -c gesetzt, alten Lauf beendet
5 Minuten
13:20
Sieben Deep-Dive-Agenten sterben
Sitzungslimit der Claude-Nutzung (5-Stunden-Fenster), sieben parallel gestartet
Nach Reset in Wellen neu gestartet, N fortgesetzt
5 Stunden Wartezeit, kaum verlorene Arbeit
18:47
Build bricht ab
Zahlwort-Tabelle kannte keine 1
Hilfsfunktion mit Fallback
1 Minute
7. Die drei Runde-1-Prompts im Kern
Niederschwellig: „Denk wie der Vertriebler, der morgens um 7 vor Baustellenstart 20 Minuten beim Meister am Küchentisch sitzt. Was kann er dort in einem Satz erklären, sofort demonstrieren und für 500 bis 3.000 Euro einmalig oder 29 bis 149 Euro im Monat verkaufen, sodass der Betrieb am gleichen Tag unterschreibt? … Geh systematisch vor: Wo fließt Geld weg oder Zeit verloren? Welche Pflicht zwingt zum Handeln? Was können plancraft, HERO, OneQrew, Streit, pds nicht bündeln? Was verkauft sich, weil jemand persönlich einführt? Liefere 12 Kandidaten, mindestens 8 davon klein.“
Geldflüsse: „Ein Handwerksbetrieb steht in einem Netz: Endkunden, Großhändler, Hersteller, Innungen, Berufsschulen, Steuerberater, Banken, Versicherungen, Berufsgenossenschaft, Prüforganisationen, Behörden, Sachverständige, Subunternehmer, Azubis, Nachfolger. An jeder Kante fließt Geld, Information oder Haftung, und an vielen fehlt Software, die dem Betrieb nützt. Wer könnte außer dem Betrieb Zahler sein? … Zweite Perspektive: Was wird mit den aktuellen Modellen erst 2026 möglich, das 2023 Spielzeug war?“
Kontrarisch (Codex): „Zwei andere Agenten suchen parallel niederschwellig und entlang der Geldflüsse. Finde, was beide übersehen: Welche Annahmen aus Runde 1/2 sind für ein Team mit Vertriebler falsch? Welche fast langweiligen Dinge verkaufen sich, weil sie eine Pflicht, einen Kalender, ein Formular oder eine Strafe bedienen? Welche Nischen-Gewerke haben eigene Software-Wüsten? Was bauen die etablierten Häuser aus Datenschutz-, Nischen- oder Servicegründen nicht? … Nenne drei Annahmen aus dem Briefing, die du für falsch hältst.“