Handwerk × KI

Runde 3: der Ablauf

11. September 2026 · 12:10 bis 19:00 Uhr · zurück zum Ideenbuch

Was hier steht

Wie aus dem Auftrag „mindestens fünf weitere, auch kleine Ideen, im Gespräch mit starken Subagenten“ 36 Kandidaten, sieben Steckbriefe und die ersten Deep-Dives wurden: welche Agenten liefen, mit welchem Modell, wie oft sie im Gespräch weitergeführt wurden, was sie geliefert haben und was schiefging.

3Ideen-Agenten in drei Gesprächsrunden (zwei Claude Fable 5.1, einmal GPT-5.6-Terra über Codex)
36Kandidaten in Runde 1, davon 29 in Runde 2 gestrichen oder verschmolzen
7Ideen ausgewählt (G, H, I, J, K, L, N), je ein verbindlicher Steckbrief
7 + 1Deep-Dive-Agenten gestartet, einer als Gutachter; sieben erst durch das Sitzungslimit gestoppt
1,7 Mio.Tokens der Subagenten und Codex-Läufe, die abgeschlossen sind (ohne laufende Deep-Dives, ohne Orchestrator)
20Arbeitsdokumente, archiviert unter quellen/runde3/

1. Aufbau: ein Orchestrator, Subagenten, ein zweites Modell

Ich (Claude Fable 5.1 in Claude Code) habe nicht selbst Ideen erfunden, sondern den Prozess geführt: Briefing schreiben, Agenten mit verschiedenen Blickwinkeln starten, ihre Ergebnisse lesen, Dubletten erkennen, Kritik und die Ergebnisse der jeweils anderen zurückspielen, entscheiden, und am Ende die Seite bauen. Drei Mechanismen haben das getragen:

Alle Agenten teilten sich denselben Kontext über Dateien im Arbeitsverzeichnis: ein Briefing (2.701 Wörter: Team, Ideen A bis F, fünf Skizzen aus der Marktanalyse, Käuferverhalten, Preisanker, Regulatorik), später die Ergebnisdateien der anderen Agenten. Jede Runde hatte eine Aufgaben-Datei, die alle drei gleich bekamen, plus eine individuelle Nachricht mit Kritik an genau ihren Kandidaten.

2. Die vier Phasen

  1. 1
    Ideation, Runde 1 (12:19 bis 12:34). Drei Agenten, drei Linsen, je zwölf Kandidaten im festen Format (Größe S/M/L, Ein-Satz-Pitch, erster Satz des Vertrieblers beim Meister, Preisformat, warum keine Plattform es gratis bündelt, Bauaufwand, erster Umsatz, Wettbewerber mit URL, Risiko, Anschluss an A bis F).

    Linse „niederschwellig“: der Vertriebler um 7 Uhr am Küchentisch, 500 bis 3.000 Euro einmalig oder 29 bis 149 Euro im Monat. Linse „Geldflüsse“: die Kanten des Betriebs zu Großhändlern, Herstellern, Versicherern, Verwaltungen, Innungen, Behörden, plus die Frage, was erst mit 2026er-Modellen geht. Linse „kontrarisch“ (Codex): welche Annahmen aus Runde 1/2 für ein Team mit Vertriebler falsch sind, welche langweiligen Pflichten sich verkaufen, welche Nischen-Gewerke Software-Wüsten sind.

  2. 2
    Cross-Pollination, Runde 2 (12:40 bis 12:51). Jeder las die beiden anderen Listen. Aufgaben: meine Dubletten-Cluster bestätigen oder korrigieren und pro Cluster die eine beste Form benennen, mindestens zwölf der 36 streichen (auch eigene), eine gemeinsame Top 8 mit Kill-Kriterium je Idee, ein Vorschlag für sechs bis sieben Deep-Dives, zwei harte Fragen an die anderen.

    Dazu bekam jeder Agent Antworten auf seine offenen Fragen aus Runde 1 (als Annahmen, weil du nicht erreichbar warst: Bürosoftware-Mix, Betriebstypen, 2 bis 3 halbe Tage Vor-Ort pro Woche, WhatsApp ja, sensible Dokumente per Web-Link) und individuelle Kritik: dem Geldflüsse-Agenten etwa, dass seine Zuschuss-Zahl unbelegt ist; er hat sie daraufhin mit IAB- und BG-BAU-Quellen selbst auf 1.000 bis 4.000 Euro heruntergerechnet.

  3. 3
    Auswahl und Steckbriefe, Runde 3 (12:56 bis 13:07). Ich habe die drei Top-8-Listen nebeneinandergelegt: drei Ideen waren bei allen dreien, vier bei zweien. Daraus die Auswahl G bis L und N. Jeder Agent schrieb dann für die Ideen, deren beste Form aus seiner Linse kam, einen verbindlichen Steckbrief (Produkt, Einmal versus Abo, Gewerke-Reihenfolge, Vertriebler-Skript, was aus welcher Variante überlebt, Rechtsgrenze, die eine Zahl, Kill-Kriterium, drei Recherchefragen) und musste die Streitpunkte entscheiden, etwa Elektro oder SHK zuerst bei der Bestandsernte.

    Codex schrieb den Steckbrief für N und dazu für alle sieben einen „Anwalt des Teufels“: das stärkste Scheiter-Argument, was der Deep-Dive nicht schönreden darf, und welche Recherche das prüft.

  4. 4
    Deep-Dives mit Gutachten (ab 13:05, Neustart 18:40). Pro Idee ein frischer Fable-Agent mit Anleitung (Gliederung wie A bis F, 4.000 bis 6.000 Wörter, JSON exakt nach dem Schema von A.json plus Kurzname, Runde, Größe, mindestens zwölf echte Quellen), seinem Steckbrief, dem Anwalt-des-Teufels-Abschnitt und den Runde-2-Dokumenten. Danach Runde 2 je Deep-Dive: ein Gutachten von GPT-5.6-Terra (sechs Gegenargumente mit Quellen, Score-Urteil, Faktenfehler, „der eine Satz des Meisters“), das der Autor in Kapitel 13 beantworten und in Scores und JSON einarbeiten muss.

    Für N ist dieser Zyklus komplett gelaufen. G, H, I, J, K wurden beim Abschluss gestoppt, L nicht mehr gestartet; die Steckbriefe aller sechs liegen vor.

3. Agentenregister

Token-Zahlen sind die kumulierten Werte je Agent über alle Runden, wie sie das Agent-Werkzeug beim Abschluss meldet; bei Codex die „tokens used“ je Lauf. Dauer ist die reine Laufzeit der Runde.

AgentModellRundenLieferungTokensWerkzeugaufrufeDauer
Ideation „niederschwellig“Claude Fable 5.13 (R1, R2, Steckbriefe G/J/K)12 Kandidaten (4.699 Wörter); Dubletten-Karte, 19 Streichungen, Top 8 (5.334 Wörter); Steckbriefe G, J, K plus drei Pilotdaten vor Code (4.527 Wörter)377.35823 / 10 / 618,5 / 14,2 / 12,2 min
Ideation „Geldflüsse“Claude Fable 5.13 (R1, R2, Steckbriefe H/I/L)12 Kandidaten mit Kanten-Tabelle (5.365 Wörter); Zuschuss-Zahl selbst korrigiert, 16 Streichungen, Top 8 (4.909 Wörter); Steckbriefe H, I, L mit VOB-Fristenkette und RDG-Grenze (5.379 Wörter)438.37638 / 13 / 1020,2 / 12,5 / 14,2 min
Ideation „kontrarisch“GPT-5.6-Terra (Codex CLI, reasoning xhigh)3 in einer fortgesetzten Sitzung12 Kandidaten, 3 angegriffene Annahmen (2.969 Wörter, 14 Websuchen); Haftungs-Tabelle, 16 Streichungen, Top 8 (2.982 Wörter); Steckbrief N plus Anwalt des Teufels für alle sieben (2.111 Wörter)150.004 / 153.557 / 128.20314 / 2 / 6 Websuchen7 / 7 / 7 min
Deep-Dive N (Innungs-Azubi-Hotline)Claude Fable 5.12 (Entwurf, nach Limit fortgesetzt; Runde 2 mit Gutachten beim Abschluss gestoppt)N.md 6.997 Wörter, 14 Kapitel, 33 Quellen; N.json valide; Scores Ø 5,0, bewusst unter A bis F359.85810 (nach Fortsetzung)17 + 6 min
Gutachter NGPT-5.6-Terra (Codex, neue Sitzung)1Sechs Gegenargumente, Score-Vorschlag Ø 3,1 statt 5,0, sieben Faktenprüfungen (u. a. Praktikumswoche als engster Substitut, Art. 8 DSGVO, AI-Act-Frist bestätigt), 1.544 Wörter104.59910 Websuchen3 min
Deep-Dives G, H, I, J, KClaude Fable 5.1gestopptBeim Abschluss um 19:05 in der Lesephase gestoppt, keine Dateien; Steckbriefe liegen vor, Deep-Dives offen (siehe OFFENE-PUNKTE.md)offenoffenoffen
Deep-Dives G, H, I, J, K, L (erster Anlauf)Claude Fable 5.1abgebrochenUm 13:20 bis 13:30 durch das Sitzungslimit (HTTP 429, Reset 13:50) in der Lesephase beendet, keine Dateiengering

4. Zeitleiste

5. Was ich als Orchestrator selbst entschieden habe

Inhaltlich

  • Die acht Dubletten-Cluster in Runde 2 (Sicherheiten, Bestandsernte, Sub-Nachweise, Betriebsmittel, Belege/Material, Hausverwaltung, Ereignis/Schaden, Papier rein) und die Liste der Einzelgänger.
  • Die Antworten auf die offenen Fragen der Agenten als ausdrücklich gekennzeichnete Annahmen, weil du nicht erreichbar warst. Diese Annahmen sind der wichtigste offene Punkt.
  • Die Auswahl der sieben nach Stimmenzahl und Mischung: mindestens vier kleine, nicht nur SHK/Elektro, nicht nur Compliance, mindestens ein „Partner zahlt“-Modell, mindestens eine Idee mit Umsatz unter 30 Tagen.
  • Die Zuweisung der Steckbriefe an die Linse, aus der die beste Form kam; Codex als Anwalt des Teufels statt als Autor.
  • Zuschuss-Scan, Schaden-Kit, Zettel-Abtipper und Kassen-Nachschau nicht ausarbeiten, sondern mit ihren Zahlen im Abschnitt „Runde 3“ dokumentieren.

Technisch

  • Generator: Ideen werden aus allen einbuchstabigen JSON-Dateien außer M geladen; Ausgabe direkt nach index.html; neue Felder kurz, runde, groesse; Karten nach Runde gruppiert; Größen-Badge als Text, nicht als Farbe.
  • Buchstaben G bis L und N für die neuen Ideen, M bleibt die Marktdatei; die Markt-Marke im Tab ist jetzt „€“.
  • Codex nur lesend (-s read-only), Ausgabe über -o in eine Datei, Sitzung per ID fortgesetzt, Modell bei jedem Resume explizit gesetzt.
  • Deep-Dive-Agenten schreiben Entwürfe früh, damit ein Abbruch nicht alles kostet; nach dem Limit in zwei Wellen statt sieben parallel.
  • Alle Zwischenstände liegen unter quellen/runde3/: Briefing, Anleitung, Gutachten-Vorlage, drei Runde-1-Listen, Runde-2-Aufgabe und drei Antworten, Auswahl, drei Steckbrief-Dateien, Gutachten zu N.

6. Pannen und was sie gekostet haben

WannWasUrsacheLösungKosten
12:12Codex „not found“Binary nicht im PATHIn der VS-Code-Extension gefunden, Pfad in einer Erinnerung notiert3 Minuten
12:13Build bricht abPython-Modul markdown fehltuv run --with markdown python3 build.py1 Minute
12:20timeout unbekanntmacOS hat kein GNU timeoutTimeout des Bash-Werkzeugs genutzt1 Minute
12:41Codex-Resume scheitert zweimal, läuft dann mit falschem Modellresume kennt --color nicht, braucht --skip-git-repo-check, nimmt das Config-ModellFlags entfernt, Modell per -c gesetzt, alten Lauf beendet5 Minuten
13:20Sieben Deep-Dive-Agenten sterbenSitzungslimit der Claude-Nutzung (5-Stunden-Fenster), sieben parallel gestartetNach Reset in Wellen neu gestartet, N fortgesetzt5 Stunden Wartezeit, kaum verlorene Arbeit
18:47Build bricht abZahlwort-Tabelle kannte keine 1Hilfsfunktion mit Fallback1 Minute

7. Die drei Runde-1-Prompts im Kern

Niederschwellig: „Denk wie der Vertriebler, der morgens um 7 vor Baustellenstart 20 Minuten beim Meister am Küchentisch sitzt. Was kann er dort in einem Satz erklären, sofort demonstrieren und für 500 bis 3.000 Euro einmalig oder 29 bis 149 Euro im Monat verkaufen, sodass der Betrieb am gleichen Tag unterschreibt? … Geh systematisch vor: Wo fließt Geld weg oder Zeit verloren? Welche Pflicht zwingt zum Handeln? Was können plancraft, HERO, OneQrew, Streit, pds nicht bündeln? Was verkauft sich, weil jemand persönlich einführt? Liefere 12 Kandidaten, mindestens 8 davon klein.“

Geldflüsse: „Ein Handwerksbetrieb steht in einem Netz: Endkunden, Großhändler, Hersteller, Innungen, Berufsschulen, Steuerberater, Banken, Versicherungen, Berufsgenossenschaft, Prüforganisationen, Behörden, Sachverständige, Subunternehmer, Azubis, Nachfolger. An jeder Kante fließt Geld, Information oder Haftung, und an vielen fehlt Software, die dem Betrieb nützt. Wer könnte außer dem Betrieb Zahler sein? … Zweite Perspektive: Was wird mit den aktuellen Modellen erst 2026 möglich, das 2023 Spielzeug war?“

Kontrarisch (Codex): „Zwei andere Agenten suchen parallel niederschwellig und entlang der Geldflüsse. Finde, was beide übersehen: Welche Annahmen aus Runde 1/2 sind für ein Team mit Vertriebler falsch? Welche fast langweiligen Dinge verkaufen sich, weil sie eine Pflicht, einen Kalender, ein Formular oder eine Strafe bedienen? Welche Nischen-Gewerke haben eigene Software-Wüsten? Was bauen die etablierten Häuser aus Datenschutz-, Nischen- oder Servicegründen nicht? … Nenne drei Annahmen aus dem Briefing, die du für falsch hältst.“