Leistung 02 · Entwicklung
Produktionsreife entsteht nicht im Prompt, sondern im Prozess.
Wir bauen Agenten wie Software-Systeme: mit sauberem Client, Prompts unter Versionskontrolle, Evals als Merge-Kriterium und einer Test-Pyramide, die auch Tool-Fehler und Grenzfälle abdeckt.
Was ihr bekommt
Agenten-Entwicklung im Detail
Produktionsreifer Client
Retries, Timeouts, Streaming, Fehlerbehandlung, Kostenkontrolle: Der API-Client ist die Stelle, an der Demos von Systemen getrennt werden.
Loop & Agent SDK
Wir nutzen das Claude Agent SDK für den Agenten-Loop — Tool-Orchestrierung, Kontext-Management und Session-Handling müssen nicht neu erfunden werden.
Prompts als Code
Prompts liegen versioniert im Repo, mit Review, Diff und Rollback. Ein Prompt-Änderung ohne Eval-Lauf kommt nicht in Produktion.
Eval-Driven Development
Das Golden Set wächst mit jedem Fehlerfall. Regression im Eval blockiert den Merge — so wird Qualität messbar statt gefühlt.
Test-Pyramide
Unit-Tests für Tools, Integrationstests für Flows, Evals für Verhalten. Jede Ebene fängt eine andere Klasse von Fehlern.
Claude Code als Umgebung
Entwicklung, Debugging und Eval-Läufe passieren in Claude Code — die Umgebung, in der Agenten gebaut werden, ist selbst agentisch.
Vom Prototyp zum System, dem ihr vertrauen könnt.
Wir bauen den Agenten, den der Design Sprint validiert hat.