Zum Inhalt springen

Arbeiten

voxcog: KI-Agenten, die im Betrieb tragen

Torn StudioKunde: voxcog

Das Verhältnis des Studios zum Kunden

voxcog ist ein Produkt, das Torn Studio gebaut hat und an dem das Studio beteiligt ist. Das Studio verantwortete Produktleitung, Architektur und Umsetzung bis zur Übergabe im August 2026.

Kurze Antwort

Torn Studio hat voxcogs Agentenplattform gebaut: 55 Werkzeuge hinter einem Agenten, der sie bei Bedarf nachlädt, drei Modellstufen, sodass jeder Aufruf an die günstigste geht, die die Aufgabe löst, und eine Auswertung, die bei jeder Änderung in der CI läuft. Übergeben im August 2026.

Der Auftrag

voxcog brauchte einen Agenten, der das gesamte Produkt in einem Gespräch erreicht — Dokumente, Signale, Aufgaben, Kalender, Recherche und fertige Produktunterlagen — und der im Betrieb mehrere Kunden gleichzeitig bedient.

Was es schwierig machte

  • Ein früherer Aufbau legte rund vierzig Werkzeuge und einen langen Systemprompt in jeden Aufruf, traf damit die Anthropic-Grenze von 50.000 Tokens pro Minute und blockierte den Chat für alle Kunden gleichzeitig.
  • Der Betrieb läuft auf einer serverlosen Plattform mit 270 Sekunden Laufzeit je Zug, also muss jeder Agentenlauf innerhalb dieser Zeit fertig werden.
  • Die Antworten müssen im Nachhinein belastbar sein, was laufende Qualitätsmessung verlangt und eine Messung, die in der CI gegen aufgezeichnete Läufe läuft.

Zahlen zum Nachzählen

55Werkzeuge hinter einem Agenten
In einem Modul registriert und dort zählbar. Der Agent trägt einen kleinen festen Satz im Prompt und lädt den Rest nach, wenn ein Gespräch ihn verlangt.
3Modellstufen
Haiku 4.5, Sonnet 4.6 und Opus 4.6, deklariert in einer Datei mit zwölf Zeilen. Eine ganze Spur zwischen Stufen zu verschieben ist eine Zeilenänderung.
50.000Tokens pro Minute, die Grenze
Das Limit, an das die frühere Topologie immer wieder stieß. Die neue trägt denselben Katalog unter derselben Grenze, indem sie den Prompt klein hält.
20Schritte höchstens pro Lauf
Die Grenze für den tiefsten Recherchemodus. Der Kommentar im Code hält fest, dass sie erst nach einer neuen Laufzeitmessung steigen darf, was aus der Grenze eine Entscheidung mit Überprüfungsregel macht.

So wurde es gemacht

Ein Agent, Werkzeuge auf Abruf

Fünf Spezialagenten wurden durch einen Dirigenten mit einem kleinen festen Werkzeugsatz ersetzt. Den Rest des Katalogs erreicht er über eine Suche, die ein Werkzeug erst lädt, wenn es gebraucht wird. So bleibt jeder Aufruf klein, auch wenn der Katalog wächst.

Drei Modellstufen mit klaren Grenzen

Haiku 4.5 sortiert und beantwortet das Einfache, Sonnet 4.6 übernimmt die Argumentation und schreibt die Unterlagen, Opus 4.6 bleibt für das Schwerste in Reserve. Jeder Aufruf geht an die günstigste Stufe, die die Aufgabe löst, und eine 429-Antwort wird gemäß dem Retry-after-Header erneut versucht.

Budgets, die Code sind

Jeder Rechercheauftrag bekommt eine Schrittgrenze nach Tiefe — vier, sechs oder zwanzig Schritte — bemessen daran, dass ein Werkzeugaufruf rund fünf Sekunden dauert. Die Grenze liegt in einer Funktion mit eigenen Tests, und der Kommentar darüber hält fest, dass zwanzig erst nach einer neuen Laufzeitmessung steigen darf.

Auswertung bei jeder Änderung

Ein aufgezeichneter Lauf wird als Artefakt abgelegt und offline erneut abgespielt. Das gibt der CI eine deterministische Schranke, die weder Schlüssel noch Datenbank braucht. Darüber liegen ein nächtlich bewerteter Lauf und Stichproben zu Relevanz, Halluzination und Ton.

Technik

  • Next.js 16
  • Mastra
  • Claude Haiku 4.5
  • Claude Sonnet 4.6
  • Supabase
  • Postgres
  • pgvector
  • Vitest

Was dieser Beleg trägt

Das zeigt, dass eine Agentenplattform so gebaut werden kann, dass sie im Betrieb trägt und messbar bleibt. Über den Marktwert von voxcog sagt es nichts: die Plattform wurde vor dem Start übergeben und hatte zur Übergabe keine zahlenden Nutzer.

Belege

Worauf dieser Artikel beruht — eine Messung von uns, eine datierte Quelle oder eine Entscheidung und ihr Preis.

  • Messung

    Wie viele Werkzeuge der Agent erreichen kann

    Messobjekt: voxcogs Werkzeugregister

    Methode: Die Schlüssel in dem Modul zählen, das die Werkzeuge des Agenten registriert.

    Ergebnis: 55 Werkzeuge

  • Entscheidung

    Fünf Spezialagenten durch einen Dirigenten ersetzen, der Werkzeuge bei Bedarf nachlädt.

    Was sie gekostet hat: Die Delegation zwischen Agenten lässt sich nicht mehr als eigenes Verhalten testen, und parallele Recherche wartet, bis die Topologie wieder geöffnet wird.

  • Entscheidung

    Die Telemetrie speichert Messwerte und keinen Text — weder Prompt noch Antwort noch Werkzeugargumente.

    Was sie gekostet hat: Eine schlechte Antwort zu untersuchen verlangt, sie erneut zu erzeugen, weil der Text fehlt.

Häufige Fragen

Warum trägt ein einziger Agent den gesamten Werkzeugkatalog?
Fünf Agenten bedeuteten, dass eine Argumentation bei jeder Übergabe zu Prosa verdichtet wurde, und diese Verdichtung kostete mehr Qualität, als die Spezialisierung zurückgab. Ein Dirigent mit abrufbaren Werkzeugen hält den ganzen Zusammenhang an einer Stelle.
Wie verhindern Sie, dass ein Agentenlauf ausufert?
Jeder Modus trägt eine Schrittgrenze im Code, bemessen an der tatsächlichen Dauer eines Werkzeugaufrufs. Der letzte Schritt erzwingt eine Antwort, indem die Werkzeugwahl abgeschaltet wird, sodass ein Lauf auch bei erschöpftem Budget mit einer Antwort endet.
Woher wissen Sie, dass die Antwortqualität über die Zeit hält?
Ein aufgezeichneter Lauf wird als Artefakt abgelegt und in der CI abgespielt. Das ergibt eine Schranke, die deterministisch ist und mit aufgezeichnetem Material auskommt. Darüber liegen ein nächtlich bewerteter Lauf und Stichproben zu Relevanz und Halluzination.
Was kostet der Betrieb einer solchen Plattform?
Die Kosten hängen davon ab, welches Modell welchen Aufruf beantwortet, und deshalb liegt das Routing im Code: einfaches Sortieren läuft auf dem günstigsten Modell, und nur die schwere Argumentation erreicht das teure. Eine ganze Spur zu verschieben ist eine Zeilenänderung.
Lässt sich derselbe Aufbau auf unsere internen Systeme anwenden?
Ja, das Muster ist vom Produkt unabhängig. Ein Dirigent, ein Werkzeugkatalog auf Abruf, Budgets im Code und eine Auswertung in der CI sind dieselben vier Teile, ob die Werkzeuge Ihre Datenbank oder Ihr Ticketsystem lesen.
Wie lange hat die Agentenplattform gedauert?
Der Umbau wurde im April 2026 geplant und die Auswertungsschranke im Mai, und beide liefen vor der Übergabe im August im Betrieb. Die Arbeit lief parallel zum Rest der Plattform und wurde von einer Person gemacht.

Erzählen Sie uns, was Sie bauen wollen

Dreißig Minuten, kostenlos, und eine klare Antwort, ob wir das richtige Studio dafür sind.