Hoppa till innehåll

Arbete

voxcog: AI-agenter som håller i produktion

Torn StudioKund: voxcog

Studions relation till kunden

voxcog är en produkt Torn Studio har byggt och äger en del av. Studion stod för produktledning, arkitektur och bygge fram till överlämningen i augusti 2026.

Kort svar

Torn Studio byggde voxcogs agentplattform: 55 verktyg bakom en agent som hämtar dem vid behov, tre modellnivåer där varje anrop går till den billigaste som klarar uppgiften, och en utvärdering som körs i CI vid varje ändring. Plattformen lämnades över i augusti 2026.

Uppdraget

voxcog behövde en agent som kunde nå hela produktens funktionalitet i ett samtal — dokument, signaler, uppgifter, kalender, research och färdiga PM-underlag — och som gick att köra i produktion för flera kunder samtidigt.

Det som gjorde det svårt

  • Ett tidigare bygge lade omkring fyrtio verktyg och en lång systemprompt i varje anrop, vilket slog i Anthropics tak på 50 000 tokens per minut och låste chatten för alla kunder samtidigt.
  • Körningen sker på en serverlös plattform med 270 sekunders väggklocka för hela turen, så varje agentkörning måste bli klar innan den tiden är slut.
  • Svaren måste gå att lita på i efterhand, vilket kräver att kvalitet mäts löpande och att den mätningen går att köra i CI mot inspelade körningar.

Siffror som går att räkna efter

55verktyg bakom en agent
Registrerade i en modul och räknebara där. Agenten bär en liten fast uppsättning i prompten och hämtar resten när ett samtal kräver det.
3modellnivåer
Haiku 4.5, Sonnet 4.6 och Opus 4.6, deklarerade i en fil på tolv rader. Att byta nivå för en hel lane är en radändring.
50 000tokens per minut, taket
Gränsen den tidigare topologin slog i. Den nya bär samma katalog under samma tak genom att hålla prompten liten.
20steg som mest per körning
Taket för det djupaste researchläget. Kommentaren i koden säger att det inte får höjas förrän väggklockan är uppmätt på nytt, vilket gör taket till ett beslut med en översynsregel.

Så gjordes det

En agent, verktyg som hämtas vid behov

Fem specialistagenter ersattes av en dirigent med en liten fast verktygsuppsättning. Resten av katalogen når den genom en sökning som laddar in ett verktyg först när det behövs, vilket håller varje anrops prompt liten även när katalogen växer.

Tre modellnivåer med tydliga gränser

Haiku 4.5 sorterar och svarar på det enkla, Sonnet 4.6 gör resonemanget och skriver underlagen, Opus 4.6 ligger i reserv för det tyngsta. Varje anrop går till den billigaste nivån som klarar uppgiften, och 429-svar återförsöks enligt serverns egen retry-after.

Budgetar som är kod

Varje researchuppdrag får ett stegtak satt efter djup — fyra, sex eller tjugo steg — dimensionerat efter att ett verktygsanrop tar omkring fem sekunder. Taket ligger i en funktion med egna tester, och kommentaren över det säger att tjugo inte får höjas förrän väggklockan är mätt om.

Utvärdering som körs varje gång

En inspelad körning sparas som artefakt och spelas upp igen offline, vilket ger en deterministisk grind i CI som varken behöver nycklar eller databas. Ovanpå den ligger en nattlig bedömd körning och löpande stickprov på relevans, hallucination och ton.

Teknik

  • Next.js 16
  • Mastra
  • Claude Haiku 4.5
  • Claude Sonnet 4.6
  • Supabase
  • Postgres
  • pgvector
  • Vitest

Vad beviset räcker till

Det här visar att en agentplattform går att bygga så att den håller under drift och går att mäta. Det visar ingenting om vad voxcog är värt på en marknad: plattformen lämnades över före lansering och hade inga betalande användare vid överlämningen.

Underlag

Vad den här artikeln vilar på — en mätning vi gjort, en daterad källa eller ett beslut vi tagit och vad det kostade.

  • Mätning

    Hur många verktyg agenten kan nå

    Mätobjekt: voxcogs verktygsregister

    Metod: Räkna nycklarna i modulen som registrerar verktygen för agenten.

    Resultat: 55 verktyg

  • Beslut

    Ersätt fem specialistagenter med en dirigent som hämtar verktyg vid behov.

    Vad det kostade: Delegering mellan agenter går inte längre att testa som eget beteende, och parallell research får vänta tills topologin öppnas igen.

  • Beslut

    Telemetrin sparar mätvärden och inga texter — varken prompt, svar eller verktygsargument.

    Vad det kostade: Att felsöka ett dåligt svar kräver att det återskapas, eftersom texten är borta.

Vanliga frågor

Varför bär en enda agent hela verktygskatalogen?
Fem agenter innebar att ett resonemang komprimerades till prosa varje gång arbetet lämnades vidare, och den komprimeringen kostade mer i kvalitet än specialiseringen gav tillbaka. En dirigent med hämtbara verktyg håller hela sammanhanget på ett ställe.
Hur hindrar ni att en agentkörning skenar?
Varje läge har ett stegtak i kod, satt efter hur lång tid ett verktygsanrop faktiskt tar. Sista steget tvingar fram ett svar genom att stänga av verktygsvalet, så en körning avslutas med ett svar även när budgeten är slut.
Hur vet ni att svaren håller kvalitet över tid?
En inspelad körning sparas som artefakt och spelas upp i CI, vilket ger en grind som är deterministisk och klarar sig på inspelat material. En nattlig bedömd körning och löpande stickprov på relevans och hallucination ligger ovanpå.
Vad kostar en sådan här plattform att driva?
Kostnaden styrs av modellvalet per anrop, och därför ligger routningen i kod: enkel sortering går på den billigaste modellen och bara det tunga resonemanget går till den dyra. Att flytta en hel lane mellan nivåer är en radändring.
Kan samma upplägg användas på våra interna system?
Ja, mönstret är oberoende av produkten. En dirigent, en verktygskatalog som hämtas vid behov, budgetar i kod och en utvärdering i CI är samma fyra delar oavsett om verktygen läser er databas eller ert ärendesystem.
Hur lång tid tog agentplattformen?
Ombyggnaden planerades i april 2026 och utvärderingsgrinden i maj, och båda låg i produktion före överlämningen i augusti. Arbetet gjordes parallellt med resten av plattformen av en person.

Berätta vad du vill bygga

Trettio minuter, kostnadsfritt, och ett rakt besked om vi är rätt studio för uppdraget.