Hopp til innhold

Arbeid

voxcog: AI-agenter som holder i produksjon

Torn StudioKunde: voxcog

Studioets forhold til kunden

voxcog er et produkt Torn Studio har bygget og eier en andel av. Studioet hadde ansvaret for produktledelse, arkitektur og bygging fram til overleveringen i august 2026.

Kort svar

Torn Studio bygget voxcogs agentplattform: 55 verktøy bak én agent som henter dem ved behov, tre modellnivåer der hvert kall går til det billigste som klarer oppgaven, og en evaluering som kjører i CI ved hver endring. Plattformen ble overlevert i august 2026.

Oppdraget

voxcog trengte en agent som kunne nå hele produktet i én samtale — dokumenter, signaler, oppgaver, kalender, research og ferdige produktunderlag — og som kunne kjøre i produksjon for flere kunder samtidig.

Det som gjorde det vanskelig

  • En tidligere versjon la rundt førti verktøy og en lang systemledetekst i hvert kall, noe som traff Anthropics tak på 50 000 tokens per minutt og låste chatten for alle kundene samtidig.
  • Kjøringen skjer på en serverløs plattform med 270 sekunders veggklokke for hele turen, så hver agentkjøring må bli ferdig innenfor den tiden.
  • Svarene må være til å stole på i ettertid, noe som krever at kvaliteten måles løpende og at målingen kjører i CI mot innspilte kjøringer.

Tall som lar seg telle

55verktøy bak én agent
Registrert i én modul og tellbare der. Agenten bærer et lite fast sett i ledeteksten og henter resten når en samtale krever det.
3modellnivåer
Haiku 4.5, Sonnet 4.6 og Opus 4.6, deklarert i en fil på tolv linjer. Å flytte en hel bane mellom nivåer er en linjeendring.
50 000tokens per minutt, taket
Grensen den forrige topologien stadig traff. Den nye bærer samme katalog under samme tak ved å holde ledeteksten liten.
20steg på det meste per kjøring
Grensen for den dypeste researchmodusen. Kommentaren i koden sier at den ikke skal heves før veggklokken er målt på nytt, noe som gjør grensen til et beslutning med en revisjonsregel.

Slik ble det gjort

Én agent, verktøy som hentes ved behov

Fem spesialistagenter ble erstattet av én dirigent med et lite fast verktøysett. Resten av katalogen når den gjennom et søk som laster inn et verktøy først når det trengs, noe som holder hvert kall lite selv når katalogen vokser.

Tre modellnivåer med tydelige grenser

Haiku 4.5 sorterer og svarer på det enkle, Sonnet 4.6 gjør resonnementet og skriver underlagene, Opus 4.6 ligger i reserve for det tyngste. Hvert kall går til det billigste nivået som klarer oppgaven, og et 429-svar prøves på nytt etter serverens egen retry-after.

Budsjetter som er kode

Hvert researchoppdrag får en steggrense satt etter dybde — fire, seks eller tjue steg — dimensjonert etter at et verktøykall tar rundt fem sekunder. Grensen ligger i én funksjon med egne tester, og kommentaren over den sier at tjue ikke skal heves før veggklokken er målt på nytt.

Evaluering som kjører hver gang

En innspilt kjøring lagres som artefakt og spilles av igjen offline, noe som gir CI en deterministisk port som verken trenger nøkler eller database. En nattlig vurdert kjøring og løpende stikkprøver på relevans, hallusinasjon og tone ligger over den.

Teknologi

  • Next.js 16
  • Mastra
  • Claude Haiku 4.5
  • Claude Sonnet 4.6
  • Supabase
  • Postgres
  • pgvector
  • Vitest

Hva beviset rekker til

Dette viser at en agentplattform kan bygges slik at den holder under drift og lar seg måle. Det sier ingenting om hva voxcog er verdt i et marked: plattformen ble overlevert før lansering og hadde ingen betalende brukere ved overleveringen.

Grunnlag

Hva denne artikkelen hviler på — en måling vi gjorde, en datert kilde eller en beslutning vi tok og hva den kostet.

  • Måling

    Hvor mange verktøy agenten kan nå

    Måleobjekt: voxcogs verktøyregister

    Metode: Tell nøklene i modulen som registrerer verktøyene for agenten.

    Resultat: 55 verktøy

  • Beslutning

    Erstatt fem spesialistagenter med én dirigent som henter verktøy ved behov.

    Hva det kostet: Delegering mellom agenter lar seg ikke lenger teste som egen atferd, og parallell research venter til topologien åpnes igjen.

  • Beslutning

    Telemetrien lagrer måleverdier og ingen tekst — verken ledetekst, svar eller verktøyargumenter.

    Hva det kostet: Å feilsøke et dårlig svar krever at det gjenskapes, siden teksten er borte.

Vanlige spørsmål

Hvorfor bærer én agent hele verktøykatalogen?
Fem agenter betydde at et resonnement ble komprimert til prosa hver gang arbeidet ble sendt videre, og den komprimeringen kostet mer i kvalitet enn spesialiseringen ga tilbake. Én dirigent med hentbare verktøy holder hele sammenhengen ett sted.
Hvordan hindrer dere at en agentkjøring løper løpsk?
Hver modus har en steggrense i kode, satt ut fra hvor lang tid et verktøykall faktisk tar. Siste steg tvinger fram et svar ved å slå av verktøyvalget, så en kjøring avsluttes med et svar selv når budsjettet er brukt opp.
Hvordan vet dere at svarkvaliteten holder over tid?
En innspilt kjøring lagres som artefakt og spilles av i CI, noe som gir en port som er deterministisk og klarer seg på innspilt materiale. En nattlig vurdert kjøring og stikkprøver på relevans og hallusinasjon ligger over.
Hva koster en slik plattform å drifte?
Kostnaden styres av hvilken modell som svarer på hvert kall, og derfor ligger rutingen i kode: enkel sortering går på den billigste modellen og bare det tunge resonnementet når den dyre. Å flytte en hel bane mellom nivåer er en linjeendring.
Kan samme oppsett brukes på våre interne systemer?
Ja, mønsteret er uavhengig av produktet. Én dirigent, en verktøykatalog som hentes ved behov, budsjetter i kode og en evaluering i CI er de samme fire delene enten verktøyene leser databasen deres eller saksbehandlingssystemet.
Hvor lang tid tok agentplattformen?
Ombyggingen ble planlagt i april 2026 og evalueringsporten i mai, og begge lå i produksjon før overleveringen i august. Arbeidet gikk parallelt med resten av plattformen og ble gjort av én person.

Fortell hva du vil bygge

Tretti minutter, kostnadsfritt, og et ærlig svar på om vi er riktig studio for oppdraget.