voxcog: AI-agenter der holder i produktion
Studiets forhold til kunden
voxcog er et produkt, Torn Studio har bygget og ejer en andel af. Studiet stod for produktledelse, arkitektur og udvikling frem til overdragelsen i august 2026.
Kort svar
Torn Studio byggede voxcogs agentplatform: 55 værktøjer bag én agent, der henter dem efter behov, tre modelniveauer hvor hvert kald går til det billigste, der kan løse opgaven, og en evaluering, der kører i CI ved hver ændring. Platformen blev overdraget i august 2026.
Opgaven
voxcog havde brug for en agent, der kunne nå hele produktet i én samtale — dokumenter, signaler, opgaver, kalender, research og færdige produktoplæg — og som kunne køre i produktion for flere kunder ad gangen.
Det der gjorde det svært
- En tidligere version lagde omkring fyrre værktøjer og en lang systemprompt i hvert kald, hvilket ramte Anthropics loft på 50.000 tokens i minuttet og låste chatten for alle kunder på samme tid.
- Kørslen sker på en serverløs platform med 270 sekunders vægur for hele turen, så hver agentkørsel skal blive færdig inden for den tid.
- Svarene skal kunne stoles på bagefter, hvilket kræver, at kvaliteten måles løbende, og at målingen kører i CI mod indspillede kørsler.
Tal der kan tælles efter
- 55værktøjer bag én agent
- Registreret i ét modul og tællelige der. Agenten bærer et lille fast sæt i prompten og henter resten, når en samtale kræver det.
- 3modelniveauer
- Haiku 4.5, Sonnet 4.6 og Opus 4.6, erklæret i en fil på tolv linjer. At flytte en hel bane mellem niveauer er en linjeændring.
- 50.000tokens i minuttet, loftet
- Grænsen som den tidligere topologi blev ved med at ramme. Den nye bærer samme katalog under samme loft ved at holde prompten lille.
- 20trin højst pr. kørsel
- Loftet for den dybeste researchtilstand. Kommentaren i koden siger, at det ikke må hæves, før væguret er målt igen, hvilket gør loftet til en beslutning med en revisionsregel.
Sådan blev det gjort
Én agent, værktøjer der hentes efter behov
Fem specialistagenter blev erstattet af én dirigent med et lille fast værktøjssæt. Resten af kataloget når den gennem en søgning, der indlæser et værktøj først, når det er nødvendigt, hvilket holder hvert kald lille, selv når kataloget vokser.
Tre modelniveauer med tydelige grænser
Haiku 4.5 sorterer og svarer på det enkle, Sonnet 4.6 laver ræsonnementet og skriver oplæggene, Opus 4.6 ligger i reserve til det tungeste. Hvert kald går til det billigste niveau, der kan løse opgaven, og et 429-svar prøves igen efter serverens eget retry-after.
Budgetter der er kode
Hver researchopgave får et trinloft sat efter dybde — fire, seks eller tyve trin — dimensioneret efter at et værktøjskald tager omkring fem sekunder. Loftet ligger i én funktion med egne tests, og kommentaren over det siger, at tyve ikke må hæves, før væguret er målt igen.
Evaluering der kører hver gang
En indspillet kørsel gemmes som artefakt og afspilles igen offline, hvilket giver CI en deterministisk port, der hverken behøver nøgler eller database. En natlig bedømt kørsel og løbende stikprøver på relevans, hallucination og tone ligger oven på den.
Teknologi
- Next.js 16
- Mastra
- Claude Haiku 4.5
- Claude Sonnet 4.6
- Supabase
- Postgres
- pgvector
- Vitest
Hvad beviset rækker til
Det her viser, at en agentplatform kan bygges, så den holder i drift og lader sig måle. Det siger intet om, hvad voxcog er værd på et marked: platformen blev overdraget før lancering og havde ingen betalende brugere ved overdragelsen.
Grundlag
Hvad denne artikel hviler på — en måling vi lavede, en dateret kilde eller en beslutning vi traf og hvad den kostede.
- Måling
Hvor mange værktøjer agenten kan nå
Måleobjekt: voxcogs værktøjsregister
Metode: Tæl nøglerne i det modul, der registrerer agentens værktøjer.
Resultat: 55 værktøjer
- Beslutning
Erstat fem specialistagenter med én dirigent, der henter værktøjer efter behov.
Hvad det kostede: Delegering mellem agenter kan ikke længere testes som selvstændig adfærd, og parallel research venter, til topologien åbnes igen.
- Beslutning
Telemetrien gemmer måletal og ingen tekst — hverken prompt, svar eller værktøjsargumenter.
Hvad det kostede: At fejlfinde et dårligt svar kræver, at det genskabes, fordi teksten er væk.
Ofte stillede spørgsmål
- Hvorfor bærer én agent hele værktøjskataloget?
- Fem agenter betød, at et ræsonnement blev komprimeret til prosa, hver gang arbejdet blev sendt videre, og den komprimering kostede mere i kvalitet, end specialiseringen gav tilbage. Én dirigent med hentbare værktøjer holder hele sammenhængen ét sted.
- Hvordan forhindrer I, at en agentkørsel løber løbsk?
- Hver tilstand har et trinloft i kode, sat ud fra hvor lang tid et værktøjskald faktisk tager. Sidste trin fremtvinger et svar ved at slå værktøjsvalget fra, så en kørsel slutter med et svar, selv når budgettet er brugt.
- Hvordan ved I, at svarkvaliteten holder over tid?
- En indspillet kørsel gemmes som artefakt og afspilles i CI, hvilket giver en port, der er deterministisk og klarer sig på indspillet materiale. En natlig bedømt kørsel og stikprøver på relevans og hallucination ligger ovenpå.
- Hvad koster sådan en platform at drive?
- Omkostningen styres af, hvilken model der svarer på hvert kald, og derfor ligger routingen i kode: simpel sortering kører på den billigste model, og kun det tunge ræsonnement når den dyre. At flytte en hel bane mellem niveauer er en linjeændring.
- Kan samme opsætning bruges på vores interne systemer?
- Ja, mønsteret er uafhængigt af produktet. Én dirigent, et værktøjskatalog der hentes efter behov, budgetter i kode og en evaluering i CI er de samme fire dele, uanset om værktøjerne læser jeres database eller jeres sagssystem.
- Hvor lang tid tog agentplatformen?
- Ombygningen blev planlagt i april 2026 og evalueringsporten i maj, og begge lå i produktion før overdragelsen i august. Arbejdet kørte sideløbende med resten af platformen og blev udført af én person.
Fortæl os, hvad du vil bygge
Tredive minutter, helt gratis, og en klar melding om, hvorvidt vi er det rette studio til opgaven.