Spring til indhold

Arbejde

voxcog: AI-agenter der holder i produktion

Torn StudioKunde: voxcog

Studiets forhold til kunden

voxcog er et produkt, Torn Studio har bygget og ejer en andel af. Studiet stod for produktledelse, arkitektur og udvikling frem til overdragelsen i august 2026.

Kort svar

Torn Studio byggede voxcogs agentplatform: 55 værktøjer bag én agent, der henter dem efter behov, tre modelniveauer hvor hvert kald går til det billigste, der kan løse opgaven, og en evaluering, der kører i CI ved hver ændring. Platformen blev overdraget i august 2026.

Opgaven

voxcog havde brug for en agent, der kunne nå hele produktet i én samtale — dokumenter, signaler, opgaver, kalender, research og færdige produktoplæg — og som kunne køre i produktion for flere kunder ad gangen.

Det der gjorde det svært

  • En tidligere version lagde omkring fyrre værktøjer og en lang systemprompt i hvert kald, hvilket ramte Anthropics loft på 50.000 tokens i minuttet og låste chatten for alle kunder på samme tid.
  • Kørslen sker på en serverløs platform med 270 sekunders vægur for hele turen, så hver agentkørsel skal blive færdig inden for den tid.
  • Svarene skal kunne stoles på bagefter, hvilket kræver, at kvaliteten måles løbende, og at målingen kører i CI mod indspillede kørsler.

Tal der kan tælles efter

55værktøjer bag én agent
Registreret i ét modul og tællelige der. Agenten bærer et lille fast sæt i prompten og henter resten, når en samtale kræver det.
3modelniveauer
Haiku 4.5, Sonnet 4.6 og Opus 4.6, erklæret i en fil på tolv linjer. At flytte en hel bane mellem niveauer er en linjeændring.
50.000tokens i minuttet, loftet
Grænsen som den tidligere topologi blev ved med at ramme. Den nye bærer samme katalog under samme loft ved at holde prompten lille.
20trin højst pr. kørsel
Loftet for den dybeste researchtilstand. Kommentaren i koden siger, at det ikke må hæves, før væguret er målt igen, hvilket gør loftet til en beslutning med en revisionsregel.

Sådan blev det gjort

Én agent, værktøjer der hentes efter behov

Fem specialistagenter blev erstattet af én dirigent med et lille fast værktøjssæt. Resten af kataloget når den gennem en søgning, der indlæser et værktøj først, når det er nødvendigt, hvilket holder hvert kald lille, selv når kataloget vokser.

Tre modelniveauer med tydelige grænser

Haiku 4.5 sorterer og svarer på det enkle, Sonnet 4.6 laver ræsonnementet og skriver oplæggene, Opus 4.6 ligger i reserve til det tungeste. Hvert kald går til det billigste niveau, der kan løse opgaven, og et 429-svar prøves igen efter serverens eget retry-after.

Budgetter der er kode

Hver researchopgave får et trinloft sat efter dybde — fire, seks eller tyve trin — dimensioneret efter at et værktøjskald tager omkring fem sekunder. Loftet ligger i én funktion med egne tests, og kommentaren over det siger, at tyve ikke må hæves, før væguret er målt igen.

Evaluering der kører hver gang

En indspillet kørsel gemmes som artefakt og afspilles igen offline, hvilket giver CI en deterministisk port, der hverken behøver nøgler eller database. En natlig bedømt kørsel og løbende stikprøver på relevans, hallucination og tone ligger oven på den.

Teknologi

  • Next.js 16
  • Mastra
  • Claude Haiku 4.5
  • Claude Sonnet 4.6
  • Supabase
  • Postgres
  • pgvector
  • Vitest

Hvad beviset rækker til

Det her viser, at en agentplatform kan bygges, så den holder i drift og lader sig måle. Det siger intet om, hvad voxcog er værd på et marked: platformen blev overdraget før lancering og havde ingen betalende brugere ved overdragelsen.

Grundlag

Hvad denne artikel hviler på — en måling vi lavede, en dateret kilde eller en beslutning vi traf og hvad den kostede.

  • Måling

    Hvor mange værktøjer agenten kan nå

    Måleobjekt: voxcogs værktøjsregister

    Metode: Tæl nøglerne i det modul, der registrerer agentens værktøjer.

    Resultat: 55 værktøjer

  • Beslutning

    Erstat fem specialistagenter med én dirigent, der henter værktøjer efter behov.

    Hvad det kostede: Delegering mellem agenter kan ikke længere testes som selvstændig adfærd, og parallel research venter, til topologien åbnes igen.

  • Beslutning

    Telemetrien gemmer måletal og ingen tekst — hverken prompt, svar eller værktøjsargumenter.

    Hvad det kostede: At fejlfinde et dårligt svar kræver, at det genskabes, fordi teksten er væk.

Ofte stillede spørgsmål

Hvorfor bærer én agent hele værktøjskataloget?
Fem agenter betød, at et ræsonnement blev komprimeret til prosa, hver gang arbejdet blev sendt videre, og den komprimering kostede mere i kvalitet, end specialiseringen gav tilbage. Én dirigent med hentbare værktøjer holder hele sammenhængen ét sted.
Hvordan forhindrer I, at en agentkørsel løber løbsk?
Hver tilstand har et trinloft i kode, sat ud fra hvor lang tid et værktøjskald faktisk tager. Sidste trin fremtvinger et svar ved at slå værktøjsvalget fra, så en kørsel slutter med et svar, selv når budgettet er brugt.
Hvordan ved I, at svarkvaliteten holder over tid?
En indspillet kørsel gemmes som artefakt og afspilles i CI, hvilket giver en port, der er deterministisk og klarer sig på indspillet materiale. En natlig bedømt kørsel og stikprøver på relevans og hallucination ligger ovenpå.
Hvad koster sådan en platform at drive?
Omkostningen styres af, hvilken model der svarer på hvert kald, og derfor ligger routingen i kode: simpel sortering kører på den billigste model, og kun det tunge ræsonnement når den dyre. At flytte en hel bane mellem niveauer er en linjeændring.
Kan samme opsætning bruges på vores interne systemer?
Ja, mønsteret er uafhængigt af produktet. Én dirigent, et værktøjskatalog der hentes efter behov, budgetter i kode og en evaluering i CI er de samme fire dele, uanset om værktøjerne læser jeres database eller jeres sagssystem.
Hvor lang tid tog agentplatformen?
Ombygningen blev planlagt i april 2026 og evalueringsporten i maj, og begge lå i produktion før overdragelsen i august. Arbejdet kørte sideløbende med resten af platformen og blev udført af én person.

Fortæl os, hvad du vil bygge

Tredive minutter, helt gratis, og en klar melding om, hvorvidt vi er det rette studio til opgaven.