---
title: "voxcog: AI-agenter der holder i produktion"
description: "Sådan blev voxcogs agentplatform bygget om omkring én agent med 55 værktøjer, tre modelniveauer og en evaluering, der kører i CI. Leveret august 2026."
url: https://torn.studio/da/arbejde/voxcog-ai-agenter-i-produktion
locale: da
published: 2026-08-31
updated: 2026-08-26
---

# voxcog: AI-agenter der holder i produktion

> **Kort svar:** Torn Studio byggede voxcogs agentplatform: 55 værktøjer bag én agent, der henter dem efter behov, tre modelniveauer hvor hvert kald går til det billigste, der kan løse opgaven, og en evaluering, der kører i CI ved hver ændring. Platformen blev overdraget i august 2026.

**Kunde:** voxcog · **Leveret:** 2026-08-26

**Studiets forhold til kunden:** voxcog er et produkt, Torn Studio har bygget og ejer en andel af. Studiet stod for produktledelse, arkitektur og udvikling frem til overdragelsen i august 2026.

## Opgaven

voxcog havde brug for en agent, der kunne nå hele produktet i én samtale — dokumenter, signaler, opgaver, kalender, research og færdige produktoplæg — og som kunne køre i produktion for flere kunder ad gangen.

## Det der gjorde det svært

- En tidligere version lagde omkring fyrre værktøjer og en lang systemprompt i hvert kald, hvilket ramte Anthropics loft på 50.000 tokens i minuttet og låste chatten for alle kunder på samme tid.
- Kørslen sker på en serverløs platform med 270 sekunders vægur for hele turen, så hver agentkørsel skal blive færdig inden for den tid.
- Svarene skal kunne stoles på bagefter, hvilket kræver, at kvaliteten måles løbende, og at målingen kører i CI mod indspillede kørsler.

## Tal der kan tælles efter

| Tal der kan tælles efter | | |
| --- | --- | --- |
| 55 | værktøjer bag én agent | Registreret i ét modul og tællelige der. Agenten bærer et lille fast sæt i prompten og henter resten, når en samtale kræver det. |
| 3 | modelniveauer | Haiku 4.5, Sonnet 4.6 og Opus 4.6, erklæret i en fil på tolv linjer. At flytte en hel bane mellem niveauer er en linjeændring. |
| 50.000 | tokens i minuttet, loftet | Grænsen som den tidligere topologi blev ved med at ramme. Den nye bærer samme katalog under samme loft ved at holde prompten lille. |
| 20 | trin højst pr. kørsel | Loftet for den dybeste researchtilstand. Kommentaren i koden siger, at det ikke må hæves, før væguret er målt igen, hvilket gør loftet til en beslutning med en revisionsregel. |

## Sådan blev det gjort

### Én agent, værktøjer der hentes efter behov

Fem specialistagenter blev erstattet af én dirigent med et lille fast værktøjssæt. Resten af kataloget når den gennem en søgning, der indlæser et værktøj først, når det er nødvendigt, hvilket holder hvert kald lille, selv når kataloget vokser.

### Tre modelniveauer med tydelige grænser

Haiku 4.5 sorterer og svarer på det enkle, Sonnet 4.6 laver ræsonnementet og skriver oplæggene, Opus 4.6 ligger i reserve til det tungeste. Hvert kald går til det billigste niveau, der kan løse opgaven, og et 429-svar prøves igen efter serverens eget retry-after.

### Budgetter der er kode

Hver researchopgave får et trinloft sat efter dybde — fire, seks eller tyve trin — dimensioneret efter at et værktøjskald tager omkring fem sekunder. Loftet ligger i én funktion med egne tests, og kommentaren over det siger, at tyve ikke må hæves, før væguret er målt igen.

### Evaluering der kører hver gang

En indspillet kørsel gemmes som artefakt og afspilles igen offline, hvilket giver CI en deterministisk port, der hverken behøver nøgler eller database. En natlig bedømt kørsel og løbende stikprøver på relevans, hallucination og tone ligger oven på den.

**Teknologi:** Next.js 16, Mastra, Claude Haiku 4.5, Claude Sonnet 4.6, Supabase, Postgres, pgvector, Vitest

## Hvad beviset rækker til

Det her viser, at en agentplatform kan bygges, så den holder i drift og lader sig måle. Det siger intet om, hvad voxcog er værd på et marked: platformen blev overdraget før lancering og havde ingen betalende brugere ved overdragelsen.

## Ofte stillede spørgsmål

### Hvorfor bærer én agent hele værktøjskataloget?

Fem agenter betød, at et ræsonnement blev komprimeret til prosa, hver gang arbejdet blev sendt videre, og den komprimering kostede mere i kvalitet, end specialiseringen gav tilbage. Én dirigent med hentbare værktøjer holder hele sammenhængen ét sted.

### Hvordan forhindrer I, at en agentkørsel løber løbsk?

Hver tilstand har et trinloft i kode, sat ud fra hvor lang tid et værktøjskald faktisk tager. Sidste trin fremtvinger et svar ved at slå værktøjsvalget fra, så en kørsel slutter med et svar, selv når budgettet er brugt.

### Hvordan ved I, at svarkvaliteten holder over tid?

En indspillet kørsel gemmes som artefakt og afspilles i CI, hvilket giver en port, der er deterministisk og klarer sig på indspillet materiale. En natlig bedømt kørsel og stikprøver på relevans og hallucination ligger ovenpå.

### Hvad koster sådan en platform at drive?

Omkostningen styres af, hvilken model der svarer på hvert kald, og derfor ligger routingen i kode: simpel sortering kører på den billigste model, og kun det tunge ræsonnement når den dyre. At flytte en hel bane mellem niveauer er en linjeændring.

### Kan samme opsætning bruges på vores interne systemer?

Ja, mønsteret er uafhængigt af produktet. Én dirigent, et værktøjskatalog der hentes efter behov, budgetter i kode og en evaluering i CI er de samme fire dele, uanset om værktøjerne læser jeres database eller jeres sagssystem.

### Hvor lang tid tog agentplatformen?

Ombygningen blev planlagt i april 2026 og evalueringsporten i maj, og begge lå i produktion før overdragelsen i august. Arbejdet kørte sideløbende med resten af platformen og blev udført af én person.
