---
title: "voxcog: AI-agenter som håller i produktion"
description: "Hur voxcogs agentplattform byggdes om till en agent med 55 verktyg, tre modellnivåer och en utvärdering som körs i CI. Levererad augusti 2026."
url: https://torn.studio/sv/arbete/voxcog-ai-agenter-i-produktion
locale: sv
published: 2026-08-31
updated: 2026-08-26
---

# voxcog: AI-agenter som håller i produktion

> **Kort svar:** Torn Studio byggde voxcogs agentplattform: 55 verktyg bakom en agent som hämtar dem vid behov, tre modellnivåer där varje anrop går till den billigaste som klarar uppgiften, och en utvärdering som körs i CI vid varje ändring. Plattformen lämnades över i augusti 2026.

**Kund:** voxcog · **Levererat:** 2026-08-26

**Studions relation till kunden:** voxcog är en produkt Torn Studio har byggt och äger en del av. Studion stod för produktledning, arkitektur och bygge fram till överlämningen i augusti 2026.

## Uppdraget

voxcog behövde en agent som kunde nå hela produktens funktionalitet i ett samtal — dokument, signaler, uppgifter, kalender, research och färdiga PM-underlag — och som gick att köra i produktion för flera kunder samtidigt.

## Det som gjorde det svårt

- Ett tidigare bygge lade omkring fyrtio verktyg och en lång systemprompt i varje anrop, vilket slog i Anthropics tak på 50 000 tokens per minut och låste chatten för alla kunder samtidigt.
- Körningen sker på en serverlös plattform med 270 sekunders väggklocka för hela turen, så varje agentkörning måste bli klar innan den tiden är slut.
- Svaren måste gå att lita på i efterhand, vilket kräver att kvalitet mäts löpande och att den mätningen går att köra i CI mot inspelade körningar.

## Siffror som går att räkna efter

| Siffror som går att räkna efter | | |
| --- | --- | --- |
| 55 | verktyg bakom en agent | Registrerade i en modul och räknebara där. Agenten bär en liten fast uppsättning i prompten och hämtar resten när ett samtal kräver det. |
| 3 | modellnivåer | Haiku 4.5, Sonnet 4.6 och Opus 4.6, deklarerade i en fil på tolv rader. Att byta nivå för en hel lane är en radändring. |
| 50 000 | tokens per minut, taket | Gränsen den tidigare topologin slog i. Den nya bär samma katalog under samma tak genom att hålla prompten liten. |
| 20 | steg som mest per körning | Taket för det djupaste researchläget. Kommentaren i koden säger att det inte får höjas förrän väggklockan är uppmätt på nytt, vilket gör taket till ett beslut med en översynsregel. |

## Så gjordes det

### En agent, verktyg som hämtas vid behov

Fem specialistagenter ersattes av en dirigent med en liten fast verktygsuppsättning. Resten av katalogen når den genom en sökning som laddar in ett verktyg först när det behövs, vilket håller varje anrops prompt liten även när katalogen växer.

### Tre modellnivåer med tydliga gränser

Haiku 4.5 sorterar och svarar på det enkla, Sonnet 4.6 gör resonemanget och skriver underlagen, Opus 4.6 ligger i reserv för det tyngsta. Varje anrop går till den billigaste nivån som klarar uppgiften, och 429-svar återförsöks enligt serverns egen retry-after.

### Budgetar som är kod

Varje researchuppdrag får ett stegtak satt efter djup — fyra, sex eller tjugo steg — dimensionerat efter att ett verktygsanrop tar omkring fem sekunder. Taket ligger i en funktion med egna tester, och kommentaren över det säger att tjugo inte får höjas förrän väggklockan är mätt om.

### Utvärdering som körs varje gång

En inspelad körning sparas som artefakt och spelas upp igen offline, vilket ger en deterministisk grind i CI som varken behöver nycklar eller databas. Ovanpå den ligger en nattlig bedömd körning och löpande stickprov på relevans, hallucination och ton.

**Teknik:** Next.js 16, Mastra, Claude Haiku 4.5, Claude Sonnet 4.6, Supabase, Postgres, pgvector, Vitest

## Vad beviset räcker till

Det här visar att en agentplattform går att bygga så att den håller under drift och går att mäta. Det visar ingenting om vad voxcog är värt på en marknad: plattformen lämnades över före lansering och hade inga betalande användare vid överlämningen.

## Vanliga frågor

### Varför bär en enda agent hela verktygskatalogen?

Fem agenter innebar att ett resonemang komprimerades till prosa varje gång arbetet lämnades vidare, och den komprimeringen kostade mer i kvalitet än specialiseringen gav tillbaka. En dirigent med hämtbara verktyg håller hela sammanhanget på ett ställe.

### Hur hindrar ni att en agentkörning skenar?

Varje läge har ett stegtak i kod, satt efter hur lång tid ett verktygsanrop faktiskt tar. Sista steget tvingar fram ett svar genom att stänga av verktygsvalet, så en körning avslutas med ett svar även när budgeten är slut.

### Hur vet ni att svaren håller kvalitet över tid?

En inspelad körning sparas som artefakt och spelas upp i CI, vilket ger en grind som är deterministisk och klarar sig på inspelat material. En nattlig bedömd körning och löpande stickprov på relevans och hallucination ligger ovanpå.

### Vad kostar en sådan här plattform att driva?

Kostnaden styrs av modellvalet per anrop, och därför ligger routningen i kod: enkel sortering går på den billigaste modellen och bara det tunga resonemanget går till den dyra. Att flytta en hel lane mellan nivåer är en radändring.

### Kan samma upplägg användas på våra interna system?

Ja, mönstret är oberoende av produkten. En dirigent, en verktygskatalog som hämtas vid behov, budgetar i kod och en utvärdering i CI är samma fyra delar oavsett om verktygen läser er databas eller ert ärendesystem.

### Hur lång tid tog agentplattformen?

Ombyggnaden planerades i april 2026 och utvärderingsgrinden i maj, och båda låg i produktion före överlämningen i augusti. Arbetet gjordes parallellt med resten av plattformen av en person.
