---
title: "voxcog : des agents IA qui tiennent en production"
description: "Comment la plateforme d’agents de voxcog a été rebâtie autour d’un agent doté de 55 outils, de trois paliers de modèle et d’une évaluation exécutée en CI."
url: https://torn.studio/fr/realisations/voxcog-agents-ia-en-production
locale: fr
published: 2026-08-31
updated: 2026-08-26
---

# voxcog : des agents IA qui tiennent en production

> **Réponse courte:** Torn Studio a construit la plateforme d’agents de voxcog : 55 outils derrière un agent qui les charge à la demande, trois paliers de modèle pour que chaque appel parte vers le moins cher capable de traiter la tâche, et une évaluation exécutée en CI à chaque changement. Livrée en août 2026.

**Client:** voxcog · **Livré:** 2026-08-26

**La relation du studio au client:** voxcog est un produit que Torn Studio a construit et dans lequel le studio détient une participation. Le studio a assuré la direction produit, l’architecture et la réalisation jusqu’à la livraison en août 2026.

## La commande

voxcog avait besoin d’un agent capable d’atteindre tout le produit en une seule conversation — documents, signaux, tâches, agenda, recherche et livrables produit — et de tourner en production pour plusieurs clients à la fois.

## Ce qui rendait la tâche difficile

- Une version antérieure plaçait une quarantaine d’outils et une longue consigne système dans chaque appel, ce qui heurtait le plafond Anthropic de 50 000 jetons par minute et bloquait le chat pour tous les clients en même temps.
- L’exécution a lieu sur une plateforme sans serveur avec 270 secondes d’horloge par tour, donc chaque exécution de l’agent doit se terminer dans ce délai.
- Les réponses doivent tenir après coup, ce qui suppose une mesure continue de la qualité et une mesure exécutée en CI sur des exécutions enregistrées.

## Des chiffres vérifiables

| Des chiffres vérifiables | | |
| --- | --- | --- |
| 55 | outils derrière un agent | Déclarés dans un module et dénombrables là. L’agent porte un petit jeu fixe dans sa consigne et charge le reste quand la conversation l’exige. |
| 3 | paliers de modèle | Haiku 4.5, Sonnet 4.6 et Opus 4.6, déclarés dans un fichier de douze lignes. Déplacer une voie entière entre paliers tient en une ligne. |
| 50 000 | jetons par minute, le plafond | La limite que l’ancienne topologie heurtait sans cesse. La nouvelle porte le même catalogue sous le même plafond en gardant la consigne courte. |
| 20 | étapes au plus par exécution | Le plafond du mode de recherche le plus profond. Le commentaire du code précise qu’il ne monte qu’après un nouveau relevé d’horloge, ce qui en fait une décision assortie d’une règle de révision. |

## Comment cela a été fait

### Un agent, des outils chargés à la demande

Cinq agents spécialisés ont été remplacés par un chef d’orchestre doté d’un petit jeu d’outils fixe. Il atteint le reste du catalogue via une recherche qui charge un outil au moment précis où il sert, ce qui garde chaque appel léger même quand le catalogue grandit.

### Trois paliers de modèle aux frontières nettes

Haiku 4.5 trie et répond au simple, Sonnet 4.6 mène le raisonnement et rédige les livrables, Opus 4.6 reste en réserve pour le plus lourd. Chaque appel part vers le palier le moins cher capable de traiter la tâche, et une réponse 429 est retentée selon l’en-tête retry-after du serveur.

### Des budgets qui sont du code

Chaque mandat de recherche porte un plafond d’étapes fixé par profondeur — quatre, six ou vingt — dimensionné sachant qu’un appel d’outil prend environ cinq secondes. Le plafond vit dans une fonction avec ses propres tests, et le commentaire au-dessus précise que vingt ne monte qu’après un nouveau relevé d’horloge.

### Une évaluation exécutée à chaque fois

Une exécution enregistrée est conservée comme artefact et rejouée hors ligne, ce qui donne à la CI une barrière déterministe qui se contente du matériel enregistré. Au-dessus viennent une exécution jugée chaque nuit et des sondages sur la pertinence, l’hallucination et le ton.

**Technologies:** Next.js 16, Mastra, Claude Haiku 4.5, Claude Sonnet 4.6, Supabase, Postgres, pgvector, Vitest

## Jusqu’où va cette preuve

Ceci montre qu’une plateforme d’agents peut être construite pour tenir en exploitation et rester mesurable. Sur la valeur de marché de voxcog, cela ne dit rien : la plateforme a été livrée avant le lancement et comptait alors zéro utilisateur payant.

## Questions fréquentes

### Pourquoi un seul agent porte-t-il tout le catalogue d’outils ?

À cinq agents, un raisonnement était comprimé en prose à chaque passage de relais, et cette compression coûtait plus en qualité que la spécialisation ne rapportait. Un chef d’orchestre aux outils chargeables garde tout le contexte au même endroit.

### Comment empêchez-vous une exécution d’agent de déraper ?

Chaque mode porte un plafond d’étapes dans le code, fixé sur la durée réelle d’un appel d’outil. La dernière étape force une réponse en coupant le choix d’outil, si bien qu’une exécution se termine par une réponse même à budget épuisé.

### Comment savez-vous que la qualité des réponses tient dans la durée ?

Une exécution enregistrée est conservée comme artefact et rejouée en CI, ce qui donne une barrière déterministe qui se contente du matériel enregistré. Au-dessus viennent une exécution jugée chaque nuit et des sondages sur la pertinence et l’hallucination.

### Combien coûte l’exploitation d’une telle plateforme ?

Le coût dépend du modèle qui répond à chaque appel, et c’est pourquoi le routage vit dans le code : le tri simple tourne sur le modèle le moins cher et seul le raisonnement lourd atteint le plus cher. Déplacer une voie entière tient en une ligne.

### Le même montage peut-il servir sur nos systèmes internes ?

Oui, le motif est indépendant du produit. Un chef d’orchestre, un catalogue d’outils chargé à la demande, des budgets dans le code et une évaluation en CI forment les mêmes quatre pièces, que les outils lisent votre base ou votre outil de tickets.

### Combien de temps a demandé la plateforme d’agents ?

La refonte a été planifiée en avril 2026 et la barrière d’évaluation en mai, et les deux tournaient en production avant la livraison d’août. Le travail a couru en parallèle du reste de la plateforme et a été mené par une seule personne.
