voxcog : des agents IA qui tiennent en production
La relation du studio au client
voxcog est un produit que Torn Studio a construit et dans lequel le studio détient une participation. Le studio a assuré la direction produit, l’architecture et la réalisation jusqu’à la livraison en août 2026.
Réponse courte
Torn Studio a construit la plateforme d’agents de voxcog : 55 outils derrière un agent qui les charge à la demande, trois paliers de modèle pour que chaque appel parte vers le moins cher capable de traiter la tâche, et une évaluation exécutée en CI à chaque changement. Livrée en août 2026.
La commande
voxcog avait besoin d’un agent capable d’atteindre tout le produit en une seule conversation — documents, signaux, tâches, agenda, recherche et livrables produit — et de tourner en production pour plusieurs clients à la fois.
Ce qui rendait la tâche difficile
- Une version antérieure plaçait une quarantaine d’outils et une longue consigne système dans chaque appel, ce qui heurtait le plafond Anthropic de 50 000 jetons par minute et bloquait le chat pour tous les clients en même temps.
- L’exécution a lieu sur une plateforme sans serveur avec 270 secondes d’horloge par tour, donc chaque exécution de l’agent doit se terminer dans ce délai.
- Les réponses doivent tenir après coup, ce qui suppose une mesure continue de la qualité et une mesure exécutée en CI sur des exécutions enregistrées.
Des chiffres vérifiables
- 55outils derrière un agent
- Déclarés dans un module et dénombrables là. L’agent porte un petit jeu fixe dans sa consigne et charge le reste quand la conversation l’exige.
- 3paliers de modèle
- Haiku 4.5, Sonnet 4.6 et Opus 4.6, déclarés dans un fichier de douze lignes. Déplacer une voie entière entre paliers tient en une ligne.
- 50 000jetons par minute, le plafond
- La limite que l’ancienne topologie heurtait sans cesse. La nouvelle porte le même catalogue sous le même plafond en gardant la consigne courte.
- 20étapes au plus par exécution
- Le plafond du mode de recherche le plus profond. Le commentaire du code précise qu’il ne monte qu’après un nouveau relevé d’horloge, ce qui en fait une décision assortie d’une règle de révision.
Comment cela a été fait
Un agent, des outils chargés à la demande
Cinq agents spécialisés ont été remplacés par un chef d’orchestre doté d’un petit jeu d’outils fixe. Il atteint le reste du catalogue via une recherche qui charge un outil au moment précis où il sert, ce qui garde chaque appel léger même quand le catalogue grandit.
Trois paliers de modèle aux frontières nettes
Haiku 4.5 trie et répond au simple, Sonnet 4.6 mène le raisonnement et rédige les livrables, Opus 4.6 reste en réserve pour le plus lourd. Chaque appel part vers le palier le moins cher capable de traiter la tâche, et une réponse 429 est retentée selon l’en-tête retry-after du serveur.
Des budgets qui sont du code
Chaque mandat de recherche porte un plafond d’étapes fixé par profondeur — quatre, six ou vingt — dimensionné sachant qu’un appel d’outil prend environ cinq secondes. Le plafond vit dans une fonction avec ses propres tests, et le commentaire au-dessus précise que vingt ne monte qu’après un nouveau relevé d’horloge.
Une évaluation exécutée à chaque fois
Une exécution enregistrée est conservée comme artefact et rejouée hors ligne, ce qui donne à la CI une barrière déterministe qui se contente du matériel enregistré. Au-dessus viennent une exécution jugée chaque nuit et des sondages sur la pertinence, l’hallucination et le ton.
Technologies
- Next.js 16
- Mastra
- Claude Haiku 4.5
- Claude Sonnet 4.6
- Supabase
- Postgres
- pgvector
- Vitest
Jusqu’où va cette preuve
Ceci montre qu’une plateforme d’agents peut être construite pour tenir en exploitation et rester mesurable. Sur la valeur de marché de voxcog, cela ne dit rien : la plateforme a été livrée avant le lancement et comptait alors zéro utilisateur payant.
Preuves
Sur quoi repose cet article — une mesure que nous avons faite, une source datée ou une décision et son coût.
- Mesure
Combien d’outils l’agent peut atteindre
Objet mesuré: le registre d’outils de voxcog
Méthode: Compter les clés du module qui déclare les outils de l’agent.
Résultat: 55 outils
- Décision
Remplacer cinq agents spécialisés par un chef d’orchestre qui charge les outils à la demande.
Ce qu’elle a coûté: La délégation entre agents cesse d’être testable comme comportement propre, et la recherche parallèle attend la réouverture de la topologie.
- Décision
La télémétrie conserve des mesures et aucun texte : ni consigne, ni réponse, ni arguments d’outil.
Ce qu’elle a coûté: Analyser une mauvaise réponse oblige à la reproduire, puisque le texte a disparu.
Questions fréquentes
- Pourquoi un seul agent porte-t-il tout le catalogue d’outils ?
- À cinq agents, un raisonnement était comprimé en prose à chaque passage de relais, et cette compression coûtait plus en qualité que la spécialisation ne rapportait. Un chef d’orchestre aux outils chargeables garde tout le contexte au même endroit.
- Comment empêchez-vous une exécution d’agent de déraper ?
- Chaque mode porte un plafond d’étapes dans le code, fixé sur la durée réelle d’un appel d’outil. La dernière étape force une réponse en coupant le choix d’outil, si bien qu’une exécution se termine par une réponse même à budget épuisé.
- Comment savez-vous que la qualité des réponses tient dans la durée ?
- Une exécution enregistrée est conservée comme artefact et rejouée en CI, ce qui donne une barrière déterministe qui se contente du matériel enregistré. Au-dessus viennent une exécution jugée chaque nuit et des sondages sur la pertinence et l’hallucination.
- Combien coûte l’exploitation d’une telle plateforme ?
- Le coût dépend du modèle qui répond à chaque appel, et c’est pourquoi le routage vit dans le code : le tri simple tourne sur le modèle le moins cher et seul le raisonnement lourd atteint le plus cher. Déplacer une voie entière tient en une ligne.
- Le même montage peut-il servir sur nos systèmes internes ?
- Oui, le motif est indépendant du produit. Un chef d’orchestre, un catalogue d’outils chargé à la demande, des budgets dans le code et une évaluation en CI forment les mêmes quatre pièces, que les outils lisent votre base ou votre outil de tickets.
- Combien de temps a demandé la plateforme d’agents ?
- La refonte a été planifiée en avril 2026 et la barrière d’évaluation en mai, et les deux tournaient en production avant la livraison d’août. Le travail a couru en parallèle du reste de la plateforme et a été mené par une seule personne.
Dites-nous ce que vous voulez construire
Trente minutes, sans frais, et une réponse franche sur le fait que nous soyons ou non le bon studio.