voxcog: agentes de IA que aguantan en producción
La relación del estudio con el cliente
voxcog es un producto que Torn Studio construyó y en el que el estudio tiene una participación. El estudio llevó la gestión de producto, la arquitectura y la construcción hasta la entrega en agosto de 2026.
Respuesta breve
Torn Studio construyó la plataforma de agentes de voxcog: 55 herramientas detrás de un agente que las carga cuando hacen falta, tres niveles de modelo para que cada llamada vaya al más barato capaz de resolverla, y una evaluación que corre en CI con cada cambio. Se entregó en agosto de 2026.
El encargo
voxcog necesitaba un agente capaz de alcanzar todo el producto en una sola conversación — documentos, señales, tareas, calendario, investigación y entregables de producto — y de funcionar en producción para varios clientes a la vez.
Lo que lo hizo difícil
- Una versión anterior metía unas cuarenta herramientas y un prompt de sistema largo en cada llamada, lo que chocaba con el techo de Anthropic de 50.000 tokens por minuto y bloqueaba el chat para todos los clientes a la vez.
- La ejecución ocurre en una plataforma sin servidor con 270 segundos de reloj por turno, así que cada corrida del agente tiene que terminar dentro de ese margen.
- Las respuestas tienen que sostenerse después, lo que exige medir la calidad de forma continua y que esa medición corra en CI contra corridas grabadas.
Cifras que se pueden contar
- 55herramientas tras un agente
- Registradas en un módulo y contables ahí. El agente lleva un conjunto fijo pequeño en el prompt y carga el resto cuando la conversación lo pide.
- 3niveles de modelo
- Haiku 4.5, Sonnet 4.6 y Opus 4.6, declarados en un archivo de doce líneas. Mover un carril entero entre niveles es cambiar una línea.
- 50.000tokens por minuto, el techo
- El límite con el que chocaba la topología anterior. La nueva sostiene el mismo catálogo bajo el mismo techo manteniendo el prompt pequeño.
- 20pasos como máximo por corrida
- El tope del modo de investigación más profundo. El comentario del código dice que solo sube tras volver a medir el reloj, lo que convierte el tope en una decisión con regla de revisión.
Cómo se hizo
Un agente y herramientas bajo demanda
Cinco agentes especialistas se sustituyeron por un director con un conjunto fijo y pequeño de herramientas. El resto del catálogo lo alcanza mediante una búsqueda que carga una herramienta justo cuando hace falta, lo que mantiene cada llamada pequeña aunque el catálogo crezca.
Tres niveles de modelo con límites claros
Haiku 4.5 clasifica y responde lo sencillo, Sonnet 4.6 hace el razonamiento y escribe los entregables, Opus 4.6 queda en reserva para lo más pesado. Cada llamada va al nivel más barato capaz de resolverla, y una respuesta 429 se reintenta según la cabecera retry-after del propio servidor.
Presupuestos que son código
Cada encargo de investigación lleva un tope de pasos fijado por profundidad — cuatro, seis o veinte — dimensionado sabiendo que una llamada a herramienta tarda unos cinco segundos. El tope vive en una función con sus propias pruebas, y el comentario encima dice que veinte solo sube tras volver a medir el reloj.
Una evaluación que corre cada vez
Una corrida grabada se guarda como artefacto y se reproduce offline, lo que da a CI una puerta determinista que funciona con material grabado. Encima van una corrida juzgada cada noche y muestreos continuos de relevancia, alucinación y tono.
Tecnología
- Next.js 16
- Mastra
- Claude Haiku 4.5
- Claude Sonnet 4.6
- Supabase
- Postgres
- pgvector
- Vitest
Hasta dónde llega esta prueba
Esto demuestra que una plataforma de agentes puede construirse de forma que aguante en operación y se pueda medir. De su valor de mercado dice poco: la plataforma se entregó antes del lanzamiento y en ese momento tenía cero usuarios de pago.
Evidencia
En qué se apoya este artículo — una medición nuestra, una fuente fechada o una decisión y lo que costó.
- Medición
Cuántas herramientas puede alcanzar el agente
Objeto medido: el registro de herramientas de voxcog
Método: Contar las claves del módulo que registra las herramientas del agente.
Resultado: 55 herramientas
- Decisión
Sustituir cinco agentes especialistas por un director que carga herramientas bajo demanda.
Lo que costó: La delegación entre agentes deja de poder probarse como comportamiento propio, y la investigación en paralelo espera a que la topología se reabra.
- Decisión
La telemetría guarda métricas y ningún texto: ni prompt, ni respuesta, ni argumentos de herramienta.
Lo que costó: Depurar una mala respuesta obliga a reproducirla, porque el texto ya no está.
Preguntas frecuentes
- ¿Por qué un solo agente carga todo el catálogo de herramientas?
- Con cinco agentes, cada traspaso comprimía un razonamiento a prosa, y esa compresión costaba más calidad de la que devolvía la especialización. Un director con herramientas bajo demanda mantiene todo el contexto en un mismo sitio.
- ¿Cómo evitáis que una corrida del agente se descontrole?
- Cada modo lleva un tope de pasos en código, fijado según lo que tarda de verdad una llamada a herramienta. El último paso fuerza una respuesta apagando la elección de herramienta, así que una corrida termina respondiendo aunque agote el presupuesto.
- ¿Cómo sabéis que la calidad de las respuestas se mantiene?
- Una corrida grabada se guarda como artefacto y se reproduce en CI, lo que da una puerta determinista que funciona con material grabado. Encima van una corrida juzgada cada noche y muestreos de relevancia y alucinación.
- ¿Cuánto cuesta operar una plataforma así?
- El coste depende de qué modelo responde cada llamada, y por eso el enrutado vive en código: la clasificación sencilla corre en el modelo más barato y solo el razonamiento pesado llega al caro. Mover un carril entero es cambiar una línea.
- ¿Se puede aplicar el mismo diseño a nuestros sistemas internos?
- Sí, el patrón es independiente del producto. Un director, un catálogo de herramientas bajo demanda, presupuestos en código y una evaluación en CI son las mismas cuatro piezas, lean las herramientas tu base de datos o tu sistema de tickets.
- ¿Cuánto tardó la plataforma de agentes?
- La reconstrucción se planificó en abril de 2026 y la puerta de evaluación en mayo, y ambas estaban en producción antes de la entrega de agosto. El trabajo corrió en paralelo al resto de la plataforma y lo hizo una sola persona.
Cuéntanos qué quieres construir
Treinta minutos, sin coste, y una respuesta directa sobre si somos el estudio adecuado.