Cómo Jev puede hacer que un agente de IA sea más eficiente
- La pregunta
- ¿Puede un modelo pequeño y económico que solo clasifica decidir qué entra en el contexto de un modelo grande sin empeorar el rendimiento del agente?
- El resultado
- Sí, y merece la pena: un 29 % más barato de media, un 61 % en la mejor tarea, con un 99 % de superación de los controles de calidad en cada variante.
Qué quería averiguar
En julio sostuve que los modelos pequeños deberían decidir qué ven los modelos grandes, y concluí diciendo que la economía era un motivo para experimentar, no una prueba de nada.
Jev se lanzó el 15 de septiembre. No escribe ningún texto; devuelve probabilidades calibradas sobre respuestas definidas por el código y cuesta 0,042 $ por millón de tokens de entrada. Esto hizo que dos versiones muy concretas de la idea fueran lo suficientemente baratas como para medirlas, así que las probé:
- Precargar las habilidades. Dejar que lea la solicitud y la descripción de una línea de cada documento interno, e inyectar lo que importa antes del primer turno del agente, para que este nunca gaste un ciclo en recuperarlos.
- Filtrar la carga útil (payload) de la herramienta. Dejar que califique cada campo de una respuesta de API y elimine aquellos sobre los que el agente no actuará, antes de que entren en la ventana de contexto y empiecen a reenviarse en cada turno.
Ambos son problemas de clasificación. Ninguno requiere un modelo que sepa escribir.
Cómo se probó
Una SaaS B2B ficticia con 17 herramientas cuyas cargas útiles imitan la estructura real de Stripe, Zendesk, HubSpot y un CMS de centro de ayuda, 11 documentos de políticas internas (de los cuales varios no aportan nada) y 8 tareas divididas en dos ejes: cuántos turnos requieren y cuánta de su carga útil es ruido.
Cuatro variantes, seis repeticiones cada una, 192 ejecuciones. La calificación es determinista: 59 comprobaciones, cada una consistente en una llamada a herramienta con argumentos exactos o un dato que aparece solo dentro de un documento de política. Sin jueces LLM, por lo que si “el agente realmente tenía la política” es medible y no discutible.
Los resultados
Coste medio de una ejecución de agente, basado en Claude Opus 5
La media es un 29 % más barata. En la mejor tarea la reducción es del 61 %, en la peor del 13 %. Los turnos bajan de 4,44 a 3,71, y los tokens de entrada frescos, los más caros, caen un 49 %.
Los dos mecanismos responden a cosas completamente diferentes, lo cual es más importante que la media si estás decidiendo si usar alguno:
La precarga responde a turnos eliminablesNo al tamaño de la carga útil
- Ideal donde una tarea necesita una política y gastaría un turno en recuperarla
- Sin valor donde no se aplica ninguna política
- Puede ser contraproducente: un documento cargado erróneamente se reenvía en cada turno
El filtrado responde a la densidad de la carga útilNo a la longitud de la tarea
- Ideal donde la mayoría de los bytes son texto que nadie lee
- Casi nulo donde cada campo es fundamental
- Se acumula, porque un campo eliminado no se reenvía en el siguiente turno
Conclusiones
Un campo no es útil por sí mismo. Es útil según lo que el agente vaya a hacer con él, y esa información no está en la carga útil. Indicar al calificador qué herramientas puede llamar el agente eleva la relevancia del campo del que depende la tarea de 0,18 a 0,73, reduciendo al mismo tiempo el número de campos conservados de 51 a 27. Un contexto más rico hace que el filtro sea más seguro y agresivo a la vez.
El precio de tu modelo principal decide si el filtrado merece la pena. Cuesta un número fijo de tokens baratos y ahorra un número variable de tokens caros, por lo que el resultado puede variar. Con un modelo de 0,20 $ por millón, cuesta un 21 % más de lo que ahorra; con Opus 5, ahorra un 29 %. El punto de equilibrio está en torno a los 0,55 $ por millón con el almacenamiento de prompts (prompt caching) activado.
Un campo eliminado no produce un error. Produce una respuesta incorrecta pero segura. Una versión temprana eliminó un ID de cuenta y su duplicado, y el agente actuó sobre el único identificador restante, que era el objeto equivocado, y luego presentó un informe impecable sobre él. Cualquier despliegue necesita rutas críticas declaradas y un umbral calibrado en función de ellas.
Aquí se probaron dos puntos de partida. Elegir qué archivos abre un agente, decidir cuándo compactar una conversación o filtrar una escritura antes de que ocurra: nada de esto fue medido, y no asumiría que funciona hasta que se compruebe.

