TypeSafe AI presentó la semana pasada Jev, un modelo de inteligencia artificial diseñado para tomar decisiones que el software y los agentes puedan ejecutar directamente. La startup, fundada por Diogo Almeida, exinvestigador de OpenAI, dejó de lado funciones habituales como escribir correos, generar código o mantener conversaciones para apostar por una IA más limitada, pero también más rápida y barata, pensada para resolver tareas concretas en sistemas automatizados.
A diferencia de los modelos conversacionales, Jev se concentra en clasificar información, asignar puntajes y calcular probabilidades. En lugar de generar textos largos para explicar una respuesta, devuelve directamente un resultado que otro software pueda interpretar y ejecutar. TypeSafe lo lanzó a US$ 0,042 por millón de tokens de entrada y no cobra por la salida.
Esa diferencia cobra sentido en tareas en las que el sistema no necesita conversar, sino simplemente elegir qué hacer. En empresas que procesan miles de decisiones automáticas por hora, evitar la generación de respuestas innecesarias puede reducir considerablemente tanto los tiempos como los costos.

Los primeros experimentos llamaron la atención de los desarrolladores. Pranit Sharma, ingeniero de Vercel, informó que reemplazar un modelo de lenguaje por Jev para clasificar la seguridad de comandos permitió obtener respuestas entre cinco y 18 veces más rápidas, con mayor precisión en esa prueba. Otro desarrollador lo utilizó para ordenar correos empresariales y encontró costos muy inferiores a los de Gemini, aunque el modelo de Google fue ligeramente más preciso.
Una inteligencia artificial diseñada para decidir
Una situación cotidiana permite entender la diferencia. Un cliente escribe a un bot de soporte porque le cobraron dos veces por una suscripción y solicita un reembolso. Antes de responder, el sistema necesita determinar si el mensaje corresponde a facturación, soporte técnico o ventas.
Un modelo de lenguaje convencional interpreta el mensaje, identifica qué hacer y puede generar una respuesta escrita. Jev recibe el texto junto con una serie de opciones previamente definidas y devuelve directamente una elección acompañada de una estimación de probabilidad. La aplicación puede tomar ese resultado y continuar con el proceso.
La diferencia cobra mayor importancia cuando una empresa necesita procesar 100.000 mensajes similares. En muchos casos, el software no necesita una explicación para cada decisión. Solo necesita saber a qué categoría pertenece el pedido para ejecutar el siguiente paso.
Jev admite tres tipos de consultas. Choice selecciona una respuesta entre opciones predefinidas. Score evalúa la información según una escala numérica o una serie de criterios. Noul, el nombre que TypeSafe eligió para la tercera modalidad, calcula la probabilidad de que una afirmación sea verdadera. Además, varias preguntas pueden analizarse en paralelo a partir de una misma entrada.

TypeSafe define a Jev como un modelo de Sistema Uno, en referencia a la distinción del psicólogo Daniel Kahneman entre el pensamiento rápido e intuitivo y el razonamiento más lento. La compañía también afirma que utiliza una arquitectura propia y un método de entrenamiento denominado Aprendizaje por Refuerzo para Decisiones Calibradas, diseñado para mejorar la forma en que expresa la incertidumbre.
Almeida lo resumió como una herramienta que recibe información desordenada y devuelve decisiones estructuradas con probabilidades. Los desarrolladores evitan así pedirle al modelo una explicación escrita para luego extraer una decisión y descartar el resto del texto.
Ese enfoque también limita lo que puede hacer. Jev no redacta una respuesta para un cliente, no inventa una nueva categoría cuando las opciones disponibles son insuficientes, ni ejecuta por sí mismo un proceso empresarial complejo. Los desarrolladores deben definir la información importante, las acciones posibles y el software que interpretará el resultado.
La idea de obtener respuestas estructuradas de una IA tampoco nació con Jev. OpenAI introdujo en 2024 una función que obliga a sus modelos a responder según esquemas predefinidos. La diferencia está en que TypeSafe diseñó su sistema desde el inicio en torno a este tipo de decisiones, en lugar de utilizar un modelo conversacional para producirlas.
La batalla por el costo y la velocidad
TypeSafe bautizó el modelo en referencia al economista del siglo XIX William Stanley Jevons, quien estudió cómo una mejora en la eficiencia del uso de los recursos podía impulsar un mayor consumo. La empresa apuesta por una dinámica similar en inteligencia artificial. Si tomar una decisión automática cuesta mucho menos, podría ser viable incorporar estas funciones a procesos que hoy dependen de reglas fijas o de la intervención humana.

La compañía asegura que Jev puede responder en entre 70 y 500 milisegundos. También destaca su bajo costo. Con la tarifa anunciada, procesar mil millones de tokens de entrada costaría apenas US$ 42, aunque esa cifra no contempla otros gastos necesarios para operar el sistema.
La diferencia frente a los grandes modelos de lenguaje es considerable. Procesar esa misma cantidad de información costaría alrededor de US$ 4.000 con Claude Opus 5.5 de Anthropic o GPT-5.6 Sol de OpenAI, subiría a US$ 5.000 con Claude Opus 5 y llegaría a US$ 10.000 con Claude Fable 5.1 o GPT-6 Astra. Además, en esos casos todavía habría que sumar el costo de los tokens de salida.
TypeSafe sostiene que sus propias evaluaciones mostraron que Jev puede ser hasta 194 veces más rápido y 445 veces más barato que los modelos de lenguaje de última generación. La propia compañía reconoce que esas cifras representan el extremo superior de las mejoras que espera que experimenten sus clientes.
El precio y la velocidad no son los únicos factores a tener en cuenta. Pruebas independientes de Explainx.ai le dieron a Jev una precisión agregada del 67,8%, por debajo del 74,1% alcanzado por el modelo con mejor desempeño en esa evaluación. La importancia de esa diferencia depende del uso. Un error al clasificar un mensaje de baja prioridad puede tener consecuencias menores, pero una decisión equivocada al autorizar una transacción financiera o al evaluar un comando informático peligroso deja mucho menos margen para fallar.
Las pruebas realizadas por los desarrolladores muestran precisamente esa tensión. En el experimento de Vercel, Jev mejoró tanto la velocidad como la precisión al clasificar comandos. En otro ensayo, Nikhil Mudholkar, CTO de Bryo AI, encontró que Gemini ofrecía una precisión ligeramente superior para clasificar correos empresariales, aunque a un costo entre 10 y 20 veces mayor.

LangChain encontró otro posible uso de Jev al probarlo como herramienta para evaluar el trabajo de los agentes de IA. En un experimento realizado el 20 de septiembre, Jev coincidió con el criterio de un revisor humano en las 500 evaluaciones realizadas, con un tiempo promedio de 0,44 segundos y un costo de apenas US$ 0,00035 por prueba.
También mostró resultados más consistentes que los de sus competidores, aunque el ensayo se limitó a un solo agente y a un conjunto reducido de tareas. Esa consistencia, además, no garantiza por sí sola que una decisión sea correcta.
El problema aparece cuando la decisión es incorrecta
TypeSafe afirma que Jev no puede tener alucinaciones, lo que generó debate entre desarrolladores. La empresa se refiere a que el sistema no puede salir de la estructura definida. Si debe elegir entre cinco categorías, por ejemplo, no puede inventar una sexta. Eso no impide que seleccione la categoría equivocada ni que asigne una probabilidad elevada a una respuesta incorrecta. Una respuesta puede respetar perfectamente la estructura exigida y, aun así, tomar una decisión equivocada.
Una investigación publicada el 21 de septiembre por VentureBeat mostró hasta qué punto la información que recibe Jev puede influir en su decisión. En la prueba, el modelo evaluó un comando informático potencialmente destructivo y le asignó una probabilidad de 0,76 a bloquearlo. Luego, un ingeniero agregó entre los datos de entrada un mensaje falso que simulaba una autorización y esa probabilidad cayó a 0,48.
El experimento se limitó a un solo caso, por lo que no permite saber con qué frecuencia podría repetirse este comportamiento. Aun así, mostró que datos maliciosos incluidos en la entrada pueden influir de forma significativa en la respuesta del sistema.

El tema también generó debate entre los desarrolladores en Hacker News. Algunos cuestionaron si las comparaciones con los grandes modelos de lenguaje eran realmente válidas, ya que se trata de herramientas con alcances distintos. Otros señalaron que esos modelos también pueden configurarse para entregar respuestas estructuradas, por lo que pusieron el foco en dos ventajas más concretas de Jev, su mayor velocidad y su menor costo.
Almeida explicó que su frustración con las limitaciones de la inteligencia artificial conversacional para automatizar software fue uno de los motivos detrás del proyecto. "Tenemos un potencial enorme y, sin embargo, no nos sirve de nada", afirmó.
Más que reemplazar por completo a los grandes modelos de lenguaje, Jev podría funcionar como una pieza dentro de sistemas que combinen distintas formas de inteligencia artificial. Podría utilizarse, por ejemplo, para revisar acciones propuestas por otros agentes, determinar cuándo hace falta recurrir a un modelo más avanzado o validar un resultado antes de que un proceso automático continúe.
Los primeros ensayos muestran que ese enfoque puede funcionar en tareas específicas, pero todavía falta comprobar cómo responde cuando deja atrás las pruebas controladas y pasa a utilizarse de forma sostenida en sistemas reales. Su adopción dependerá, en buena medida, de si logra mantener su desempeño y precisión cuando aumenten el volumen y la variedad de las decisiones que debe tomar.
*Esta nota fue publicada originalmente en Forbes.com.