¿Es real la "IA sin alucinaciones"? - La idea de "no dejar hablar" a ChatGPT: La verdadera identidad de la IA ultrarrápida "Jev" que entusiasma a los desarrolladores

¿Es real la "IA sin alucinaciones"? - La idea de "no dejar hablar" a ChatGPT: La verdadera identidad de la IA ultrarrápida "Jev" que entusiasma a los desarrolladores

¿El verdadero valor de la IA reside en "hablar bien"?

Durante mucho tiempo, los avances en la IA generativa se han medido en términos de "qué tan naturalmente puede escribir" o "qué tan bien puede responder a preguntas difíciles". Sin embargo, cuando las empresas integran la IA profundamente en el software para automatizar procesos, la fluidez no siempre es el mayor valor.

Lo necesario es distinguir si una consulta es sobre cancelación de contrato o una solicitud de reembolso. Determinar si un comando que se intenta ejecutar es peligroso. Elegir el modelo de IA adecuado para el trabajo y devolver el grado de confianza en la decisión de una manera que el programa pueda manejar.

Aquí es donde entra en juego "Jev", lanzado en acceso temprano por la empresa estadounidense TypeSafe AI. Dirigido por Diogo Almeida, un ex investigador de OpenAI involucrado en la investigación de RLHF y el desarrollo de tecnologías que condujeron a ChatGPT.

La característica más destacada de Jev es que no chatea. No genera historias ni explicaciones, sino que devuelve valores y probabilidades predefinidos para las opciones establecidas por los desarrolladores. TypeSafe lo llama "System One Model", optimizado para procesar juicios instantáneos en lugar de razonamientos largos y profundos, similar al "sistema 1" del pensamiento humano rápido e intuitivo.


La velocidad obtenida al "no crear textos"

Los modelos de lenguaje a gran escala generan cada token uno por uno, basándose en las palabras o tokens anteriores. Aunque son altamente versátiles y se pueden utilizar para conversaciones, resúmenes, creación de programas, etc., cuanto más largo sea el output, más tiempo y costo se requiere. Además, al usarlos desde un programa, es necesario analizar las respuestas y verificar si están en el formato esperado.

Jev renuncia intencionalmente a esta libertad. Aunque la entrada puede ser datos no estructurados como el lenguaje natural, los candidatos de salida y el tipo de datos se determinan de antemano. Por ejemplo, clasifica correos de clientes en "facturación", "cancelación", "fallo del producto" u "otros", devolviendo la probabilidad de cada uno. Al no escribir textos palabra por palabra y emitir múltiples juicios en paralelo, es más fácil de acelerar.

Según los datos publicados por TypeSafe, el tiempo de respuesta es de 70 a 500 milisegundos. El costo de entrada es de 0.042 dólares por cada millón de tokens, y el output es tratado como gratuito ya que "no es un costo medible". La compañía afirma que, en las tareas tipo System One, puede ser de 10 a 200 veces más rápido que los LLM existentes, manteniendo una inteligencia similar. Su evaluación interna muestra que es 193.6 veces más rápido y 444.6 veces más económico.

Sin embargo, estas evaluaciones son principalmente diseñadas y publicadas por los desarrolladores. TypeSafe también aclara que la posibilidad de sesgo por parte de los creadores del flujo de trabajo, las condiciones de comparación que favorecen a Jev, y la falta de subsidios de precio solo pueden ser probadas a largo plazo. No se debe interpretar la impresionante multiplicación como un rendimiento generalizable para todos los usos.


La facilidad de integración supera la "inteligencia" para los desarrolladores

Justo después de su lanzamiento, hubo tanto interés que la capacidad de ofrecer la API no pudo mantenerse al día temporalmente. En las redes sociales, lo que destacó no fueron las reacciones disfrutando de charlas con el modelo, sino las publicaciones de desarrolladores que lo reemplazaron en flujos de trabajo reales para medir su efectividad.

 

Pranit Sharma, ingeniero de software en Vercel, informó que al reemplazar el modelo de OpenAI existente con Jev para la clasificación de seguridad de comandos, logró mejorar la precisión y aumentar la velocidad de 5 a 18 veces.

Nikhil Mudholkar, CTO de Bryo AI, comparó la clasificación de correos electrónicos de trabajo con Gemini. Aunque en sus pruebas Gemini tuvo una precisión ligeramente superior, el costo de Jev fue de 1/10 a 1/20, y destacó especialmente la utilidad de las probabilidades prácticas asignadas a cada juicio, lo que facilita el diseño de un sistema que solo remite casos de baja confianza a humanos.

Por otro lado, Armin Ronacher, involucrado en la infraestructura de ejecución de modelos de código abierto, señaló que el manejo de probabilidades es responsabilidad del usuario. ¿Se debe detener el proceso al 50% o se puede ejecutar automáticamente al 95%? El modelo no determina ese umbral. Jev muestra incertidumbre, pero cómo convertir esa incertidumbre en reglas de negocio es algo que las empresas deben diseñar.

Estos informes en redes sociales son ejemplos iniciales interesantes que muestran el potencial de Jev. Sin embargo, no son evaluaciones independientes realizadas bajo condiciones uniformes, sino resultados de pruebas específicas de cada desarrollador. Es necesario distinguir entre reacciones favorables y pruebas de rendimiento general.


¿Qué significa "no alucinar"?

Una de las expresiones más importantes sobre Jev es que "no alucina".

Si los candidatos de salida y el tipo están fijados desde el principio, es más fácil evitar problemas como crear elementos inexistentes o romper el formato a mitad de la explicación. Dado que lo que se devuelve está limitado a valores booleanos, etiquetas de clasificación, números, probabilidades, etc., hay poco espacio para generar texto ilegible por el software o llamadas a funciones ficticias.

Sin embargo, que el formato sea correcto no garantiza que el contenido del juicio lo sea. Incluso si se clasifica erróneamente una "solicitud de reembolso" como una "pregunta general", el formato de salida sigue siendo perfectamente correcto. Lo que TypeSafe garantiza principalmente es que no se sale del esquema o tipo, no que siempre sea correcto sobre la realidad.

Además, la calibración de probabilidades también es crucial. Si se recopilan muchos casos donde el modelo responde "90%" y realmente alrededor del 90% son correctos, se puede decir que la probabilidad está bien calibrada. Por el contrario, si muestra 90% pero la tasa de aciertos es del 60%, no se puede usar como válvula de seguridad para la automatización. Es necesario seguir verificando según la industria, el idioma, la longitud de la entrada y los cambios de datos con el tiempo.

Cuando se usa en empresas japonesas, también se debe verificar cómo maneja el lenguaje honorífico japonés, las expresiones abreviadas, el lenguaje específico de la empresa y las solicitudes ambiguas. Incluso si tiene un buen rendimiento en correos electrónicos en inglés, no garantiza la misma precisión en registros de centros de llamadas o documentos de aprobación en japonés.


No reemplazar la IA generativa, sino supervisarla

Un uso prometedor de Jev no es solo reemplazar los LLM, sino también actuar como un "supervisor" antes y después de la IA generativa.

Por ejemplo, determinar si una solicitud de usuario incluye un comando para obtener información confidencial. Verificar si las operaciones que un agente de IA intenta realizar son peligrosas. Evaluar si las respuestas generadas no contradicen el contenido de la conversación o violan prohibiciones. Invocar un LLM de alto rendimiento como supervisor cada vez aumenta el costo y el tiempo de espera, pero un modelo de juicio rápido y económico permite incluir múltiples etapas de verificación.

Otro uso es el "enrutamiento de modelos". Las solicitudes simples se envían a modelos pequeños y económicos, las preguntas difíciles a modelos de alto rendimiento, y las solicitudes que incluyen imágenes a modelos multimodales. Si se utiliza un LLM costoso para el enrutamiento, el efecto de ahorro se reduce, pero un modelo como Jev podría permitir una selección detallada en la entrada.

En los sistemas empresariales, a menudo es más realista combinar pequeñas piezas con diferentes especialidades que confiar todo el proceso a una sola IA omnipotente, en términos de costo, velocidad y auditoría. Jev apunta a ser un "componente común de juicio" que se llama dentro de innumerables aplicaciones, invisible para el usuario.


El "Paradoja de Jevons" en el nombre

El nombre Jev se deriva del economista del siglo XIX William Stanley Jevons. La Paradoja de Jevons es la idea de que cuando mejora la eficiencia en el uso de recursos, en lugar de ahorrar, el uso se expande y el consumo total puede aumentar.

Si el costo de juicio de la IA se reduce a 1/100, no significa necesariamente que las empresas reducirán su gasto en IA a 1/100. Podrían agregar cientos o miles de procesos de juicio en situaciones donde antes era demasiado caro implementar. Esto permitiría insertar "juicios un poco más inteligentes" en cada consulta, transacción, clic y operación de agente.

Esto aumenta la conveniencia, pero también significa que la supervisión y selección automática se expanden a lugares invisibles. Si se utiliza para clasificar candidatos, priorizar clientes o detectar fraudes, los errores y sesgos pueden tener un gran impacto. La ventaja de ser económico y por lo tanto ampliamente utilizable está acompañada del riesgo de amplificar en gran medida los mismos errores de juicio.


Procedimientos realistas de implementación para empresas japonesas

En Japón, la implementación de IA generativa a menudo comienza con el soporte para chats internos y la creación de documentos. Los modelos tipo Jev son adecuados para la siguiente etapa. Clasificación de consultas, priorización de alertas de supervisión, clasificación de casos de ventas, revisión de contenido, aprobación de operaciones de agentes de IA, tareas que actualmente requieren que los humanos miren la pantalla y tomen decisiones.

Al implementar, es seguro primero correr en paralelo con el juicio humano en lugar de automatizar inmediatamente. Medir la precisión y calibración de probabilidades con datos de trabajo, y establecer un umbral más alto para la automatización en elementos donde el error tiene un gran costo. Los casos de baja confianza deben ser devueltos a los humanos, y se debe continuar monitoreando los cambios en el modelo y los datos de entrada. Además, es necesario registrar quién definió los candidatos de salida y quién aprobó los umbrales.

Es importante no diluir la responsabilidad diciendo "porque la IA lo decidió", sino poder explicar las reglas que convierten las probabilidades de la IA en decisiones empresariales. La fortaleza de Jev radica en devolver valores estructurados en lugar de texto libre. La diferencia entre un simple clasificador rápido y una base confiable para el negocio depende de si se puede conectar esa fortaleza a la capacidad de auditoría.


El campo de batalla principal de la IA se mueve fuera de la pantalla

Jev no es una amenaza para terminar con los chatbots como ChatGPT. En la creación de textos, el diálogo, el razonamiento complejo y las tareas creativas, la libertad de los LLM es indispensable. Sin embargo, en los pequeños juicios que se repiten millones de veces dentro del software, la libertad puede ser un obstáculo.

La pregunta esencial que plantea Jev no es "¿cuál es la IA más inteligente?", sino "¿realmente se necesita generación de texto para ese trabajo?". Si la respuesta necesaria son solo unas pocas opciones y probabilidades, no hay mucha razón para invocar un modelo de conversación gigante cada vez.

En el futuro, aumentarán modelos similares y productos competidores, y se avanzará en evaluaciones independientes de terceros. La arquitectura secreta de Jev, su afirmación de haber sido entrenado solo con datos sintéticos, y la sostenibilidad de su precio también necesitan ser verificados. Aun así, la perspectiva de que el futuro de la IA no solo reside en pantallas de chat llamativas, sino que se extiende a procesos discretos como la toma de decisiones, supervisión, clasificación y enrutamiento, es convincente.

La próxima revolución de la IA no necesariamente nos hablará. Será tan rápida que apenas la notaremos, decidiendo "qué hacer a continuación" en lo profundo del software. Jev está tratando de liderar este cambio silencioso.


Sobre las reacciones en redes sociales

Las reacciones en redes sociales presentadas en el texto se basan en pruebas individuales publicadas por desarrolladores justo después del lanzamiento y en entrevistas y citas de TechCrunch. Aunque hay una fuerte valoración de la velocidad, el precio y la salida de probabilidades, no son evaluaciones independientes a gran escala bajo las mismas condiciones, por lo que es necesario reevaluarlas con datos reales de cada empresa.


URL de referencia