
Imagen: Olkeri
Por Olkeri.space
Por qué alucina la IA: cómo detectar y prevenir los errores seguros de la IA
La alucinación de la IA es estructural, no un fallo pasajero. Por qué los modelos inventan datos, dónde se concentran los errores y qué comprobaciones los detectan de verdad.
Leer este artículo en: English · Français · Deutsch
Alucinación es el término que designa que un sistema de IA afirme algo falso con absoluta confianza. Es la limitación de mayor consecuencia de los modelos de lenguaje actuales, y la menos comprendida por quienes se apoyan en ellos.
Lo esencial es que la alucinación no es un defecto a la espera de un parche. Se sigue directamente de cómo funcionan estos sistemas, lo que significa que puede gestionarse y reducirse, pero no darse por resuelta.
Por qué ocurre:
Un modelo de lenguaje está entrenado para producir texto probable, no texto verdadero. Nada en su entrenamiento distingue una afirmación correcta de una incorrecta que se lea con naturalidad. No hay base de datos interna que consultar ni mecanismo alguno para contrastar una afirmación con la realidad.
Cuando usted pide una referencia, el modelo ha absorbido el patrón de cómo son las referencias: nombres de autores, un título verosímil, una revista, un año. Generar una que encaje en ese patrón es exactamente aquello para lo que fue entrenado. Si ese artículo existe es una pregunta que el sistema nunca se hace.
Eso explica también un comportamiento contraintuitivo: los modelos suelen alucinar con más aplomo en temas oscuros. Donde los datos de entrenamiento eran escasos, el patrón es débil, pero el modelo sigue produciendo texto fluido, porque la fluidez es lo que optimiza. La seguridad de la salida no aporta información sobre su exactitud.
Dónde se concentran los errores:
La invención no se reparte por igual, y eso es lo que la hace manejable.
Las cifras concretas son de alto riesgo: estadísticas, precios, fechas, medidas, datos financieros. Los modelos aproximan cantidades a partir de patrones y producen números que parecen razonables y con frecuencia son erróneos.
Las citas y las fuentes son la categoría de mayor riesgo de todas. Los artículos fabricados, la jurisprudencia inventada, las direcciones inexistentes y las citas mal atribuidas son extremadamente comunes. Escritos judiciales con referencias inventadas han acarreado sanciones en varias jurisdicciones.
Los acontecimientos recientes son poco fiables porque los datos de entrenamiento tienen fecha de corte. Preguntado por algo posterior, un modelo puede adivinar en lugar de declinar.
Los detalles sobre personas y organizaciones reales, biografías, cargos, afiliaciones, quién dijo qué, se confabulan a menudo a partir de asociaciones verosímiles.
A la inversa, el riesgo es bajo cuando el modelo transforma un texto que usted aportó, razona sobre un problema que usted puede seguir o se mueve en conocimiento general bien cubierto. La distinción está en si la respuesta depende de recuperar datos o de operar sobre material que tiene delante.
Cómo detectarla:
La fluidez no es prueba. El texto alucinado se lee exactamente igual que el texto exacto, porque ambos se generan del mismo modo. Juzgar por el tono es, con diferencia, el error más común.
Desconfíe de una precisión excesiva sobre algo difícil de saber: un porcentaje exacto en un contexto oscuro, una fecha precisa para un suceso menor, una fuente con nombre para una afirmación nada polémica. La precisión innecesaria suele señalar la completación de un patrón más que un recuerdo.
Haga la misma pregunta en una conversación nueva. El conocimiento genuino tiende a ser estable; la invención varía de un intento a otro. Respuestas incoherentes a una pregunta factual significan que el modelo no lo sabe.
Verifique todo aquello en lo que se vaya a confiar, empezando por las categorías anteriores. Cada referencia, cada cifra, cada cita atribuida.
Qué la reduce de verdad:
Aporte el material fuente. Un modelo que lee un documento que usted le entregó y responde a partir de él está haciendo comprensión lectora, que se le da bien, en lugar de recuerdo, que se le da mal. Es la mayor mejora individual disponible y la razón por la que los sistemas de recuperación dominan los despliegues empresariales.
Exija citas ligadas al texto aportado. Cuando un sistema debe señalar qué pasaje respalda cada afirmación, las aseveraciones sin respaldo se hacen visibles en vez de camuflarse.
Dé permiso explícito para declinar. Los modelos entrenados para ser útiles responden por defecto. Instrucciones del tipo «si la respuesta no está en el material aportado, dilo» aumentan de forma medible las negativas del tipo correcto.
Pida el razonamiento antes que las conclusiones. Los modelos que recorren un problema paso a paso cometen menos errores en preguntas de varias etapas, y el razonamiento expuesto le da algo que comprobar.
Acote la tarea. «Resume este documento» es mucho más seguro que «háblame de este tema», porque lo primero tiene una fuente verificable y lo segundo no.
Donde el riesgo es inaceptable:
Algunos usos no deben apoyarse en absoluto en salidas no verificadas: referencias jurídicas sin comprobar, orientación médica sin revisión profesional, cifras financieras sin conciliar, afirmaciones factuales destinadas a publicación sin trabajo de fuentes, y cualquier decisión que afecte a los derechos o la seguridad de alguien.
El patrón de todos los fallos que se han hecho públicos es el mismo. Alguien tomó una salida fluida por una salida verificada. La tecnología se comportó exactamente como fue diseñada; el proceso que la rodeaba no tuvo en cuenta cómo funciona.
La posición realista:
Los modelos más recientes alucinan menos que los antiguos, y las técnicas de recuperación y de razonamiento han estrechado bastante la brecha. El problema se ha vuelto menos frecuente, lo que en cierto sentido lo hace más peligroso: los errores raros invitan a la complacencia, y el error que uno ha dejado de buscar es el que llega al cliente.
Trate estos sistemas como a un colega extremadamente capaz que de vez en cuando afirma algo falso con total convicción y sin darse cuenta. Ese encuadre genera los hábitos correctos. Delegue sin reparos, verifique todo lo que tenga consecuencias y nunca deje que el aplomo sustituya a la evidencia.