Saltar al contenido

Laboratorio

Laboratorio de fiabilidad

Aquí se explica, con números, por qué un agente falla más cuanto más larga es la tarea y qué aporta comprobar cada paso. Puedes jugar con las simulaciones; los resultados reales los medimos nosotros y aquí solo se consultan.

No confundir con el banco de pruebas (personas y programas participan), ni con el protocolo PI-001 (evaluamos agentes en webs). El Laboratorio explica por qué fallan.

Simulación 1 · gratuita, sin modelo

¿Por qué fallan más las tareas largas?

Si cada paso sale bien con probabilidad p y los pasos son independientes, una cadena de n pasos sale entera bien con probabilidad p elevado a n.

Fórmula
34,87 %
2.000 cadenas simuladas · semilla 1
34,55 %
Intervalo al 95 %: de 32,50 % a 36,66 %
Probabilidad de cadena completa según el número de pasos, con acierto por paso 90,00 %.

Modelo matemático ilustrativo: pasos independientes, misma probabilidad de acierto y ningún error recuperable. No es una ley de los agentes ni una medición. Los agentes reales pueden corregirse, o equivocarse más en unos pasos que en otros.

Simulación 2 · gratuita, sin modelo

Cadena de pasos: propagar, verificar o calcular

Un inventario de juguete con tres productos y eventos de entrada, salida y transferencia. Un sistema simulado acierta cada paso con la probabilidad elegida. Se compara qué pasa si sus errores se arrastran, si un verificador los detecta y repara, y si lo calcula todo el programa.

MétricaEstado propagadoCon verificaciónControl algorítmico
Estado final correctoNoSíSí
Cadena sin ningún error propioNoNoNo aplica
Primer paso incorrecto72—
Reintentos tras aviso del verificador020
Reparaciones externas000
Llamadas al sistema10120
Ver la cadena completa

Inicio: A=5, B=5, C=20

  1. Se pasan 3 unidades de B a A
  2. Entran 7 unidades de B
  3. Entran 7 unidades de A
  4. Salen 4 unidades de A
  5. Entran 3 unidades de B
  6. Se pasan 2 unidades de A a C
  7. Entran 3 unidades de A
  8. Salen 1 unidades de C
  9. Se pasan 7 unidades de B a C
  10. Se pasan 5 unidades de B a C

La columna «con verificación» puede acabar bien gracias a las reparaciones externas: ese acierto es del sistema completo, no del modelo. Por eso se cuentan aparte. Aquí no hay ningún modelo de lenguaje: es una simulación para entender las métricas. La misma tarea con modelos reales está justo debajo.

Parte 2 · medido por nosotros

Resultados con modelos reales

Método:
LAB-CAD v1
Tandas:
2 (2026-10-07, 2026-10-07)
Llamadas:
3332

La misma cadena de inventario, resuelta por modelos reales en dos condiciones. «De golpe»: el modelo recibe todos los movimientos y da el inventario final. «Por tramos verificados»: recibe tramos de 5 movimientos, un verificador externo comprueba cada tramo, permite un reintento y, si vuelve a fallar, repara el estado. Esa reparación nunca cuenta como acierto. 30 cadenas por casilla y tanda; la segunda tanda usa cadenas nuevas. El intervalo es de Wilson al 95 %.

Cómo leer la tabla. Cada modelo aparece dos veces: una con cadenas de 10 pasos y otra con cadenas de 30. «30/30» son los aciertos sobre 30 cadenas. El paréntesis es el margen al 95 %: con solo 30 cadenas, 30/30 no prueba que el modelo sea perfecto, solo que su acierto real probablemente está entre el 89 % y el 100 %. «Reparaciones: 0» significa que el verificador nunca tuvo que corregirlo.

Tanda 1 · 2026-10-07 (1674 llamadas, cadenas distintas en cada tanda)

ModeloPasos de la cadenaDe golpe: final correctoPor tramos: sin ninguna reparaciónReparaciones
GPT-5.4 nano100/30 (0 %–11 %)0/30 (0 %–11 %)58
GPT-5.4 nano300/30 (0 %–11 %)0/30 (0 %–11 %)165
Gemini 3.1 Flash Lite100/30 (0 %–11 %)5/30 (7 %–34 %)33
Gemini 3.1 Flash Lite300/30 (0 %–11 %)0/30 (0 %–11 %)77
GPT-5.4 mini100/30 (0 %–11 %)8/30 (14 %–44 %)29
GPT-5.4 mini300/30 (0 %–11 %)1/30 (1 %–17 %)82
Gemini 3.7 Flash1030/30 (89 %–100 %)30/30 (89 %–100 %)0
Gemini 3.7 Flash3030/30 (89 %–100 %)30/30 (89 %–100 %)0

Tanda 2 · 2026-10-07 (1658 llamadas, cadenas distintas en cada tanda)

ModeloPasos de la cadenaDe golpe: final correctoPor tramos: sin ninguna reparaciónReparaciones
GPT-5.4 nano100/30 (0 %–11 %)0/30 (0 %–11 %)52
GPT-5.4 nano300/30 (0 %–11 %)0/30 (0 %–11 %)160
Gemini 3.1 Flash Lite101/30 (1 %–17 %)9/30 (17 %–48 %)28
Gemini 3.1 Flash Lite300/30 (0 %–11 %)0/30 (0 %–11 %)82
GPT-5.4 mini100/30 (0 %–11 %)6/30 (10 %–37 %)25
GPT-5.4 mini300/30 (0 %–11 %)2/30 (2 %–21 %)69
Gemini 3.7 Flash1030/30 (89 %–100 %)30/30 (89 %–100 %)0
Gemini 3.7 Flash3030/30 (89 %–100 %)30/30 (89 %–100 %)0

Lectura: la segunda tanda confirma la primera. Los tres modelos pequeños casi nunca terminan bien una cadena de golpe: 1 de 360 intentos entre las dos tandas. La verificación externa no los vuelve fiables: los errores se evitan porque el verificador los detecta y los repara. Gemini 3.7 Flash, el modelo más capaz, acertó todas las cadenas en ambas condiciones y en las dos tandas. En esta tarea, elegir el modelo influyó mucho más que verificar por tramos.

Límites: una sola tarea aritmética, una sola redacción de instrucciones, parámetros por defecto de cada modelo y dos tandas del mismo día. No es una clasificación general de modelos ni dice nada de otras tareas. Los modelos cambian con el tiempo.

Apunte opcional Caos con reglas conocidas

Sistema de Lorenz (σ=10, ρ=28, β=8/3) integrado con el método RK4. Dos trayectorias parten casi del mismo punto: con reglas exactas y conocidas, la diferencia crece hasta hacerlas imprevisibles.

Coordenada x de las dos trayectorias a lo largo de 30 unidades de tiempo.
Distancia entre trayectorias (escala logarítmica). La línea clara usa la mitad de paso temporal: el método numérico también cambia el resultado a largo plazo.

Esta simulación ilustra caos determinista. Los experimentos con modelos de lenguaje miden otros fenómenos: que un modelo cambie su respuesta no demuestra caos matemático. El cálculo con decimales de ordenador tampoco es la verdad física exacta.

¿Y ahora?

Fuentes e inspiración

  • Inspiración: vídeo de Oliver Nabani (YouTube). Es una adaptación independiente, no reproduce sus experimentos.
  • Tareas largas: METR, 2025. Los pasos de esta simulación no equivalen a horas de trabajo humano.
  • Autoconsistencia y votación: Wang et al., 2022.