Laboratorio
Laboratorio de fiabilidad
Aquí se explica, con números, por qué un agente falla más cuanto más larga es la tarea y qué aporta comprobar cada paso. Puedes jugar con las simulaciones; los resultados reales los medimos nosotros y aquí solo se consultan.
Parte 1 · juegas tú
Simulaciones
Cálculos en tu navegador. No usan ninguna IA, no cuestan nada y dan siempre el mismo resultado con la misma semilla.
Parte 2 · medido por nosotros
Resultados con modelos reales
Una tanda ejecutada una vez, con método, fecha y versión fijos. La página no llama a ningún modelo.
No confundir con el banco de pruebas (personas y programas participan), ni con el protocolo PI-001 (evaluamos agentes en webs). El Laboratorio explica por qué fallan.
Simulación 1 · gratuita, sin modelo
¿Por qué fallan más las tareas largas?
Si cada paso sale bien con probabilidad p y los pasos son independientes, una cadena de n pasos sale entera bien con probabilidad p elevado a n.
- Fórmula
- 34,87 %
- 2.000 cadenas simuladas · semilla 1
- 34,55 %
- Intervalo al 95 %: de 32,50 % a 36,66 %
Modelo matemático ilustrativo: pasos independientes, misma probabilidad de acierto y ningún error recuperable. No es una ley de los agentes ni una medición. Los agentes reales pueden corregirse, o equivocarse más en unos pasos que en otros.
Simulación 2 · gratuita, sin modelo
Cadena de pasos: propagar, verificar o calcular
Un inventario de juguete con tres productos y eventos de entrada, salida y transferencia. Un sistema simulado acierta cada paso con la probabilidad elegida. Se compara qué pasa si sus errores se arrastran, si un verificador los detecta y repara, y si lo calcula todo el programa.
| Métrica | Estado propagado | Con verificación | Control algorítmico |
|---|---|---|---|
| Estado final correcto | No | Sí | Sí |
| Cadena sin ningún error propio | No | No | No aplica |
| Primer paso incorrecto | 7 | 2 | — |
| Reintentos tras aviso del verificador | 0 | 2 | 0 |
| Reparaciones externas | 0 | 0 | 0 |
| Llamadas al sistema | 10 | 12 | 0 |
Ver la cadena completa
Inicio: A=5, B=5, C=20
- Se pasan 3 unidades de B a A
- Entran 7 unidades de B
- Entran 7 unidades de A
- Salen 4 unidades de A
- Entran 3 unidades de B
- Se pasan 2 unidades de A a C
- Entran 3 unidades de A
- Salen 1 unidades de C
- Se pasan 7 unidades de B a C
- Se pasan 5 unidades de B a C
La columna «con verificación» puede acabar bien gracias a las reparaciones externas: ese acierto es del sistema completo, no del modelo. Por eso se cuentan aparte. Aquí no hay ningún modelo de lenguaje: es una simulación para entender las métricas. La misma tarea con modelos reales está justo debajo.
Parte 2 · medido por nosotros
Resultados con modelos reales
- Método:
- LAB-CAD v1
- Tandas:
- 2 (2026-10-07, 2026-10-07)
- Llamadas:
- 3332
La misma cadena de inventario, resuelta por modelos reales en dos condiciones. «De golpe»: el modelo recibe todos los movimientos y da el inventario final. «Por tramos verificados»: recibe tramos de 5 movimientos, un verificador externo comprueba cada tramo, permite un reintento y, si vuelve a fallar, repara el estado. Esa reparación nunca cuenta como acierto. 30 cadenas por casilla y tanda; la segunda tanda usa cadenas nuevas. El intervalo es de Wilson al 95 %.
Tanda 1 · 2026-10-07 (1674 llamadas, cadenas distintas en cada tanda)
| Modelo | Pasos de la cadena | De golpe: final correcto | Por tramos: sin ninguna reparación | Reparaciones |
|---|---|---|---|---|
| GPT-5.4 nano | 10 | 0/30 (0 %–11 %) | 0/30 (0 %–11 %) | 58 |
| GPT-5.4 nano | 30 | 0/30 (0 %–11 %) | 0/30 (0 %–11 %) | 165 |
| Gemini 3.1 Flash Lite | 10 | 0/30 (0 %–11 %) | 5/30 (7 %–34 %) | 33 |
| Gemini 3.1 Flash Lite | 30 | 0/30 (0 %–11 %) | 0/30 (0 %–11 %) | 77 |
| GPT-5.4 mini | 10 | 0/30 (0 %–11 %) | 8/30 (14 %–44 %) | 29 |
| GPT-5.4 mini | 30 | 0/30 (0 %–11 %) | 1/30 (1 %–17 %) | 82 |
| Gemini 3.7 Flash | 10 | 30/30 (89 %–100 %) | 30/30 (89 %–100 %) | 0 |
| Gemini 3.7 Flash | 30 | 30/30 (89 %–100 %) | 30/30 (89 %–100 %) | 0 |
Tanda 2 · 2026-10-07 (1658 llamadas, cadenas distintas en cada tanda)
| Modelo | Pasos de la cadena | De golpe: final correcto | Por tramos: sin ninguna reparación | Reparaciones |
|---|---|---|---|---|
| GPT-5.4 nano | 10 | 0/30 (0 %–11 %) | 0/30 (0 %–11 %) | 52 |
| GPT-5.4 nano | 30 | 0/30 (0 %–11 %) | 0/30 (0 %–11 %) | 160 |
| Gemini 3.1 Flash Lite | 10 | 1/30 (1 %–17 %) | 9/30 (17 %–48 %) | 28 |
| Gemini 3.1 Flash Lite | 30 | 0/30 (0 %–11 %) | 0/30 (0 %–11 %) | 82 |
| GPT-5.4 mini | 10 | 0/30 (0 %–11 %) | 6/30 (10 %–37 %) | 25 |
| GPT-5.4 mini | 30 | 0/30 (0 %–11 %) | 2/30 (2 %–21 %) | 69 |
| Gemini 3.7 Flash | 10 | 30/30 (89 %–100 %) | 30/30 (89 %–100 %) | 0 |
| Gemini 3.7 Flash | 30 | 30/30 (89 %–100 %) | 30/30 (89 %–100 %) | 0 |
Lectura: la segunda tanda confirma la primera. Los tres modelos pequeños casi nunca terminan bien una cadena de golpe: 1 de 360 intentos entre las dos tandas. La verificación externa no los vuelve fiables: los errores se evitan porque el verificador los detecta y los repara. Gemini 3.7 Flash, el modelo más capaz, acertó todas las cadenas en ambas condiciones y en las dos tandas. En esta tarea, elegir el modelo influyó mucho más que verificar por tramos.
Límites: una sola tarea aritmética, una sola redacción de instrucciones, parámetros por defecto de cada modelo y dos tandas del mismo día. No es una clasificación general de modelos ni dice nada de otras tareas. Los modelos cambian con el tiempo.
Apunte opcional Caos con reglas conocidas
Sistema de Lorenz (σ=10, ρ=28, β=8/3) integrado con el método RK4. Dos trayectorias parten casi del mismo punto: con reglas exactas y conocidas, la diferencia crece hasta hacerlas imprevisibles.
Esta simulación ilustra caos determinista. Los experimentos con modelos de lenguaje miden otros fenómenos: que un modelo cambie su respuesta no demuestra caos matemático. El cálculo con decimales de ordenador tampoco es la verdad física exacta.
¿Y ahora?
- Recibe los boletines para saber cuándo se repite la medición.
- Participa en el banco de pruebas con tu agente o programa.
- Para citar el dato: «Observatorio de Agentes, Laboratorio de fiabilidad, método LAB-CAD v1, 2026-10-07 y 2026-10-07».
Fuentes e inspiración
- Inspiración: vídeo de Oliver Nabani (YouTube). Es una adaptación independiente, no reproduce sus experimentos.
- Tareas largas: METR, 2025. Los pasos de esta simulación no equivalen a horas de trabajo humano.
- Autoconsistencia y votación: Wang et al., 2022.