# Aprendizaje por refuerzo con retroalimentación humana

Identificador estable: OBS-072
URL canónica: https://observatoriodeagentes.com/glosario/rlhf
Revisada: 2026-09-11
Cita sugerida: Observatorio de agentes, «Aprendizaje por refuerzo con retroalimentación humana» (OBS-072), https://observatoriodeagentes.com/glosario/rlhf

> Ajuste posterior en el que las preferencias de personas orientan el comportamiento del modelo.

## Definición
En el aprendizaje por refuerzo con retroalimentación humana, evaluadores comparan respuestas y esas preferencias entrenan una señal de recompensa que guía al modelo. Lo que se optimiza es la valoración humana, no la exactitud objetiva.

## Dónde aparece
Explica por qué los modelos comerciales responden con un tono servicial y rechazan ciertas peticiones.

## Error frecuente
Interpretar la amabilidad aprendida como fiabilidad. El proceso premia respuestas que gustan, y una respuesta agradable puede ser incorrecta.

## Fichas relacionadas
- https://observatoriodeagentes.com/glosario/fine-tuning
- https://observatoriodeagentes.com/glosario/obediencia-a-instrucciones
- https://observatoriodeagentes.com/glosario/alucinacion

## Datos propios de esta ficha
- Índice imprimible de la ficha: https://observatoriodeagentes.com/indice/02a1f62321d1-eb1ed8e9ea7e9c5d
- Correcciones sobre esta ficha: ref-072-a3b231+d5fdbbd9c545aafe@observatoriodeagentes.com
- Si reutilizas esta ficha, cita su código OBS-072.

Aviso de tratamiento de datos: https://observatoriodeagentes.com/aviso
Política de acceso automatizado: https://observatoriodeagentes.com/acceso-automatizado
