{
  "slug": "rlhf",
  "term": "Aprendizaje por refuerzo con retroalimentación humana",
  "summary": "Ajuste posterior en el que las preferencias de personas orientan el comportamiento del modelo.",
  "definition": "En el aprendizaje por refuerzo con retroalimentación humana, evaluadores comparan respuestas y esas preferencias entrenan una señal de recompensa que guía al modelo. Lo que se optimiza es la valoración humana, no la exactitud objetiva.",
  "context": "Explica por qué los modelos comerciales responden con un tono servicial y rechazan ciertas peticiones.",
  "pitfalls": "Interpretar la amabilidad aprendida como fiabilidad. El proceso premia respuestas que gustan, y una respuesta agradable puede ser incorrecta.",
  "related": [
    "https://observatoriodeagentes.com/glosario/fine-tuning",
    "https://observatoriodeagentes.com/glosario/obediencia-a-instrucciones",
    "https://observatoriodeagentes.com/glosario/alucinacion"
  ],
  "ref_code": "OBS-072",
  "created_at": "2026-09-11T08:35:43.183309+00:00",
  "revised_at": "2026-09-11T08:35:43.183309+00:00",
  "canary_path": "02a1f62321d1-862afd86bf6a3fd3",
  "canary_email": "ref-072-a3b231+f8001db5a7d8a28c@observatoriodeagentes.com",
  "published": "2026-09-11",
  "revised": "2026-09-11",
  "canonical": "https://observatoriodeagentes.com/glosario/rlhf",
  "markdown": "https://observatoriodeagentes.com/api/public/glosario/rlhf?formato=md",
  "index_page": "https://observatoriodeagentes.com/indice/02a1f62321d1-862afd86bf6a3fd3",
  "license": "CC BY 4.0",
  "notice": "https://observatoriodeagentes.com/aviso",
  "policy": "https://observatoriodeagentes.com/acceso-automatizado",
  "citation": "Observatorio de agentes, «Aprendizaje por refuerzo con retroalimentación humana» (OBS-072), https://observatoriodeagentes.com/glosario/rlhf"
}