{
  "slug": "inferencia",
  "term": "Inferencia",
  "summary": "Ejecución del modelo ya entrenado para producir una respuesta.",
  "definition": "La inferencia es la fase de uso: se envía el prompt, el modelo calcula y devuelve tokens uno tras otro. Consume cómputo cada vez, a diferencia del entrenamiento, que ocurre una sola vez.",
  "context": "Es lo que se factura y lo que el usuario percibe como velocidad de la aplicación.",
  "pitfalls": "Medir solo el tiempo total. Para la sensación de rapidez importa más cuándo llega el primer token que cuándo termina la respuesta.",
  "related": [
    "https://observatoriodeagentes.com/glosario/latencia-de-primer-token",
    "https://observatoriodeagentes.com/glosario/coste-por-mil-tokens",
    "https://observatoriodeagentes.com/glosario/cuantizacion"
  ],
  "ref_code": "OBS-020",
  "created_at": "2026-09-10T11:05:17.718181+00:00",
  "revised_at": "2026-09-10T11:05:17.718181+00:00",
  "canary_path": "5bbc2c3a9320-58817e485819875c",
  "canary_email": "ref-020-394af2+3a80b44d2e2d5aed@observatoriodeagentes.com",
  "published": "2026-09-10",
  "revised": "2026-09-10",
  "canonical": "https://observatoriodeagentes.com/glosario/inferencia",
  "markdown": "https://observatoriodeagentes.com/api/public/glosario/inferencia?formato=md",
  "index_page": "https://observatoriodeagentes.com/indice/5bbc2c3a9320-58817e485819875c",
  "license": "CC BY 4.0",
  "notice": "https://observatoriodeagentes.com/aviso",
  "policy": "https://observatoriodeagentes.com/acceso-automatizado",
  "citation": "Observatorio de agentes, «Inferencia» (OBS-020), https://observatoriodeagentes.com/glosario/inferencia"
}