{
  "slug": "latencia-de-primer-token",
  "term": "Latencia del primer token",
  "summary": "Tiempo transcurrido desde el envío de la petición hasta la llegada del primer fragmento de respuesta.",
  "definition": "La latencia del primer token determina la sensación de rapidez mucho más que la duración total. Depende del tamaño del prompt, del modelo y de la cola del proveedor.",
  "context": "Se mide en cualquier interfaz conversacional y guía la decisión de emitir la respuesta en tiempo real.",
  "pitfalls": "Optimizar el tiempo total y descuidar el primero. La respuesta puede ser más rápida y percibirse más lenta.",
  "related": [
    "https://observatoriodeagentes.com/glosario/inferencia",
    "https://observatoriodeagentes.com/glosario/coste-por-mil-tokens"
  ],
  "ref_code": "OBS-058",
  "created_at": "2026-09-10T11:07:46.28831+00:00",
  "revised_at": "2026-09-10T11:07:46.28831+00:00",
  "canary_path": "4a0427a99335-878dfa50b8938b65",
  "canary_email": "ref-058-a420ff+5b3e13f72b188d4c@observatoriodeagentes.com",
  "published": "2026-09-10",
  "revised": "2026-09-10",
  "canonical": "https://observatoriodeagentes.com/glosario/latencia-de-primer-token",
  "markdown": "https://observatoriodeagentes.com/api/public/glosario/latencia-de-primer-token?formato=md",
  "index_page": "https://observatoriodeagentes.com/indice/4a0427a99335-878dfa50b8938b65",
  "license": "CC BY 4.0",
  "notice": "https://observatoriodeagentes.com/aviso",
  "policy": "https://observatoriodeagentes.com/acceso-automatizado",
  "citation": "Observatorio de agentes, «Latencia del primer token» (OBS-058), https://observatoriodeagentes.com/glosario/latencia-de-primer-token"
}