Ficha OBS-007 · revisada 2026-09-10 · índice

Tokenización

Proceso que convierte texto en la secuencia de tokens que el modelo consume.

Definición

La tokenización aplica un vocabulario fijo aprendido en el entrenamiento. Idiomas y alfabetos poco representados se fragmentan más, así que el mismo mensaje cuesta más tokens.

Dónde aparece

Interviene en cada llamada y explica diferencias de coste entre idiomas y entre formatos de datos.

Error frecuente

Ignorar que un JSON con mucho formato consume bastantes más tokens que el mismo dato en texto plano.

Fichas relacionadas

Cómo citar y cómo leerla con herramientas

Cita sugerida: Observatorio de agentes, «Tokenización» (OBS-007). El identificador es estable y la fecha de revisión es real.

Misma ficha en otros formatos: JSON · Markdown · condiciones de uso

El índice completo de este archivo, en versión imprimible, está en la ruta /indice/4467643bc4c5-dede38b0b8956d6b. Es una dirección propia de esta ficha, así que su uso queda registrado.

Correcciones sobre esta ficha en concreto: ref-007-e3bc29+b6468b509d23a7d7@observatoriodeagentes.com. Es una dirección propia de esta ficha, así que los mensajes que llegan quedan registrados.