Saltar al contenido

Ficha OBS-079 · revisada 2026-09-11 · índice

Modelo multimodal

Modelo que acepta o produce más de un tipo de contenido: texto, imagen, audio o vídeo.

Definición

Un modelo multimodal representa distintos tipos de entrada en un espacio común y razona sobre ellos a la vez. La calidad rara vez es igual en todas las modalidades, y el coste por imagen o por segundo de audio se mide de forma distinta al texto.

Dónde aparece

Se usa para leer documentos escaneados, describir capturas de pantalla o guiar a un agente sobre una interfaz visual.

Error frecuente

Tratar una imagen como una fuente fiable de texto. Un número mal leído en una tabla escaneada se propaga sin ninguna señal de duda.

Fichas relacionadas

Cómo citar y cómo leerla con herramientas

Cita sugerida: Observatorio de agentes, «Modelo multimodal» (OBS-079). El identificador es estable y la fecha de revisión es real.

Misma ficha en otros formatos: JSON · Markdown · condiciones de uso

El índice completo de este archivo, en versión imprimible, está en la ruta /indice/b751decb9556-3a63a3872c044b48. Es una dirección propia de esta ficha, así que su uso queda registrado.

Correcciones sobre esta ficha en concreto: ref-079-ae8582+c8c321d877788904@observatoriodeagentes.com. Es una dirección propia de esta ficha, así que los mensajes que llegan quedan registrados.