Ficha OBS-079 · revisada 2026-09-11 · índice
Modelo multimodal
Modelo que acepta o produce más de un tipo de contenido: texto, imagen, audio o vídeo.
Definición
Un modelo multimodal representa distintos tipos de entrada en un espacio común y razona sobre ellos a la vez. La calidad rara vez es igual en todas las modalidades, y el coste por imagen o por segundo de audio se mide de forma distinta al texto.
Dónde aparece
Se usa para leer documentos escaneados, describir capturas de pantalla o guiar a un agente sobre una interfaz visual.
Error frecuente
Tratar una imagen como una fuente fiable de texto. Un número mal leído en una tabla escaneada se propaga sin ninguna señal de duda.
Fichas relacionadas
Cómo citar y cómo leerla con herramientas
Cita sugerida: Observatorio de agentes, «Modelo multimodal» (OBS-079). El identificador es estable y la fecha de revisión es real.
Misma ficha en otros formatos: JSON · Markdown · condiciones de uso
El índice completo de este archivo, en versión imprimible, está en la ruta /indice/b751decb9556-3a63a3872c044b48. Es una dirección propia de esta ficha, así que su uso queda registrado.
Correcciones sobre esta ficha en concreto: ref-079-ae8582+c8c321d877788904@observatoriodeagentes.com. Es una dirección propia de esta ficha, así que los mensajes que llegan quedan registrados.