Modelo multimodal
multimodal · vision-language model · VLM
En corto
Un modelo multimodal puede procesar más de un tipo de entrada en la misma solicitud, más comúnmente texto junto con imágenes, y cada vez más audio y video. Las entradas no textuales se convierten en la misma representación interna que los tokens, razón por la cual una sola imagen puede consumir una parte sustancial de la ventana de contexto.
Un modelo multimodal maneja entradas de diferentes tipos en una sola solicitud: preguntar sobre un gráfico, transcribir y responder a partir de audio, o leer una captura de pantalla de un mensaje de error.
Mecánicamente, la entrada no textual se pasa a través de un codificador que produce vectores en el mismo espacio que consume el modelo de lenguaje. Desde la perspectiva del modelo, hay una sola secuencia; la imagen simplemente llega como un bloque de posiciones dentro de ella.
Eso tiene una consecuencia práctica directa: las imágenes consumen presupuesto de contexto. Una captura de pantalla de alta resolución puede costar tanto de la ventana de contexto como varias páginas de texto, y la misma cantidad en facturación. Reducir la escala antes de enviar suele ser un ahorro gratuito y neutral en cuanto a precisión para tareas que no dependen de detalles finos.
La capacidad es desigual de maneras que vale la pena probar en lugar de asumir. Leer texto en una imagen, describir una escena e interpretar un diagrama son habilidades diferentes con diferente fiabilidad. Las tablas densas, la escritura a mano y los gráficos donde la respuesta depende de la comparación precisa de valores siguen siendo los puntos débiles: el modelo puede producir un número con confianza que simplemente se ha leído mal.
Preguntas frecuentes
- ¿Cuánto de la ventana de contexto utiliza una imagen?
- Depende de la resolución y del esquema de codificación del proveedor, pero una captura de pantalla de página completa suele costar del orden de mil tokens o más. Consulte la fórmula del proveedor antes de enviar imágenes en masa.
- ¿Pueden los modelos multimodales generar imágenes tan bien como leerlas?
- La lectura y la generación son capacidades separadas. Muchos modelos aceptan imágenes como entrada mientras producen solo texto; la generación de imágenes suele ser un modelo distinto, a veces invocado como una herramienta.