§ Modelos & Famílias
Multimodal
Também conhecido como: multimodalidade
Multimodal significa que o modelo aceita ou produz mais do que um tipo de dados — texto, imagem, áudio, vídeo. GPT-5 e Claude Sonnet 4.5 aceitam imagens. Gemini 2.5 aceita vídeo. DALL·E, Midjourney e Stable Diffusion geram imagens a partir de texto. Sora e Veo geram vídeo. Modelos verdadeiramente multimodais (texto+imagem+áudio numa só rede) são o estado da arte; multimodal por pipeline (encadear modelos especialistas) ainda é mais comum em produção.
Termos relacionados
Aprender Multimodal na prática
O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).