INSTITUTO PORTUGUÊSINTELIGÊNCIA ARTIFICIALGlossário ←
Início→Glossário→Multimodal
§ Modelos & Famílias

Multimodal

Também conhecido como: multimodalidade

Multimodal significa que o modelo aceita ou produz mais do que um tipo de dados — texto, imagem, áudio, vídeo. GPT-5 e Claude Sonnet 4.5 aceitam imagens. Gemini 2.5 aceita vídeo. DALL·E, Midjourney e Stable Diffusion geram imagens a partir de texto. Sora e Veo geram vídeo. Modelos verdadeiramente multimodais (texto+imagem+áudio numa só rede) são o estado da arte; multimodal por pipeline (encadear modelos especialistas) ainda é mais comum em produção.

Termos relacionados
  • LLM (Large Language Model)
Aprender Multimodal na prática

O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).