Devs & IA
Termo de IA

Multimodal

Modelos que entendem mais de um tipo de dado: texto, imagem, áudio, vídeo.

Multimodal descreve um modelo que trabalha com mais de um tipo de dado — não só texto, mas também imagem, áudio ou vídeo, muitas vezes de forma combinada. Um modelo multimodal pode descrever uma foto, ler um gráfico numa captura de tela, transcrever fala ou gerar imagem a partir de texto.

Por que importa: abre casos de uso que texto puro não alcança. Você pode mandar o print de um erro e pedir explicação, enviar a foto de um rascunho e pedir o código da interface, ou dar um PDF cheio de tabelas e imagens para análise. Para quem projeta ou analisa, é a ponte entre o que está na tela e o que a IA consegue processar. O cuidado é o de sempre: a IA pode ler a imagem errado com a mesma confiança com que lê o texto errado — conferir continua sendo obrigatório.

Termos relacionados