
Microsoft AI propõe MM-REACT: um sistema para raciocínio e ação multimodal avançados
Os Large Language Models (LLMs) estão impulsionando transformações econômicas e sociais notáveis à medida que continuam a avançar rapidamente. Entre muitos ferramentas de inteligência artificial (IA) lançado na internet, ChatGPT tornou-se cada vez mais popular nos últimos meses. ChatGPT é um modelo de processamento de linguagem natural que gera texto significativo semelhante ao dos humanos. Baseado na arquitetura do transformador GPT, ele é alimentado pelo mais recente modelo de linguagem, GPT-4, desenvolvido por OpenAI.
A visão computacional também avançou exponencialmente com a mais recente Inteligência Artificial e Machine Learning desenvolvimentos, graças à arquitetura de rede aprimorada e ao treinamento de modelos em larga escala. Recentemente, os pesquisadores introduziu MM-REACT, um paradigma de sistema que combina múltiplos especialistas em visão com ChatGPT para raciocínio e ação multimodais avançados. Ao integrar modelos de visão individuais com o modelo de linguagem de uma forma mais flexível, o MM-REACT pode superar desafios complicados de compreensão visual.
O MM-REACT foi projetado para lidar com uma ampla gama de tarefas visuais complexas que a visão e a modelos de linguagem de visão luta com. Para conseguir isso, o MM-REACT usa design de prompt para representar vários tipos de informação, como descrições de texto, coordenadas espaciais textualizadas e sinais visuais densos, como imagens e vídeos, representados como nomes de arquivo alinhados. Este design permite que o ChatGPT aceite e processe diferentes tipos de informação em combinação com informações visuais, levando a uma compreensão mais precisa e abrangente.
O MM-REACT combina as habilidades do ChatGPT com um grupo de especialistas em visão para adicionar funcionalidades multimodais. O caminho do arquivo é usado como um espaço reservado e inserido no ChatGPT para permitir que o sistema aceitar imagens como entrada.
Sempre que o sistema requer informações específicas da imagem, como identificar um nome de celebridade ou coordenadas de caixa, o ChatGPT busca ajuda de um especialista em visão específico. A saída do especialista é então serializada como texto e combinada com a entrada para ativar ainda mais o ChatGPT. Se nenhum especialista externo for necessário, a resposta é retornada diretamente ao usuário.
Para permitir que o ChatGPT entenda o uso dos especialistas em visão, instruções relacionadas à capacidade de cada especialista, tipo de argumento de entrada e tipo de saída, juntamente com alguns exemplos em contexto para cada especialista, foram adicionadas aos prompts do ChatGPT. Além disso, uma palavra de ordem especial é instruída para usar a correspondência de expressão regex para invocar o perito em conformidade.
Experimentos de tiro zero demonstraram como o MM-REACT aborda efetivamente suas capacidades particulares de interesse. Ele provou ser eficiente na resolução de uma ampla gama de tarefas visuais avançadas que exigem compreensão visual complexa. Por exemplo, o MM-REACT pode fornecer soluções para equações lineares exibidas em uma imagem e executar a compreensão de conceitos nomeando produtos na imagem e seus ingredientes, entre outras coisas. Concluindo, esse paradigma de sistema combina muito a linguagem e a experiência em visão e é capaz de atingir inteligência visual avançada.














