Microsoft IA MM-REACT
Blog

Microsoft AI propõe MM-REACT: um sistema para raciocínio e ação multimodal avançados

Os Large Language Models (LLMs) estão impulsionando transformações econômicas e sociais notáveis ​​à medida que continuam a avançar rapidamente. Entre muitos ferramentas de inteligência artificial (IA) lançado na internet, ChatGPT tornou-se cada vez mais popular nos últimos meses. ChatGPT é um modelo de processamento de linguagem natural que gera texto significativo semelhante ao dos humanos. Baseado na arquitetura do transformador GPT, ele é alimentado pelo mais recente modelo de linguagem, GPT-4, desenvolvido por OpenAI.

A visão computacional também avançou exponencialmente com a mais recente Inteligência Artificial e Machine Learning desenvolvimentos, graças à arquitetura de rede aprimorada e ao treinamento de modelos em larga escala. Recentemente, os pesquisadores introduziu MM-REACT, um paradigma de sistema que combina múltiplos especialistas em visão com ChatGPT para raciocínio e ação multimodais avançados. Ao integrar modelos de visão individuais com o modelo de linguagem de uma forma mais flexível, o MM-REACT pode superar desafios complicados de compreensão visual.

O MM-REACT foi projetado para lidar com uma ampla gama de tarefas visuais complexas que a visão e a modelos de linguagem de visão luta com. Para conseguir isso, o MM-REACT usa design de prompt para representar vários tipos de informação, como descrições de texto, coordenadas espaciais textualizadas e sinais visuais densos, como imagens e vídeos, representados como nomes de arquivo alinhados. Este design permite que o ChatGPT aceite e processe diferentes tipos de informação em combinação com informações visuais, levando a uma compreensão mais precisa e abrangente.

O MM-REACT combina as habilidades do ChatGPT com um grupo de especialistas em visão para adicionar funcionalidades multimodais. O caminho do arquivo é usado como um espaço reservado e inserido no ChatGPT para permitir que o sistema aceitar imagens como entrada.

Sempre que o sistema requer informações específicas da imagem, como identificar um nome de celebridade ou coordenadas de caixa, o ChatGPT busca ajuda de um especialista em visão específico. A saída do especialista é então serializada como texto e combinada com a entrada para ativar ainda mais o ChatGPT. Se nenhum especialista externo for necessário, a resposta é retornada diretamente ao usuário.

Para permitir que o ChatGPT entenda o uso dos especialistas em visão, instruções relacionadas à capacidade de cada especialista, tipo de argumento de entrada e tipo de saída, juntamente com alguns exemplos em contexto para cada especialista, foram adicionadas aos prompts do ChatGPT. Além disso, uma palavra de ordem especial é instruída para usar a correspondência de expressão regex para invocar o perito em conformidade.

Experimentos de tiro zero demonstraram como o MM-REACT aborda efetivamente suas capacidades particulares de interesse. Ele provou ser eficiente na resolução de uma ampla gama de tarefas visuais avançadas que exigem compreensão visual complexa. Por exemplo, o MM-REACT pode fornecer soluções para equações lineares exibidas em uma imagem e executar a compreensão de conceitos nomeando produtos na imagem e seus ingredientes, entre outras coisas. Concluindo, esse paradigma de sistema combina muito a linguagem e a experiência em visão e é capaz de atingir inteligência visual avançada.

Qual é a sua reação?

Animado
0
Boa
0
in Love
0
Not Sure
0
Boba
0
David Green
David é um cientista pesquisador do Reino Unido. Com grande interesse em IA, ele está sempre procurando maneiras novas e inovadoras de aplicar a tecnologia. Quando não está trabalhando, ele gosta de tocar violão e compor sua própria música.

    Sugestões para você

    Mais em:Blog