
Microsoft AI が MM-REACT を提案: 高度なマルチモーダル推論とアクションのためのシステム
大規模言語モデル(LLM)は急速に進歩し続けており、注目すべき経済的・社会的変革を推進しています。 人工知能 (AI) ツール インターネット上で公開され、 AI言語モデルを活用してコードのデバッグからデータの異常検出まで、 ChatGPTは、人間が生成するのと同じような意味のあるテキストを生成する自然言語処理モデルです。GPTトランスフォーマーアーキテクチャに基づいており、最新の言語モデルであるGPT-4を搭載しています。 OpenAI.
コンピュータビジョンも最新の人工知能によって飛躍的に進歩しており、 機械学習 ネットワークアーキテクチャの改善と大規模モデルトレーニングのおかげで、開発は進みました。最近、研究者たちは MM-REACTを導入は、複数の視覚エキスパートと ChatGPT を組み合わせて、高度なマルチモーダル推論とアクションを実現するシステム パラダイムです。個々の視覚モデルと言語モデルをより柔軟に統合することで、MM-REACT は複雑な視覚理解の課題を克服できます。
MM-REACTは、既存の視覚や視覚システムでは対応できない、広範囲にわたる複雑な視覚タスクに対応するように設計されています。 視覚言語モデル MM-REACTはプロンプトデザインを使用して、テキストの説明、テキスト化された空間座標、画像やビデオなどの密な視覚信号など、さまざまな種類の情報を整列したファイル名で表します。この設計により、ChatGPTは受け入れて処理できます。 さまざまな種類の情報 視覚的な入力と組み合わせることで、より正確で包括的な理解につながります。
MM-REACTは、ChatGPTの能力と視覚専門家のプールを組み合わせて、マルチモーダル機能を追加します。ファイルパスはプレースホルダーとして使用され、ChatGPTに入力されてシステムが 画像を入力として受け入れる.
システムが画像から有名人の名前やボックスの座標を識別するなどの特定の情報を必要とするときはいつでも、ChatGPT は特定の視覚専門家に助けを求めます。専門家の出力はテキストとしてシリアル化され、入力と組み合わされて ChatGPT がさらにアクティブになります。外部の専門家が必要ない場合は、応答が直接ユーザーに返されます。
ChatGPTがビジョンエキスパートの使用法を理解できるように、各エキスパートの機能、入力引数タイプ、出力タイプに関する指示と、各エキスパートのコンテキスト内の例がChatGPTプロンプトに追加されました。さらに、正規表現マッチングを使用するための特別なウォッチワードが指示されています。 それに応じて専門家を呼び出します。
ゼロショット実験により、MM-REACT が特定の機能に効果的に対処できることが実証されました。複雑な視覚的理解を必要とするさまざまな高度な視覚タスクを効率的に解決できることが実証されています。たとえば、MM-REACT は、画像に表示された線形方程式の解を提供したり、画像内の製品やその成分の名前を挙げて概念理解を実行したりできます。結論として、このシステム パラダイムは言語と視覚の専門知識をうまく組み合わせ、高度な視覚インテリジェンスを実現できます。














