Skip to content
モデル・研究

マルチモーダルモデル

multimodal · vision-language model · VLM

ひとことで

マルチモーダルモデルは、同じリクエスト内で複数種類の入力を処理できます。一般的にはテキストと画像の組み合わせですが、徐々に音声や動画も含まれるようになっています。非テキスト入力は、トークンと同じ内部表現に変換されるため、単一の画像がコンテキストウィンドウの大きな割合を占めることがあります。

マルチモーダルモデルは、チャートについて質問したり、音声を文字起こしして答えたり、エラーメッセージのスクリーンショットを読んだりと、異なる種類の入力を一つのリクエストで処理します。機械的には、テキスト以外の入力はエンコーダを通して、言語モデルが消費するのと同じ空間のベクトルに変換されます。モデルから見ると、すべてが一つのシーケンスとして扱われ、画像はその中の位置のブロックとして現れます。直接的な実用的な結果として、画像はコンテキスト予算を消費することになります。高解像度のスクリーンショットは、数ページ分のテキストと同じだけのコンテキストウィンドウを占め、請求でも同等のコストがかかります。細部に依存しないタスクでは、送信前にダウンスケーリングすることで、費用がかからず、精度に影響のない節約が可能です。能力は偏りがあり、仮定するのではなくテストすべき側面があります。画像内のテキスト読み取り、シーンの説明、図の解釈は異なるスキルで、信頼性も異なります。密集した表、手書き文字、正確な値比較に依存するチャートは弱点の一つで、モデルは自信に満ちた数値を出力することがありますが、単に誤読しているだけです。

よくある質問

画像はコンテキストウィンドウのどの程度を占めますか?
解像度やプロバイダーのエンコーディング方式によって異なりますが、フルページのスクリーンショットは通常、数千トークン以上のコストがかかります。一括で画像を送信する前に、プロバイダーの計算式を確認してください。
マルチモーダルモデルは画像を生成できるだけでなく読むこともできるのか?
読み取りと生成は別々の機能です。多くのモデルは画像を入力として受け取りますが、テキストだけを出力します。画像生成は別個のモデルとして扱われることが多く、時にツールとして呼び出されます。

関連語

2026年8月22日 最終更新