大規模言語モデルが流暢になっていく一方で、その世界理解はずっと狭いままでした。ほぼすべてをテキスト——文書、プロンプト、書き起こし——に頼り、トーンや環境、物理的な文脈は切り離されていました。結果は印象的でしたが、脆いものでした。システムは知的に聞こえながら、現実を日常的に誤解していました。

その限界は、いまマルチモーダルAI——テキストと画像、音声、動画、そしてモーション、深度、空間的文脈といったセンサーベースのデータを組み合わせるモデル——によって解消されつつあります。

この変化は、しばしば技術的なアップグレードとして語られます。しかし実際には、知能がどうデザインされ、どう知覚され、どう信頼されるかという次元の変化です。

前史:流行る前のマルチモーダル

複数の信号を組み合わせることで知能が向上するという発想自体は、新しいものではありません。1990年代後半から2000年代初頭にかけて、ヒューマンコンピュータインタラクションと認知科学の研究者たちは、人間が曖昧さを減らすために重なり合う感覚的手がかりに頼っていることを示していました。表情だけでは信頼できません。声のトーンが助けになります。発話だけでは曖昧です。身振りがそれを明確にします。

初期のAIシステムは、この知見を試していました。MIT Media Labのような機関でのアフェクティブ・コンピューティング研究は、表情認識と音声分析を組み合わせて感情状態を推測していました。ロボティクス研究室は、視覚と触覚センサーを融合し、機械がより確実に物をつかめるようにしました。これらのシステムは機能していましたが、対象が狭く、コストが高く、スケールさせるのが困難でした。

2023年前後に変わったのは、発想そのものではなく、インフラでした。

基盤モデルが方程式を変える

大規模基盤モデルの登場は、転換点になりました。個別のタスクごとに個別のモデルを訓練する代わりに、企業は複数の領域にまたがる共有表現を学習する汎用モデルを構築し始めました。

2023年にリリースされたOpenAIのGPT-4は、テキストに加えて画像入力を受け付けた、初期の広く普及したモデルの一つでした。デモでは、ユーザーがホワイトボードや冷蔵庫、スケッチといった日常の物の写真をモデルに見せ、単なる画像キャプション生成をはるかに超えた、文脈を踏まえた応答を受け取りました。モデルはピクセルを認識していただけではなく、状況について推論していたのです。

Google DeepMindは、テキスト、画像、音声、動画、コードにまたがるマルチモーダルシステムとして最初から設計されたGeminiで続きました。AnthropicのClaudeも、まもなく視覚能力を導入しました。同時にMeta AIは、テキスト、画像、音声、動画、深度データ、モーションセンサーデータという6つのモダリティを単一の埋め込み空間に整合させる研究モデル、ImageBindをリリースしています。

ImageBindの重要性は、消費者向けタスクでの性能にあるのではなく、その含意にあります。モダリティはもはや一対一で対にする必要がない、ということです。どんな信号も、他のどんな信号とも関連づけられます。

これは根本的な変化です。「言語にどう視覚を加えるか」ではなく、研究者たちはいま「どう知覚されるかにかかわらず、世界をどう一貫して表現するか」を問うています。

インタラクションからコンテキストへ

今日のAIプロダクトの多くは、いまだにインタラクション主導です。ユーザーが尋ね、システムが応答する。この型は、問題が明確に定義され、文脈が明示的である場合にはうまく機能します。

マルチモーダルシステムは、その前提を崩し始めています。

AIがスクリーンショットとサポートチケットを同時に分析できるなら、確認の質問はもう必要ありません。会議アシスタントが発話パターン、表情の手がかり、プレゼンテーションのスライドを組み合わせられるなら、促されなくても混乱や意見の相違を検知できます。システムが視覚的に、時間的に、空間的に、いま何が起きているかを観察できるなら、説明する負担はユーザーから離れていきます。

これが、マルチモーダルAIがますます「コンテキストアウェア」と呼ばれるようになっている理由です。

そして、これがデザインの重みを増している理由でもあります。

自明ではない入力の台頭

テキスト、画像、音声が見出しを賑わせる一方で、最も興味深いマルチモーダル研究の一部は、従来のUIの外側で起きています。

モーション、深度、温度、慣性計測ユニットといったセンサーデータは、ますます一級の入力として扱われています。ロボティクスでは、Google PaLM-Eのようなモデルが、視覚的知覚と自己受容感覚データを統合し、物理的な行動を計画します。自動運転では、AIシステムがカメラ映像、レーダー、ライダー、GPS、音声を融合させ、安全に関わる判断を下しています。

移動の領域を超えて、研究者たちは生体信号、環境データ、さらには化学的なセンシングを試しています。たとえば電子鼻は、分子シグネチャを解釈することでガス漏れや腐敗を検知でき、AIの知覚に生化学的な層を加えます。これらのシステムは今日、主に産業用途か実験段階にとどまっていますが、より大きな流れを示しています。物理世界に根ざした知能です。

デザイナーにとって、これは新しい問いを生みます。これらの入力は、ボタンやフォームを通じてやってくるものではありません。それらは環境的で、継続的で、多くの場合、目に見えません。

注意という、デザイン上の意思決定

システムがより多くの信号にアクセスできるようになるにつれ、制約となるのはもはやデータではなく、注意になります。

すべてのマルチモーダルシステムは、次を決めなければなりません。

  • どの信号が重要か
  • どれを無視できるか
  • コンテキストはどれだけ持続すべきか
  • いつ不確実性を表に出すべきか

これらの意思決定は、インターフェースのモックアップにはめったに現れません。しかし、どんな視覚的なディテールよりも、ユーザーの信頼を形づくります。一瞬の信号に過剰反応するシステムは、侵害的に感じられます。意味のある文脈を無視するシステムは、無能に感じられます。

ここで、デザインリーダーシップが重要になります。エンジニアは、モデルをより有能にできます。デザイナーは、その能力がどう表現され——あるいは、抑制されるかを決めます。

派手なデモより、静かなUX

最も説得力のあるマルチモーダル体験は、控えめである傾向があります。

よく設計されたシステムは、質問を減らします。目新しさを加えるのではなく、摩擦を減らします。選択的に介入します。

これは、AIがしばしばマーケティングされる方法とは逆行します。デモはスペクタクルを強調します。リアルタイムの音声、アニメーション化されたアバター、視覚エフェクト。しかし実際には、持続的な採用は、信頼でき、敬意を払っていると感じられるシステムから生まれます。

カスタマーサポートでは、マルチモーダルAIは、自分自身に注意を向けさせることなく、より速く問題を解決するときに最もうまく機能します。教育では、学習者に恥をかかせることなく混乱に気づくときに役立ちます。クリエイティブツールでは、プロセスを乗っ取ることなく意図を拡張するときに成功します。

マルチモーダルUXとは、より騒がしいUXではありません。より精密なUXです。

学術と産業が、収束しつつある——ぎこちなく

学術研究は長らく、頑健な知能への道としてマルチモーダルなグラウンディングを重視してきました。一方、産業界の採用は、コスト削減、自動化、差別化という別のインセンティブに駆動されています。

いま、これらの動機がぶつかり合っています。

ヘルスケア、教育、エンタープライズツールは、いずれもAIが文脈を欠くと苦しみます。同時に、システムがより多くを知覚するようになるにつれ、規制上・倫理上の懸念も高まります。表情分析、音声ストレス検知、生体推論には、現実的なリスクが伴います。

デザインは、これらの圧力が交差する地点に位置しています。能力を振る舞いへと翻訳する。境界線を定義する。

知覚するシステムに、信頼をデザインする

マルチモーダルAIへの信頼は、透明性に関する声明だけでは獲得できません。一貫性、抑制、そして回復可能性によって獲得されます。

ユーザーは、システムを次の基準で判断します。

  • どれくらいの頻度で間違えるか
  • どれくらいの自信を持って間違えるか
  • 異議を唱えられたとき、どう応答するか
  • 曖昧さを尊重しているか

より多くを見るシステムは、より少なくを前提としなければなりません。

この原則は、どんなモデルベンチマークよりも重要だと分かるかもしれません。

インターフェースから、状況認識へ

デザインは、時間とともに範囲を広げてきました。

  • 画面から、フローへ
  • フローから、システムへ
  • システムから、時間をまたぐ振る舞いへ

マルチモーダルAIは、この領域をさらに広い何かへと押し進めます。「状況認識」をデザインすることです。

システムは、いま何が起きていると考えているのか。その信念を支える根拠は何か。不確実性を、どう伝えるのか。どうやって、邪魔にならずにいるのか。

これらの問いは、新しいものではありません。しかし、いまや避けて通れません。

これから一年、マルチモーダルデザインで探求したいテーマ

マルチモーダルAIが成熟するにつれ、最も重要な問いはもはや、システムに何が「できるか」ではなくなっています。どう振る舞うか——何に気づき、何を記憶し、不完全な情報にどれだけの自信を持って行動するか、です。

現在の研究と初期のプロダクトのシグナルをもとに、次に最も探求したいマルチモーダルデザインの課題を、3つ挙げます。

1. プロンプトから、状況的トリガーへ

ほとんどのAIシステムは、いまだに尋ねられるのを待っています。

マルチモーダルなシステムでさえ、画像や音声、動画を、同じループへのより豊かな入力として扱っていることが多い——プロンプトが入り、応答が出る。しかしアフェクティブ・コンピューティングとコンテキストアウェアなシステムに関する研究は、別のモデルを示唆しています。明示的な要求ではなく、「摩擦のパターン」を認識することから知能が立ち上がる、というモデルです。

ためらい。繰り返し。トーンの変化。ペースの変化。

これらの信号は、すでに存在しています。デザイン上の課題は、検知そのものではなく、判断です。それはいつ重要なのか。介入が助けになるのはいつか。沈黙のほうがよいのはいつか。

私が関心を持っているのは、確信が高く、結果が重要な場合にだけ介入するシステムです。割り込む権利を、みずから獲得するシステム。その抑制をデザインすることが、この先のマルチモーダルの課題の中でも、とりわけ重要になるかもしれません。

2. 監視なきエフェメラルなマルチモーダル記憶

マルチモーダルAIは、自然と、より豊かな記憶を可能にします。何が言われたか、何が見られたか、どう言われたか、いつだったか。その能力は同時に、最大のリスクでもあります。

人間とAIのインタラクションに関する研究は一貫して、短命な記憶が有用性と信頼を向上させることを示していますが、多くのプロダクトはいまだに記憶を二択として扱っています。永久に保持するか、完全に破棄するかです。

私が関心を持っているのは、その中間です。モダリティをまたいで、エフェメラルに、減衰していく記憶。

システムが文脈を短く記憶し、デフォルトでは薄れさせ、ユーザーが意図的に重要なものだけを保存できるとしたら、どうでしょうか。雑談ではなく、意思決定。生の入力ではなく、結果。網羅的なログではなく、意図。

記憶を、形とライフスパンとアフォーダンスを持つ「素材」としてデザインすることは、この領域をますます定義しつつある監視への懸念を引き起こすことなく、より有能なAI体験を切り拓く可能性があります。

3. 入力が不完全なときの、確信のデザイン

マルチモーダルシステムが、よりノイズが多く、より曖昧な入力——ぼやけた画像、部分的な音声、環境信号——を取り込むようになるにつれ、最大のリスクは失敗ではありません。過信です。

現代のモデルの多くは、すでに内部で不確実性を追跡しています。欠けているのは、その不確実性が人にどう伝えられるかです。

今日、不確実性はしばしば隠されているか、免責事項として表面化されます。どちらも、信頼を築きません。

私が関心を持っているのは、入力の質に応じてトーン、具体性、断定の強さを調整するシステムです。人間が自然に疑いを伝える方法を映し出すような。明示的な警告ではなく、言葉や推奨の強さにおける、微妙な変化です。

ヘルスケア、金融、法律、エンタープライズといったハイステークスな領域では、これは当たり前の要件になっていくかもしれません。信頼は、常に正しいことからは生まれません。システムが、いつ自分が間違っているかもしれないかを知っていることから生まれます。

これらのテーマが、共に重要である理由

これらの課題を合わせて見ると、デザインの役割における一つの転換が見えてきます。

私たちはもう、インターフェースやフローだけを形づくっているのではありません。形づくっているのは——

  • システムが何に気づくか
  • 何を記憶するか
  • どれだけの確信を持って行動するか

マルチモーダルAIが本質的に必要としているのは、より多くの機能ではありません。より良い判断力です。

それが、次に最も探求したい領域です。

この先を見据えて

私自身が関心を持っているのは、プロダクティビティの見世物を超え、本物の協働へと向かうマルチモーダルAI体験を探ることです。文脈を注意深く観察し、控えめに行動し、じっくりと信頼を獲得するシステム。

AIデザインの未来は、システムがどれだけのことをできるかによって定義されるのではありません。

いつ何もしないべきかを、どれだけよく理解しているかによって定義されるのです。