Skip to content

モデル・研究

新しいフロンティアモデル、ベンチマーク、学習手法とその研究。

14 本

Google DeepMind、AIで夫婦の「記録されていない記憶」を再現 『Love, Rendered』

Google DeepMindは、70年以上連れ添った夫婦バート・シャッツとエセル・シャッツのために、一度も撮影されたことのない記憶を再現するドキュメンタリー『Love, Rendered』を映画製作者たちと共同制作したと発表した。同作では生成AIによる画像修復とパフォーマンスキャプチャモデルが用いられたという。Googleはまた、Geminiアプリを使えばユーザーが自分の家族写真を修復・カラー化できるとも述べている。

約3分

アップステージ、カラクリと共同開発した日本語対応LLM「Syn Pro」を発表

アップステージは、Karakuri社と共同開発した日本語大規模言語モデル「Syn Pro」をリリースした。同社によると、このモデルは320億パラメータ未満の日本語ローカル訓練LLMの中で首位にランクし、Nejumiリーダーボードでは世界トップ20入りを果たしたほか、オンプレミス、プライベートクラウド、あるいは顧客所有のGPU上での導入が可能だという。

約2分

DeepSeek、ネイティブな視覚理解を備えた「V4.1-Flash」を公開

DeepSeekは、ネイティブな視覚理解を備えた5520億パラメータの専門家混合(MoE)モデル「V4.1-Flash」を公開した。同社によると、非対称構造を採用しており、入力処理には80億パラメータ、出力生成には160億パラメータが活性化されるという。同モデルはDeepSeek API上ですでに利用可能で、ピーク時・オフピーク時それぞれの新たな料金が設定されている。

約3分

Upstage、コンパクトなオープンソース言語モデル「Solar Mini」を発表

Upstageは、32層のLlama 2アーキテクチャを基盤とし、Mistral 7Bの重みで初期化したコンパクトな大規模言語モデル「Solar Mini」を発表した。同社によると、深度アップスケーリング手法は、深度方向のスケーリングと継続的な事前学習を組み合わせたものだ。Solar MiniはApache 2.0ライセンスの下で一般公開されている。

約2分

Upstage、マルチステップのエージェント業務向け「Solar Pro 4」を提供開始

Upstageは、ドキュメントやツール、ターミナル作業を伴うマルチステップのエージェント業務向けに設計された、APIで利用可能なモデル「Solar Pro 4」を提供開始した。同社によると、512Kトークンのコンテキストウィンドウと最大128Kトークンの出力に対応し、英語、韓国語、日本語を扱えるほか、提供された根拠から回答を裏付けられない場合はその旨を報告する。

約3分

アンソロピック、研究機関によるクロード活用の科学エージェント構築事例を公表

アンソロピックは2026年1月15日、スタンフォード大学の「Biomni」プロジェクト、マサチューセッツ工科大学(MIT)のチーズマン研究室、スタンフォード大学のルンドバーグ研究室という3つの研究機関が、遺伝子クラスターの解釈や生物医学データ分析、実験対象となる遺伝子の選定といった作業のためにクロードを基盤としたシステムを構築したとするケーススタディを公表した。

約4分

ファインチューニング、検索、それともプロンプト改善か:選び方

まず失敗の原因を診断する。モデルが何かを知らないのであれば、それは知識の不足であり、検索によって解決できる。モデルは知っているのに、構成や口調、形式が不適切なら、それは振る舞いの問題であり、まずプロンプトで、それでも足りなければファインチューニングで対処する。その両方を試しても専門的な技能を発揮できない場合、残る選択肢がファインチューニングだ。プロンプトは最も安価で元に戻しやすく、事実を扱うなら検索が標準的な選択肢となる。ファインチューニングは3つの中で最も高価で、最も元に戻しにくい。

約7分

分析:長大なコンテキストは検索を不要にしたのではなく、その役割を変えた

不要にはならないが、役割は変わる。非常に大きなコンテキストウィンドウを埋め尽くすと、中ほどに埋もれた情報に対する精度が低下し、リクエストごとの遅延とコストが増大するうえ、回答がどの情報源に基づくのかも特定しにくくなる。大規模または頻繁に更新されるコーパス、出典の明示やアクセス制御が必要な用途、コストに厳しい大量処理では、引き続き検索を標準とするのが適切だ。長大なコンテキストは今や、文書全体を対象とする推論、タスク内でのエージェントの作業記憶、そして検索で対象を絞り込んだ後の第2段階に最も適している。

約9分

分析:公開ベンチマークはもはや実運用品質を予測しない――本当に機能する評価セットの作り方

公開ベンチマークが測定するのは、狭く固定的で、広く公開されたタスクにすぎず、しかも学習データによる汚染や、そこを狙い撃ちした最適化が年々進んでいる。実運用の品質を左右するのは、自社のプロンプトであり、扱う文書であり、ツールのスキーマであり、許容できる失敗の範囲であって、そのいずれもリーダーボードは測っていない。現実的な答えは、実際のケースを50から300件集め、期待される挙動を記録した独自の評価セットを用意することだ。これをモデルやプロンプトを変更するたびに実行し、可能な限り厳密な照合で採点し、それが難しい場合は評価基準を明確化したモデル審査によって採点する。

約8分

Anthropic、Claude 3.7 Sonnetの利用状況に関する第2回経済指数レポートを公開

Anthropicの第2回経済指数レポートによると、Claude 3.7 Sonnetの公開後、Claude.aiの利用はコーディング、教育、科学、医療分野で増加した。拡張思考モードは技術系職種で最も多く利用された。利用全体に占める能力拡張型の割合は57%で横ばいとなり、Anthropicは新たに630カテゴリーからなる利用分類体系とタスク単位の自動化データを公開した。

約3分

MiniMaxがサウンドタグと音声クローン機能を備えたSpeech 2.8をリリース

MiniMaxは、息継ぎやためらいを表現するネイティブサウンドタグ、10秒間のサンプルによる音声クローニング、ノイズや歪みの低減を目的とした処理を備えた合成音声モデル「Speech 2.8」を発表しました。同社はまた、中国語(標準語)と日本語の言語横断的な音声生成を改善し、自社プラットフォームおよびAudio製品を通じて同モデルを利用可能にしたと述べています。

約3分

DeepSeekがV4-Flash-Vision-Expマルチモーダルモデルをリリース

DeepSeekは、APIプラットフォーム上で実験的なマルチモーダルモデル「DeepSeek-V4-Flash-Vision-Exp」をリリースしました。同社によると、テキストタスクではDeepSeek-V4-Flashと同等の性能を維持しつつ、画像認識機能を追加しており、マルチモーダルエージェントのベンチマーク性能はV4-Flashから大幅に向上し、Opus-4.8に迫るとしています。DeepSeekはまた、無料のFiles APIとDeepSeek Harness 0.1.1も公開しました。

約2分

RAG(検索拡張生成)とは何か、いつ必要か

検索拡張生成とは、質問に関連する箇所を自社の文書から探し出し、それをモデルのプロンプトに入れて、その内容にもとづいて答えさせる方式である。モデルの重みは変わらない。知識はリクエスト時にコンテキストとして届く。

約4分

コンテキストウィンドウとは何か、そしてなぜ枯渇してしまうのか?

コンテキストウィンドウは、モデルが一度のリクエストで考慮できるテキストの最大量(トークン数で測定)です。システム指示、これまでの会話、貼り付けたドキュメント、生成中の回答を含みます。合計が制限を超えると、何かを削除したり要約したりしなければなりません。

約5分