Google DeepMindは、70年以上連れ添った夫婦バート・シャッツとエセル・シャッツのために、一度も撮影されたことのない記憶を再現するドキュメンタリー『Love, Rendered』を映画製作者たちと共同制作したと発表した。同作では生成AIによる画像修復とパフォーマンスキャプチャモデルが用いられたという。Googleはまた、Geminiアプリを使えばユーザーが自分の家族写真を修復・カラー化できるとも述べている。
2026年9月13日 · 約3分
アップステージは、Karakuri社と共同開発した日本語大規模言語モデル「Syn Pro」をリリースした。同社によると、このモデルは320億パラメータ未満の日本語ローカル訓練LLMの中で首位にランクし、Nejumiリーダーボードでは世界トップ20入りを果たしたほか、オンプレミス、プライベートクラウド、あるいは顧客所有のGPU上での導入が可能だという。
2026年9月12日 · 約2分
DeepSeekは、ネイティブな視覚理解を備えた5520億パラメータの専門家混合(MoE)モデル「V4.1-Flash」を公開した。同社によると、非対称構造を採用しており、入力処理には80億パラメータ、出力生成には160億パラメータが活性化されるという。同モデルはDeepSeek API上ですでに利用可能で、ピーク時・オフピーク時それぞれの新たな料金が設定されている。
2026年9月10日 · 約3分
Upstageは、32層のLlama 2アーキテクチャを基盤とし、Mistral 7Bの重みで初期化したコンパクトな大規模言語モデル「Solar Mini」を発表した。同社によると、深度アップスケーリング手法は、深度方向のスケーリングと継続的な事前学習を組み合わせたものだ。Solar MiniはApache 2.0ライセンスの下で一般公開されている。
2026年9月8日 · 約2分
Upstageは、ドキュメントやツール、ターミナル作業を伴うマルチステップのエージェント業務向けに設計された、APIで利用可能なモデル「Solar Pro 4」を提供開始した。同社によると、512Kトークンのコンテキストウィンドウと最大128Kトークンの出力に対応し、英語、韓国語、日本語を扱えるほか、提供された根拠から回答を裏付けられない場合はその旨を報告する。
2026年9月7日 · 約3分
アンソロピックは2026年1月15日、スタンフォード大学の「Biomni」プロジェクト、マサチューセッツ工科大学(MIT)のチーズマン研究室、スタンフォード大学のルンドバーグ研究室という3つの研究機関が、遺伝子クラスターの解釈や生物医学データ分析、実験対象となる遺伝子の選定といった作業のためにクロードを基盤としたシステムを構築したとするケーススタディを公表した。
2026年8月29日 · 約4分
まず失敗の原因を診断する。モデルが何かを知らないのであれば、それは知識の不足であり、検索によって解決できる。モデルは知っているのに、構成や口調、形式が不適切なら、それは振る舞いの問題であり、まずプロンプトで、それでも足りなければファインチューニングで対処する。その両方を試しても専門的な技能を発揮できない場合、残る選択肢がファインチューニングだ。プロンプトは最も安価で元に戻しやすく、事実を扱うなら検索が標準的な選択肢となる。ファインチューニングは3つの中で最も高価で、最も元に戻しにくい。
2026年8月27日 · 約7分
不要にはならないが、役割は変わる。非常に大きなコンテキストウィンドウを埋め尽くすと、中ほどに埋もれた情報に対する精度が低下し、リクエストごとの遅延とコストが増大するうえ、回答がどの情報源に基づくのかも特定しにくくなる。大規模または頻繁に更新されるコーパス、出典の明示やアクセス制御が必要な用途、コストに厳しい大量処理では、引き続き検索を標準とするのが適切だ。長大なコンテキストは今や、文書全体を対象とする推論、タスク内でのエージェントの作業記憶、そして検索で対象を絞り込んだ後の第2段階に最も適している。
2026年8月27日 · 約9分
公開ベンチマークが測定するのは、狭く固定的で、広く公開されたタスクにすぎず、しかも学習データによる汚染や、そこを狙い撃ちした最適化が年々進んでいる。実運用の品質を左右するのは、自社のプロンプトであり、扱う文書であり、ツールのスキーマであり、許容できる失敗の範囲であって、そのいずれもリーダーボードは測っていない。現実的な答えは、実際のケースを50から300件集め、期待される挙動を記録した独自の評価セットを用意することだ。これをモデルやプロンプトを変更するたびに実行し、可能な限り厳密な照合で採点し、それが難しい場合は評価基準を明確化したモデル審査によって採点する。
2026年8月27日 · 約8分
Anthropicの第2回経済指数レポートによると、Claude 3.7 Sonnetの公開後、Claude.aiの利用はコーディング、教育、科学、医療分野で増加した。拡張思考モードは技術系職種で最も多く利用された。利用全体に占める能力拡張型の割合は57%で横ばいとなり、Anthropicは新たに630カテゴリーからなる利用分類体系とタスク単位の自動化データを公開した。
2026年8月27日 · 約3分
MiniMaxは、息継ぎやためらいを表現するネイティブサウンドタグ、10秒間のサンプルによる音声クローニング、ノイズや歪みの低減を目的とした処理を備えた合成音声モデル「Speech 2.8」を発表しました。同社はまた、中国語(標準語)と日本語の言語横断的な音声生成を改善し、自社プラットフォームおよびAudio製品を通じて同モデルを利用可能にしたと述べています。
2026年8月26日 · 約3分
DeepSeekは、APIプラットフォーム上で実験的なマルチモーダルモデル「DeepSeek-V4-Flash-Vision-Exp」をリリースしました。同社によると、テキストタスクではDeepSeek-V4-Flashと同等の性能を維持しつつ、画像認識機能を追加しており、マルチモーダルエージェントのベンチマーク性能はV4-Flashから大幅に向上し、Opus-4.8に迫るとしています。DeepSeekはまた、無料のFiles APIとDeepSeek Harness 0.1.1も公開しました。
2026年8月26日 · 約2分
検索拡張生成とは、質問に関連する箇所を自社の文書から探し出し、それをモデルのプロンプトに入れて、その内容にもとづいて答えさせる方式である。モデルの重みは変わらない。知識はリクエスト時にコンテキストとして届く。
2026年8月22日 · 約4分
コンテキストウィンドウは、モデルが一度のリクエストで考慮できるテキストの最大量(トークン数で測定)です。システム指示、これまでの会話、貼り付けたドキュメント、生成中の回答を含みます。合計が制限を超えると、何かを削除したり要約したりしなければなりません。
2026年8月22日 · 約5分