Skip to content
オープンソース AI

オープン・ウェイトとオープンソースAI:ラベルが実際に何を意味するのか

多くの「オープンソース」と呼ばれるモデルは、標準的な定義に則ってオープンソースとは言えません。各種ライセンスで合法的にできることと、構築前に問うべき質問をまとめます。

DigitalNeuron Desk約1分

ひとことで言うと

オープン・ウェイトとオープンソースAIの違いは何ですか?

オープンな重みとは、学習済みのモデルファイルをダウンロードし、ライセンスに従って自分で実行できるという意味です。オープンソースは、使用・学習・改変・再配布が制限なく行えるというより厳しい法的基準です。多くの広く使われるモデルはオープンな重みですが、オープンソースとは限りません。

要点

  • ダウンロードできるだけでは、制限のないとは言えない。ライセンスを読むべきで、発表文だけを読むべきではない。
  • カスタムコミュニティ ライセンスは、許容使用規則、ユーザー数の上限、または表記要件を追加することが多いです。
  • オープンな重みは依然として透明性のない学習データを意味する――数値は確認できるが、何が生み出したのかは分からない。
  • 商用での利用にあたっては、以下の点が気になるところです:商用利用が可能か、ファインチューニングして再配布できるか、そしてその出力を使って別のモデルを学習してもよいかです。

Open source AI は分野で最も過剰に使用される表現です。モデルをダウンロードして実行できるもの、論文が公開されたもの、場合によっては無料トライアルがあるホスティング API まで、あらゆるものに適用されます。この区別は重要です。なぜなら、それがあなたの弁護士が何を配布できるかを決定するからです。

人々が意味する三つの異なるもの

Open weights(オープン重み) 訓練済みパラメータがダウンロード可能に公開されています。自社のハードウェアでモデルを実行し、数値を検査し、ファインチューニングし、API 呼び出しなしでサービングできます。商用利用が可能かどうかは、付随するライセンス次第です。

Open source(実際の標準) Open Source Definition に合致するライセンス:任意の目的で使用、研究、改変、再配布でき、誰がどのように使用しても制限はありません。Apache‑2.0、MIT、BSD などが該当します。特定の使用を禁じるカスタムライセンスは、たとえその禁止が合理的に思えても Open Source ではありません。

Open research(オープンリサーチ) 論文とおそらく評価コードが公開され、重みは一切ありません。読むことはできますが、導入はできません。

モデルはこれらの組み合わせのいずれかです。ほとんどの「オープン」リリースは、オープン重みにカスタムライセンスを付与し、オープンリサーチも含まれますが、オープンソースとは言えません。

カスタムライセンスが通常付加する条件

条件は一般に緩やかですが、時に決定的です。次の点に注意してください。

  • Acceptable‑use policy(適切使用ポリシー) 禁止対象アプリケーションのリストがライセンスに組み込まれ、参照によって変更されることがあります。
  • Scale thresholds(スケール閾値) 月間アクティブユーザー数が一定以上になると別契約が必要という条項です。スタートアップには関係ないかもしれませんが、大規模プラットフォームには障壁となります。
  • Attribution and naming(帰属と命名) 「Built with X」と表示する、または派生モデルの名前にベースモデル名を接頭辞で付すなどの要件です。
  • Derivative‑licence propagation(派生ライセンスの伝播) ファインチューニングしたバージョンは同じライセンスで配布しなければなりません。
  • Output restrictions(出力制限) モデルの出力を使って競合モデルを訓練することを制限する条項です。オープン重みライセンスだけでなく、ホスティングAPIの利用規約にも見られます。

これらはいずれもソフトウェアライセンスの通常の一部です。問題は「オープン」という言葉が、これらすべてを伴わないことを暗示している点です。

なぜこの区別が単なるこだわりではないのか

具体的な三つの状況で実際に影響が出ます。

ホワイトラベリング ベースモデルのライセンスが名前を明示することを要求すれば、ホワイトラベル製品は実際には無ブランドとは言えません。

Copyleft 汚染 一部の AI コンポーネントは AGPL で配布されます。ホスティング製品では AGPL のネットワーク条項により、独自ソースコードの公開が義務付けられることがあります。これはライセンスの決定であり、製品への影響も大きいため、意図的に行うべきです。

調達 企業や公的機関の調達部門は、モデルとそのライセンスをすべて列記したソフトウェア部品表(SBOM)を要求することが増えています。「オープンソースです」だけでは、ライセンスファイルに他の記述がある場合は通過しません。

ビルド前に問うべき質問

  1. 重みと一緒にどのライセンスファイルが提供されているか? ブログ記事ではなくリポジトリにあるファイルです。
  1. 商用利用が可能で、ユーザー数の上限があるか? 閾値がある場合は、成長予測と照らし合わせて検討してください。
  1. ファインチューニングして再配布できるか? 結果はどのライセンスで配布しなければならないか?
  1. 出力を自由に使えるか? 特に他モデルの訓練や蒸留に使用できるか?
  1. 適切使用ポリシーが適用され、変更できるか? 参照によってポリシーが変更されると、導入後に制約が変わる可能性があります。
  1. モデルカードは訓練データについてどのように記載しているか? 法的

よくある質問

Llamaはオープンソースですか?
LlamaはMetaの独自コミュニティ ライセンスのもとで配布されており、OSI認定のオープンソース ライセンスとは異なります。重みはダウンロードでき、商用利用は広く許可されていますが、ライセンスにはオープンソース ライセンスにはない条件が含まれています。
どのモデルのライセンスが本当にオープンソースですか?
Apache-2.0またはMITライセンスでリリースされたモデル — 例えばMistral、Qwen、DeepSeekなどいくつかのモデルが含まれる — は標準的な定義を満たします。必ず該当するモデルカードを確認してください。出版者はリリースごとにライセンスが異なる場合があるためです。
オープンソースのモデルをファインチューニングして販売してもいいですか?
基本的にははいですが、条件は異なります。一部のライセンスでは、ライセンスを引き継ぐ、ベースモデルに名前を付ける、適切な使用ポリシーに従うなどの条件が課されることがあります。重みと一緒に提供されるライセンスファイルを確認してください。
オープンな重みは、訓練データを見ることができるという意味ですか?
いいえ。主要なリリースのほとんどは、学習コーパス全体を公開しません。パラメータは入手できますが、データについては一般的な説明しか提供されません。

出典

  1. The Open Source Definition — Open Source Initiative
  2. The Open Source AI Definition — Open Source Initiative
  3. Llama licence and acceptable use policy — Meta
タグopen sourcelicensingopen weightscompliance

あわせて読みたい

分析: OpenAI が Codex ハーネスをオープンソース化 — ハーネスとは何か、そして「オープン」は何を意味するか

ハーネスはモデルの実行レイヤーで、タスクを保持し、長時間実行のコンテキストを管理し、ツールを呼び出し、イベントをストリーミングし、中断を許可し、承認を人間にルーティングします。OpenAIは、非対話型CLI、SDK、app-serverを含む自社のCodexハーネスをApache-2.0でリリースし、フォークして商用製品に組み込むことができるようにしました。モデルの重みはリリースされていませんが、ハーネスは依然として有料APIを呼び出すため、ライセンスコストはゼロで、実行コストはありません。

約12分

分析:オープンソースモデルは本当にどれだけ遅れているのか?

一般的なベンチマークでは、最先端のオープンソースモデルがフロンティアの商用モデルに近づいており、多くの日常的なタスクでは差がほとんど分からない。残るギャップは、長期的な信頼性、ツールの使用、非常に長いコンテキスト、安全性チューニング、そして自分で実行する運用作業に現れる。

約5分

分析:オープンウェイトモデルのセルフホスティング——導入を左右する採算計算と、誰も予算に織り込まないコスト

高水準かつ安定した稼働率を確保できる場合に限られる。セルフホスティングでは、トークン単位の変動費が時間単位の固定費に変わるため、アクセラレーターを高稼働させられれば有利だが、遊休時間が生じると大幅に不利になる。正確に比較するには、アクセラレーターの稼働時間、冗長化、エンジニアリング工数に加え、小規模モデルで十分な品質を確保できるかを検証する評価作業まで含めたシステム全体の費用を、同一トラフィックに対するAPI料金と比べる必要がある。主権、データレジデンシー、最低遅延の保証は、採算計算とは別にセルフホスティングを正当化し得る理由となる。

約9分