ONE-PAGE BRIEF
この1枚で、3つの数字を分ける
緑の領域はトークンごとの稼働範囲。メモリ容量の割合を示す図ではありません。
THE TAKEAWAY
独英の文書を、自社で動かす選択肢
Aleph Alphaは2026年10月3日、独語・英語に重点を置くMoEモデルKolibri-1を公開した。推論モードとツール呼び出しを備え、自社でホストする文書処理や業務支援の選択肢として読む。
本号は10月4日号として公式発表を取り上げる。導入を考えるときは、稼働パラメータ、保持する重み、使う文書の長さを別々に確認する。
出典・位置付け:公式発表・モデルカード
WHAT IS OPEN
公開重みと、運用の責任を分ける
モデルカードのライセンス表記はApache 2.0。公開された重みと構成を利用する条件として確認する。学習コードや学習データのすべてが公開されている、という意味ではない。
自社ホストは配置とアクセスを設計できる選択肢。一方、データの取扱い、出力の確認、権限、ログ、保守は導入側の仕事として残る。「sovereign」という位置付けを法令適合の保証として扱わない。
出典・位置付け:公式モデルカード
ACTIVE ≠ TOTAL
78Bの全体から、3.46Bをトークンごとに動かす
総パラメータは78,103,074,560。1トークン当たりの稼働パラメータは3,457,573,120で、全体の約4.4%に相当する(本号による比率計算)。
| 数値 | 意味 |
|---|---|
| 78B 全体 | モデル全体の容量。稼働していない部分も保持する。 |
| 3.46B 稼働/token | そのトークンの処理に動かす部分。メモリ容量の表記ではない。 |
出典・位置付け:公式モデルカード
CONTEXT IN PRACTICE
最大100万と、実務推奨26万を区別する
最大コンテキストは1,048,576トークン。一方、複雑なタスクや配信効率を重視する場合、公式は262,144トークン以下を推奨する。後者がネイティブのコンテキスト長だ。
最大値は、すべての文書で品質や応答速度を保証する数字ではない。長い文書を一括投入する前に、根拠を拾えるか、待ち時間と同時実行の条件を満たすかを実文書で確かめる。
出典・位置付け:モデルカード・技術報告
HUMAN IN THE LOOP
検索・文書処理・ツール利用は、人の確認と組み合わせる
公式が想定する用途には、独英のアシスタント、文書処理、検索拡張生成(RAG)、コーディング、ツールを使う業務が含まれる。出力を人が確認してから実行する構成が前提だ。
推論の強さはnone / low / medium / highから設定できる。ツール呼び出しはAPIや検索への接続を可能にするが、呼び出しの妥当性と結果の検証は組み込み側で行う。
出典・位置付け:公式モデルカード
THE MEMORY BUDGET
約78GBは重みだけ。運用全体の予算ではない
公式モデルカードはFP8の重み容量を約78GBと示す。稼働パラメータが少なくても、モデル全体の重みをメモリに保持する必要がある。
実行時にはKVキャッシュなどの領域も必要になる。必要なGPU構成は文書長、同時実行、実装に左右されるため、重みの78GBだけを機器選定や費用見積もりの根拠にしない。
出典・位置付け:公式モデルカード
WHAT WE HAVE NOT TESTED
日本語性能と、実業務の品質は未検証
Kolibriは独語・英語を中心に設計されている。本号では日本語の精度、実業務の速度、運用費用を実測していない。独英での設計意図から、日本語でも同じ結果が得られるとは推定しない。
公開資料の評価は開発元による評価として読む。学習データの言語比率やベンチマーク値には資料間の違いが見られるため、本号では順位付けや数値比較に使わない。
出典・位置付け:公式ブログ・モデルカード
TEST YOUR OWN DOCUMENTS
実文書・根拠・速度をそろえて、小さく評価する
ここからは本号の編集部提案。導入候補にする場合は、代表的な独英文書と人が確認した答えを用意し、利用条件を固定して評価する。
| 評価の軸 | 確認する内容 |
|---|---|
| 文書と根拠 | 短文・長文、検索が必要な問い、原文にない問いを含め、根拠の位置と誤回答を記録する。 |
| 実行の条件 | 文書長・同時実行数・推論モードを記録し、待ち時間とメモリ使用量を比較する。 |
| 承認と運用 | 人の確認、ツール権限、失敗時の停止、ログと保守担当を定める。 |
出典・位置付け:編集部提案(公式要件ではありません)
コピー後に [ ] を書き換えてください。編集部の評価用ひな形です。