01 — 原材料を決める
量だけでなく、配合が能力を決める
Web、書籍、コード、画像などを集め、重複・低品質・個人情報・評価問題の混入を減らします。数学やコードを増やせば、その領域の基礎能力が変わります。
- 主に伸びる
- 知識の幅、言語感覚、領域能力
- これだけでは
- 会話の指示に素直に従うとは限らない
- 失敗例
- 重複や誤情報まで大量に覚え、評価データも漏れる
LLM DEVELOPMENT MAP
大量の文章から世界のパターンを学び、人やAIのフィードバックで振る舞いを整え、難問を解く練習を重ね、道具と安全装置を組み合わせる。AstraやFableのような新モデルは、この工程全体を更新して作られます。
先に結論
新モデル = パラメータを増やした旧モデル、ではありません。データ、計算量、学習課題、評価、推論時の「考える量」、ツール、提供時の安全策までを一体で設計したシステムです。
01
FROM DATA TO PRODUCT
各工程を選ぶと、その工程が何を変えるのかが分かります。
01 — 原材料を決める
Web、書籍、コード、画像などを集め、重複・低品質・個人情報・評価問題の混入を減らします。数学やコードを増やせば、その領域の基礎能力が変わります。
02
THREE KINDS OF LEARNING
A
事前学習・継続事前学習
文章の続きを当て続けることで、言葉、事実、コード、概念間の関係をパラメータに圧縮します。
例「首都は」の次に「東京」が来やすい構造を、膨大な文脈から学ぶ。
B
教師あり学習・選好学習・RLHF/RLAIF
良い回答例や回答同士の比較から、指示に従う、正直に限界を伝える、安全に断るといった振る舞いを整えます。
例2つの回答を比べ、「簡潔で根拠がある方」に高い報酬を与える。
C
検証可能な報酬・強化学習・推論計算
正解を自動判定できる数学、コード、操作課題などで試行錯誤し、長く考えるほど答えを改善できるようにします。
例コードを実行し、テストが通った解法に報酬を与える。
Aが「能力の土台」、Bが「操縦性と性格」、Cが「難問を解く方策」に強く効く、というのが大まかな見取り図です。実際の学習は互いに重なります。
03
WHAT WE ACTUALLY KNOW
企業は重み・データ配合・完全な訓練レシピを公開していません。以下は「公表済み」と「妥当な推定」を分離したものです。
OPENAI
複雑な推論、コード、コンピューター操作、研究、資料作成を対象にした最上位モデル。
公表されていること
ここからは推定
大規模な基礎学習に加え、検証可能な課題でのRL、長時間のエージェント軌跡、ツール失敗からの回復、安全方針を守る訓練の比重を増やしたと考えるのが自然です。
ANTHROPIC
長時間・複数アプリにまたがる仕事、コーディング、専門的な知識作業を対象にしたモデル。
公表されていること
ここからは推定
Fable 5.1固有の全レシピは非公開です。公開されたClaude系手法と評価結果から、長いエージェント作業、自己検証、憲法ベースの選好学習を反復改善した可能性が高い、とまで言えます。
つまり、世代交代で何が変わる?
基礎モデルそのものの能力に加えて、どんな問題で練習したか、何を良しと採点したか、実行時にどれだけ考えられるか、どんな道具と安全策を与えたかが変わります。製品上の性能は、その掛け算です。
04
MODEL UPGRADE LAB
4つのレバーを動かしてみてください。これは教育用の概念モデルで、実モデルの性能予測ではありません。
バランス型:大きな穴はありません。ただし最先端モデルでは、最弱の工程が全体の上限になりがちです。
05
COMMON MISCONCEPTIONS
いいえ。同じ低品質データの追加は効きにくく、重複、誤情報、偏りも増やします。質、配合、モデル設計、計算量のバランスが重要です。
主目的は振る舞いの調整です。OpenAIはGPT-4について、能力の多くは事前学習から来て、ポストトレーニングは操縦性に強く効くと説明しています。
いいえ。課題、道具、推論量、採点方法、コストで順位は変わります。学習データに似た問題が混ざる「汚染」も確認が必要です。
実際の製品は、検索、コード実行、メモリ、権限管理、入出力フィルター、監視を組み合わせます。同じ重みでも、システム設計で体感性能は変わります。
06
PRIMARY SOURCES
公開情報は更新されます。モデル固有の主張は各社の一次情報へリンクしています。
内容確認:2026年9月21日