LLM DEVELOPMENT MAP

LLMは、巨大な暗記マシンを作って終わりではない。

大量の文章から世界のパターンを学び、人やAIのフィードバックで振る舞いを整え、難問を解く練習を重ね、道具と安全装置を組み合わせる。AstraやFableのような新モデルは、この工程全体を更新して作られます。

先に結論

新モデル = パラメータを増やした旧モデル、ではありません。データ、計算量、学習課題、評価、推論時の「考える量」、ツール、提供時の安全策までを一体で設計したシステムです。

開発ラインを見る

01

FROM DATA TO PRODUCT

モデルができるまで、7つの工程

各工程を選ぶと、その工程が何を変えるのかが分かります。

01 — 原材料を決める

量だけでなく、配合が能力を決める

Web、書籍、コード、画像などを集め、重複・低品質・個人情報・評価問題の混入を減らします。数学やコードを増やせば、その領域の基礎能力が変わります。

主に伸びる
知識の幅、言語感覚、領域能力
これだけでは
会話の指示に素直に従うとは限らない
失敗例
重複や誤情報まで大量に覚え、評価データも漏れる
ポイント:工程は一方向ではありません。評価で「長い作業の途中に目的を忘れる」と分かれば、訓練課題や道具の使い方を直して、また評価します。

02

THREE KINDS OF LEARNING

「強くする」は、3種類ある

A

世界を知る

事前学習・継続事前学習

文章の続きを当て続けることで、言葉、事実、コード、概念間の関係をパラメータに圧縮します。

「首都は」の次に「東京」が来やすい構造を、膨大な文脈から学ぶ。

B

望ましく振る舞う

教師あり学習・選好学習・RLHF/RLAIF

良い回答例や回答同士の比較から、指示に従う、正直に限界を伝える、安全に断るといった振る舞いを整えます。

2つの回答を比べ、「簡潔で根拠がある方」に高い報酬を与える。

C

解き方を鍛える

検証可能な報酬・強化学習・推論計算

正解を自動判定できる数学、コード、操作課題などで試行錯誤し、長く考えるほど答えを改善できるようにします。

コードを実行し、テストが通った解法に報酬を与える。

Aが「能力の土台」、Bが「操縦性と性格」、Cが「難問を解く方策」に強く効く、というのが大まかな見取り図です。実際の学習は互いに重なります。

03

WHAT WE ACTUALLY KNOW

AstraとFableは、どう作られた?

企業は重み・データ配合・完全な訓練レシピを公開していません。以下は「公表済み」と「妥当な推定」を分離したものです。

OPENAI

GPT-6 Astra

複雑な推論、コード、コンピューター操作、研究、資料作成を対象にした最上位モデル。

公表されていること

  • 「事前学習・強化学習・アラインメント」にまたがる研究を統合。
  • ツールを使う長い仕事と、少ない出力トークンでの効率を重視。
  • 安全制約を守る訓練、危険能力の評価、推論監視を重ねている。

ここからは推定

大規模な基礎学習に加え、検証可能な課題でのRL、長時間のエージェント軌跡、ツール失敗からの回復、安全方針を守る訓練の比重を増やしたと考えるのが自然です。

OpenAIの発表を見る

ANTHROPIC

Claude Fable 5.1

長時間・複数アプリにまたがる仕事、コーディング、専門的な知識作業を対象にしたモデル。

公表されていること

  • Fableと制限付きのMythosは同じ基盤モデルで、安全策が異なる。
  • Claude系はRLHFに加え、原則を使ってAIが評価するConstitutional AIを採用。
  • 長時間作業、自己検証、ツール利用、安全性を実環境に近い評価で測る。

ここからは推定

Fable 5.1固有の全レシピは非公開です。公開されたClaude系手法と評価結果から、長いエージェント作業、自己検証、憲法ベースの選好学習を反復改善した可能性が高い、とまで言えます。

Anthropicの発表を見る

つまり、世代交代で何が変わる?

基礎モデルそのものの能力に加えて、どんな問題で練習したか何を良しと採点したか実行時にどれだけ考えられるかどんな道具と安全策を与えたかが変わります。製品上の性能は、その掛け算です。

04

MODEL UPGRADE LAB

どこに投資すると、何が強くなる?

4つのレバーを動かしてみてください。これは教育用の概念モデルで、実モデルの性能予測ではありません。

50

データの質・範囲、モデル設計、学習計算量

50

指示追従、選好、安全な振る舞い

50

数学・コード・計画など検証可能な課題

50

検索、実行環境、記憶、権限、安全装置

この配分で伸びやすいもの

知識・言語58
指示追従58
難問の推論58
長時間の実務58
安全性・制御性58

バランス型:大きな穴はありません。ただし最先端モデルでは、最弱の工程が全体の上限になりがちです。

05

COMMON MISCONCEPTIONS

よくある4つの誤解

誤解 1データを増やせば、ずっと賢くなる?

いいえ。同じ低品質データの追加は効きにくく、重複、誤情報、偏りも増やします。質、配合、モデル設計、計算量のバランスが重要です。

誤解 2RLHFで新しい知識を大量に覚えさせる?

主目的は振る舞いの調整です。OpenAIはGPT-4について、能力の多くは事前学習から来て、ポストトレーニングは操縦性に強く効くと説明しています。

誤解 3ベンチマーク1位なら、何でも一番?

いいえ。課題、道具、推論量、採点方法、コストで順位は変わります。学習データに似た問題が混ざる「汚染」も確認が必要です。

誤解 4モデル単体が全部やっている?

実際の製品は、検索、コード実行、メモリ、権限管理、入出力フィルター、監視を組み合わせます。同じ重みでも、システム設計で体感性能は変わります。

06

PRIMARY SOURCES

根拠を自分で確かめる

公開情報は更新されます。モデル固有の主張は各社の一次情報へリンクしています。

  1. OpenAI — GPT-6 Astra: A new generation of intelligenceAstraの能力、事前学習・RL・アラインメント、評価。
  2. OpenAI — GPT-4 research次トークン予測、RLHF、事前学習と操縦性の役割。
  3. OpenAI — Learning to reason with LLMs学習時・推論時の計算量と推論性能。
  4. Anthropic — Claude Fable 5.1 and Mythos 5.1長時間作業、評価、安全性、同一基盤モデルの説明。
  5. Anthropic — Claude's ConstitutionConstitutional AIとAIフィードバックによる強化学習。

内容確認:2026年9月21日