0. 「6.1出た!」の前に、ちょっと待て。6.0、Chatに来たっけ?
SNSを開いたら、いきなり「GPT-6.1 Sol」が飛んできた。
反応はだいたいこうなる。
え、6.1? 早くない?
そして三秒後に、もっと根本的な疑問が出る。
待って。GPT-6.0 Solって、通常のChatGPTにもう来てたっけ?
来ていない。
OpenAIは2026年9月22日にGPT-6 SolとGPT-6 Lunaを発表したが、提供先はChatGPT Work、Codex、APIで、通常のChatには「not yet available」と明記していた。
そのわずか7日後、9月29日にGPT-6.1 Solが登場した。しかしこれも、開始時点ではChatGPT Work、Codex、API向けで、通常Chatにはまだ来ていない。
つまり現象だけ見るとこうだ。
6.0 Solが通常Chatの玄関で靴を脱ぐ前に、6.1 SolがCodexの裏口から入ってきた。
モデル番号の進み方だけ見れば未来にいるのに、普段のチャット画面はまだ別の時間軸を生きている。
1. 2026年9月のモデル更新、時刻表が新幹線より速い
公開日の並びを見ると、体感がバグる理由がわかる。
- 9月3日:GPT-6 Astra
- 9月22日:GPT-6 Sol / Luna
- 9月22日:Claude Opus 5.5
- 9月28日:Claude Sonnet 5.5
- 9月29日:GPT-6.1 Sol
GPT-6 Solから6.1 Solまでは7日である。
昔の感覚なら「新モデルが出た、しばらく使おう」だった。
今は違う。
新モデルのレビューを書き終える前に、レビュー対象が旧モデルになる。
駅のホームで「次は6.0」と表示されたから待っていたら、通過列車6.1が先に爆走していく感じである。
しかもAnthropic側も9月22日にOpus 5.5、9月28日にSonnet 5.5を続けて出している。
競争が激しいこと自体は明らかだ。ただし「OpenAIがClaude 5.5に驚いて6.1を急遽出した」とまで断定できる公的証拠はない。
外から見ると殴り合いに見える。
中で本当に「うわ、Claudeやべえ、今夜出すぞ」となったかは知らない。
ここは分けておく必要がある。
2. 6.1 Solは何が変わったのか――雑に言うと「Sol価格でAstra側へ寄せた」
GPT-6.1 Solの公式な売りはかなり明快だ。
Astraに近い性能を、Astraの標準入出力価格の5分の1で。
API価格は入力100万トークンあたり2ドル、出力10ドルで、GPT-6 Solと同じ。キャッシュ入力だけ0.20ドルから0.10ドルへ半減した。
性能面では、OpenAIの公表値で次の改善がある。
- DeepSWE 1.1ではGPT-6 Astraに並び、GPT-6 Solの最高値を6.4ポイント上回った。
- AutomationBenchでは同じmedium設定のGPT-6 Solより4.8ポイント改善し、Opus 5.5を2.2ポイント上回った。
- OSWorld 2.0では最大推論時にGPT-6 Solより7ポイント改善し、Astraとの差は2.1ポイント。
- 難しい会話を集めた事実性評価では、low設定の「少なくとも1つ事実誤りを含む回答」が11.4%から7.7%へ低下した。
なので「ただ番号を0.1増やしました」ではない。
普通にかなり大きな改良である。
ただしここで、ベンチマーク表を見て即座に「じゃあもうAstraいらないじゃん」とするのも早い。OpenAI自身、科学研究系などではAstraを最上位として残している。
近いと同じは違う。
そしてもっと重要なのは、ベンチマーク上の差と、ユーザーが仕事中に感じる差も別物だということだ。
3. そして通常Chatはまだ5.6系。製品の時間軸が完全に分裂した
ここが一番ややこしい。
2026年9月30日時点で、対象の有料ChatGPTでは通常の会話体験の中心はGPT-5.6 Solで、Free / GoはGPT-5.6 Luna。対象プランの一部にはGPT-6 Astraを使うGPT-6 Proもある。
一方でGPT-6 Sol、Luna、そして6.1 SolはWorkやCodex側で先行している。
つまり今は、
モデル世代の更新速度 ≠ 通常ChatGPTの更新速度
になっている。
これは「GPT-6が出た」という一文だけでは説明できない。
APIにはいる。 Codexにもいる。 Workにもいる。 でも普段のChatにはいない。
さらにAstraだけはGPT-6 Proとして別ルートからChatに顔を出す。
もう家系図ではない。
路線図である。
「GPT-6を使える?」と聞かれても、「どの製品で、どのプランで、どのモードの話?」まで聞かないと答えられない。
モデル名だけ追う時代から、配備先まで追わないと意味がない時代になった。
4. 「Astra級!」と言われても、体感で圧倒的とは限らない
GPT-6.1 Solの宣伝文句は強い。
near-Astra intelligence。
だがユーザーが実際に欲しいのは「Astraに何点近いか」ではない。
仕事を投げたときに、
- 指示を忘れないか
- 途中で変な方向へ逃げないか
- コードを壊さないか
- 長いタスクを完走するか
- 修正指示を一回で反映するか
- 何度も往復せず最終形まで持っていくか
である。
ベンチマークで最強でも、手元の仕事では「そこまで違うか?」になることは普通にある。
逆もある。平均スコアでは少し低くても、自分の仕事との相性が良ければそちらの方が圧倒的に便利だ。
だからAstraを使って「強いのはわかる。でも、言うほど世界が変わった感じはしない」と感じる人がいても不思議ではない。
モデル評価は、偏差値表ではなく道具との相性でもある。
5. Claude 5.5との競争は見える。でも「原因」は勝手に確定しない
タイミングだけ見ると面白い。
Claude Opus 5.5は9月22日。 Claude Sonnet 5.5は9月28日。 GPT-6.1 Solは9月29日。
しかもOpenAIの6.1発表資料は、GDP.pdfやAutomationBenchなどでOpus 5.5を直接比較対象にしている。
なのでユーザー側から、
「これ、競合が強すぎるから急いで殴り返してない?」
と見えるのは自然である。
Anthropic側もOpus 5.5で長時間コーディング、コスト削減、5時間利用枠の拡大を強く打ち出している。
つまり競争軸は「誰が一番賢いか」だけではない。
誰が長く働けるか、いくらで回せるか、長い仕事をどこまで止まらず走れるかに移っている。
ただし、リリース日が近いことと、社内の意思決定の因果は別だ。
競争が激しいのは事実。 「Claudeのせいで7日で6.1を出した」は推測。
ここをごちゃ混ぜにすると、面白い話が一瞬で都市伝説になる。
6. そしてヘビーユーザーは冷める。「すごいのは分かった。で、何分使えるの?」
ここからが実務の本題である。
新しいCodexモデルが出る。
公式は言う。
「コーディング性能が上がりました」 「Astraに近づきました」 「コスト効率が上がりました」
ヘビーユーザーは聞く。
「で、連続でどれくらい使える?」
ここで利用枠が短時間で尽きる体験を何度もすると、モデル発表への感情が変わる。
最初は、 「うおおお新モデル!」
次は、 「お、強そう」
その次は、 「あ、そう。どうせ上限来るんでしょ。じゃあClaude使うわ」
になる。
これは性能を否定しているわけではない。
むしろ性能が高いからこそ、使えない時間の機会損失が大きくなる。
世界最速のスポーツカーでも、ガソリンがコップ一杯しか入らなければ長距離配送には使えない。
「0-100km/hが何秒か」より「今日何km走れるか」が重要な仕事がある。
7. 実務では「最高性能」より「持続スループット」を見る
長時間のコーディング、記事生成、調査、データ処理、修理、エージェント運用では、一発の回答品質だけでは足りない。
実務上の価値は、ざっくりこう考えた方がよい。
実効仕事量 ≈ 1回あたりの品質 × 利用可能量 × 完走率 ÷ 往復コスト
ここで利用上限が厳しいと、1回あたりの品質が高くても総仕事量が伸びない。
逆に、少し性能が低くても、
- 長時間連続で使える
- タスクを止めない
- コンテキストを維持する
- 修正ループが少ない
- 別モデルへの退避が不要
なら、一日の終わりに完成している仕事は多くなる。
だからヘビーユーザーがClaude Codeを選ぶ理由が「Claude信者だから」ではなく、
その日の仕事を最後まで流せるから
という場合がある。
ここはベンチマーク表だけ見ていると見落としやすい。
8. 新モデルのニュースを見るとき、最初に見るべき数字が変わった
以前なら新モデル発表で見るものは精度だった。
今は違う。
少なくとも高頻度利用では、見る順番はこうなる。
- 自分の仕事で本当に強いか
- 利用上限はどのくらいか
- 上限到達後に何へフォールバックするか
- 長時間タスクを完走できるか
- 料金またはサブスク込みで一日にどれだけ処理できるか
- そのうえでベンチマークを見る
「Astraに近い!」は魅力的だ。
でも高負荷ユーザーにとっては、その直後にもう一つ質問がある。
「近いのは分かった。営業時間は?」
最強ラーメン屋でも営業時間7分なら、昼飯の主力にはできない。
モデルの知能が急速に上がった結果、次のボトルネックは知能ではなく供給量になり始めている。
9. 結論――モデル番号より「今日どれだけ仕事が終わったか」
GPT-6 SolからGPT-6.1 Solまで7日。
しかも通常Chatに6.0 Solが展開される前に、Work / Codex / APIでは6.1へ進んだ。
これはAI開発の速度としてはすごい。
同時に、ユーザーからするとだんだん笑えてくる。
バージョン番号が人間の理解速度を追い越している。
そしてヘビーユーザー側の評価軸も変わった。
「一番賢いモデルは何か?」ではない。
「自分の仕事を一日通して一番多く終わらせるモデルは何か?」
そこまで含めて初めて実用性能である。
6.1がAstra級でも、使いたい瞬間に使えないなら、別のモデルへ流れる。
逆に、少しだけ弱くても、ずっと働いてくれるなら主力になる。
新モデル祭りはまだ続くだろう。
たぶん次の発表も早い。
だが高頻度ユーザーの反応は、もう以前ほど単純ではない。
「新モデル出た!」 ではなく、
「ほう。で、今日は何時間働いてくれる?」
である。

