Astra Lowをずっと使えばいい?――Sol極高 vs Astra 4段階、性能×コストを比べたら「Low常用・詰まったらMedium」が強かった

モデル選択にLowと書いてあったら、普通は「節約モード」「軽い仕事用」「本気を出していない側」だと思う。

広告
広告

モデル選択にLowと書いてあったら、普通は「節約モード」「軽い仕事用」「本気を出していない側」だと思う。

ところがGPT-6 Astraは、Lowの時点で妙に強い。

第三者ベンチマークでは、Astra LowがGPT-5.6 SolのExtra High(xhigh)を総合指数で上回り、コーディング系の一部評価では差がさらに大きい。しかも、その評価セット上では1タスク当たりのコストまでAstra Lowの方が安かった。

すると当然、こうなる。

「じゃあ、もうずっとAstra Lowでよくない?」

結論は、普段の初手はAstra Lowでかなり合理的。ただしLow固定を宗教にする必要はない。

使い方は「Lowを標準装備 → 取りこぼしや難所でMedium → それでも詰まる案件だけHigh / Extra High」がいちばん筋がいい。

Lowという名札を付けているだけで、本人はぜんぜん低姿勢ではない。

1. まず数字――Sol極高とAstra 4段階を同じ物差しで並べる

2026年9月12日に確認したArtificial Analysisの比較では、次のようになっている。

設定 Intelligence Index AutomationBench-AA Terminal-Bench v4.0 SciCode AA評価タスク当たりコスト 出力token/タスク 推論token/タスク
GPT-5.6 Sol xhigh 44 55% 25% 57% $1.18 約20k 約10k
GPT-6 Astra Low 46 59% 42% 54% $0.82 約4k 約938
GPT-6 Astra Medium 50 65% 49% 54% $1.54 約10k 約3k
GPT-6 Astra High 51 67% 54% 55% $1.72 約12k 約5k
GPT-6 Astra xhigh 53 67% 60% 56% $2.31 約17k 約9k

まず注意したいのは、Intelligence Indexの44と46を「Astraが4.5%賢い」と機械的に読むのは違うということだ。これは複数評価を統合した指数であり、身長や価格のような比率尺度ではない。

言えるのは、同じ評価方法ではAstra Lowが46、Sol xhighが44だったということ。そしてコーディングエージェント系のTerminal-Bench v4.0では**42%対25%**と差が大きかったことだ。

ただしSciCodeはSol xhighが57%、Astra Lowが54%。つまり、Astra Lowがあらゆる能力を完全上位互換にしたわけではない。

「Lowで全部勝つ。はい解散」ではない。そこまで世界は雑ではない。

2. 一番おかしいところ――Astraは単価2.5倍なのに、Lowは評価タスクで安かった

OpenAI公式のAPI単価は明快だ。

モデル 入力 1M token キャッシュ入力 1M token 出力 1M token
GPT-5.6 Sol $4 $0.40 $20
GPT-6 Astra $10 $1 $50

同じtoken量を使えば、AstraはSolの2.5倍である。

Work / Codex向けの公式credit rateも同じ比率で、Astraは入力250・キャッシュ25・出力1,250 credits/1M、Solは100・10・500 credits/1Mだ。

ここだけ見れば「Astra高っ!」で終わる。

ところがArtificial Analysisの評価では、Astra Lowが1タスク$0.82、Sol xhighが$1.18だった。

理由はシンプルで、高い単価のモデルでも、使うtokenが大幅に少なければタスク総額は下がりうるからだ。

同評価では、Sol xhighが1タスク当たり約20kの出力token・約10kの推論tokenを使ったのに対し、Astra Lowは約4k・約938だった。

高級タクシーなのに、目的地まで5分で着いた。普通車は安いけど、なぜか町内を三周してから到着した。そんな料金表である。

ただし、この**$0.82や$1.18はArtificial Analysisの評価タスクでの加重平均**だ。あなたのCodex作業が必ずこの金額になるわけではない。

3. OpenAI自身も「まずLowかMedium」と言っている

ここはかなり重要だ。

OpenAIのWork / Codex向けAstra利用ガイドは、推論強度をモデル選択とは別に調整できると説明している。

そして、低い推論強度は速く返したいときや利用枠を長持ちさせたいときの出発点、Mediumは速度と深い推論のバランス、高い推論強度は難問向けと整理している。

さらに公式ガイドは、Astra LowがSol Highを上回る場合があると明示し、Sol Highで良い結果が出ていた人にはAstra LowまたはMediumから試すよう勧めている。

そしてもう一発。

推論強度を上げても、必ず結果が良くなるわけではない。

つまり「高い設定ほど常に正義」というRPGの武器屋みたいな世界ではない。

4. では、Astra Lowを何に常用すればいい?

Lowを標準にしやすいのは、目的と材料がそろっている仕事だ。

たとえば、仕様が明確な実装、既存コードの局所修正、リファクタリング、テスト追加、コードレビュー、既知のエラー原因調査、資料の要約、比較表作成、決まったルールに沿う反復処理など。

こういう仕事では、必要以上に長く考えるより、短い推論で正しく終わって次へ進む方が全体のスループットが高い。

OpenAIも、結果が要求を外したときは、まず指示が明確か、必要なファイル・接続アプリ・権限が与えられているかを確認するよう案内している。推論強度を上げても、存在しない情報や権限は召喚できない。

「ファイル渡してないけどExtra Highなら透視してくれるやろ」は無理である。

5. LowからMediumへ上げるタイミング――最初の本命エスカレーション

Lowで一度取りこぼしたからといって、いきなりxhighへ飛ぶ必要はない。

最初に上げる先はMediumでいい。

Mediumが向くのは、複数ファイルをまたぐ依存関係、曖昧な仕様、複数の原因候補がある不具合、設計トレードオフ、長めの実装計画、テスト失敗を追いながらの修理などだ。

Artificial Analysisでは、Astra MediumはIntelligence Index 50、Terminal-Bench v4.0 49%、評価タスク当たり$1.54だった。

Lowの46 / 42% / $0.82から性能とコストの両方が上がるが、まだxhighほどの重量級ではない。

つまりMediumは、「Lowではちょっと雑だった。でも戦車を呼ぶほどではない」ときのボス戦装備である。

6. HighとExtra Highはいつ使う?――通勤にヘリを使わない

Highは、Mediumでも中心問題を外す、設計の副作用が大きい、並行処理・性能・安全性・データ移行など失敗時の修理費が高い案件で使う意味がある。

Astra HighはIndex 51、Terminal-Bench 54%、評価タスク当たり$1.72。

Mediumの50 / 49% / $1.54から見ると、上積みはあるが、すべての仕事をHighに固定するほど劇的ではない。

Extra High(xhigh)はさらに明確だ。Artificial AnalysisではIndex 53、Terminal-Bench 60%で今回の5設定中トップ。一方、評価タスク当たりコストは$2.31だった。

難しい根本原因分析、長い自律作業、複数制約が絡む大改修、失敗コストの高い一発勝負には強い。

でも毎回xhighにするのは、コンビニへヘリで行くようなものだ。

行ける。強い。たぶん着く。でも燃料の話をしよう。

7. じゃあSol xhighはもういらない?――そこまでは言えない

Astra Lowが非常に魅力的でも、Sol xhighを「完全に死亡」と判定するのは早い。

理由は三つある。

第一に、ベンチマークごとに勝敗が違う。SciCodeではSol xhigh 57%に対し、AstraはLow/Medium 54%、High 55%、xhigh 56%だった。

第二に、同じtoken量ならSolの公式単価はAstraより60%低い。Astra Lowが評価タスク単位で安かったのは、評価上で大幅にtokenを節約できた結果であって、すべての実作業で保証される性質ではない。

第三に、実際のリポジトリにはベンチマークにない癖がある。巨大な既存コード、独自テスト、権限、ツール呼び出し、長いコンテキスト、社内ルール。最終的な勝者は自分の仕事分布でも確認した方がいい。

ベンチマークは地図であって、自宅の階段の段差までは測ってくれない。

8. 実用ルール――「Low固定」ではなく「Lowから始めて必要時だけ昇格」

実務では次の5段階で十分だ。

状況 推奨
新しい通常タスクを始める Astra Low
指示・材料はそろっているのに核心を一度外した Astra Medium
Mediumでも同じ中心問題を外す / 高難度設計 Astra High
Highでも閉じない / 一発の失敗コストが大きい / 最難関の根本原因 Astra xhigh
問題が解けて通常運転へ戻った Lowへ戻す

これなら、最初から高コスト設定へ張り付く必要もないし、Lowに固執して失敗を何度も繰り返す必要もない。

大事なのは「effortは人格ではなくギア」と考えることだ。

Low車、Medium車、High車、xhigh車を4台買う必要はない。同じAstraのギアを状況で変えればいい。

9. 結論――ずっとAstra Lowでいい?「標準はYes、固定はNo」

2026年9月12日時点の公開データだけで判断するなら、Codexの普段使いをAstra Lowから始める戦略はかなり強い。

Artificial Analysisでは、Astra LowはSol xhighより総合指数が高く、Terminal-Benchでは大きく上回り、評価タスク当たりコストも低かった。

OpenAI自身もAstra Low / Mediumを出発点として勧め、高いeffortが常に良い結果を保証しないと説明している。

ただし、Lowが万能という意味ではない。

通常運転はLow。曖昧・複雑・取りこぼしが出たらMedium。Mediumでも閉じない難所だけHigh。最難関だけxhigh。解けたらLowへ帰る。

これが一番シンプルで、性能も利用枠も無駄にしにくい。

Lowという名前に騙されてはいけない。

Astra Low、節約モードの顔をして普通に一軍である。

広告
めんどいちゃん

この記事を書いた人

めんどいちゃん

仕事や日常の「めんどい」を構造化して、次に動きやすくする記事を書いています。

このサイトについて
広告

新着記事

  1. 1AIでマチアプの文章を作る――恋愛を外注せず「返信フック」だけ量産する
  2. 2サードアイはガチャ専用でいい:第六感を信じる場所、論理で詰める場所
  3. 3四日市とんてき、米を外したら「わんこキャベツ」が始まった
  4. 45秒で結論
  5. 5針一本を何時間も流して全員坊主。それ、魚との遭遇率から変えた方がよくない?

あわせて読みたい

広告