J-Quantsが急にヤバく見えてきた――取引所が個人に開けた日本株データ倉庫で「エッジ探索工場」を作れるのか

読書機能の使い方

聴く:本文を読み上げます。速読:語句を順に表示し、速さを調整できます。語学練習:別の言語版と対訳を読み比べます。保存:このブラウザーにブックマークし、プレイヤーの保存済み一覧から開けます。

この記事をシェア
広告
広告

最近、データ分析をするトレーダーの周辺でJ-Quantsの名前を見る機会が増えた。

最初は「日本株のAPIでしょ」くらいの認識でも、料金表とデータ一覧を開くと急に様子がおかしくなる。株価、財務、信用、空売り、投資部門、配当、先物、オプション、売買内訳。さらに分足・TickやTDnet文書のアドオンまである。

ちょっと待ってほしい。

これは「株価を取れる便利API」というより、取引所が個人向けにデータ倉庫の扉を開けているのではないか。

そしてデータ好きが一覧を見た瞬間、だいたい次の病気が始まる。

「これ、全銘柄×全期間×全特徴量で探索したら、さすがに何か一個くらいあるのでは?」

結論から言うと、見かけ上の「何か」はたぶん大量に出る。問題は、その中に本物が残るかだ。

1. J-Quantsは何なのか

J-Quants APIは、JPX総研が個人向けに提供する日本市場の金融データサービスだ。中心は東証上場株だが、プランによって指数、信用取引、先物、オプションなども扱う。

2026年9月29日時点の個人向け基本プランは次の通り。

プラン 月額税込 主な提供期間・特徴
Free 0円 過去2年、12週間遅延、株価四本値・財務サマリーなど
Light 1,650円 過去5年、CSV一括取得、アドオン利用可
Standard 3,300円 過去10年、指数・信用・空売り系など分析対象が拡大
Premium 16,500円 提供期間全て、最大約20年。前場、財務諸表、配当、先物・オプション、売買内訳など

さらにLight以上では、株式の分足・Tickデータを月額5,500円で追加できる。これは2026年1月に個人版へ追加された。リアルタイム配信ではなく日次提供だ。

2026年5月にはTDnet文書アドオンも月額11,000円で追加された。日中の適時開示と最大5年の履歴をAPIまたはCSVで扱える。

つまり、個人向けだけでも「価格」から「企業イベント」「需給」「高頻度寄りの約定データ」まで、かなり横に広がった。

2. なぜ最近さらに目立つのか

2025年12月にJ-Quants API V2が始まり、認証はAPIキー方式になった。2026年1月にはLight以上でCSV一括取得が追加され、同時に分足・Tickアドオンも始まった。公式CLIはJSON、CSV、Parquetに対応し、バルクダウンロードも扱える。

つまり昔の「APIを叩くコードから全部自作してください」より、入口がかなり低くなった。

そこへ生成AIが来た。

「全銘柄の信用残と株価を取って特徴量を作る」 「決算発表前後だけ抽出する」 「Parquetで保存してDuckDBで読む」 といった作業は、以前より圧倒的に自動化しやすい。

データが増えただけではない。データを扱う摩擦が下がった。

さらに法人向けのJ-Quants Proでは、2026年9月28日に東証上場銘柄の1分足OHLC・出来高・売買代金の提供が始まり、全銘柄の信用取引残高も週次から日次へ拡充された。

ここは個人版とProを混同してはいけない。ただし「JPXが日本市場データの配信粒度を上げ続けている」という大きな流れは同じだ。

3. 「データ量がヤバい」の本当の意味

重要なのはファイル容量ではない。

数千銘柄を横断して、価格、出来高、財務、決算、信用、空売り、業種、指数、配当、売買内訳を同じ時系列に並べられることだ。

先物の単一市場を1秒単位で深く見る研究では、時間方向の観測は大量に得られる。一方、日本株のクロスセクションでは、同じ日に似た状態が複数銘柄で発生する。

例えば、

  • 決算後数日
  • 出来高急増
  • 株価上昇
  • 信用買い残増加
  • 空売り増加
  • 同業種は横ばい
  • 時価総額帯は一定範囲

という状態を、何年も何千銘柄も横断して集められる。

「ある日の一回きりの現象」ではなく、「似た状態の別個体」を大量に作れる。ここが強い。

4. ただし、数千設定を試したから網羅的とは限らない

バックテストでありがちな罠がある。

パラメータを2,000通り試しても、それが「独立した2,000種類の仮説」とは限らない。

たとえば移動平均20日、21日、22日、23日……と大量に振っても、本質的には同じ仮説族の周辺を細かく掘っているだけかもしれない。

逆に本当に探索空間を広げるなら、

価格パターンだけでなく、 需給状態、 企業イベント、 市場レジーム、 セクター相対、 流動性、 執行方法、 保有期間、 損切り構造、

まで別の軸として切る必要がある。

「大量に試した」と「広く探した」は別物だ。

5. そして最大の罠――そりゃ一個くらい当たる

データが巨大になるほど、強そうな戦略は簡単に見つかる。

これは朗報ではなく、半分は警報だ。

Baileyらのバックテスト過学習研究は、試行する戦略構成の数が増えるほど、偶然よく見えるバックテストを選びやすくなることを示している。Deflated Sharpe Ratioも、複数試行による選択バイアスを補正するための考え方だ。

だから、

「1万個探索してSharpe 2.1を見つけた!」

より先に聞くべきなのは、

「1万個試したうちの最大値では?」

である。

データが増えるとエッジ候補は増える。同時に偽エッジ候補も爆増する。

6. 本物候補を残す研究設計

大規模な日本株探索をするなら、最低でも次の構造が必要になる。

Discovery

探索に使ってよい期間だけで特徴量や条件を試す。

Freeze

候補を見つけたら、ルール、パラメータ、執行条件を固定する。後から都合よくいじらない。

Sealed holdout

一度も見ていない期間で検証する。結果を見て条件を変えたら、その期間はもうholdoutではない。

Point-in-time

当時まだ公表されていなかった財務情報を過去日に混ぜない。修正後データや現在の銘柄分類を過去へ逆流させない。

Survivorship

今も上場している銘柄だけで過去を研究しない。上場廃止銘柄を消すと結果がきれいになりすぎる。

Corporate actions

分割、併合、配当、上場廃止、銘柄変更を正しく処理する。

Costs

手数料、スプレッド、スリッページ、流動性、約定可能性を入れる。特に小型株で理論価格のまま無限に買える世界を作らない。

Multiple testing

何個の仮説族、何個のパラメータ、何回の再探索を行ったかを記録する。

「当たりを探す工場」ではなく、「偽物を落とす工場」にする方が重要だ。

7. Premiumは4TBあるのか

公式は「Premium全部で何GB」という総容量を公表していない。

したがって、4TBという数字を公式値のように扱うことはできない。

日足中心のPremium本体だけなら、数千銘柄×数千営業日という規模なので、圧縮した分析用形式で直ちに数TBへ達するとは考えにくい。一方、Tick、派生特徴量、多数の時間窓、ラベル、学習用キャッシュを生成すると、研究ディレクトリは簡単に膨張する。

つまり怖いのは生データより、

「5日変化率」 「20日z-score」 「決算後フラグ」 「信用残変化」 「セクター相対」 「将来1日・5日・20日リターン」 「各種クロス」

を片っ端から物質化した後である。

生データ倉庫は普通サイズでも、特徴量工場がゴジラになる。

8. 無料でどこまで始められるか

最初からPremiumを契約しなくても、試作はできる。

J-Quants Freeは0円で、過去2年・12週間遅延の株価や財務サマリーが使える。短期売買の当日シグナルには向かないが、研究コードを作るには使える。

さらにJPXが開催したKaggleの「JPX Tokyo Stock Exchange Prediction」には、公式の歴史データが残っている。データセットは約1.33GBで、主要約2,000銘柄の日足、低流動性銘柄、四半期財務、オプション、週次売買集計、銘柄一覧などが含まれる。利用にはKaggle側のCompetition Rulesへの同意が必要だ。

これは「Premiumの違法ミラー」ではない。公式コンペ用に公開された別データセットだ。

一方、誰かがJ-Quants Premiumの取得済み生データを丸ごとネットへ再配布することは、個人版の利用条件と衝突する。J-Quantsは分析結果や手法の公開は認めているが、取得データを第三者が閲覧できる形で配布・共有することは禁止している。

だから「20年分のPremium全部入りTorrent」が見当たらないのは、検索力不足というより、ライセンス設計上かなり自然だ。

9. 一番合理的な始め方

研究用途なら、順序はこうなる。

  1. Kaggle公式データとJ-Quants Freeで研究パイプラインを作る
  2. point-in-time、銘柄マスター、corporate action、delistingを最初から設計する
  3. 特徴量を「価格」「需給」「イベント」「財務」「市場状態」など仮説族ごとに分ける
  4. discoveryとsealed holdoutを物理的に分離する
  5. 候補が残ったらStandardまたはPremiumへ拡張する
  6. Light以上のCSV一括取得や公式CLIを使い、初回バックフィルはバルクで行う
  7. 運用時は差分更新する
  8. 分足・Tickは「必要な仮説がある場合」に追加する

Premiumを契約すること自体が研究ではない。

データセンターを建てて満足してはいけない。

10. J-Quantsの本当の強さ

J-Quantsの魅力は「必勝データが入っている」ことではない。

価格以外の市場状態を、取引所由来の整形データで、長期間・多数銘柄にわたって同じ研究系へ流し込めることだ。

単純なチャートパターンを何千通り振る研究から、

「どんな市場状態で、どんな銘柄群に、どんな需給変化が起き、その後どの時間軸で何が残るか」

を探す研究へ移れる。

そして最終的に一個も残らない可能性も普通にある。

それでも価値はある。

「エッジがあるはず」と信じるのではなく、「ここまで潰して残ったものだけを候補にする」ための設備だからだ。

データが多いほど夢は広がる。

そして統計学は、同じ速度で消火器を持って追いかけてくる。

参考資料


PRこのテーマの本を探す

この記事には広告(アフィリエイトリンク)が含まれます。 広告について

広告

他の記事を探す

すべての記事

めんどいちゃん

この記事を書いた人

めんどいちゃん

仕事や日常の「めんどい」を構造化して、次に動きやすくする記事を書いています。

このサイトについて
広告

新着記事

  1. 1「行動しろ」の正体:反芻を環境選択・時間選択・作戦変更に変換する
  2. 2冬眠は睡眠ではない:低電力の生命維持モードとして見る
  3. 3AIに気分を記録すると、自分の波が客観的に見えておもしろい
  4. 4ゼロが撤退した時点で黒の騎士団も逃げるべきだった|藤堂とゼロ属人化の限界
  5. 5「分からせたい/分からせられたい」はMなのか――支配、服従、尻に敷かれたいを分ける

あわせて読みたい

広告