English · 简体中文 · 日本語 · Deutsch · Français · Español · Português
1,250 億パラメータの AI モデルを、手元のゲーミング PC で動かす
NVIDIA または AMD のグラフィックカード(12 GB 以上) · Windows または Linux · 無料のオープンソース

ボクセルの五重塔の庭。1 回のプロンプトで作成し、RTX 5070 上の Strata(IQ3_S、128K コンテキスト)で実行 ·
動画全体(49 秒)
Strata は Qwen3.8-Flash-Next を普通の PC で動かします。 これは大きくて賢い AI モデルで、ふつうはサーバーが必要です。チャットをしたり、コードを書いたり、画像を読んだりできます。 アプリやコーディングエージェントとも連携します。データが PC の外に出ることはありません。
ごく普通のゲーミング PC 2 台で測りました。1 トークンは英単語のおよそ ¾ です。
- 回答の書き出し: 短いチャットで返答が表示される速さです。毎秒 60 トークンあれば、読むより速く表示されます。
- プロンプトの読み込み: 送った内容を取り込む速さです(ここでは 32K トークンの文書、コード、またはチャット履歴)。
| NVIDIA: RTX 5070 (12 GB), Ryzen 5 7600, 64 GB RAM | AMD: RX 9070 XT (16 GB), Ryzen 9 3900X, 47 GB RAM | ||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
|
|
NVIDIA:Q2_0 はエンジン 0.1.36、ほかの行は 0.1.26 で測定(回答 4K、プロンプト 32K)。表の全体は DETAILS.md にあります。VRAM が多いカードほど速くなります。RTX 3090(24 GB)なら 毎秒およそ 100-140 トークンで書き出せるはずです。長いチャットやほかのカードについて:モデルごとの速度、 コミュニティの測定結果。
Strata は無料です。あなたの PC でうまく動いたら、コーヒー 1 杯の支援が開発を続ける力になります。
| グラフィックカード | NVIDIA GeForce RTX 20、30、40、50 シリーズ、または AMD Radeon RX 7900 XT / XTX、RX 7800 XT / 7700 XT、RX 9060 XT、RX 9070 / 9070 XT、Radeon AI PRO R9700、RX 6800 / 6900 シリーズ。VRAM 12 GB 以上が必要です。 |
| RAM | 32 GB 以上。RAM の量で使えるモデルが決まります。64 GB あればすべてのサイズが動きます。 |
| ディスク | 空き容量が約 80 GB。できれば SSD を使ってください。初回の起動がずっと速くなります。 |
| OS | Windows 10 / 11 または Linux。NVIDIA または AMD の最新のグラフィックドライバー。 |
ほかに必要なものはすべてインストーラーが用意します。2 枚や 3 枚のカードでモデルを分担することもできます(マルチ GPU)。
試験的なサポート。コミュニティのメンバーが自分のマシンで書き、テストしたものです:
- 古いグラフィックカード(Tesla P40 / V100、GTX 10、Radeon VII / MI50、RX 6700 XT、RX 5500 XT):Older GPUs。
- Intel Arc(Linux でソースからビルド):Intel Arc。
- AMD Ryzen AI Max(Strix Halo)(Linux でソースからビルド):Strix Halo。
- AVX2 のない古いプロセッサー:動きますが、遅いです。Older CPUs。
全リスト:docs/INSTALL.md。
AI コーディングアシスタント(Claude Code、Cursor、Codex、GitHub Copilot など)を使っていますか? これを貼り付けてください:
Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.
AI がグラフィックカード、RAM、ディスクを調べて、合うモデルを選びます。それからインストールして起動し、 アプリのつなぎ方を教えてくれます。AI ツールは Strata の MCP サーバー を通じて、 Strata のインストール、起動、停止もできます。
Strata をダウンロードして展開します(または git clone します)。
Windows: START-HERE.bat をダブルクリック。Linux: Strata フォルダーで ./setup.sh を実行します。
手順は NVIDIA でも AMD でも同じです。インストーラーがカードを見つけて、それに合うエンジンを用意します。 いくつか質問があります:
- どのモデルを、どのサイズで使うか
- コンテキストをどのくらいにするか(モデルが覚えておけるテキストの量)
- 画像を読ませるかどうか
毎回 Enter を押せば、おすすめの答えになります。そのあとモデル(約 70 GB)をダウンロードして起動します。
ダウンロードが止まったら、もう一度実行してください。続きから再開します。ブラウザーで Strata アプリが
http://127.0.0.1:8080 に開きます。
モデルの起動中、1-3 分ほど PC が重くなったり、反応しなくなったりすることがあります(初回がいちばん長いです)。 Strata は 35-55 GB を RAM に読み込み、その一部をグラフィックカード用に固定します。これは正常です。 ウィンドウを閉じずに待ってください。Strata が何をしているかはウィンドウに表示されます。
次回からは START-HERE.bat(または ./setup.sh)をもう一度実行します。すぐに起動し、同じものを 2 回ダウンロードすることはありません。
モデルを止めるときはウィンドウを閉じます。UPDATE.bat(./update.sh)を使うと、Strata を起動せずに更新できます。
更新、Docker、複数のカード、ファイルの保存場所、すべてのオプションについて:docs/INSTALL.md。
インストーラーが RAM に合わせてひとつ勧めます。同じモデルにも、圧縮の強さが違う複数のサイズがあります。 小さいサイズほど速く、大きいサイズほど少し賢くなります。
| RAM | 選ぶもの | 理由 |
|---|---|---|
| 32 GB | Coder | 32 GB に収まり、コード向けに作られている(24 GB のカードなら Q2_0 と IQ2_XS も動く) |
| 48 GB | IQ2_XS(または最速の Q2_0) | 大きいサイズは収まらない |
| 64 GB | IQ2_XS(おすすめ)、または IQ3_XXS / IQ3_S | すべてのサイズが収まる。IQ3_S がいちばん賢く、いちばん遅い |
| 96 GB 以上 | IQ3_S、または Unsloth の UD-IQ4_XS(約 4-bit) | ほかのものを全部開いたままでも、最大のサイズが入る余裕がある |
- Coder: エキスパートを半分取り除いたコーディング向け版です。フルモデルの SWE-bench Verified スコアの 91% に届き(作者による測定)、32 GB の RAM に収まります。コード以外では弱く、中国語などの CJK のテキストも苦手です(#438)。 そうした用途には、すべてのエキスパートを残している Q2_0、IQ2_XS、IQ3_S を選んでください。
- Swift 1.5: 答える前に考える時間がずっと短いファインチューン版です。 ほぼ同じ品質のまま、答えが早く返ってきます。
- Unsloth UD-IQ4_XS: Unsloth の約 4-bit 版で、品質は IQ3_S と UD-Q4_K_XL の間です。 ダウンロードは 94 GB。RAM が約 80 GB 未満だと、答えている間に Strata がその一部を SSD から読むので遅くなります(NVMe SSD が有効です)。
- Unsloth UD-Q4_K_XL(試験的):フルモデルにいちばん近いものです。 ただし答えている間、Strata はその大部分を SSD から読むので、64 GB の PC では毎秒 7-8.5 トークンしか書き出せません。
- OrcaRouter's Uncensored IQ3_XXS: 手動でセットアップします。 インストーラーのメニューにはありません。
サイズ、ダウンロード、どれがどこに収まるかについて:docs/MODELS.md。あとで別のモデルを追加するには
SETUP.bat(Linux:./setup.sh --setup)を実行します。

Strata アプリの Monitor(左)。コーディングエージェントが動画の五重塔の庭を書いているところ(右)
- ブラウザーで:
http://127.0.0.1:8080を開きます。Chat、モデルと GPU/CPU/RAM の様子をリアルタイムで見る Monitor、 設定とアドレスが載った About があります。 - アプリやコーディングエージェントから: 「OpenAI-compatible」プロバイダーを追加し、ベース URL に
http://127.0.0.1:8080/v1を指定します。API キーとモデル名は何でもかまいません。- Anthropic の API を使うアプリ:
http://127.0.0.1:8080/v1/messages(Claude Code:ANTHROPIC_BASE_URL=http://127.0.0.1:8080)。 - Codex CLI など OpenAI Responses API を使うアプリ:
/v1/responses(設定方法)。
- Anthropic の API を使うアプリ:
- 思考(Thinking): チャットのメニュー、またはアプリの「reasoning effort」で off、low、medium、high を選びます。 off がいちばん速く、high は難しい質問に向いています。
- 画像: セットアップで「Images?」に yes と答えます。そのあとチャットで Picture をクリックするか、アプリで画像を添付します。 AMD のカードは、Linux ではプロセッサーを使って画像を読みます。Windows ではまだ読めません。
- スマートフォンや別の PC から:
START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>。キーは必ず設定してください。 - リクエストは 1 つずつ: 初期設定では Strata は 1 つのリクエストに答え、ほかは待ちます。複数に同時に答えるには
"parallel": 2を設定します(BATCHING.md)。12 GB のカードでは、それぞれの回答が遅くなります。 - 長いプロンプト: Strata はチャットの最初のメッセージをすべて読みます。30,000 トークンあたり約 1 分かかります。 2 通目以降のメッセージは数秒で始まります。
- Strata の初回起動で PC が固まった。 モデルの読み込み中はよくあることです。ウィンドウを閉じずに待ってください。 10 分たっても固まったまま? PC を再起動し、ほかのプログラムを閉じてもう一度試すか、小さいサイズを選んでください。
- ダウンロードやインストールの途中で止まった。
START-HERE.bat(または./setup.sh)をもう一度実行してください。 止まったところから続きます。 - とても遅く、ディスクのランプが点滅し続ける。または「the engine stopped unexpectedly」と表示される。 PC の空き RAM が 足りません。ほかのプログラムを閉じるか(ブラウザーは多く使います)、小さいサイズ(Q2_0 または IQ2_XS)を選んでください。
- ポート 8080 がすでに使われていると表示される。 Strata はもう動いています。そのウィンドウを探してください。
ほかの問題と解決方法:docs/TROUBLESHOOTING.md。それでも解決しない場合は
issue を作成し、Strata フォルダーにある strata-<model>.log を添付してください。
セキュリティの問題を見つけたら、非公開で報告してください:SECURITY.md。
このようなモデルは、ふつう数百ギガバイトのグラフィックメモリを持つサーバーで動きます。あなたのグラフィックカードは 12-24 GB です。Strata は PC 全体で作業を分担する ことで、モデルを収めています。台所を思い浮かべてください。 いつも使う道具は調理台に置き、残りは食料庫にしまっておきます。
- モデルは 24,576 個の小さな専門家(「エキスパート」)のチームです。 1 語ごとに必要なのはそのうち 10 個だけです。
- グラフィックカード は、よく使われる数千個のエキスパートを持ちます。RAM はすべてのエキスパートを持ち、 プロセッサー が残りを同時に処理します。SSD は大きなルックアップテーブルを持ちます。
- 予想してから確認: 小さなヘルパーが次の数語を予想します。大きなモデルがそれをまとめて確認します。 答えは同じまま、1.6-1.8x 早く返ってきます。
- 長いテキストは大きなまとまりで読みます(一度に最大 8,192 トークン)。速さは毎秒 1,000 トークン以上です。
もっと詳しい説明:docs/HOW_IT_WORKS.md。各部分とその数値: 詳細と論文。
モデルは Qwen チームの Qwen3.8-Flash-Next です。 圧縮は ISTA-DASLab、UkisAI(Swift 1.5)、 Unsloth によるものです。Strata は llama.cpp / ggml の一部を使っています。すべてのクレジット: docs/HOW_IT_WORKS.md。Strata は MIT License のオープンソースです。一部のパーツと すべてのモデルには、それぞれ独自のライセンスがあります(どれか)。
Strata は無料のオープンソースです。役に立ったら、開発を支援していただけます:
