Skip to content

Latest commit

 

History

History
211 lines (155 loc) · 17 KB

File metadata and controls

211 lines (155 loc) · 17 KB

Strata

English · 简体中文 · 日本語 · Deutsch · Français · Español · Português

1,250 億パラメータの AI モデルを、手元のゲーミング PC で動かす
NVIDIA または AMD のグラフィックカード(12 GB 以上) · Windows または Linux · 無料のオープンソース

Strata のモデルが書いたボクセルの五重塔の庭。ブラウザで動いている様子
ボクセルの五重塔の庭。1 回のプロンプトで作成し、RTX 5070 上の Strata(IQ3_S、128K コンテキスト)で実行 · 動画全体(49 秒)

Strata は Qwen3.8-Flash-Next を普通の PC で動かします。 これは大きくて賢い AI モデルで、ふつうはサーバーが必要です。チャットをしたり、コードを書いたり、画像を読んだりできます。 アプリやコーディングエージェントとも連携します。データが PC の外に出ることはありません。

どのくらい速い?

ごく普通のゲーミング PC 2 台で測りました。1 トークンは英単語のおよそ ¾ です。

  • 回答の書き出し: 短いチャットで返答が表示される速さです。毎秒 60 トークンあれば、読むより速く表示されます。
  • プロンプトの読み込み: 送った内容を取り込む速さです(ここでは 32K トークンの文書、コード、またはチャット履歴)。
NVIDIA: RTX 5070 (12 GB), Ryzen 5 7600, 64 GB RAMAMD: RX 9070 XT (16 GB), Ryzen 9 3900X, 47 GB RAM
サイズ 回答の書き出し プロンプトの読み込み
Q2_0 94 tokens/s 2,650 tokens/s
IQ2_XS 79 tokens/s 2,090 tokens/s
IQ3_XXS 62 tokens/s 1,750 tokens/s
IQ3_S 53 tokens/s 1,620 tokens/s
Coder 55 tokens/s 2,180 tokens/s
サイズ 回答の書き出し プロンプトの読み込み
Q2_0 60 tokens/s 1,160 tokens/s
IQ2_XS 52 tokens/s 1,110 tokens/s
Coder 44 tokens/s 1,420 tokens/s

NVIDIA:Q2_0 はエンジン 0.1.36、ほかの行は 0.1.26 で測定(回答 4K、プロンプト 32K)。表の全体は DETAILS.md にあります。VRAM が多いカードほど速くなります。RTX 3090(24 GB)なら 毎秒およそ 100-140 トークンで書き出せるはずです。長いチャットやほかのカードについて:モデルごとの速度、 コミュニティの測定結果。

Buy Me A Coffee
Strata は無料です。あなたの PC でうまく動いたら、コーヒー 1 杯の支援が開発を続ける力になります。

必要なもの

グラフィックカード NVIDIA GeForce RTX 20、30、40、50 シリーズ、または AMD Radeon RX 7900 XT / XTX、RX 7800 XT / 7700 XT、RX 9060 XT、RX 9070 / 9070 XT、Radeon AI PRO R9700、RX 6800 / 6900 シリーズ。VRAM 12 GB 以上が必要です。
RAM 32 GB 以上。RAM の量で使えるモデルが決まります。64 GB あればすべてのサイズが動きます。
ディスク 空き容量が約 80 GB。できれば SSD を使ってください。初回の起動がずっと速くなります。
OS Windows 10 / 11 または Linux。NVIDIA または AMD の最新のグラフィックドライバー。

ほかに必要なものはすべてインストーラーが用意します。2 枚や 3 枚のカードでモデルを分担することもできます(マルチ GPU)。

試験的なサポート。コミュニティのメンバーが自分のマシンで書き、テストしたものです:

  • 古いグラフィックカード(Tesla P40 / V100、GTX 10、Radeon VII / MI50、RX 6700 XT、RX 5500 XT):Older GPUs。
  • Intel Arc(Linux でソースからビルド):Intel Arc。
  • AMD Ryzen AI Max(Strix Halo)(Linux でソースからビルド):Strix Halo。
  • AVX2 のない古いプロセッサー:動きますが、遅いです。Older CPUs。

全リスト:docs/INSTALL.md。

インストール

AI にセットアップしてもらう

AI コーディングアシスタント(Claude Code、Cursor、Codex、GitHub Copilot など)を使っていますか? これを貼り付けてください:

Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.

AI がグラフィックカード、RAM、ディスクを調べて、合うモデルを選びます。それからインストールして起動し、 アプリのつなぎ方を教えてくれます。AI ツールは Strata の MCP サーバー を通じて、 Strata のインストール、起動、停止もできます。

自分でやる

Strata をダウンロードして展開します(または git clone します)。 Windows: START-HERE.bat をダブルクリック。Linux: Strata フォルダーで ./setup.sh を実行します。

手順は NVIDIA でも AMD でも同じです。インストーラーがカードを見つけて、それに合うエンジンを用意します。 いくつか質問があります:

  • どのモデルを、どのサイズで使うか
  • コンテキストをどのくらいにするか(モデルが覚えておけるテキストの量)
  • 画像を読ませるかどうか

毎回 Enter を押せば、おすすめの答えになります。そのあとモデル(約 70 GB)をダウンロードして起動します。 ダウンロードが止まったら、もう一度実行してください。続きから再開します。ブラウザーで Strata アプリが http://127.0.0.1:8080 に開きます。

モデルの起動中、1-3 分ほど PC が重くなったり、反応しなくなったりすることがあります(初回がいちばん長いです)。 Strata は 35-55 GB を RAM に読み込み、その一部をグラフィックカード用に固定します。これは正常です。 ウィンドウを閉じずに待ってください。Strata が何をしているかはウィンドウに表示されます。

次回からは START-HERE.bat(または ./setup.sh)をもう一度実行します。すぐに起動し、同じものを 2 回ダウンロードすることはありません。 モデルを止めるときはウィンドウを閉じます。UPDATE.bat(./update.sh)を使うと、Strata を起動せずに更新できます。 更新、Docker、複数のカード、ファイルの保存場所、すべてのオプションについて:docs/INSTALL.md。

どのモデルを選べばいい

インストーラーが RAM に合わせてひとつ勧めます。同じモデルにも、圧縮の強さが違う複数のサイズがあります。 小さいサイズほど速く、大きいサイズほど少し賢くなります。

RAM 選ぶもの 理由
32 GB Coder 32 GB に収まり、コード向けに作られている(24 GB のカードなら Q2_0 と IQ2_XS も動く)
48 GB IQ2_XS(または最速の Q2_0) 大きいサイズは収まらない
64 GB IQ2_XS(おすすめ)、または IQ3_XXS / IQ3_S すべてのサイズが収まる。IQ3_S がいちばん賢く、いちばん遅い
96 GB 以上 IQ3_S、または Unsloth の UD-IQ4_XS(約 4-bit) ほかのものを全部開いたままでも、最大のサイズが入る余裕がある
  • Coder: エキスパートを半分取り除いたコーディング向け版です。フルモデルの SWE-bench Verified スコアの 91% に届き(作者による測定)、32 GB の RAM に収まります。コード以外では弱く、中国語などの CJK のテキストも苦手です(#438)。 そうした用途には、すべてのエキスパートを残している Q2_0、IQ2_XS、IQ3_S を選んでください。
  • Swift 1.5: 答える前に考える時間がずっと短いファインチューン版です。 ほぼ同じ品質のまま、答えが早く返ってきます。
  • Unsloth UD-IQ4_XS: Unsloth の約 4-bit 版で、品質は IQ3_S と UD-Q4_K_XL の間です。 ダウンロードは 94 GB。RAM が約 80 GB 未満だと、答えている間に Strata がその一部を SSD から読むので遅くなります(NVMe SSD が有効です)。
  • Unsloth UD-Q4_K_XL(試験的):フルモデルにいちばん近いものです。 ただし答えている間、Strata はその大部分を SSD から読むので、64 GB の PC では毎秒 7-8.5 トークンしか書き出せません。
  • OrcaRouter's Uncensored IQ3_XXS: 手動でセットアップします。 インストーラーのメニューにはありません。

サイズ、ダウンロード、どれがどこに収まるかについて:docs/MODELS.md。あとで別のモデルを追加するには SETUP.bat(Linux:./setup.sh --setup)を実行します。

使い方

Strata アプリの Monitor タブと、その横で動くコーディングエージェント
Strata アプリの Monitor(左)。コーディングエージェントが動画の五重塔の庭を書いているところ(右)

  • ブラウザーで: http://127.0.0.1:8080 を開きます。Chat、モデルと GPU/CPU/RAM の様子をリアルタイムで見る Monitor、 設定とアドレスが載った About があります。
  • アプリやコーディングエージェントから: 「OpenAI-compatible」プロバイダーを追加し、ベース URL に http://127.0.0.1:8080/v1 を指定します。API キーとモデル名は何でもかまいません。
    • Anthropic の API を使うアプリ:http://127.0.0.1:8080/v1/messages(Claude Code: ANTHROPIC_BASE_URL=http://127.0.0.1:8080)。
    • Codex CLI など OpenAI Responses API を使うアプリ:/v1/responses (設定方法)。
  • 思考(Thinking): チャットのメニュー、またはアプリの「reasoning effort」で off、low、medium、high を選びます。 off がいちばん速く、high は難しい質問に向いています。
  • 画像: セットアップで「Images?」に yes と答えます。そのあとチャットで Picture をクリックするか、アプリで画像を添付します。 AMD のカードは、Linux ではプロセッサーを使って画像を読みます。Windows ではまだ読めません。
  • スマートフォンや別の PC から: START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>。キーは必ず設定してください。
  • リクエストは 1 つずつ: 初期設定では Strata は 1 つのリクエストに答え、ほかは待ちます。複数に同時に答えるには "parallel": 2 を設定します(BATCHING.md)。12 GB のカードでは、それぞれの回答が遅くなります。
  • 長いプロンプト: Strata はチャットの最初のメッセージをすべて読みます。30,000 トークンあたり約 1 分かかります。 2 通目以降のメッセージは数秒で始まります。

詳しくは:チャットの保存場所、API。

うまくいかないとき

  • Strata の初回起動で PC が固まった。 モデルの読み込み中はよくあることです。ウィンドウを閉じずに待ってください。 10 分たっても固まったまま? PC を再起動し、ほかのプログラムを閉じてもう一度試すか、小さいサイズを選んでください。
  • ダウンロードやインストールの途中で止まった。 START-HERE.bat(または ./setup.sh)をもう一度実行してください。 止まったところから続きます。
  • とても遅く、ディスクのランプが点滅し続ける。または「the engine stopped unexpectedly」と表示される。 PC の空き RAM が 足りません。ほかのプログラムを閉じるか(ブラウザーは多く使います)、小さいサイズ(Q2_0 または IQ2_XS)を選んでください。
  • ポート 8080 がすでに使われていると表示される。 Strata はもう動いています。そのウィンドウを探してください。

ほかの問題と解決方法:docs/TROUBLESHOOTING.md。それでも解決しない場合は issue を作成し、Strata フォルダーにある strata-<model>.log を添付してください。 セキュリティの問題を見つけたら、非公開で報告してください:SECURITY.md。

しくみ

このようなモデルは、ふつう数百ギガバイトのグラフィックメモリを持つサーバーで動きます。あなたのグラフィックカードは 12-24 GB です。Strata は PC 全体で作業を分担する ことで、モデルを収めています。台所を思い浮かべてください。 いつも使う道具は調理台に置き、残りは食料庫にしまっておきます。

モデルの 24,576 個のエキスパート:よく使うものはグラフィックカードに、すべては RAM に、ルックアップテーブルは SSD に

  • モデルは 24,576 個の小さな専門家(「エキスパート」)のチームです。 1 語ごとに必要なのはそのうち 10 個だけです。
  • グラフィックカード は、よく使われる数千個のエキスパートを持ちます。RAM はすべてのエキスパートを持ち、 プロセッサー が残りを同時に処理します。SSD は大きなルックアップテーブルを持ちます。

小さなヘルパーが次の単語を予想し、大きなモデルがまとめて確認して正しいものを残す

  • 予想してから確認: 小さなヘルパーが次の数語を予想します。大きなモデルがそれをまとめて確認します。 答えは同じまま、1.6-1.8x 早く返ってきます。
  • 長いテキストは大きなまとまりで読みます(一度に最大 8,192 トークン)。速さは毎秒 1,000 トークン以上です。

もっと詳しい説明:docs/HOW_IT_WORKS.md。各部分とその数値: 詳細と論文。

クレジットとライセンス

モデルは Qwen チームの Qwen3.8-Flash-Next です。 圧縮は ISTA-DASLab、UkisAI(Swift 1.5)、 Unsloth によるものです。Strata は llama.cpp / ggml の一部を使っています。すべてのクレジット: docs/HOW_IT_WORKS.md。Strata は MIT License のオープンソースです。一部のパーツと すべてのモデルには、それぞれ独自のライセンスがあります(どれか)。

Strata を支援する

Strata は無料のオープンソースです。役に立ったら、開発を支援していただけます:

Buy Me A Coffee