Skip to content

Latest commit

 

History

History
221 lines (165 loc) · 14.6 KB

File metadata and controls

221 lines (165 loc) · 14.6 KB

Strata

English · 简体中文 · 日本語 · Deutsch · Français · Español · Português

Faites tourner un modèle d'IA de 125 milliards de paramètres sur votre propre PC de jeu
Carte graphique NVIDIA ou AMD (12 Go ou plus) · Windows ou Linux · gratuit et open source

Un jardin de pagode en voxels écrit par le modèle de Strata, qui tourne dans le navigateur
Un jardin de pagode en voxels, généré en une seule requête sur une RTX 5070 avec Strata (IQ3_S, contexte de 128K) · vidéo complète (49 s)

Strata fait tourner Qwen3.8-Flash-Next sur un PC normal. C'est un grand modèle d'IA, très capable, qui demande d'habitude un serveur. Il discute, écrit du code, lit des images et fonctionne avec vos applications et vos agents de code. Rien ne quitte votre PC.

Quelle est sa vitesse ?

Nous l'avons mesurée sur deux PC de jeu ordinaires. Un token correspond à environ ¾ d'un mot.

  • Écrit les réponses : la vitesse à laquelle la réponse s'affiche dans une courte discussion. 60 tokens par seconde, c'est plus rapide que votre lecture.
  • Lit votre prompt : la vitesse à laquelle il absorbe ce que vous envoyez (ici un document, du code ou un historique de discussion de 32K tokens).
NVIDIA : RTX 5070 (12 Go), Ryzen 5 7600, 64 Go de RAMAMD : RX 9070 XT (16 Go), Ryzen 9 3900X, 47 Go de RAM
Taille Écrit les réponses Lit votre prompt
Q2_0 94 tokens/s 2,650 tokens/s
IQ2_XS 79 tokens/s 2,090 tokens/s
IQ3_XXS 62 tokens/s 1,750 tokens/s
IQ3_S 53 tokens/s 1,620 tokens/s
Coder 55 tokens/s 2,180 tokens/s
Taille Écrit les réponses Lit votre prompt
Q2_0 60 tokens/s 1,160 tokens/s
IQ2_XS 52 tokens/s 1,110 tokens/s
Coder 44 tokens/s 1,420 tokens/s

NVIDIA : Q2_0 avec le moteur 0.1.36, les autres lignes avec 0.1.26 (réponses de 4K, prompts de 32K). Les tableaux complets sont dans DETAILS.md. Une carte avec plus de VRAM va plus vite : une RTX 3090 (24 Go) devrait écrire environ 100-140 tokens par seconde. Longues discussions et autres cartes : vitesse de chaque modèle, résultats de la communauté.

Buy Me A Coffee
Strata est gratuit. S'il tourne bien sur votre PC, un café aide à poursuivre le travail.

Ce qu'il vous faut

Carte graphique NVIDIA GeForce RTX série 20, 30, 40 ou 50, ou AMD Radeon RX 7900 XT / XTX, RX 7800 XT / 7700 XT, RX 9060 XT, RX 9070 / 9070 XT, Radeon AI PRO R9700 ou série RX 6800 / 6900. Il faut 12 Go de VRAM ou plus.
RAM 32 Go ou plus. Votre RAM décide quel modèle tient. Avec 64 Go, toutes les tailles tournent.
Disque Environ 80 Go libres. Prenez un SSD si possible : le premier démarrage est bien plus rapide.
Système Windows 10 / 11 ou Linux, avec un pilote graphique NVIDIA ou AMD à jour.

L'installateur s'occupe de tout le reste. Deux ou trois cartes peuvent se partager le modèle (multi-GPU).

Expérimental, écrit et testé par des membres de la communauté sur leurs propres machines :

  • Cartes graphiques plus anciennes (Tesla P40 / V100, GTX 10, Radeon VII / MI50, RX 6700 XT, RX 5500 XT) : Older GPUs.
  • Intel Arc, compilé depuis les sources sous Linux : Intel Arc.
  • AMD Ryzen AI Max (Strix Halo), compilé depuis les sources sous Linux : Strix Halo.
  • Processeurs plus anciens sans AVX2 : ça marche, mais lentement. Older CPUs.

La liste complète : docs/INSTALL.md.

Installation

Laissez votre IA l'installer

Vous utilisez un assistant de code IA (Claude Code, Cursor, Codex, GitHub Copilot, ...) ? Collez-lui ceci :

Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.

Il vérifie votre carte graphique, votre RAM et votre disque, et choisit le modèle qui convient. Ensuite il l'installe, le démarre et vous explique comment connecter vos applications. Les outils d'IA peuvent aussi installer, démarrer et arrêter Strata grâce à son serveur MCP.

Ou faites-le vous-même

Téléchargez Strata et décompressez-le (ou faites un git clone). Windows : double-cliquez sur START-HERE.bat. Linux : lancez ./setup.sh dans le dossier Strata.

Les étapes sont les mêmes pour NVIDIA et AMD. L'installateur détecte votre carte et installe le bon moteur pour elle. Il vous pose quelques questions :

  • quel modèle et quelle taille,
  • combien de contexte (la quantité de texte que le modèle garde en tête),
  • s'il doit lire les images.

Appuyez sur Entrée à chaque fois pour garder la réponse recommandée. Ensuite il télécharge le modèle (environ 70 Go) et le démarre. Si le téléchargement s'arrête, relancez-le : il reprend là où il s'était arrêté. Votre navigateur ouvre l'application Strata à l'adresse http://127.0.0.1:8080.

Pendant le démarrage du modèle, votre PC peut ralentir ou ne plus répondre pendant 1-3 minutes (plus longtemps la première fois). Strata charge 35-55 Go dans votre RAM et en réserve une partie pour la carte graphique. C'est normal. Attendez, et ne fermez pas la fenêtre. La fenêtre montre ce que fait Strata.

La fois suivante, relancez START-HERE.bat (ou ./setup.sh). Il démarre tout de suite et ne télécharge rien deux fois. Fermez sa fenêtre pour arrêter le modèle. UPDATE.bat (./update.sh) met Strata à jour sans le démarrer. Mises à jour, Docker, plusieurs cartes, emplacement des fichiers et toutes les options : docs/INSTALL.md.

Quel modèle choisir ?

L'installateur en recommande un selon votre RAM. Le même modèle existe en plusieurs tailles, plus ou moins compressées. Les petites tailles sont plus rapides. Les grandes sont un peu plus intelligentes.

Votre RAM Prenez Pourquoi
32 Go Coder il tient dans 32 Go et il est fait pour le code (avec une carte de 24 Go, Q2_0 et IQ2_XS tournent aussi)
48 Go IQ2_XS (ou Q2_0, le plus rapide) les plus grandes tailles ne tiennent pas
64 Go IQ2_XS (recommandé), ou IQ3_XXS / IQ3_S toutes les tailles tiennent ; IQ3_S est le meilleur et le plus lent
96 Go ou plus IQ3_S, ou l'UD-IQ4_XS d'Unsloth (~4 bits) de la place pour les plus grandes tailles, avec tout le reste ouvert
  • Coder : une version pour le code, avec la moitié des experts en moins. Elle atteint 91 % du score SWE-bench Verified du modèle complet (mesuré par ses auteurs) et tient dans 32 Go de RAM. Elle est moins bonne en dehors du code, y compris pour le chinois et les autres textes CJK (#438). Pour ces cas, prenez Q2_0, IQ2_XS ou IQ3_S, qui gardent tous les experts.
  • Swift 1.5 : un fine-tune qui réfléchit bien moins longtemps avant de répondre. Vous avez la réponse plus tôt, avec à peu près la même qualité.
  • Unsloth UD-IQ4_XS : la version ~4 bits d'Unsloth, entre IQ3_S et UD-Q4_K_XL en qualité. Un téléchargement de 94 Go. Avec moins de ~80 Go de RAM, Strata en lit une partie depuis le SSD pendant qu'il répond, il y est donc plus lent (un SSD NVMe aide).
  • Unsloth UD-Q4_K_XL (expérimental) : le plus proche du modèle complet. Mais Strata en lit la plus grande partie depuis le SSD pendant qu'il répond, donc il n'écrit que 7-8.5 tokens/s sur un PC avec 64 Go.
  • OrcaRouter's Uncensored IQ3_XXS : vous l'installez à la main. Il n'est pas dans le menu de l'installateur.

Tailles, téléchargements et ce qui tient où : docs/MODELS.md. Pour ajouter un autre modèle plus tard, lancez SETUP.bat (Linux : ./setup.sh --setup).

Utilisation

L'onglet Monitor de l'application Strata à côté d'un agent de code
Le Monitor de l'application Strata (à gauche) pendant qu'un agent de code écrit le jardin de pagode de la vidéo (à droite)

  • Dans le navigateur : ouvrez http://127.0.0.1:8080. Vous y trouvez Chat, un Monitor en direct du modèle et de votre GPU/CPU/RAM, et About avec les réglages et les adresses.
  • Vos applications et agents de code : ajoutez un fournisseur « OpenAI-compatible » avec l'URL de base http://127.0.0.1:8080/v1. N'importe quelle clé API et n'importe quel nom de modèle fonctionnent.
    • Applications qui utilisent l'API d'Anthropic : http://127.0.0.1:8080/v1/messages (Claude Code : ANTHROPIC_BASE_URL=http://127.0.0.1:8080).
    • Codex CLI et les autres applications qui utilisent l'API OpenAI Responses : /v1/responses (configuration).
  • Réflexion : choisissez off, low, medium ou high dans le menu du chat ou dans le « reasoning effort » de votre application. Off est le plus rapide. High est le meilleur pour les questions difficiles.
  • Images : répondez oui à « Images? » pendant l'installation. Ensuite cliquez sur Picture dans le chat, ou joignez des images dans votre application. Les cartes AMD lisent les images sous Linux via le processeur ; sous Windows, pas encore.
  • Depuis votre téléphone ou un autre PC : START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>. Définissez toujours une clé.
  • Une requête à la fois : par défaut, Strata répond à une requête et les autres attendent. Pour répondre à plusieurs en même temps, mettez "parallel": 2 (BATCHING.md). Sur une carte de 12 Go, chaque réponse devient alors plus lente.
  • Longs prompts : Strata lit en entier le premier message d'une discussion, environ 1 minute pour 30,000 tokens. Les messages suivants démarrent en quelques secondes.

Plus d'infos : où sont stockées vos discussions, l'API.

Un problème ?

  • Mon PC s'est figé au premier démarrage de Strata. C'est normal pendant le chargement du modèle. Attendez, et ne fermez pas la fenêtre. Toujours figé après 10 minutes ? Redémarrez le PC, fermez les autres programmes et réessayez, ou choisissez une taille plus petite.
  • Il s'est arrêté pendant le téléchargement ou l'installation. Relancez START-HERE.bat (ou ./setup.sh). Il reprend là où il s'était arrêté.
  • C'est très lent et le voyant du disque clignote sans arrêt, ou il affiche « the engine stopped unexpectedly ». Votre PC n'a pas assez de RAM libre. Fermez les autres programmes (les navigateurs en utilisent beaucoup), ou choisissez une taille plus petite (Q2_0 ou IQ2_XS).
  • Il dit que le port 8080 est déjà utilisé. Strata tourne déjà. Cherchez sa fenêtre.

Autres problèmes et leurs solutions : docs/TROUBLESHOOTING.md. Toujours bloqué ? Ouvrez une issue et joignez strata-<model>.log depuis le dossier Strata. Vous avez trouvé un problème de sécurité ? Signalez-le en privé : SECURITY.md.

Comment ça marche ?

Les modèles comme celui-ci tournent d'habitude sur des serveurs avec des centaines de gigaoctets de mémoire graphique. Votre carte graphique a 12-24 Go. Strata fait tenir le modèle en répartissant le travail sur tout votre PC. Pensez à une cuisine : ce que vous utilisez tout le temps reste sur le plan de travail, et le reste attend dans le placard.

Les 24,576 experts du modèle : les plus sollicités sur la carte graphique, tous en RAM, une table de correspondance sur le SSD

  • Le modèle est une équipe de 24,576 petits spécialistes (les « experts »). Chaque mot n'en demande que 10.
  • Votre carte graphique garde les quelques milliers d'experts les plus utilisés. Votre RAM les contient tous, et votre processeur travaille sur les autres en même temps. Votre SSD contient une grande table de correspondance.

Un petit assistant devine les mots suivants ; le grand modèle les vérifie tous d'un coup et garde les bons

  • Deviner, puis vérifier : un petit assistant devine les quelques mots suivants. Le grand modèle les vérifie tous d'un coup. Vous obtenez la même réponse, 1.6-1.8x plus tôt.
  • Les longs textes sont lus par gros morceaux (jusqu'à 8,192 tokens à la fois), à plus de 1,000 tokens par seconde.

L'explication plus longue : docs/HOW_IT_WORKS.md. Chaque partie et ses chiffres : les détails et l'article.

Crédits et licence

Le modèle est Qwen3.8-Flash-Next, de l'équipe Qwen. Il a été compressé par ISTA-DASLab, UkisAI (Swift 1.5) et Unsloth. Strata utilise des parties de llama.cpp / ggml. Tous les crédits : docs/HOW_IT_WORKS.md. Strata est open source sous licence MIT. Quelques parties et chaque modèle ont leur propre licence (lesquelles).

Soutenir Strata

Strata est gratuit et open source. S'il vous est utile, vous pouvez soutenir son développement :

Buy Me A Coffee