
Créateurs et IA
Stable Diffusion et LLM locaux : pourquoi la VRAM tranche
Pour faire tourner Stable Diffusion et un LLM en local, comparez trois paliers de VRAM : 8 Go pour un 7 B quantifié, 16 Go pour SDXL / Flux FP8 et un 13 B, 32 Go pour la 5090 et un 70 B en 4-bit. Ce dossier vous aide à acheter des Go plutôt qu’un décompte CUDA, et à éviter l’offload vers la RAM qui tue le rythme.
- Auteur
- Par Rédaction MCG
- Date de publication
- Publié le
- Dernière mise à jour
- Mis à jour le
- Temps de lecture
- 8 min de lecture
La VRAM décide, pas le décompte CUDA, et vous le constatez dès qu’un graphe ComfyUI refuse de rester en mémoire. Pour choisir une carte d’IA locale en 2026, comparez trois paliers : 8 Go pour SD 1.5 et un LLM 7 B quantifié, 16 Go pour SDXL, Flux en FP8 et un 13 B sans offload constant, 32 Go pour la 5090 et un 70 B en 4-bit. ComfyUI, dès que vous empilez ControlNet et upscale, pousse chaque palier d’un cran et les secondes deviennent des dizaines. Ce dossier détaille poids, quantifications et contexte avec des exemples concrets, et vous aide à acheter des Go plutôt qu’un slogan Tensor.
Le guide créateurs pose l’ordre des critères. Ici, seuls les poids et le frame buffer comptent.
Trois paliers : 8, 16, 32 Go
Huit Go (5060, généralement constaté autour de ~300–330 €) tiennent SD 1.5, SDXL de base en 1024² et Llama 7 B en 4-bit. Ajoutez un ControlNet, un IP-Adapter, un upscale 2× : ComfyUI bascule en RAM, et vous attendez des dizaines de secondes là où le graphe nu répondait encore. Les drapeaux --lowvram sauvent le lancement, pas le rythme.
Seize Go (5070 Ti, généralement constaté autour de ~850–980 €, ou 5080, généralement constaté autour de ~1 200–1 350 €) ouvrent SDXL avec un ControlNet et un LoRA, Flux.1 Dev en FP8 / GGUF, et un 13 B quantifié sans offload constant. C’est le palier où l’IA locale cesse d’être une démonstration. Voir combien de VRAM en 2026.
Trente-deux Go (5090, 575 W, généralement constatée autour de ~3 500–3 900 €) tiennent Flux FP16, des graphes très chargés et un 70 B en 4-bit. Vérifier la disponibilité. Ce n’est pas un GPU de salon, et vous le sentez déjà au TDP.
Douze Go (5070) se coincent au milieu : SDXL confortable, Flux seulement quantifié, 13 B juste. Mieux que 8 Go. Moins tenable que 16 Go dès que votre flux de travail cesse d’être minimal.
ComfyUI sature plus que le checkpoint
Le checkpoint SDXL FP16 pèse autour de 6,5 Go, mais le VAE, les deux CLIP, un ControlNet (2–3 Go), l’IP-Adapter et le buffer de sampling poussent un graphe sérieux vers 12–16 Go. Flux.1 Dev FP16 annonce 10–12 Go de poids, souvent 16–20 Go une fois les nœuds annexes chargés, et c’est là que 12 Go commencent à swapper.
Les quantifications (FP8, NF4, GGUF) reculent le mur. Elles ne l’effacent pas. Un Flux NF4 tient parfois en 10–12 Go ; le même graphe avec deux ControlNet et un upscale 4× le ramène vers 16 Go, et vous le voyez dans nvidia-smi avant de le sentir à l’attente.
Gardez un seul checkpoint chargé. Alterner SDXL et Flux dans la même session sans unload, c’est le chemin le plus court vers l’OOM. ComfyUI propose des nœuds « unload model » : utilisez-les, ou redémarrez.
AnimateDiff, SVD, les modèles vidéo : autre ligue. Seize Go passent des clips courts. Vingt-quatre à trente-deux Go deviennent le plancher dès que vous empilez les images.
Les cœurs CUDA ne tranchent pas
Un 13 B qui ne rentre pas va en RAM, puis sur le SSD, et la latence explose au point que le token suivant tarde une seconde. Acheter davantage de CUDA sur une carte 12 Go, alors qu’une 16 Go moins dense accueille le modèle, c’est acheter le mauvais chiffre.
ROCm / HIP existent. L’écosystème local (bitsandbytes, kernels, documentation ComfyUI, forks Windows) reste CUDA-first. Le dossier NVIDIA vs AMD 2026 est un débat jeu. Ici, NVIDIA l’emporte parce que les poids et les outils parlent CUDA, pas parce que le raster 1440p est plus propre.
Intel Arc et XPU : possible, davantage de réglages manuels, moins de tutoriels à jour. Utile si la carte est déjà là, pas un achat « pour apprendre ComfyUI ».
LLM : 7 B, 13 B, 70 B
7 B Q4 : 5–8 Go, une 5060 suffit si vous restez sur un contexte raisonnable. 13 B Q4 / Q5 : 9–14 Go, visez 16 Go. 70 B Q4 : environ 35–40 Go de poids selon la quantification ; 32 Go tiennent avec offload, ou vous basculez des couches vers la RAM. Ce n’est plus un PC de jeu.
Le contexte (8 k, 32 k, 128 k) gonfle le cache KV. Un 7 B à 128 k tokens peut dépasser un 13 B à 4 k, et vous le voyez dès que le prompt s’allonge. Lisez la documentation du serveur (llama.cpp, Ollama, vLLM) avant le panier.
Ollama « le modèle charge » n’est pas une mesure. nvidia-smi pendant le prompt montre si vous êtes à 7 Go ou à 15,8 Go. Achetez après avoir vu ce chiffre, pas après un message vantant un contexte 128 k.
Pilotes Studio, pas Game Ready, si vous mélangez Premiere et l’inférence. Windows natif ou WSL2 : les deux fonctionnent ; mélanger les piles CUDA dans les deux environnements, moins.
Quel palier retenir
Pour apprendre, SD 1.5 et un 7 B, une 5060 et de la patience suffisent. Pour produire (SDXL, Flux FP8, 13 B), visez 16 Go, 5070 Ti d’abord, 5080 si le budget tient. 70 B, Flux FP16, vidéo : 5090, ou le nuage à l’heure. Le dossier créateurs recadre le reste. Achetez des Go, pas un slogan Tensor.
Questions fréquentes
8 Go suffisent-ils pour Stable Diffusion en 2026 ?
Pour SD 1.5 et un SDXL nu, oui, souvent avec --lowvram, à condition d’accepter une attente plus longue. ControlNet, upscale et IP-Adapter saturent et basculent vers la RAM, ce que vous sentez tout de suite. Flux FP16, non.
Faut-il compter les cœurs CUDA ?
Non. Un modèle tient en VRAM ou il part en RAM, et la vitesse ne compte qu’après. Seize Go sur 5070 Ti battent 12 Go plus riches en CUDA dès que le graphe ComfyUI grossit.
La 5090 est-elle obligatoire pour un LLM local ?
Non. Les 7 B et 13 B quantifiés tiennent en 8–16 Go si vous restez raisonnable sur le contexte. La 5090 (32 Go) ouvre les 70 B 4-bit et le Flux lourd, dans une fourchette souvent autour de ~3 500–3 900 €.