
Créateurs et IA
Machine learning à la maison : configurer une carte NVIDIA
Pour apprendre le machine learning à la maison, comparez CUDA, 16 Go de VRAM, les pilotes Studio et Windows ou WSL2 plutôt qu’une 5090. Ce dossier vous aide à monter un poste d’apprentissage (CNN, fine-tune 7–13 B) sans déboguer ROCm ni payer 575 W pour un premier backward().
- Auteur
- Par Rédaction MCG
- Date de publication
- Publié le
- Dernière mise à jour
- Mis à jour le
- Temps de lecture
- 8 min de lecture
CUDA d’abord, puis 16 Go, des pilotes Studio et Windows ou WSL2 : une 5070 Ti suffit pour apprendre CNN, notebooks et fine-tune 7–13 B, et une 5090 n’est pas un prérequis. Pour monter un poste d’apprentissage ML en 2026, comparez quatre critères : l’écosystème CUDA (wheels PyTorch, pas ROCm à déboguer), la VRAM (16 Go plutôt que 8), un seul pilote Studio, et 32 Go de RAM système pour les dataloaders. Ce dossier détaille Windows, WSL et les paliers mémoire avec des exemples concrets, et vous aide à avancer sur un premier backward() sans payer 575 W pour un cours.
Le guide créateurs mélange IA générative et montage. Ici, le sujet est le poste d’apprentissage ML, pas ComfyUI.
CUDA, le prérequis
PyTorch et JAX sortent des binaires CUDA. TensorFlow GPU aussi, avec un temps de retard. Un tutoriel 2026 qui dit pip install torch suppose une GeForce. Sur Radeon, chercher une wheel ROCm, lire une issue, perdre la soirée, et vous n’avez toujours pas lancé le notebook.
Le comparatif NVIDIA vs AMD tranche le jeu. Pour le ML maison, NVIDIA l’emporte parce que l’écosystème a choisi, pas parce que le raster 1440p est plus propre.
Intel et oneAPI / XPU : possible, encore plus de recoins. Utile si la carte est déjà là. Pas un achat « pour apprendre ».
Pilotes Studio, Windows, WSL
Game Ready suffit à lancer nvidia-smi. Studio est plus calme si le même PC ouvre Premiere. Un seul pilote à la fois. DDU avant de passer d’AMD à NVIDIA.
Windows natif : CUDA Toolkit et cuDNN via les pip wheels (souvent embarqués dans PyTorch). Évitez d’installer trois toolkits 11.8 / 12.1 / 12.4 à la main : les chemins se marchent dessus et torch.cuda.is_available() reste à False.
WSL2 + Ubuntu : le GPU passe le pont, nvidia-smi dans Linux, les notebooks collent aux README. C’est le chemin le plus proche des serveurs. Windows à jour, pilote GeForce récent, pas de distribution exotique.
Docker : NVIDIA Container Toolkit côté Linux / WSL. Utile pour figer un cours. Inutile la première semaine.
nvidia-smi une fois par session. Si la VRAM reste à 2 Go pendant un « entraînement », le tenseur est sur le processeur. Corrigez cela avant d’accuser le TDP.
Seize Go pour apprendre, pas 32
Huit Go (5060) : MNIST, petits CNN, un 7 B Q4. Les batches vision 224² explosent vite. Baissez le batch, activez le gradient checkpointing, attendez.
Douze Go (5070) : plus de marge, encore juste pour un 13 B et un jeu de données en cache.
Seize Go (5070 Ti, généralement constatée autour de ~850–980 €, 300 W) : le palier cours et perso. Fine-tune LoRA 7–13 B, Stable Diffusion comme exercice, pas comme usine. Voir combien de VRAM en 2026.
Trente-deux Go (5090, 575 W, généralement constatée autour de ~3 500–3 900 €) : 70 B 4-bit, gros batches, recherche. Vérifier la disponibilité. Un étudiant n’amortit pas cela face au nuage à l’heure (Colab, RunPod, un A6000 d’occasion studio).
La 5080 16 Go va aussi vite, parfois davantage, que la 5070 Ti. Elle se justifie si vous jouez en 4K le week-end. Elle n’apprend pas « mieux ».
Ce que vous configurez vraiment
Python 3.11 / 3.12, venv, PyTorch avec CUDA 12.x, torch.cuda.is_available() à True. Trente-deux Go de RAM système (les dataloaders), NVMe pour les jeux de données. Alimentation 750 W gold pour la 5070 Ti, 1000 W seulement si 5090.
Limitez la VRAM dans les notebooks (max_split_size_mb) plutôt que de faire planter le bureau. N’entraînez pas un LLM 70 B « pour voir » un dimanche.
Mixed precision (fp16 / bf16) double souvent le batch tenable. Un cours qui reste en fp32 sur 8 Go apprend plus lentement qu’un LoRA fp16 sur 16 Go. Le bouton « plus de CUDA » n’existe pas ; le dtype, si.
Le dossier créateurs relie ML, diffusion et montage. Un seul GPU 16 Go sert les trois à l’échelle amateur.
Les jeux de données (ImageNet allégé, un corpus texte) tiennent sur le NVMe, pas en VRAM. Streamez le batch. Deux To utiles valent mieux qu’une 5090 sans données. Fine-tune LoRA 7 B : une soirée sur 5070 Ti. Full fine-tune 13 B fp16 : coupez, ou louez une heure.
Quel palier retenir
Apprendre : 5070 Ti, pilotes Studio, WSL2 ou Windows propre, 16 Go. 5060 seulement pour les MOOC légers. 5090 si l’inférence 32 Go se facture, pas pour un premier backward(). AMD si la carte est déjà dans le boîtier et que vous acceptez ROCm. Sinon, CUDA et avancer. Un forum qui vend la 5090 comme « le GPU pour apprendre » vend un TDP, pas un cours. Commencez petit, mesurez nvidia-smi, changez si le modèle ne rentre plus.
Questions fréquentes
Faut-il une 5090 pour apprendre le ML ?
Non. Une 5070 Ti 16 Go tient les cours, les CNN et un fine-tune 7–13 B quantifié si vous restez raisonnable sur le batch. La 5090 sert aux 70 B et aux batches qui facturent, pas à un premier backward().
Windows ou WSL pour CUDA ?
Les deux. WSL2 + Ubuntu évite les surprises de chemins Windows et colle aux README des serveurs. Native Windows + PyTorch cu124 fonctionne. Ne mixez pas deux piles CUDA à la main.
ROCm remplace-t-il CUDA à la maison ?
Sur Linux, parfois. Sur Windows, encore trop d’angles morts, et vous passez la soirée sur une issue GitHub. Pour apprendre sans déboguer le backend, NVIDIA.