Accueil / Guides / Quelle carte graphique pour faire tourner un modèle d'IA en local ?

Quelle carte graphique pour faire tourner un modèle d'IA en local ?

⚡ Ce qu'il faut retenir
  • La VRAM est le critère n°1 : un LLM 7B quantisé en Q4 exige ~5 Go, un 70B en Q4 exige ~40 Go minimum
  • 16 Go de VRAM est le seuil confortable pour la majorité des usages IA courants en 2025
  • Les GPU NVIDIA restent avantageux grâce à CUDA, mais AMD progresse avec ROCm 6.x
  • Budget minimum réaliste pour de l'IA locale sérieuse : 450 € (RTX 5060 Ti 16 Go) à 2 000 €+ (RTX 5090)

Faire tourner un modèle d'IA en local — qu'il s'agisse d'un LLM comme Llama 3, Mistral ou Qwen, ou d'un modèle de diffusion comme SDXL ou Flux — n'est pas la même chose que jouer à un jeu vidéo. La contrainte principale n'est pas la puissance brute de calcul : c'est la VRAM. Si votre modèle ne tient pas entièrement dans la mémoire vidéo, il déborde sur la RAM système via le CPU, et les performances s'effondrent d'un facteur 10 à 50×. Choisir la bonne carte graphique, c'est donc avant tout choisir la bonne quantité de VRAM.

Ce guide détaille les besoins réels selon les cas d'usage — LLM, image, audio, fine-tuning — et vous donne des recommandations concrètes avec des prix en euros, des modèles compatibles et des compromis honnêtes. Pas de marketing, que des chiffres.

Pourquoi la VRAM prime sur tout le reste en IA locale

Un modèle de langage stocke ses poids en mémoire GPU pendant l'inférence. Un LLM de 7 milliards de paramètres en précision FP16 occupe environ 14 Go de VRAM. En quantisation Q4_K_M (4 bits via llama.cpp ou Ollama), ce même modèle descend à ~4,5-5 Go — il tient sur une carte à 8 Go, mais sans marge pour le contexte. Un contexte de 8 000 tokens ajoute environ 1 à 2 Go supplémentaires selon l'architecture. Un modèle 13B en Q4 demande ~8-9 Go, un 34B en Q4 environ 22 Go, un 70B en Q4 environ 40 Go.

Si le modèle déborde en RAM (mode CPU offload partiel), la vitesse de génération chute à 1-3 tokens/seconde, contre 30-80 tokens/s sur une bonne GPU. C'est la différence entre une conversation fluide et attendre 30 secondes par phrase. Retenez une règle simple : prévoyez toujours 20-30 % de VRAM libre au-dessus du poids du modèle pour les KV-cache et le contexte.

Les seuils de VRAM selon les modèles et usages

  • 8 Go VRAM : LLM jusqu'à 7B en Q4 (contexte court), Stable Diffusion 1.5 / SDXL avec optimisations, Whisper large-v3 (audio). Limité, déconseillé pour usage intensif.
  • 12 Go VRAM : LLM 7B en Q8 ou 13B en Q4 confortablement, SDXL sans compromis, Flux.1 Schnell en fp8. Seuil acceptable pour débuter sérieusement.
  • 16 Go VRAM : LLM 13B en Q8, 34B en Q4, Flux.1 Dev en fp8, ComfyUI avec plusieurs modèles chargés. Seuil recommandé en 2025 pour un usage polyvalent.
  • 24 Go VRAM : LLM 34B en Q8, 70B en Q4 partiellement, fine-tuning LoRA sur 7B, Flux.1 Dev en fp16. Confort maximal pour la majorité des projets.
  • 32-48 Go VRAM : LLM 70B en Q4 complet, fine-tuning 13B, multi-modèles simultanés. Territoire pro/semi-pro.
  • 80-96 Go VRAM : LLM 70B en fp16, 405B quantisé, entraînement complet. Cartes pro (A100, H100) uniquement.

Pour la génération d'images, Stable Diffusion XL tourne correctement à partir de 10 Go de VRAM, mais Flux.1 Dev en fp16 réclame 24 Go. En fp8 avec des optimisations (attention slicing, VAE tiling), Flux peut fonctionner sur 16 Go avec des temps de génération un peu plus longs (~25-35 secondes par image 1024×1024 sur une RTX 5070).

NVIDIA vs AMD : l'écosystème compte autant que la puissance

NVIDIA domine l'IA locale grâce à CUDA, la bibliothèque de calcul parallèle utilisée par PyTorch, TensorFlow, llama.cpp (en mode CUDA), ComfyUI, Automatic1111, et quasiment tous les frameworks IA. La compatibilité est quasi universelle, le support est immédiat dès la sortie d'un nouveau modèle. Les GPU NVIDIA comme la RTX 5060 Ti 16 Go (~450 €), la RTX 5070 (~650 €) ou la RTX 5090 (2 000 €+) sont des valeurs sûres sans friction de configuration.

AMD progresse significativement avec ROCm 6.x : llama.cpp supporte les GPU RDNA 3 et RDNA 4 (RX 7000/9000) en natif sur Linux, et de plus en plus sur Windows via HIP. Une RX 9060 XT 16 Go (~400-450 €) ou une RX 7900 XTX 24 Go (~750 €) sont des alternatives valides si vous acceptez une configuration parfois plus manuelle. La RX 7900 XTX avec ses 24 Go à ce prix reste un excellent rapport VRAM/euro. Attention : certains outils comme CUDA-only kernels (Triton, Flash Attention) ne fonctionnent pas nativement sur AMD.

Budget serré (350-500 €) : les options 16 Go accessibles

La RTX 5060 Ti 16 Go (~450 €) est la carte à cibler en priorité dans ce budget. Ses 16 Go de GDDR7 permettent de faire tourner confortablement des LLM 13B en Q8, des 34B en Q4, et Flux.1 Schnell en fp8. En inférence LLM avec llama.cpp, elle génère environ 35-45 tokens/seconde sur un Llama 3.1 8B en Q4. C'est fluide et utilisable au quotidien. La RX 9060 XT 16 Go (~400 €) est une alternative AMD à surveiller, avec des perfs similaires si ROCm est bien configuré.

À éviter dans ce budget : les cartes à 8 Go (RTX 5060 non-Ti, RX 7600 Evo), qui bloquent rapidement dès qu'on veut passer à des modèles plus capables ou augmenter le contexte. Une carte à 8 Go achetée aujourd'hui sera frustrante dans 12 mois. Pour 50-100 € de plus, les 16 Go changent radicalement l'expérience.

Budget intermédiaire (600-900 €) : le sweet spot pour l'IA sérieuse

La RTX 5070 (~650 €) avec ses 12 Go peut sembler en retrait face à la 5060 Ti 16 Go sur la VRAM, mais sa puissance de calcul brute (environ 1,8× plus rapide en FP16) accélère sensiblement les temps de génération d'images et les LLM quantisés. Elle reste limitée sur les modèles dépassant 10B en quantisation haute. La RTX 5070 Ti (~850 €) avec 16 Go de GDDR7 est le meilleur compromis de cette gamme : vitesse élevée + VRAM confortable. Elle génère ~65-80 tokens/s sur un 8B en Q4, et tourne Flux.1 Dev en fp8 en ~15 secondes.

Dans cette gamme, une RTX 3090 d'occasion (~400-500 €) mérite aussi d'être mentionnée : ses 24 Go de GDDR6X restent imbattables pour le budget, permettant des LLM 34B en Q8 ou 70B en Q4. La bande passante mémoire est inférieure aux nouvelles générations (936 Go/s vs 1 500+ Go/s pour les RTX 5000), mais pour de l'inférence pure, c'est souvent suffisant. Idéale si vous cherchez avant tout du VRAM au meilleur prix.

Haut de gamme (1 000-2 500 €) : pour le fine-tuning et les grands modèles

La RTX 5080 (~1 100 €) avec ses 16 Go haute vitesse est excellente pour l'inférence rapide mais reste bloquée à 16 Go — ce qui peut être limitant pour du fine-tuning LoRA sur 13B ou des modèles 70B même quantisés. La RTX 5090 (~2 000-2 200 €) avec 32 Go de GDDR7 et une bande passante mémoire de 1 792 Go/s est la carte la plus puissante du marché grand public en 2025. Elle fait tourner des LLM 70B en Q4 entièrement en VRAM, génère Flux.1 Dev en fp16 en ~8 secondes, et permet du fine-tuning LoRA sur des 13B-34B sans compromis.

Pour le fine-tuning complet (full fine-tuning) d'un modèle 7B en fp16, comptez ~70 Go de VRAM minimum avec les gradients et l'optimizer — aucun GPU grand public ne suffit seul. QLoRA sur 4 bits réduit ce besoin à ~12-16 Go, rendant le fine-tuning accessible sur une RTX 5070 Ti ou 5080. Si le fine-tuning est votre priorité principale, deux RTX 3090 en NVLink (48 Go combinés) restent une option compétitive face à une seule RTX 5090.

Les logiciels et frameworks à connaître avant d'acheter

  • Ollama : frontend simplifié pour llama.cpp, supporte CUDA et ROCm, idéal pour débuter avec des LLM locaux.
  • llama.cpp : moteur d'inférence ultra-optimisé, supporte NVIDIA, AMD et Apple Silicon, nombreux formats de quantisation.
  • LM Studio : interface graphique pour llama.cpp, excellent pour les débutants sur Windows/Mac.
  • ComfyUI : interface node-based pour Stable Diffusion, SDXL, Flux, très flexible.
  • Automatic1111 / Forge : interface classique pour la génération d'images, excellente compatibilité extensions.
  • vLLM : serveur LLM haute performance, CUDA uniquement, pour des usages API locaux.
  • Unsloth : fine-tuning optimisé QLoRA/LoRA, réduit la VRAM nécessaire de 30-50% par rapport à HuggingFace standard.

La quasi-totalité de ces outils fonctionnent nativement avec NVIDIA sans configuration spéciale. Avec AMD sur Linux et ROCm 6.x, llama.cpp, Ollama et ComfyUI fonctionnent bien. Sur Windows avec AMD, attendez-vous à plus de friction : ROCm est encore en beta sur Windows et certains outils refusent de démarrer sans manipulation manuelle des variables d'environnement.

Ce qu'il faut vérifier d'autre avant d'acheter

La VRAM est prioritaire, mais d'autres éléments comptent. La bande passante mémoire détermine la vitesse de traitement des tokens : une RTX 5090 à 1 792 Go/s génère presque 2× plus de tokens par seconde qu'une RTX 3090 à 936 Go/s sur le même modèle, toutes choses égales par ailleurs. Le TDP (consommation) est aussi crucial : une RTX 5090 consomme 575W sous charge, une RTX 5060 Ti 180W. Votre alimentation et votre refroidissement doivent suivre. Prévoyez une PSU avec 20-25% de marge au-dessus du TDP total de votre config.

La longueur du contexte impacte aussi la VRAM : un contexte de 32 000 tokens sur un LLM 8B peut nécessiter 4-6 Go de KV-cache supplémentaires. Si vous travaillez sur de longs documents ou des conversations étendues, comptez large. Enfin, vérifiez la compatibilité de votre boîtier : les RTX 5090 mesurent jusqu'à 36 cm de long et nécessitent 3-4 slots PCIe. Ce détail pratique est souvent négligé.

Tableau récapitulatif : quelle GPU pour quel usage

  • LLM 7B-13B casual (Ollama, LM Studio) : RTX 5060 Ti 16 Go ou RX 9060 XT 16 Go — budget ~400-450 €
  • LLM 34B + génération d'images SDXL/Flux : RTX 5070 Ti 16 Go ou RTX 3090 24 Go (occasion) — budget ~500-900 €
  • LLM 70B en Q4 + fine-tuning LoRA 13B : RTX 5090 32 Go — budget ~2 000-2 200 €
  • Génération d'images uniquement (Flux.1, SDXL) : RTX 5070 12 Go suffit, RTX 5070 Ti pour plus de confort
  • Multi-modèles simultanés ou RAG complexe : 24 Go minimum, RTX 3090 occasion ou RTX 5090
  • Fine-tuning QLoRA 7B : RTX 5060 Ti 16 Go minimum, RTX 5070 Ti recommandé

Le rapport VRAM/prix reste l'indicateur clé. En 2025, la RTX 5060 Ti 16 Go (~450 €) et la RTX 3090 d'occasion (~450-500 €) offrent les meilleurs ratios. La RTX 5090 est justifiée uniquement si vous avez besoin de faire tourner des modèles 70B+ entièrement en VRAM ou de faire du fine-tuning sur des modèles moyens sans contrainte.

ASUS Prime RTX 5060 Ti 16G
Notre reco pour ce besoin
ASUS Prime RTX 5060 Ti 16G
16 Go · 8,0/10 · 629,99 €

Questions fréquentes

Peut-on faire de l'IA locale avec 8 Go de VRAM en 2025 ?
Techniquement oui, mais c'est limité. Avec 8 Go, vous pouvez faire tourner des LLM 7B en Q4 (contexte court de 2 000-4 000 tokens), Stable Diffusion 1.5 ou SDXL avec attention slicing, et Whisper large pour la transcription. Dès que vous voulez un contexte plus long, un modèle plus grand ou Flux.1, vous êtes bloqué. Pour tout usage sérieux ou évolutif, 16 Go est le seuil minimum recommandé en 2025.
Quelle est la différence entre l'inférence et le fine-tuning en termes de VRAM ?
L'inférence (faire tourner un modèle existant) est bien moins gourmande que le fine-tuning. Pour un LLM 7B en Q4, l'inférence nécessite ~5 Go. Le fine-tuning QLoRA du même modèle en 4 bits avec Unsloth réclame ~8-12 Go. Le fine-tuning complet (full fine-tuning) en fp16 demande ~70 Go pour un 7B — impossible sur GPU grand public seul. Si votre objectif est le fine-tuning, privilégiez au minimum 16 Go (QLoRA 7B) ou 24 Go (QLoRA 13B).
Les GPU AMD fonctionnent-ils vraiment pour l'IA locale ?
En 2025, AMD est viable pour l'IA locale, particulièrement sur Linux avec ROCm 6.x. llama.cpp, Ollama, ComfyUI et PyTorch supportent officiellement les GPU RDNA 3 (RX 7000) et RDNA 4 (RX 9000). Les performances sont proches de NVIDIA sur l'inférence pure. Les limitations restent : pas de Flash Attention natif, certains kernels CUDA-only ne fonctionnent pas, et la configuration sur Windows est encore instable. Si vous êtes à l'aise avec Linux, une RX 9060 XT 16 Go ou une RX 7900 XTX 24 Go sont d'excellentes alternatives économiques.
Est-ce que la RAM système peut compenser un manque de VRAM ?
Partiellement, via le CPU offload disponible dans llama.cpp et Ollama. Si votre modèle dépasse la VRAM, les couches excédentaires sont traitées par le CPU en RAM. Mais la pénalité est sévère : une génération qui tourne à 40 tokens/s entièrement en GPU peut tomber à 2-5 tokens/s avec 50% en CPU offload. C'est praticable pour tester ou pour des modèles rarement utilisés, mais inacceptable pour un usage quotidien fluide. La RAM doit être rapide (DDR5 6000+ recommandé) et abondante (32 Go minimum, 64 Go conseillé pour les gros modèles en offload partiel).

→ Aide-toi du quiz ou compare sur toutes les cartes.