Ce que le calcul couvre
Poids quantifiés, réserve runtime, estimation du cache de contexte, concurrence active, mémoire système et stockage du corpus avec marge de versionnement.
Obtenez une première enveloppe de mémoire et d’infrastructure à partir de cinq paramètres. Les hypothèses, réserves et limites restent visibles : aucun matériel n’est recommandé aveuglément.
Enveloppe indicative
14B · INT4 · 8k
VRAM de travail
12–16 Gio
24 Go de VRAM cible
Poids du modèle
7,3 Gio
Estimation des poids chargés uniquement
Mémoire système
32 Gio
Réserve indicative pour le système et le service
Stockage de départ
256 Go
Modèles, corpus, index, versions et sauvegardes
Points à valider
Poids quantifiés, réserve runtime, estimation du cache de contexte, concurrence active, mémoire système et stockage du corpus avec marge de versionnement.
Modèle exact, qualité de quantification, débit en tokens, latence, moteur d’inférence, sécurité, réseau, refroidissement, disponibilité et coût total d’exploitation.
Formule de cadrage
L’outil part du nombre de paramètres et de la précision effective pour estimer les poids chargés. Il ajoute ensuite une réserve de runtime et une estimation du cache KV dépendant du contexte et des sessions actives, puis applique une marge haute de 25 %. Cette méthode volontairement prudente ne remplace pas une mesure avec le modèle et le moteur retenus.
Hugging Face documente la réduction d’empreinte des poids en 8 et 4 bits ainsi que ses limites.
vLLM explique l’effet du cache KV sur la mémoire et les options de quantification FP8.
Mistral documente l’auto-hébergement et recommande un moteur d’inférence optimisé tel que vLLM.
Non. Elle fournit une enveloppe de cadrage pour l’inférence. Le choix final dépend du modèle exact, du moteur d’inférence, de la latence attendue, du débit, de la sécurité, du réseau, de l’alimentation et des tests réalisés sur les données du projet.
Les poids du modèle ne constituent qu’une partie de la mémoire utilisée. Le runtime, le cache KV, la longueur du contexte et les sessions simultanées ajoutent une charge qui varie selon l’architecture et le moteur d’inférence.
Non. Elle réduit fortement l’empreinte mémoire, mais son effet doit être évalué sur les tâches, documents et critères de qualité réels de l’entreprise.