Point de départ
Écrire le profil de charge avant la configuration.
« Faire tourner un LLM » n’est pas un besoin dimensionnable. Un profil exploitable nomme le modèle ou la famille évaluée, la précision, le contexte, le nombre de sessions, la latence cible et la disponibilité attendue.
Modèle et précision
Nombre de paramètres, quantification autorisée et qualité mesurée sur le cas d’usage.
Contexte
Longueur réellement utilisée, taille des documents et mémoire du cache par session.
Concurrence
Utilisateurs simultanés, files d’attente acceptables et pics prévisibles.
Niveau de service
Latence, débit, horaires, indisponibilité acceptable et reprise.
Calculateur transparent
Première estimation de mémoire.
L’outil estime la mémoire des poids, ajoute une marge d’exécution puis une réserve par session. Il sert au cadrage, pas à valider une configuration.
Le cache KV varie fortement selon le modèle, la longueur de contexte, la concurrence et le moteur d’inférence. La quantification ajoute aussi des métadonnées. Mesurez toujours le modèle, le backend et le corpus réellement retenus avant tout achat.
Format d’infrastructure
Station, serveur ou plusieurs nœuds.
Station de travail
Pertinent pour
Prototypage, ingénierie, faible concurrence et usage proche de l’utilisateur.
À contrôler
Disponibilité, bruit, chaleur, accès distant, sauvegarde et remplacement de la machine.
Serveur mutualisé
Pertinent pour
API interne, plusieurs applications, contrôle d’accès centralisé et exploitation continue.
À contrôler
Châssis, alimentation, refroidissement, réseau, supervision, maintenance et redondance.
Plusieurs accélérateurs ou nœuds
Pertinent pour
Modèle trop grand pour une mémoire unique, débit élevé ou séparation de plusieurs charges.
À contrôler
Topologie d’interconnexion, parallélisme du moteur, complexité logicielle et coût d’exploitation.
Système complet
La mémoire GPU n’est que le premier filtre.
- Débit CPU et mémoire système pour l’ingestion et le prétraitement
- Stockage des modèles, index, données et sauvegardes
- Réseau entre utilisateurs, stockage et nœuds de calcul
- Puissance électrique, refroidissement et implantation
- Compatibilité des pilotes, runtimes et outils d’inférence
- Supervision, journaux, mises à jour et retour arrière
- Disponibilité des pièces et procédure de maintenance
- Capacité d’évolution sans remplacer toute la plateforme
Preuve avant achat
Un protocole simple et reproductible.
- 01
Figer le candidat
Version du modèle, quantification, moteur d’inférence, paramètres et longueur de contexte.
- 02
Rejouer la charge
Questions, documents et concurrence représentatifs, pas seulement une invite courte.
- 03
Mesurer
Mémoire maximale, temps avant le premier jeton, débit, latence par percentile et erreurs.
- 04
Tester l’exploitation
Démarrage, mise à jour, journalisation, panne, reprise et comportement sous saturation.
Le calculateur de cette page n’est pas un benchmark. Il rend une hypothèse de mémoire visible ; seul un test avec le modèle, le backend et la charge retenus peut valider une configuration.
Sources
Références utilisées.
Les affirmations techniques s’appuient en priorité sur des organismes publics, des publications de recherche et la documentation des outils.
- Hugging FaceDocumentation Transformers — bitsandbytesPrincipes et compromis de quantification 8 bits et 4 bits.
- Hugging FaceDocumentation Transformers — quantification
- vLLMConfiguration du moteur d’inférenceParamètres de cache, mémoire et parallélisme du moteur.
- ANSSIRecommandations de sécurité pour un système d’IA générative