Dimensionnement IA

Choisir une station ou un serveur GPU pour l’IA

Méthode de dimensionnement d’une station ou d’un serveur GPU à partir du modèle, de la mémoire, du contexte, de la concurrence et des contraintes d’exploitation.

24 juillet 202610 min

Réponse directe

Le bon matériel se déduit du modèle réellement évalué, de sa précision, de la longueur de contexte, du nombre de sessions simultanées et du niveau de service attendu. La mémoire nécessaire n’est qu’un premier filtre : débit, refroidissement, alimentation, stockage, réseau, disponibilité et maintenance déterminent ensuite le choix entre station, serveur ou plusieurs nœuds.

Point de départ

Écrire le profil de charge avant la configuration.

« Faire tourner un LLM » n’est pas un besoin dimensionnable. Un profil exploitable nomme le modèle ou la famille évaluée, la précision, le contexte, le nombre de sessions, la latence cible et la disponibilité attendue.

Modèle et précision

Nombre de paramètres, quantification autorisée et qualité mesurée sur le cas d’usage.

Contexte

Longueur réellement utilisée, taille des documents et mémoire du cache par session.

Concurrence

Utilisateurs simultanés, files d’attente acceptables et pics prévisibles.

Niveau de service

Latence, débit, horaires, indisponibilité acceptable et reprise.

Calculateur transparent

Première estimation de mémoire.

L’outil estime la mémoire des poids, ajoute une marge d’exécution puis une réserve par session. Il sert au cadrage, pas à valider une configuration.

Estimation minimale de planification

6,5Gio

Enveloppe jusqu’à 24 Gio

Poids seuls
3,7 Gio
Avec marge runtime
4,5 Gio
Réserve sessions
2,0 Gio

Le cache KV varie fortement selon le modèle, la longueur de contexte, la concurrence et le moteur d’inférence. La quantification ajoute aussi des métadonnées. Mesurez toujours le modèle, le backend et le corpus réellement retenus avant tout achat.

Format d’infrastructure

Station, serveur ou plusieurs nœuds.

Station de travail

Pertinent pour

Prototypage, ingénierie, faible concurrence et usage proche de l’utilisateur.

À contrôler

Disponibilité, bruit, chaleur, accès distant, sauvegarde et remplacement de la machine.

Serveur mutualisé

Pertinent pour

API interne, plusieurs applications, contrôle d’accès centralisé et exploitation continue.

À contrôler

Châssis, alimentation, refroidissement, réseau, supervision, maintenance et redondance.

Plusieurs accélérateurs ou nœuds

Pertinent pour

Modèle trop grand pour une mémoire unique, débit élevé ou séparation de plusieurs charges.

À contrôler

Topologie d’interconnexion, parallélisme du moteur, complexité logicielle et coût d’exploitation.

Système complet

La mémoire GPU n’est que le premier filtre.

  • Débit CPU et mémoire système pour l’ingestion et le prétraitement
  • Stockage des modèles, index, données et sauvegardes
  • Réseau entre utilisateurs, stockage et nœuds de calcul
  • Puissance électrique, refroidissement et implantation
  • Compatibilité des pilotes, runtimes et outils d’inférence
  • Supervision, journaux, mises à jour et retour arrière
  • Disponibilité des pièces et procédure de maintenance
  • Capacité d’évolution sans remplacer toute la plateforme

Preuve avant achat

Un protocole simple et reproductible.

  1. 01

    Figer le candidat

    Version du modèle, quantification, moteur d’inférence, paramètres et longueur de contexte.

  2. 02

    Rejouer la charge

    Questions, documents et concurrence représentatifs, pas seulement une invite courte.

  3. 03

    Mesurer

    Mémoire maximale, temps avant le premier jeton, débit, latence par percentile et erreurs.

  4. 04

    Tester l’exploitation

    Démarrage, mise à jour, journalisation, panne, reprise et comportement sous saturation.

Le calculateur de cette page n’est pas un benchmark. Il rend une hypothèse de mémoire visible ; seul un test avec le modèle, le backend et la charge retenus peut valider une configuration.

Sources

Références utilisées.

Les affirmations techniques s’appuient en priorité sur des organismes publics, des publications de recherche et la documentation des outils.

Décision suivante

Valider le cas d’usage avant de choisir le modèle ou le matériel.

Présenter votre contexte