Novekia Proof Lab

Dimensionnez votreIA locale.

Obtenez une première enveloppe de mémoire et d’infrastructure à partir de cinq paramètres. Les hypothèses, réserves et limites restent visibles : aucun matériel n’est recommandé aveuglément.

Entrées du scénario

Définissez votre charge

Estimation d’inférence uniquement. Elle ne dimensionne ni entraînement, fine-tuning complet, haute disponibilité, refroidissement, réseau ou alimentation électrique.

Enveloppe indicative

Station mono-accélérateur

14B · INT4 · 8k

VRAM de travail

12–16 Gio

24 Go de VRAM cible

Poids du modèle

7,3 Gio

Estimation des poids chargés uniquement

Mémoire système

32 Gio

Réserve indicative pour le système et le service

Stockage de départ

256 Go

Modèles, corpus, index, versions et sauvegardes

Intensité de l’architecture

Points à valider

  • La quantification 4 bits réduit l’empreinte, mais la qualité doit être évaluée sur vos tâches réelles.
  • Le stockage inclut une réserve pour les documents, index, sauvegardes et versions ; le pipeline RAG reste à définir.
Méthode transparente

Une enveloppe,pas un devis matériel.

Ce que le calcul couvre

Poids quantifiés, réserve runtime, estimation du cache de contexte, concurrence active, mémoire système et stockage du corpus avec marge de versionnement.

Ce qui reste à tester

Modèle exact, qualité de quantification, débit en tokens, latence, moteur d’inférence, sécurité, réseau, refroidissement, disponibilité et coût total d’exploitation.

Formule de cadrage

L’outil part du nombre de paramètres et de la précision effective pour estimer les poids chargés. Il ajoute ensuite une réserve de runtime et une estimation du cache KV dépendant du contexte et des sessions actives, puis applique une marge haute de 25 %. Cette méthode volontairement prudente ne remplace pas une mesure avec le modèle et le moteur retenus.

Questions fréquentes
01Cette estimation suffit-elle pour acheter un serveur IA ?

Non. Elle fournit une enveloppe de cadrage pour l’inférence. Le choix final dépend du modèle exact, du moteur d’inférence, de la latence attendue, du débit, de la sécurité, du réseau, de l’alimentation et des tests réalisés sur les données du projet.

02Pourquoi afficher une fourchette de VRAM ?

Les poids du modèle ne constituent qu’une partie de la mémoire utilisée. Le runtime, le cache KV, la longueur du contexte et les sessions simultanées ajoutent une charge qui varie selon l’architecture et le moteur d’inférence.

03La quantification 4 bits conserve-t-elle toujours la qualité ?

Non. Elle réduit fortement l’empreinte mémoire, mais son effet doit être évalué sur les tâches, documents et critères de qualité réels de l’entreprise.

Lire le guide pour choisir une station ou un serveur GPU