Preuve technique Novekia

Démonstrateur RAG local : architecture, dimensionnement et recette

Une preuve de méthode reproductible pour cadrer un assistant documentaire local : hypothèses visibles, calcul mémoire, architecture cible et protocole de recette.

25 juillet 20268 min

Réponse directe

Pour un scénario de prototype avec un modèle de 8 milliards de paramètres quantifié en 4 bits et quatre sessions simultanées, le calcul documenté aboutit à une enveloppe de planification de 12,7 Gio. Une carte de 24 Gio constitue donc un point de départ plausible pour mesurer le prototype, mais pas une recommandation d’achat avant benchmark sur le corpus, le moteur d’inférence et la charge réels.

Démonstrateur Novekia — données synthétiques

Une preuve de méthode, pas un faux cas client.

Cette page montre comment Novekia transforme un besoin en architecture, en calcul vérifiable et en critères de recette. Aucun client, résultat de production ou gain commercial n’est revendiqué. Les hypothèses sont volontairement visibles pour pouvoir être contestées, remplacées et recalculées.

Scénario

Un assistant documentaire privé pour une équipe de 25 personnes.

Le scénario vise à rechercher dans des procédures internes avec citations, permissions documentaires et refus explicite lorsque la source manque. Les documents restent sur une infrastructure privée. L’objectif du prototype est de mesurer la qualité de recherche et l’expérience réelle avant tout achat définitif.

Hypothèses utilisées pour le démonstrateur RAG local
VariableHypothèseInterprétation
Utilisateurs inscrits25Le nombre total ne dimensionne pas seul le GPU.
Sessions simultanées4Hypothèse de pointe à confirmer par observation.
Modèle de cadrage8B / 4 bitsRéférence de calcul, pas choix définitif.
Réserve par session2 GioContexte et cache à mesurer avec le moteur retenu.
Marge runtime25 %Marge explicite pour le premier dimensionnement.

Architecture

Les droits, les sources et l’évaluation font partie du système.

La pile ne commence pas par le modèle. Elle commence par l’identité, les permissions et la propriété des documents. La génération arrive après la recherche filtrée et reste observable par ses citations et ses journaux.

Identité et droits

L’autorisation précède la recherche

SSOgroupesACL documentairesjournal d’accès
Corpus maîtrisé

Les sources conservent leur propriétaire et leur version

procéduresGEDmétadonnéescycle de vie
Recherche hybride

Le contexte est filtré, classé puis transmis

index lexicalindex vectorielfiltres ACLreclassement
Inférence locale

Le modèle répond avec citations ou refuse

LLM 8B 4 bitscontextecitationsrègle de refus
Contrôle

Les résultats alimentent une recette reproductible

jeu de 100 questionslatencefidélitétests d’accès
Architecture de démonstration à adapter au système d’identité, au corpus et aux exigences d’exploitation.

Dimensionnement

Une enveloppe de 12,7 Gio, calculée étape par étape.

Le calcul utilise des gibioctets (Gio) et sépare les poids du modèle, la marge d’exécution et la réserve liée aux sessions. Il reprend la même méthode que le calculateur public Novekia.

Poids seuls

3,7 Gio

8 × 10⁹ × 4/8 ÷ 1024³

Avec marge runtime

4,7 Gio

3,7 × 1,25

Avec quatre sessions

12,7 Gio

4,7 + (2 × 4)

Décision de cadrage : tester dans une enveloppe de 24 Gio.

Cette enveloppe laisse une marge au prototype, mais ne prouve ni le débit, ni la latence, ni la qualité du modèle. Le cache KV, le moteur d’inférence, la longueur de contexte et la quantification réelle doivent être mesurés avant achat ou mise en production.

Recette

Cent questions avant une conclusion.

Les seuils ci-dessous sont des objectifs de démonstration proposés, pas des résultats obtenus. Ils doivent être validés avec le métier, puis mesurés sur des questions, documents et profils d’accès représentatifs.

Recherche

≥ 85 %

La source attendue apparaît dans les cinq premiers passages.

Fidélité

≥ 90 %

Les affirmations évaluées sont supportées par les citations.

Contrôle d’accès

100 %

Les scénarios non autorisés ne révèlent aucun passage restreint.

Refus

≥ 95 %

Le système refuse lorsque la réponse n’existe pas dans le corpus.

Latence

p95 ≤ 8 s

Seuil proposé pour quatre sessions, à valider avec les utilisateurs.

Télécharger le modèle de recette CSV

Conclusion

Ce qui est démontré — et ce qui reste à mesurer.

Démontré

  • Une architecture cohérente avec des permissions documentaires.
  • Un calcul mémoire transparent et reproductible.
  • Un protocole de recette couvrant qualité, refus et sécurité.
  • Une décision de prototype séparée d’une décision d’achat.

À mesurer sur le terrain

  • Qualité du modèle sur le vocabulaire réel.
  • Rappel de la recherche sur le corpus réel.
  • Latence et débit avec le moteur retenu.
  • Consommation, disponibilité et charge d’exploitation.

Sources

Références utilisées.

Les affirmations techniques s’appuient en priorité sur des organismes publics, des publications de recherche et la documentation des outils.

Décision suivante

Valider le cas d’usage avant de choisir le modèle ou le matériel.

Présenter votre contexte