Démonstrateur Novekia — données synthétiques
Une preuve de méthode, pas un faux cas client.
Cette page montre comment Novekia transforme un besoin en architecture, en calcul vérifiable et en critères de recette. Aucun client, résultat de production ou gain commercial n’est revendiqué. Les hypothèses sont volontairement visibles pour pouvoir être contestées, remplacées et recalculées.
Scénario
Un assistant documentaire privé pour une équipe de 25 personnes.
Le scénario vise à rechercher dans des procédures internes avec citations, permissions documentaires et refus explicite lorsque la source manque. Les documents restent sur une infrastructure privée. L’objectif du prototype est de mesurer la qualité de recherche et l’expérience réelle avant tout achat définitif.
| Variable | Hypothèse | Interprétation |
|---|---|---|
| Utilisateurs inscrits | 25 | Le nombre total ne dimensionne pas seul le GPU. |
| Sessions simultanées | 4 | Hypothèse de pointe à confirmer par observation. |
| Modèle de cadrage | 8B / 4 bits | Référence de calcul, pas choix définitif. |
| Réserve par session | 2 Gio | Contexte et cache à mesurer avec le moteur retenu. |
| Marge runtime | 25 % | Marge explicite pour le premier dimensionnement. |
Architecture
Les droits, les sources et l’évaluation font partie du système.
La pile ne commence pas par le modèle. Elle commence par l’identité, les permissions et la propriété des documents. La génération arrive après la recherche filtrée et reste observable par ses citations et ses journaux.
L’autorisation précède la recherche
Les sources conservent leur propriétaire et leur version
Le contexte est filtré, classé puis transmis
Le modèle répond avec citations ou refuse
Les résultats alimentent une recette reproductible
Dimensionnement
Une enveloppe de 12,7 Gio, calculée étape par étape.
Le calcul utilise des gibioctets (Gio) et sépare les poids du modèle, la marge d’exécution et la réserve liée aux sessions. Il reprend la même méthode que le calculateur public Novekia.
Poids seuls
3,7 Gio
8 × 10⁹ × 4/8 ÷ 1024³
Avec marge runtime
4,7 Gio
3,7 × 1,25
Avec quatre sessions
12,7 Gio
4,7 + (2 × 4)
Décision de cadrage : tester dans une enveloppe de 24 Gio.
Cette enveloppe laisse une marge au prototype, mais ne prouve ni le débit, ni la latence, ni la qualité du modèle. Le cache KV, le moteur d’inférence, la longueur de contexte et la quantification réelle doivent être mesurés avant achat ou mise en production.
Recette
Cent questions avant une conclusion.
Les seuils ci-dessous sont des objectifs de démonstration proposés, pas des résultats obtenus. Ils doivent être validés avec le métier, puis mesurés sur des questions, documents et profils d’accès représentatifs.
Recherche
≥ 85 %
La source attendue apparaît dans les cinq premiers passages.
Fidélité
≥ 90 %
Les affirmations évaluées sont supportées par les citations.
Contrôle d’accès
100 %
Les scénarios non autorisés ne révèlent aucun passage restreint.
Refus
≥ 95 %
Le système refuse lorsque la réponse n’existe pas dans le corpus.
Latence
p95 ≤ 8 s
Seuil proposé pour quatre sessions, à valider avec les utilisateurs.
Conclusion
Ce qui est démontré — et ce qui reste à mesurer.
Démontré
- Une architecture cohérente avec des permissions documentaires.
- Un calcul mémoire transparent et reproductible.
- Un protocole de recette couvrant qualité, refus et sécurité.
- Une décision de prototype séparée d’une décision d’achat.
À mesurer sur le terrain
- Qualité du modèle sur le vocabulaire réel.
- Rappel de la recherche sur le corpus réel.
- Latence et débit avec le moteur retenu.
- Consommation, disponibilité et charge d’exploitation.
Sources
Références utilisées.
Les affirmations techniques s’appuient en priorité sur des organismes publics, des publications de recherche et la documentation des outils.