1Pourquoi l'assistante tourne sur la carte, et pas dans le cloud
Un assistant qui appelle une interface de programmation distante dépend de trois choses : une connexion, un fournisseur, et la confiance du client sur le trajet de ses données. En salon, les trois se dégradent en même temps. Sur un site industriel, la première n'existe pas. Chez certains clients, la troisième est rédhibitoire avant même la démonstration.
C'est la contrainte de nos propres produits : les valises et bornes VR que nous déployons fonctionnent sans réseau, et un assistant qui aurait besoin d'internet ne pourrait pas les accompagner. Le pari : tout embarquer, et vérifier que la qualité reste acceptable.
- Réponse complète
- ~6 s
- Premier mot affiché
- ~1,1 s
- Génération
- ~20 jetons/s
- Base documentaire
- 959 fragments
- Connexion requise
- aucune
Mesuré sur la configuration retenue, sur une question inédite. Carte en MAXN SUPER, fréquences verrouillées. Relevés du 22 août 2026.
2Le dispositif : trois briques sur une carte à 8 Go
Une Jetson Orin Nano Super : 67 TOPS, 8 Go de mémoire partagée entre le processeur et le processeur graphique, 102 Go/s de bande passante. JetPack 6.2.1, Ubuntu 22.04, CUDA 12, système sur SSD NVMe.
- Le modèle, quantifié, résident en mémoire, servi par Ollama.
- La recherche documentaire, développée par nos soins : le corpus est découpé en 959 fragments (chunks), chacun vectorisé par
bge-m3en 1024 dimensions. La recherche est un produit matriciel numpy, sans base vectorielle, qui à cette échelle n'apporterait qu'une dépendance de plus. - Le prompt système, environ 950 jetons (tokens), qui définit le rôle et le périmètre.
À chaque question, les quatre fragments les plus proches sont injectés dans une fenêtre de 4096 jetons. C'est le principe de la recherche documentaire augmentée (RAG) : le modèle ne répond pas de mémoire, il répond à partir des passages qu'on vient de lui donner.

3La connaissance n'est pas dans le modèle, elle est dans le corpus
Le modèle ne sait rien de l'entreprise. Il sait lire, raisonner et rédiger en français. Tout ce qu'Alixe raconte vient du corpus, retrouvé au moment de la question. Mettre à jour la documentation suffit à mettre à jour l'assistante : pas de réentraînement, pas de réglage fin, pas de coût.
C'est ce qui rend l'approche transposable. La même chaîne, un autre corpus, un autre client.
Ce que la rédaction du prompt change, à code constant
La première version récitait tout le catalogue de l'entreprise sur un simple « Salut ». Les règles de style figuraient en haut du prompt, et les faits juste avant la fin : un modèle accorde plus de poids à ce qu'il vient de lire, et celui-ci en concluait que son rôle était de réciter.
Nous l'avons corrigé en déplaçant un bloc de rappel après les faits, et en ajoutant cinq exemples de dialogues. Aucune ligne de code changée.
4Pourquoi un modèle de 3 milliards de paramètres bat un modèle de 7
En recherche documentaire, la lecture du prompt pèse autant que la génération. Avec environ 1 600 jetons de passages à ingérer avant de commencer à répondre, un modèle deux fois plus gros lit deux fois moins vite, et le coût se paie avant le premier mot.
| Mesure | Llama 3.2 3B | Mistral 7B |
|---|---|---|
| Lecture du prompt | 855 j/s | 389 j/s |
| Génération | 20,8 j/s | 11,9 j/s |
| Premier mot | 2,0 s | 10,0 s |
| Total | 6,2 s | 20,8 s |
Série A. Question réelle, ~1 600 jetons de passages injectés, index en fragments de 1400 caractères, carte en MAXN SUPER, fréquences verrouillées. Seul le modèle varie d'une colonne à l'autre.
Trois fois et demie d'écart sur le temps total, pour une pertinence équivalente sur nos questions, la connaissance venant du corpus et non du modèle.
Arbitrage assumé : Mistral reste meilleur en français libre. Nous le conservons comme profil de repli, pour les cas où la qualité rédactionnelle prime sur le temps de réponse.
5Pourquoi quatre extraits valent mieux que huit
C'est le résultat le plus contre-intuitif du travail, et le plus transférable à d'autres projets. Nous avons doublé le nombre d'extraits injectés et la taille de la fenêtre, en attendant une amélioration.
| Mesure | 4 extraits · 4096 | 8 extraits · 8192 |
|---|---|---|
| Question 1 | 7,5 s | 9,6 s |
| Question 2 | 11,0 s | 13,3 s |
| Question 3 | 2,7 s | 9,0 s |
| Lecture du prompt | 2043–2200 j/s | 1439–1566 j/s |
Série B, index en fragments de 700 caractères. Seuls le nombre d'extraits et la taille de la fenêtre varient.
Trois secondes et demie de plus en moyenne, une lecture de prompt en chute d'un tiers, et surtout davantage d'inventions. Les extraits 5 à 8 ont des scores de similarité plus faibles, donc une pertinence moindre, mais le modèle les reçoit avec le même statut de source fiable et les tisse dans sa réponse. Le cas le plus net : une question à laquelle l'assistante refusait proprement de répondre en 2,7 s recevait un développement de 9 s.
Plus de contexte, ce n'est pas plus de matière utile. C'est plus de bruit, présenté comme fiable.
Le résultat inverse compte autant : des fragments deux fois plus courts n'ont rien dégradé
Réduire la taille des fragments de 1400 à 700 caractères n'a dégradé aucune réponse. Nous craignions qu'une procédure coupée en deux ne soit restituée qu'à moitié. En pratique, les morceaux d'une même section partagent le même vocabulaire, obtiennent des scores voisins et remontent groupés : sur une question de procédure, les trois fragments concernés ressortent en positions 3, 4 et 5, et la procédure se reconstitue intégralement.
6Une quantification plus fidèle, payée 2 % de vitesse
Passer d'une quantification q4_K_M à q5_K_M coûte 2 % de vitesse, 19,9 contre 20,3 jetons par seconde, pour une représentation plus fidèle des poids du modèle, donc un meilleur français. Sur un assistant qui parle à des visiteurs, l'échange est évident.
Les autres réglages évalués ont été écartés. Un banc d'essai honnête publie aussi ce qui ne marche pas.
| Réglage | Effet mesuré |
|---|---|
| Cache d'attention en q4_0 | Nuisible : pas de noyau optimisé sur cette architecture |
| Modèles maintenus résidents sans limite | Nuisible sur 8 Go : saturation, puis fichier d'échange |
| Quantification q4_0 dite optimisée ARM | Neutre : l'avantage attendu ne s'est pas matérialisé |
| Montée de version de la couche système | Inutile : le moteur embarque ses propres bibliothèques CUDA |
7Ce que l'assistante locale refuse de dire, et pourquoi
Nos tarifs sont publics, et l'Alixe du site en parle sans difficulté. La version locale, elle, ne donne aucun prix. Ce n'est pas une question de confidentialité, c'est une décision de fiabilité : un modèle de 3 milliards de paramètres qui récite une grille tarifaire finit par inventer un chiffre, et sur un stand, un tarif faux se paie comptant. Nous préférons une assistante qui renvoie vers Philippe ou Roland, présents à côté de la borne.
Sortir les prix du périmètre supprime le seul vrai risque d'un dispositif encore expérimental. Le contrôle se construit à trois niveaux qui se cumulent, chacun rattrapant ce que le précédent laisse passer.
- Exclusion de documents entiers du corpus, avant même l'indexation.
- Filtrage des fragments à l'indexation, sur un critère de contenu.
- Règle dans le prompt système, qui traite ce qui aurait franchi les deux premiers.
Vérifié question par question : « Ça coûte combien une valise VR pour 10 casques ? » est refusée et renvoyée vers un humain, tandis qu'une question générale voisine sur le contenu d'une valise reste correctement traitée. La frontière tient sur le sujet, pas sur les mots.
La fidélité au corpus est contrôlée de la même façon : chaque nom propre cité par Alixe doit se retrouver dans les documents sources. Une commande de traçabilité affiche à tout moment les fragments retenus et leurs scores. Aucune invention constatée sur nos campagnes de vérification.
8Ce que nous ne prétendons pas
Les 8 Go sont soudés. Les modèles les plus capables en français, Mistral Small 3.2 et ses 24 milliards de paramètres par exemple, demandent environ 14 Go : hors d'atteinte, et aucun réglage n'y changera rien. Pour une rédaction longue et exigeante, une interface de programmation distante reste plus pertinente, et nous le disons à nos clients.
La carte excelle ailleurs : sur la vision, l'inférence temps réel embarquée, et sur tout dispositif qui doit fonctionner seul. C'est le même terrain que notre travail sur le robot Sirius, l'autre projet du labo.
La seule vraie montée en gamme identifiée est un module Orin NX 16 Go, qui se remplace sur le même support et ouvre l'accès aux modèles de 12 à 14 milliards de paramètres, au prix d'une dissipation supérieure.
Le choix entre local et distant se décide projet par projet. Nous savons désormais le documenter avec des mesures plutôt qu'avec des intuitions.
NVIDIA, Jetson, Ollama, Llama et Mistral sont des marques de leurs propriétaires respectifs. Cette page décrit nos propres travaux de recherche et développement : elle n’est ni éditée, ni validée, ni soutenue par ces fournisseurs. Les mesures publiées ont été relevées sur notre matériel, dans les conditions indiquées sous chaque tableau.

