Une démonstration de recherche documentaire augmentée fonctionne toujours. On prend une trentaine de documents propres, on pose trois questions préparées, le système répond avec ses sources. L'effet est immédiat et sincère : la technologie fait bien ce qu'elle promet.
Puis le corpus passe à quinze mille documents, dont des scans, des versions contradictoires et des fichiers dont personne ne sait s'ils sont à jour. Les mêmes questions donnent des réponses moins nettes. Et la vraie question apparaît : combien coûte l'entretien de ce système ?
Nous éditons NeuraScope et nous déployons ce type de dispositif chez nos clients. Voici les coûts que la démonstration ne montre pas.
Le corpus est le produit, pas l'accessoire
La croyance la plus coûteuse consiste à considérer les documents comme une matière première déjà disponible. « Nous avons tout sur le serveur partagé, il suffit de le brancher. »
Un serveur partagé accumulé sur quinze ans contient des versions successives du même document sans indication de la plus récente, des brouillons jamais supprimés, des documents contredits par une note ultérieure absente du dossier, et des fichiers dont la validité a expiré sans que personne ne l'ait signalé.
Un système de recherche documentaire ne corrige rien de tout cela. Il rend ces défauts opérationnels. Avant, une contradiction entre deux notes restait latente : chacun consultait la version qu'il connaissait. Après, le système retrouve les deux et produit une réponse qui mélange les deux logiques.
Le travail de sélection du corpus est donc la première dépense réelle, et elle est humaine. Il faut décider quels documents font autorité, lesquels sont périmés, et qui tranche en cas de conflit. Cette décision ne peut pas être déléguée à l'outil : elle demande un praticien du métier qui connaît l'histoire des documents.
Notre expérience est constante sur ce point : les projets qui échouent ne butent presque jamais sur la technologie. Ils butent sur l'absence d'un propriétaire métier capable d'arbitrer ce qui entre dans le corpus.
Le coût du découpage, et pourquoi il n'est pas un réglage
Un document n'est pas indexé entier. Il est découpé en fragments, et ce sont ces fragments qui sont retrouvés puis transmis au modèle.
Ce découpage a des conséquences directes que l'on découvre à l'usage.
Un fragment trop court perd son contexte : un paragraphe qui commence par « dans ce cas » devient inexploitable une fois séparé du cas en question. Un fragment trop long dilue le sujet et fait remonter des passages faiblement pertinents.
Surtout, le bon découpage dépend du type de document. Un contrat structuré en articles numérotés se découpe à l'article. Un compte rendu de réunion se découpe au sujet traité. Un tableau ne se découpe pas du tout sans perdre son sens : séparer les lignes de leur en-tête rend les données illisibles.
C'est pourquoi le découpage n'est pas un paramètre qu'on règle une fois. C'est une décision par famille de documents, et elle demande de regarder les résultats sur des cas réels. Le coût est un temps d'ajustement au démarrage, puis à chaque nouvelle famille de documents ajoutée.
Les documents qui ne se laissent pas lire
Une part du corpus résiste toujours à l'extraction, et il vaut mieux la mesurer avant de s'engager.
Les documents scannés sans couche de texte doivent passer par une reconnaissance de caractères, dont la qualité varie fortement selon l'original. Un scan de fax des années 2000 produit un texte truffé d'erreurs qui polluent l'index.
Les tableaux perdent leur structure dans la plupart des extractions. Les colonnes se retrouvent concaténées, les en-têtes séparés de leurs valeurs. Sur un corpus financier ou technique, c'est parfois l'essentiel de l'information qui se dégrade.
Les documents composites, où le sens naît de la mise en page, comme un plan annoté ou un formulaire, ne se réduisent pas correctement à du texte linéaire.
Le coût ici est double : un temps de traitement initial, et une décision à prendre sur ce qu'on exclut. Notre recommandation est d'exclure explicitement plutôt que d'indexer un texte dégradé. Un document absent est une lacune connue ; un document mal extrait est une source d'erreurs invisibles.
La mise à jour, le coût le plus sous-estimé
Un corpus n'est pas figé. Les documents évoluent, et c'est là que se situe le coût récurrent le plus mal anticipé.
Sur ce point, nous sommes précis avec nos clients avant l'engagement : NeuraScope ne gère pas aujourd'hui les mises à jour de document. Réimporter un fichier modifié crée un doublon. C'est une limite connue, inscrite dans notre feuille de route, et nous la disons plutôt que de la laisser découvrir.
Cette limite a des conséquences concrètes qu'il faut organiser.
Sans procédure, le corpus accumule des versions successives du même document. Le système retrouve alors des passages issus de versions différentes, et produit des réponses qui mélangent l'ancien et le nouveau. Le symptôme est déroutant : le système « se contredit », alors qu'il restitue fidèlement un corpus devenu contradictoire.
La parade est procédurale : supprimer l'ancienne version avant d'importer la nouvelle, et désigner qui en est responsable. Ce n'est pas satisfaisant, c'est efficace, et cela suppose une discipline que l'organisation doit accepter.
Un test synthétique portant sur une question dont la réponse dépend d'un document fréquemment mis à jour rend le problème visible immédiatement, plutôt que dans trois mois par un utilisateur mécontent.
Ce que coûte le fonctionnement courant
Au-delà de la mise en place, un système en production consomme des ressources qu'il faut avoir prévues.
L'indexation transforme chaque document en représentation vectorielle. Cette opération est ponctuelle par document, mais elle se répète à chaque ajout et à chaque reconstruction de l'index. Sur un corpus volumineux, une reconstruction complète se compte en heures. Il faut savoir combien avant d'en avoir besoin.
Le stockage double, en pratique : les fichiers sources d'un côté, l'index vectoriel de l'autre.
Chaque question déclenche une recherche vectorielle, puis un appel au modèle de langage avec les passages retrouvés. Si le modèle est externe, ce coût est facturé à l'usage et croît avec le nombre d'utilisateurs. Si le modèle est auto-hébergé, le coût marginal est nul mais le matériel doit être dimensionné pour la charge.
Cette différence de structure de coût est un argument concret dans l'arbitrage entre modèle hébergé et modèle externe, plus tangible que les considérations générales sur la souveraineté.
Ce que nous faisons moins bien
Quand un client nous demande ce que nous faisons moins bien, nous répondons précisément, parce que cette réponse fait gagner plus de crédibilité qu'elle n'en coûte.
Sur le chemin documentaire, il n'y a pas de reclassement des résultats. Les passages retrouvés par la recherche vectorielle sont transmis tels quels, sans étape de réévaluation qui affinerait leur ordre. Sur des corpus où la nuance entre deux passages proches compte, cela se ressent.
Les mises à jour de document ne sont pas gérées, comme indiqué plus haut.
Les connecteurs n'alimentent pas encore les autres modules : la chaîne complète allant d'un système tiers interrogé en langage naturel jusqu'à la réponse n'est pas livrée à ce jour.
Ces trois limites sont des chantiers ouverts. Les énoncer permet à un client de vérifier si elles touchent son usage réel, ce qui vaut mieux qu'une découverte après signature.
Comment réduire ces coûts
Quatre décisions font la différence, et aucune n'est technique.
Commencer petit et bien. Un corpus de deux cents documents choisis produit de meilleurs résultats que dix mille documents déversés. La tentation inverse est forte, parce que le volume rassure. C'est pourtant le corpus restreint qui permet de mesurer honnêtement la qualité.
Nommer un propriétaire du corpus. Quelqu'un qui décide ce qui entre, ce qui sort, et qui arbitre les contradictions. Sans cette personne, le corpus dérive.
Mesurer avant d'élargir. Un jeu de questions dont on connaît les réponses attendues permet de vérifier que l'ajout de mille documents améliore réellement les résultats. Souvent, il les dégrade.
Prévoir l'entretien dès le départ. Un système documentaire n'est pas livré une fois. Il demande un temps récurrent, modeste mais réel. Le budgéter évite qu'il soit pris sur le temps de personne, c'est-à-dire jamais.
Ce qu'il faut retenir
La technologie de recherche documentaire augmentée est mûre, et ce n'est pas là que se joue le résultat. Ce qui décide, c'est la qualité du corpus, la discipline de mise à jour, et l'existence d'un propriétaire métier.
Les coûts invisibles en démonstration sont la sélection des documents, l'ajustement du découpage, le traitement des documents difficiles, la gestion des versions et l'entretien courant. Aucun n'est prohibitif ; tous sont réels, et leur addition surprend quand ils n'ont pas été anticipés.
La bonne question à poser avant de lancer un projet n'est pas « quelle technologie ? », mais « qui décide de ce qui entre dans le corpus, et combien de temps y consacre-t-il par mois ? ». Si cette question n'a pas de réponse, le projet n'est pas prêt.