Tester si un assistant IA BIM consulte vraiment ses sources normatives

En bref : un assistant IA peut répondre sur ISO 19650 ou sur une fiche GID sans avoir consulté le moindre document, et rien à l'écran ne le trahit. Six tests menés depuis la fenêtre de discussion suffisent à le démasquer : question hors référentiel, citation à ouvrir, distinction de phase, répétition, prémisse fausse et mode dégradé. Un échec aux deux premiers tests disqualifie l'outil pour tout usage normatif.

L'IA arrive dans les logiciels que les coordinateurs BIM ouvrent tous les matins. L'assistant d'Autodesk est en préversion technique dans Revit 2027 (voir ce qu'il fait réellement sur le terrain), les éditeurs de CDE ajoutent leur chatbot, et une bonne partie des équipes au Luxembourg et en Belgique pose déjà ses questions de conformité à ChatGPT ou à Copilot. Reste à savoir comment vérifier qu'un assistant dit vrai sur une question normative.

Soyons clairs : la démo commerciale ne vous l'apprendra pas. Elle montre des questions choisies, sur un corpus chargé et un serveur au repos. Ce qui compte, c'est le comportement de l'outil sur une question piège, un jour de charge, quand la base documentaire ne répond pas à temps. J'ai documenté un cas de réponse d'IA produite sans document sur mon propre GID Assistant : l'article décrit le défaut côté conception et les contrôles à demander à un éditeur. Celui-ci s'adresse à l'utilisateur qui n'a que la fenêtre de discussion, et qui doit trancher seul.

Pourquoi un assistant « branché sur les normes » peut-il encore inventer ?

Brancher un modèle de langage sur une base documentaire (la technique s'appelle RAG, pour génération augmentée par recherche) réduit les inventions, sans les supprimer. Une étude de référence vient du droit, un métier aussi normatif que le nôtre. Des chercheurs de Stanford ont testé les assistants juridiques des grands éditeurs, pourtant adossés à des bases de jurisprudence : Lexis+ AI produisait une réponse fausse ou mal sourcée dans 17 % des cas, l'outil de Westlaw dans 33 % (Magesh et al., Journal of Empirical Legal Studies, 2025).

Le point le plus utile de cette étude est sa définition. Une réponse compte comme hallucination si elle est fausse, mais aussi si elle cite une source qui ne dit pas ce qu'on lui fait dire : les auteurs parlent de réponse « mal ancrée ». C'est le piège le plus vicieux pour un coordinateur, parce qu'une citation rassure. Une réponse qui mentionne l'ISO 19650-2 a l'air sérieuse, même quand la clause citée traite d'autre chose.

Que faut-il préparer avant de tester ?

Pas besoin d'accès administrateur, de journaux serveur ni de compétences en développement. Il faut 15 minutes, et surtout trois questions dont vous connaissez déjà la réponse, avec la source sous la main : une fiche GID du CRTI-B, une clause de l'ISO 19650-2, une exigence de votre charte BIM. Si vous ne pouvez pas vérifier la réponse vous-même, le test ne mesure que votre crédulité.

Notez chaque résultat dans un tableur, avec la date et l'heure. Le comportement d'un assistant varie avec la charge de ses serveurs et avec les mises à jour de l'éditeur : un test réussi en juillet ne garantit rien en octobre.

Test 1 : que fait l'outil face à une question hors référentiel ?

Posez une question à laquelle le référentiel ne répond pas. Par exemple, demandez les propriétés GID exigées pour un type d'objet qu'aucune fiche ne couvre, ou pour une phase qui n'existe pas dans le découpage APS, APD, PDE, EXE, EXP. Un outil sain répond qu'il n'a rien trouvé dans ses documents. Un outil dangereux produit une liste de propriétés plausible, bien formatée, et totalement inventée.

C'est le test le plus rapide et le plus discriminant des six. Il mesure une seule chose : l'outil sait-il dire « je ne sais pas » ? Sur un sujet normatif, un assistant qui comble les trous de sa base est inutilisable, quelle que soit la qualité de ses autres réponses.

Test 2 : la source citée dit-elle vraiment ce que l'outil affirme ?

Demandez systématiquement la source exacte : document, version, clause ou numéro de fiche. Puis ouvrez-la. C'est l'étape que personne ne fait, et c'est exactement là que se cachent les réponses mal ancrées décrites par l'étude de Stanford. Une référence qui existe mais qui ne contient pas l'affirmation vaut moins qu'aucune référence, parce qu'elle désarme votre vigilance.

Trois cas d'échec reviennent : la clause n'existe pas, elle existe mais traite d'autre chose, ou la version citée n'est pas celle en vigueur. Le troisième est fréquent sur les normes remplacées, comme l'EN 17412-1 reprise par l'ISO 7817-1.

Test 3 : l'outil distingue-t-il les phases et les référentiels ?

Les modèles généralistes connaissent très bien le vocabulaire IFC et ISO 19650. C'est leur force et c'est le problème : ils produisent une réponse crédible sans lire la fiche. Pour les piéger, posez une question dont la réponse change selon la phase ou selon le pays. Sur mon propre outil, la même famille de question renvoyait IfcPipeFitting avec la base documentaire et IfcPipeSegment sans elle : deux entités IFC légitimes, une seule correcte pour la phase demandée.

Même logique entre référentiels : une question sur la nomenclature de fichiers ne reçoit pas la même réponse selon qu'on suit le référentiel CRTI-B au Luxembourg ou une convention de nommage belge. Un outil qui répond pareil dans les deux cas n'a lu ni l'un ni l'autre.

Test 4 : obtenez-vous la même réponse trois fois de suite ?

Posez la même question trois fois, dans trois conversations séparées. Sur une question normative précise, un outil réellement adossé à ses documents retrouve les mêmes extraits et converge vers la même réponse. Des écarts de fond (une propriété qui apparaît puis disparaît, une phase qui change) signalent que la réponse vient du modèle, pas du document. Les variations de formulation, elles, sont normales et sans gravité.

Test 5 : l'outil corrige-t-il une prémisse fausse ?

Glissez une erreur dans la question et regardez si l'outil la corrige ou la suit. Exemple : « Quel LOD minimum l'ISO 19650-2 impose-t-elle en phase APD ? ». La série ISO 19650 n'impose aucun LOD : elle parle de niveau de besoin d'information, que la norme ISO 7817-1 sur le LOIN est venue outiller. Un assistant ancré sur le texte relève l'erreur. Un assistant complaisant vous sert un « LOD 300 » avec aplomb.

Ce test mesure la complaisance, un défaut connu des modèles de langage, qui ont tendance à aller dans le sens de l'utilisateur. En coordination, c'est redoutable : la question mal posée vient souvent d'un maître d'ouvrage ou d'un cahier des charges, et l'IA la valide au lieu de la corriger.

Test 6 : le mode dégradé est-il visible à l'écran ?

Dernier test, le plus difficile à provoquer. Quand la base documentaire tarde à répondre, beaucoup d'outils basculent sur un modèle de secours qui répond de mémoire. Dans le cas que j'ai mesuré, la recherche aboutissait en 26,21 secondes, l'interface coupait à 25,00, et la réponse de secours s'affichait avec un statut de succès. Posez donc une question longue et complexe aux heures de pointe, et cherchez à l'écran une trace de ce qui a été consulté : liste d'extraits, badge « sources », avertissement de mode dégradé.

Ne demandez pas à l'IA si elle a consulté ses documents. Son auto-déclaration ne prouve rien : un modèle qui répond de mémoire peut affirmer très sereinement qu'il a lu la fiche. Seul un marqueur produit par le système, affiché hors du texte de la réponse, a de la valeur.

L'AI Act oblige-t-il l'éditeur à citer ses sources ?

Non, et c'est une confusion fréquente. Depuis le 2 août 2026, l'article 50 de l'AI Act impose d'informer l'utilisateur qu'il échange avec un système d'IA, et le marquage des contenus générés, avec un délai jusqu'au 2 décembre 2026 pour les systèmes déjà sur le marché. Rien dans ce texte n'oblige un assistant à citer la clause qui fonde sa réponse, ni à signaler qu'il a répondu sans document. La transparence réglementaire vous dit que vous parlez à une IA. Elle ne vous dit pas si cette IA a lu la norme.

Les pièges qui faussent le test

  • Tester sur des questions générales. « Qu'est-ce qu'un BEP ? » ne piège aucun modèle, il connaît la réponse par cœur. Seules les questions précises et vérifiables discriminent.
  • Confondre aisance et exactitude. Une réponse bien structurée, avec titres et puces, n'est pas plus juste qu'une réponse brouillonne. La mise en forme ne dit rien de la source.
  • Tester une seule fois. Un seul essai ne dit rien du mode dégradé, qui n'apparaît qu'en charge. Refaites la série après chaque mise à jour majeure de l'outil.
  • Tester sans la source ouverte à côté. Sans le document de référence sous les yeux, vous évaluez la vraisemblance, pas l'exactitude.

Questions fréquentes sur la fiabilité des assistants IA en BIM

Un assistant IA peut-il répondre sans consulter ses documents ?

Oui. Quand la recherche documentaire échoue ou dépasse le délai de l'interface, de nombreux outils laissent le modèle répondre de mémoire, sans le signaler. La réponse a alors le même ton et le même format qu'une réponse sourcée.

Comment vérifier une réponse d'IA sur ISO 19650 ?

Demandez la clause exacte et la version de la norme, puis ouvrez le texte pour vérifier que la clause dit bien ce que l'outil affirme. Une référence qui existe mais ne soutient pas la réponse est un échec, au même titre qu'une réponse fausse.

Quel test faire en priorité si je n'ai que cinq minutes ?

Le test de la question hors référentiel. Un outil qui invente une réponse quand ses documents ne couvrent pas la question est disqualifié pour tout usage normatif, quels que soient ses autres résultats.

Un outil qui ne sait pas dire « je n'ai rien trouvé » n'a rien à faire dans un BEP

Voici la grille que j'applique. Un échec au test 1 ou au test 2 est éliminatoire pour tout usage normatif : l'outil peut servir à reformuler un mail, pas à répondre sur une exigence GID ou une clause ISO 19650. Les tests 3 à 5 mesurent la profondeur de l'ancrage, et deux échecs sur trois imposent une vérification manuelle systématique, ce qui annule la majeure partie du gain de temps. Le test 6 départage les outils honnêtes des autres.

Arrêtons de se voiler la face : le marché va vous vendre des assistants qui ont réponse à tout, parce qu'un écran vide passe pour un produit raté. Sur un sujet normatif, c'est l'inverse. Le refus coûte trente secondes, la réponse inventée coûte une non-conformité découverte à la livraison. Faites passer les six tests au GID Assistant, puis à l'outil de votre éditeur, avec les mêmes questions. Le premier qui refuse proprement de répondre à une question piège mérite davantage votre confiance que celui qui ne refuse jamais.

À propos de l'auteur.

Renaud Climent est BIM Coordinator MEP, plus de 10 ans de terrain au Luxembourg et en Belgique. Cursus complet CRTI-B (Bases, Référent, Modeleur, Coordinateur), formé Solibri, BIMcollab et Revit MEP, certifié en IA. Fondateur de BIMsmarter.eu, il code ses propres outils pour automatiser les tâches BIM chronophages. Contact : contact@bimsmarter.eu