⚠️ Service en cours de conception. L'intégralité du corpus des publications scientifiques est en cours d'intégration — les contenus affichés peuvent être incomplets ou erronés et ne doivent pas encore être considérés comme fiables.
SciencesWiki — IBM-MONOCHROME · TTY1
SciencesWiki — le savoir scientifique, libre et vulgarisé

Une IA générative produit du texte plausible, pas forcément vrai. Notre fiabilité ne vient pas d'un modèle « plus intelligent », mais d'une défense en profondeur : plusieurs garde-fous indépendants qui se rattrapent les uns les autres.

Le problème, en trois failles

  • Hallucination — le modèle affirme un fait, un chiffre ou une référence qui n'existe pas. C'est structurel : l'entraînement standard récompense la réponse confiante et punit le « je ne sais pas ».
  • Erreur d'attribution — la réponse cite une source… qui ne dit pas ce qu'on lui fait dire.
  • « Garbage in, garbage out » — même fidèle à ses sources, une IA reste fausse si les sources le sont (préprints, articles rétractés, plagiats).

Nous attaquons les trois, à des couches différentes.

Nos six couches de garde-fous

defense-in-depth.txt
 QUESTION
    │
    ▼
 ① RÉCUPÉRATION HYBRIDE     vecteur (sens) + lexical (mots exacts), fusionnés (RRF)
    │                       → on ramène le BON passage
    ▼
 ②  GÉNÉRATION CONTRAINTE   RAG strict + ABSTENTION : 0 source → 0 réponse
    │                       (on préfère le silence à l'invention)
    ▼
 ③  ATTRIBUTION (locator)   l'extrait source EXACT s'affiche derrière chaque [n]
    │                       → la preuve est inspectable
    ▼
 ④  VÉRIF. DE FIDÉLITÉ      chaque phrase vérifiée vs les passages :
    │                       LLM-juge → plein texte → HHEM (détecteur dédié)
    │                       non soutenu → [réf. nécessaire]
    ▼
 ⑤  JUGE DE LA VÉRITÉ       qualité du corpus : controverses, rétractations,
    │                       ANTIPLAGIAT (MinHash/LSH + Jaccard)
    ▼
 ⑥  LIENS VÉRIFIABLES       liens Wikipédia réels (jamais inventés)
    │
    ▼
 RÉPONSE SOURCÉE, TRAÇABLE, SIGNALÉE

① Récupération hybride — ramener la bonne preuve

Si la recherche rate la preuve, le modèle hallucine — quelle que soit la suite. On combine deux signaux : sémantique (similarité de sens via les embeddings, qui attrape la reformulation) et lexical (recherche plein texte, qui attrape les termes rares ou exacts qu'un embedding dilue, ex. « COVID »). Les deux classements sont fusionnés par RRF (Reciprocal Rank Fusion). Aucun seul ne suffit ; combinés, ils maximisent la chance de ramener le bon passage.

② Génération contrainte — l'abstention comme vertu

Le prompt interdit au modèle d'utiliser ses connaissances internes : il ne répond qu'à partir des sources fournies. Et surtout : sans source pertinente, aucune réponse n'est produite. Dire « ce n'est pas dans les sources » vaut mieux qu'une belle réponse inventée — exactement la prudence que l'entraînement standard décourage.

③ Attribution — le « locator de passage »

Derrière chaque citation [n], on affiche l'extrait source exact : le fragment de l'article qui justifie l'affirmation. Le lecteur vérifie de ses yeux que la citation est réellement ancrée — on ne demande pas de faire confiance, on rend la preuve inspectable.

④ Vérification de fidélité — le cœur anti-hallucination

Après rédaction, chaque affirmation est confrontée aux sources ; celles qui ne sont pas soutenues reçoivent le marqueur [réf. nécessaire] (convention Wikipédia). Trois crans, du plus simple au plus rigoureux :

  1. LLM-juge — un second modèle relit et marque le non-étayé. Utile, mais un juge généraliste plafonne autour de 50 % de précision.
  2. Contre le plein texte — la vérification se fait contre les passages intégraux (extraits GROBID), pas seulement le résumé : ancrage bien plus strict.
  3. HHEM — un détecteur d'hallucination dédié (modèle NLI de Vectara, multilingue FR), qui mesure si chaque phrase est logiquement impliquée par les sources. Il surpasse les LLM-juges et GPT-4, tourne en local, et travaille en « ajout seul » : il signale, il ne réécrit jamais → aucune corruption possible.

C'est le passage de « espérer qu'il n'hallucine pas » à « détecter et signaler l'hallucination ».

⑤ Le juge de la vérité — la qualité du corpus

Attention : fidélité ≠ vérité. Être fidèle au corpus ne garantit pas que le corpus dise vrai. On attaque donc aussi ce niveau :

  • Controverses & lacunes — on fait remonter les désaccords entre publications plutôt que de moyenner naïvement des sources qui se contredisent.
  • Rétractations — une source devenue non fiable est signalée jusque dans les réponses qui s'y appuyaient.
  • Antiplagiat & doublons — on repère, dans notre corpus, les œuvres au texte largement recouvrant (duplications, auto-plagiat). Méthode : MinHash/LSH pour trouver les candidats sans tout comparer, puis Jaccard exact pour confirmer le recouvrement mot à mot. Résultat non décisionnel : un score + les passages en regard, qu'un humain tranche — jamais de verdict automatique.

⑥ Liens vérifiables, jamais inventés

Quand une affirmation manque de source interne, le marqueur [réf. nécessaire] est promu en lien Wikipédia réel, résolu via l'API officielle de Wikipédia. Le modèle ne fabrique jamais d'URL : soit le lien existe, soit on garde le marqueur honnête.

Ce que nous ne prétendons pas

L'honnêteté fait partie de la fiabilité :

  • Couverture = notre corpus, pas tout le savoir. « Rien trouvé » ≠ « original » ou « vrai » : les sources hors corpus (web, bases payantes) sont invisibles. Nous ne sommes pas Turnitin.
  • Plein texte partiel — l'attribution fine et l'antiplagiat verbatim n'opèrent que là où l'on a le texte intégral (PDF en accès ouvert).
  • La similarité n'est pas une preuve — tout signal d'intégrité reste soumis à validation humaine.

Et on le mesure

Pour ne pas « espérer » mais mesurer : une évaluation continue (faithfulness, rappel de contexte, attribution) sur un jeu de questions de référence propre à notre corpus, plus un jeu de questions-pièges dont la réponse n'est PAS dans le corpus — pour mesurer le taux d'abstention correcte (refuser au lieu d'inventer).

glossaire.txt
RAG ............ on RÉCUPÈRE des passages d'un corpus, puis on GÉNÈRE à partir d'eux.
embedding ...... vecteur qui représente le SENS d'un texte (sens proche → vecteurs proches).
kNN ............ recherche des passages les plus proches d'une question.
RRF ............ fusionne deux classements (sémantique + lexical) de façon robuste.
chunk .......... fragment de texte intégral (via GROBID) ; unité de preuve.
abstention ..... répondre « pas dans les sources » plutôt que deviner.
faithfulness ... à quel point la réponse est ÉTAYÉE par les sources récupérées.
entailment/NLI . une phrase est-elle LOGIQUEMENT impliquée par les sources ? (mesure de HHEM)
HHEM ........... détecteur d'hallucination dédié (Vectara), notre garde-fou principal.
MinHash/LSH .... signatures compactes pour rapprocher les textes SANS tout comparer.
Jaccard ........ part de mots communs (intersection/union) ; recouvrement verbatim exact.

En résumé : on contraint, on trace, on vérifie, on juge le corpus, et on assume nos limites. La confiance se construit, elle ne se décrète pas.