⚠️ Service en cours de conception. L'intégralité du corpus des publications scientifiques est en cours d'intégration — les contenus affichés peuvent être incomplets ou erronés et ne doivent pas encore être considérés comme fiables.
SciencesWiki — IBM-MONOCHROME · TTY1
SciencesWiki — le savoir scientifique, libre et vulgarisé

De la collecte des publications scientifiques jusqu'à la réponse vulgarisée et relue : voici, étape par étape, comment SciencesWiki fabrique un contenu fiable, libre et sourcé.

Vue d'ensemble

pipeline.txt
 ① COLLECTE                ② INDEXATION              ③ QUESTION → RÉPONSE
 ┌────────────────────┐    ┌────────────────────┐    ┌────────────────────┐
 │ moisson OpenAlex   │──▶ │ vectorisation      │──▶ │ question posée     │
 │ (par rubrique)     │    │ (embeddings)       │    │ (visiteur ou IA)   │
 └─────────┬──────────┘    └─────────┬──────────┘    └─────────┬──────────┘
           ▼                         ▼                         ▼
 ┌────────────────────┐    ┌────────────────────┐    ┌────────────────────┐
 │ import + dédoublon │    │ placement dans     │    │ recherche RAG (kNN)│
 │ (clé = DOI)        │    │ l'arbre des savoirs│    │ garde-fou : 0 src  │
 └─────────┬──────────┘    └────────────────────┘    │ → 0 réponse        │
           ▼                                          └─────────┬──────────┘
 ┌────────────────────┐                                         ▼
 │ accès ouvert ?     │                              ┌────────────────────┐
 │ oui → PDF+fulltext │                              │ rédaction par l'IA │
 │ non → résumé seul  │                              │ (gemma, sourcée)   │
 └────────────────────┘                              └─────────┬──────────┘
                                                                ▼
 ④ PUBLICATION & CONTRÔLE                            ┌────────────────────┐
 ┌────────────────────┐   ┌────────────────────┐     │ publication        │
 │ veille des sources │◀──│ relecture comité   │◀────│ « non relu » + ⚠   │
 │ (rétractations/EoC)│   │ (validation humaine)│    │ (cartouche IA)     │
 └────────────────────┘   └────────────────────┘     └────────────────────┘

Étape par étape

  1. Moisson des publications. Pour chaque rubrique (un concept de la taxonomie OpenAlex), nous collectons les publications scientifiques correspondantes. La collecte est incrémentale (reprise du curseur) et respecte les limites de l'API (polite pool, sans clé).
  2. Import et dédoublonnage. Chaque publication est normalisée et dédupliquée par DOI : jamais de doublon, même si elle est moissonnée plusieurs fois.
  3. Accès ouvert. Nous vérifions si une version en accès libre et légal existe (OpenAlex / Unpaywall / dépôts d'auteurs). Si oui, nous téléchargeons le PDF chez l'éditeur ou le dépôt, en extrayons le texte et le découpons en fragments. Si non, seul le résumé est indexé — et nous proposons d'inviter poliment les auteurs à partager une version ouverte.
  4. Vectorisation. Le résumé et, le cas échéant, les fragments du texte intégral sont transformés en vecteurs (embeddings) par un modèle auto-hébergé. C'est ce qui permet la recherche par sens, et non par simples mots-clés.
  5. Classement. Chaque publication est rattachée automatiquement à la ou aux rubriques les plus proches de l'arbre des savoirs.
  6. Question. N'importe qui peut poser une question sous une rubrique. L'IA peut aussi proposer elle-même une question pertinente.
  7. Recherche des sources (RAG). On recherche les passages les plus pertinents (résumés et texte intégral). Garde-fou : sans source pertinente, aucune réponse n'est publiée — pas de réponse « hors-sol ».
  8. Rédaction. Le modèle d'IA open source (gemma, auto-hébergé) rédige une réponse en deux niveaux — vulgarisation (niveau collège) et académique — en citant ses sources, affichée en direct (machine à écrire).
  9. Publication. La réponse paraît avec la mention « non relu » et un cartouche rappelant qu'elle est générée par IA et peut comporter des imprécisions.
  10. Relecture humaine. Le comité scientifique relit, valide ou corrige. (À venir : sollicitation des auteurs des publications citées pour valider/préciser la réponse, avec leur badge d'auteur.)
  11. Veille des sources. (À venir) Une vérification régulière repère les études rétractées ou faisant l'objet d'une mise en garde (Expression of Concern) : elles sont signalées par un badge, exclues des futures réponses, et les réponses concernées sont réévaluées.

Nos garde-fous

garde-fous
  • Pas de source, pas de réponse. Une question sans publication pertinente n'est jamais « inventée ».
  • Sources toujours citées et liées (DOI, accès libre quand il existe).
  • Accès ouvert et légal uniquement — jamais de copie illicite.
  • Transparence : la réponse indique clairement qu'elle est générée par IA tant qu'un humain ne l'a pas relue.