Comment fonctionne Le Rapporteur
Les IA généralistes répondent au droit avec aplomb — et inventent parfois des articles de loi. Le Rapporteur ne répond jamais de mémoire : chaque référence citée est vérifiée dans les sources officielles avant d'être présentée. Au moindre doute, il refuse.
Le pipeline de confiance
Un LLM souverain (Llama-3.1-8B sur Qualcomm Cloud AI 100 ; Mistral via Modular MAX visé) rédige une réponse en citant ses sources au format « article … du Code … ».
Chaque référence d'article est extraite du texte généré (« article L. 3121-27 du Code du travail »).
Chaque citation est confrontée à Canutes / Légifrance : l'article existe-t-il, dans ce code, en vigueur ? Lien Légifrance réel. Erreur réseau = non-vérifié (fail-closed).
Toutes les citations existent → réponse avec liens cliquables. Une seule introuvable → « Je ne trouve pas de texte applicable. »
Aujourd'hui : génération → vérification (fact-check a posteriori). L'ancrage amont (RAG) est sur la feuille de route.
Les garanties
- ✓Zéro article inventé présenté comme vérifié — le fact-check est systématique, pas statistique.
- ✓Refus explicite plutôt qu'hallucination — pas de source, pas de réponse.
- ✓Sources primaires cliquables et consultables in-app — chaque citation renvoie vers Légifrance.
- ✓Comportement prouvé par des scénarios Gherkin en français — lisibles et auditables par un juriste, exécutés à chaque changement.
- ✓Souveraineté — modèle et données hébergés sur infrastructure maîtrisée, corpus 100 % officiel.
Souveraineté matérielle — au-delà de NVIDIA
Notre couche de confiance est indépendante du fournisseur de puce. Une seule interface OpenAI-compatible ; on change le backend, le même pipeline tourne ailleurs. Aujourd'hui, faire tourner un LLM open-source rime de fait avec NVIDIA/CUDA (un seul fournisseur). Nous le prouvons sans NVIDIA.
- ✓Qualcomm Cloud AI 100 — accélérateur d'inférence dédié (pas un GPU graphique détourné) : beaucoup d'opérations par watt. Backend souverain prouvé en live.
- ✓Frugalité = souveraineté + écologie — un datacenter IA, c'est d'abord une facture d'électricité ; une puce d'inférence dédiée fait le même travail pour bien moins d'énergie.
- ✓Modular MAX / Mojo = la couche de portabilité : écrire l'inférence une fois, l'exécuter sur AMD, NVIDIA, Apple… → rend les cibles souveraines (AMD, puis EU) réalistes.
Le même pipeline, plusieurs silicons :
graph TD
L["Interface LLM (OpenAI-compatible)"] --> Q["Qualcomm Cloud AI 100 · LIVE ✅"]
L --> M["Modular MAX (Mojo)"]
M --> AMD["AMD Instinct · souverain"]
M --> NV["NVIDIA · rétrocompatibilité"]
L --> EU["Vision EU/FR (non mesuré)"]
EU --> VS["VSora Jotunn8 · FR"]
EU --> AX["Axelera Metis · EU"]
L --> LO["Local · Mac / Ollama"]
Statuts : Qualcomm = prouvé live · AMD/NVIDIA via MAX = cible · VSora/Axelera = vision (pas d'accès). Voir aussi notre cartographie du schéma Canutes.
API & serveur MCP
/api/ask
réponse sourcée ou refus, citations vérifiées{"question": "Quelle est la durée légale du travail ?"}
→ {"status": "ok", "answer": "…", "citations": [{"label": "article L. 3121-27…", "exists": true, "url": "…"}]}
/api/article?ref=…
texte d'un article chargé depuis Légifrance/mcp
serveur MCP (JSON-RPC 2.0) — utilisable par tout agent# outils exposés (tools/list)
repondre_question — pipeline complet, refus si source introuvable
verifier_article — fact-check d'une référence, ex. « article 9 du Code civil »