Le navigateur, prochain eldorado de l'IA : l'architecture de ce blog en exemple
Ce qui est déjà prêt pour la suite
Le dépôt comporte un second package consacré à la préparation du modèle. Il produit un corpus RAG reproductible à partir des articles Markdown et MDX : chaque article est lu sans exécuter son MDX, validé à partir de son frontmatter, nettoyé de ses imports et composants, découpé en fragments de 1 200 caractères maximum, enrichi de son URL, de son chapitre, de ses tags et de ses métadonnées, puis identifié et trié de manière déterministe. Les brouillons sont exclus, et le format du corpus porte une version de schéma.
Six scénarios d’évaluation sont définis : question éditoriale avec citations, information absente à ne pas inventer, demande de devis incomplète, proposition commerciale vague, offre d’emploi à qualifier, et spam comportant une injection de prompt. Ce socle existe mais n’est pas encore connecté au démonstrateur : le chat actuel ne fait ni RAG sur le texte intégral, ni fine-tuning.
Ce que ce montage ne sait pas faire
Le point que la plupart des démonstrations d’IA locale passent sous silence : un modèle de 350 millions de paramètres répond mal, souvent. Il faut le dire clairement avant que tu ne déploies la même chose.
Concrètement, voici ce que tu dois attendre. Le français produit est correct mais plat, avec des tournures répétitives que la pénalité de répétition atténue sans les supprimer. Le modèle paraphrase volontiers le contexte fourni au lieu de répondre à la question posée. Il reste sensible à la formulation : deux questions équivalentes donnent des réponses de qualité très inégale. Et malgré une consigne explicite, il invente encore, en particulier quand l’outil sélectionné n’a rien retourné de pertinent. Le premier chargement demande enfin plusieurs dizaines de secondes sur une machine modeste, pour 300 à 515 Mo de téléchargement.
Ce niveau convient à un assistant de navigation dans un blog, où l’enjeu d’une mauvaise réponse est faible et où le lecteur voit immédiatement le contexte utilisé. Il ne convient pas à un support client, à une recommandation produit ou à quoi que ce soit qui engage ta responsabilité. Et une précision honnête sur l’état du projet : je n’ai pas encore fait tourner les six scénarios d’évaluation contre le démonstrateur, donc je n’ai pas de taux d’échec à te donner. Ce que tu lis ici est une observation qualitative, pas une mesure.
La cible hybride
La direction n’est pas de remplacer WebMCP par un modèle spécialisé. Les deux répondent à des problèmes différents.
flowchart TB
Question["Question"]
Retrieval["WebMCP / RAG<br/>faits actuels et citables"]
FineTuned["Modèle fine-tuné<br/>comportement et spécialisation"]
Answer["Réponse locale"]
Evaluation["Évaluation continue"]
Question --> Retrieval
Retrieval --> FineTuned
Question --> FineTuned
FineTuned --> Answer
Answer --> Evaluation
Evaluation -. améliore .-> FineTuned
Evaluation -. améliore .-> Retrieval
WebMCP apporte l’accès aux données vivantes. Le RAG fournit le contenu détaillé des articles. Le fine-tuning spécialise le comportement, le format et les règles de décision, pendant que les connaissances éditoriales changeantes restent du côté de la récupération. Transformers.js conserve l’exécution sur l’appareil.
Tags
Articles similaires
Écoconception
Empreinte environnementale estimée · Modèle SWD v4 · 442 g CO₂eq/kWh