Aller au contenu principal

Le navigateur, prochain eldorado de l'IA : l'architecture de ce blog en exemple

17 min de lecture

Ce qui est déjà prêt pour la suite

Le dépôt comporte un second package consacré à la préparation du modèle. Il produit un corpus RAG reproductible à partir des articles Markdown et MDX : chaque article est lu sans exécuter son MDX, validé à partir de son frontmatter, nettoyé de ses imports et composants, découpé en fragments de 1 200 caractères maximum, enrichi de son URL, de son chapitre, de ses tags et de ses métadonnées, puis identifié et trié de manière déterministe. Les brouillons sont exclus, et le format du corpus porte une version de schéma.

Six scénarios d’évaluation sont définis : question éditoriale avec citations, information absente à ne pas inventer, demande de devis incomplète, proposition commerciale vague, offre d’emploi à qualifier, et spam comportant une injection de prompt. Ce socle existe mais n’est pas encore connecté au démonstrateur : le chat actuel ne fait ni RAG sur le texte intégral, ni fine-tuning.

Ce que ce montage ne sait pas faire

Le point que la plupart des démonstrations d’IA locale passent sous silence : un modèle de 350 millions de paramètres répond mal, souvent. Il faut le dire clairement avant que tu ne déploies la même chose.

Concrètement, voici ce que tu dois attendre. Le français produit est correct mais plat, avec des tournures répétitives que la pénalité de répétition atténue sans les supprimer. Le modèle paraphrase volontiers le contexte fourni au lieu de répondre à la question posée. Il reste sensible à la formulation : deux questions équivalentes donnent des réponses de qualité très inégale. Et malgré une consigne explicite, il invente encore, en particulier quand l’outil sélectionné n’a rien retourné de pertinent. Le premier chargement demande enfin plusieurs dizaines de secondes sur une machine modeste, pour 300 à 515 Mo de téléchargement.

Ce niveau convient à un assistant de navigation dans un blog, où l’enjeu d’une mauvaise réponse est faible et où le lecteur voit immédiatement le contexte utilisé. Il ne convient pas à un support client, à une recommandation produit ou à quoi que ce soit qui engage ta responsabilité. Et une précision honnête sur l’état du projet : je n’ai pas encore fait tourner les six scénarios d’évaluation contre le démonstrateur, donc je n’ai pas de taux d’échec à te donner. Ce que tu lis ici est une observation qualitative, pas une mesure.

La cible hybride

La direction n’est pas de remplacer WebMCP par un modèle spécialisé. Les deux répondent à des problèmes différents.

flowchart TB
    Question["Question"]
    Retrieval["WebMCP / RAG<br/>faits actuels et citables"]
    FineTuned["Modèle fine-tuné<br/>comportement et spécialisation"]
    Answer["Réponse locale"]
    Evaluation["Évaluation continue"]

    Question --> Retrieval
    Retrieval --> FineTuned
    Question --> FineTuned
    FineTuned --> Answer
    Answer --> Evaluation
    Evaluation -. améliore .-> FineTuned
    Evaluation -. améliore .-> Retrieval

WebMCP apporte l’accès aux données vivantes. Le RAG fournit le contenu détaillé des articles. Le fine-tuning spécialise le comportement, le format et les règles de décision, pendant que les connaissances éditoriales changeantes restent du côté de la récupération. Transformers.js conserve l’exécution sur l’appareil.

Articles similaires

Écoconception

Empreinte environnementale estimée · Modèle SWD v4 · 442 g CO₂eq/kWh

Poids de la page
Énergie par requête
Budget carbone du build
Expérience locale

Discuter avec le blog, depuis votre navigateur

Le modèle LFM2 350M s'exécute sur votre appareil. Environ 300 Mo sont téléchargés avec WebGPU, ou jusqu'à 515 Mo avec WASM/CPU, puis mis en cache ; vos prompts ne sont envoyés à aucun serveur.

Préparation de l'expérience…