Aller au contenu principal

IA souveraine : modèle local, Europe ou API ?

Le lieu des données, la qualité sur vos documents, et ce que le règlement n'efface pas.

Note Google 5/5 · +130 projets livrés en cumulé · réservez 30 min

IA souveraine : modèle local, Europe ou API ?
Guide
Par Victor
13 min de lecture

IA souveraine et LLM local reviennent dans les appels d'offres des PME et des ETI, souvent comme synonymes. Ils ne le sont pas. Souveraineté veut dire : où sont les données, ce que le fournisseur en fait, et comment vous récupérez le dispositif. Un modèle hébergé dans vos locaux est une option parmi d'autres. JAIKIN tranche cette question dans le cadre de l'IA conforme au RGPD et à l'AI Act : d'abord le traitement, ensuite le lieu.

Ce guide dit quand un modèle local ou un hébergement en Europe se justifie, ce que le matériel implique sans inventer un prix de carte graphique, comment comparer la qualité aux modèles de pointe, et ce que le RGPD et l'AI Act changent vraiment.

Quand un modèle local ou européen se justifie-t-il ?

Trois situations tiennent. La donnée ne doit pas quitter un périmètre que vous administrez : secret de fabrication, contrat qui interdit un sous-traitant hors liste, environnement déjà isolé. Le fournisseur distant ne propose pas, pour ce flux, l'absence d'entraînement et une localisation défendable.

Le volume doit être stable et le cas d'usage déjà prouvé sur vos pièces. Quelqu'un dans l'entreprise doit savoir exploiter le serveur après le départ du prestataire. Hors de ces conditions, un LLM local est un projet d'infrastructure déguisé en projet d'IA.

L'hébergement en Europe chez un fournisseur, ou une API commerciale avec clauses écrites, couvre la majorité des usages de rédaction, de synthèse et d'assistance interne. Sur les plans Team et Enterprise de Claude, la page tarifs consultée le 27 septembre 2026 indique l'absence d'entraînement par défaut. Ce n'est pas une souveraineté totale : les données partent, le sous-traitant existe, le transfert se qualifie. C'est souvent suffisant, et c'est réversible plus vite qu'un cluster à amortir.

Pour le configurateur d'actes de Cambacérès, le choix publié est la zéro rétention : aucune donnée client n'est réutilisée par le configurateur. Ce n'est pas un LLM dans un local technique. C'est l'arbitrage inverse, assumé, quand le besoin est un service en ligne et que le contrat avec le fournisseur de modèle tient. Nous ne transformons pas ce choix en dogme local, ni l'inverse.

Où faire tourner le modèle, selon la donnée
Situation Choix que nous proposons Ce qu'il faut avoir écrit avant
Rédaction, recherche, code, sans donnée personnelle API d'un modèle de pointe, plan d'organisation Réglage d'entraînement vérifié, pas de collage de fichiers clients « pour essayer ».
Données personnelles, usage interne, contrat de sous-traitance possible API ou hébergement européen, minimisation avant envoi Registre, clause, durée de conservation, liste des champs réellement utiles.
Donnée qui ne doit pas sortir du périmètre Modèle hébergé par vous, ou chez un opérateur déjà dans le périmètre Qui administre, comment on met à jour, quel écart de qualité est accepté.
Idée encore non prouvée sur vos documents Pilote court sur API, pièces anonymisées Critère d'arrêt. Pas d'achat de serveur avant ce critère.

Quel matériel, et quel coût, sans se raconter un devis ?

Un LLM local de bon niveau pour de la rédaction longue ou du code demande une carte graphique professionnelle, ou un serveur loué qui en possède, plus de la mémoire, du disque rapide et une personne qui surveille les mises à jour.

Un petit modèle sur un poste de direction répond à des invites courtes et décroche dès que le contexte grossit. Nous ne publions pas ici un prix de GPU : il bouge chaque trimestre, et un chiffre sans devis serait une invention. Le coût utile se décompose en quatre lignes, à chiffrer sur votre volume.

  1. L'acquisition ou la location de la machine, et son énergie, sur la durée où le cas d'usage est encore le bon.
  2. Le temps d'exploitation : mises à jour du modèle, surveillance, sauvegardes, remplacement quand la carte meurt.
  3. L'écart de qualité : les reprises humaines quand le modèle local se trompe là où un modèle de pointe aurait tenu.
  4. Le coût d'opportunité : les mois passés à installer au lieu de traiter le processus qui justifiait l'IA.

En face, une API se paie à l'usage ou au siège. Les tarifs Claude relevés le 27 septembre 2026 sont sur claude.com/pricing : ils changent, ils sont hors taxes, et la monnaie dépend de la région. Comparer « le token API » à « un serveur qu'on possède » sans compter l'exploitation donne toujours raison au serveur sur une diapositive, et tort dans l'année qui suit. JAIKIN fait les deux colonnes avant de recommander l'une.

La qualité se mesure sur un jeu que vous connaissez : vingt documents réels, les mêmes questions, une grille d'erreurs (fait inventé, oubli, ton, format). Pas sur un classement général publié par un éditeur ou par un forum. Si le modèle local échoue sur le format que votre métier relit quand même à la main, le serveur n'a pas d'intérêt. S'il échoue sur un fait que personne ne revérifie, il est dangereux, local ou non.

Les modèles de pointe restent-ils nécessaires ?

Pour le raisonnement long, le code sur un dépôt entier et les tâches où une erreur coûte plus que l'abonnement, les modèles de pointe restent la référence pratique. Anthropic publie ses gammes et ses prix : on les relit avant un achat, on ne les grave pas ici.

Au 27 septembre 2026, la page tarifs distingue notamment Opus, Sonnet et Haiku. Nous ne figeons pas un benchmark du jour. Le modèle local doit gagner sur vos documents, pas sur une moyenne téléchargée. La comparaison se fait sur un jeu fixe, relu par le métier.

Notre outillage interne, mesuré en 2026 sur nos projets, atteint ×5 à ×10 face aux IDE et assistants de code classiques. C'est une mesure interne de chaîne de développement, pas la preuve qu'un modèle open source sur un poste de PME fera le même facteur.

Au 21 août 2026, cette chaîne vivait dans un monorepo de 128 463 lignes de TypeScript et 2 271 commits depuis septembre 2025. Transposer ce volume, ou ce facteur, à un secrétariat qui installerait un LLM « souverain » sur un portable, c'est se tromper d'objet.

Un modèle plus faible peut suffire quand la tâche est fermée : classer des tickets selon une liste fixe, extraire trois champs d'un formulaire stable, proposer une reformulation qu'un humain corrige toujours. Dans ce cas, le lieu d'hébergement se choisit selon la donnée, et la petite taille du modèle est un avantage d'exploitation. Nous le disons au cadrage, avant que le prestige du plus gros modèle n'ait dicté le devis matériel.

Besoin d'un accompagnement expert ?

Un diagnostic gratuit de 30 minutes pour analyser vos besoins et vous proposer une solution sur mesure.

Que disent vraiment le RGPD et l'AI Act ?

Le RGPD, règlement 2016/679, s'applique à un traitement de données personnelles, que le calcul ait lieu dans vos locaux ou chez un éditeur. Le lieu change les acteurs : en local, vous restez responsable, et vos administrateurs comme vos sauvegardes font partie du traitement.

Chez un éditeur hors EEE, le chapitre V encadre le transfert. Un serveur en France n'est pas hors RGPD. Il décrit un autre schéma de responsabilités, souvent plus simple à expliquer à un client qui demande où sont ses données.

L'article 22 limite les décisions fondées uniquement sur un traitement automatisé, y compris le profilage, lorsqu'elles produisent des effets juridiques ou affectent significativement une personne. Un LLM local qui noterait des candidats n'est pas conforme parce qu'il est local. Il est, en principe, interdit sous cette forme, sauf exception étroite et avec intervention humaine. Nous ne construisons pas ces systèmes.

L'AI Act, règlement 2024/1689, ajoute une couche. L'article 50, transparence, est applicable depuis le 2 août 2026 : un système qui s'adresse à une personne ou qui génère un contenu couvert doit le faire savoir. L'hébergement local ne retire pas cette obligation.

L'annexe III, systèmes à haut risque, est au 2 décembre 2027 dans le calendrier que nous appliquons. Le plafond « 35 M€ / 7 % » vise les pratiques interdites de l'article 99, pas le choix d'un hébergeur. Un modèle dans un placard ne sort pas de ces articles.

La méthode publiée sur cette page tient en cinq temps : cartographier les systèmes, y compris l'IA de l'ombre ; classer le risque et le rôle (fournisseur ou déployeur) ; écrire l'écart ; mettre en conformité technique, dont l'hébergement ; tenir la gouvernance.

Le choix local ou API arrive au quatrième temps, pas au premier. Commencer par la machine, c'est répondre avant d'avoir nommé le traitement. Le cadre de gouvernance de l'IA sert à tenir cette revue dans le temps, pas seulement le jour du devis.

Ce que nous voyons en intégration

La demande type est : « on veut de l'IA souveraine, donc un serveur ». Derrière, il y a souvent un questionnaire client qui demande où sont les données, pas une interdiction de sous-traiter. Nous répondons au questionnaire avec le schéma réel : champs envoyés, durée, lieu, entraînement, réversibilité. Parfois la réponse tient en une API européenne et une minimisation. Parfois elle tient en un modèle hébergé. Décider avant la question produit de mauvais achats.

Le piège suivant est le modèle local alimenté par un partage réseau entier. Le calcul est dans le bâtiment, et le modèle avale les bulletins rangés à côté des modes opératoires. La souveraineté du GPU ne protège pas d'un mauvais dossier. Nous appliquons le même réflexe que pour un assistant cloud : un corpus nommé, revu, pas l'arborescence « Commun ». Le rapprochement GED et conformité décrit cette hygiène documentaire mieux qu'une fiche de carte graphique.

Quand il faut agir dans un logiciel, le lieu du modèle et les outils sont deux décisions. Un LLM local qui peut lancer n'importe quelle requête SQL n'est pas plus sûr qu'une API : il est administrateur. Nous publions des outils comptés.

Le serveur MCP CorelDRAW déployé dans l'atelier Kappeler compte 44 outils. Le même principe vaut si le modèle est dans vos locaux : 44 verbes relus valent mieux qu'un accès libre « puisque ça ne sort pas ». Le guide pratique du RAG rappelle, de son côté, qu'indexer n'est pas gouverner.

Nous ne promettons pas qu'un modèle open source « égale » le modèle de pointe du mois. Nous promettons une grille sur vos pièces, un critère d'arrêt, et un hébergement qui correspond au registre. Les agents opérationnels que nous livrons suivent cette grille : perception, règle, action, escalade. Le modèle, local ou non, n'est que le moteur du raisonnement. Il ne remplace pas l'escalade.

Dans quel ordre trancher, concrètement ?

  1. Écrire le traitement : quelles données, quelle finalité, quelle personne impactée, quelle durée.
  2. Retirer tout champ qui n'est pas nécessaire. Un identifiant indirect suffit souvent à l'essai.
  3. Classer : chat interne, génération de contenu, décision sur une personne. Les calendriers ne sont pas les mêmes.
  4. Choisir le lieu avec le tableau plus haut. Ne pas acheter le serveur au prétexte du mot souverain.
  5. Mesurer vingt documents. Garder le lieu seulement si la qualité et l'exploitation tiennent ensemble.
  6. Inscrire le sous-traitant ou l'absence de sous-traitant, les accès admin, et la revue à chaque changement de modèle.

Cet ordre évite deux extrêmes que nous voyons chez les PME industrielles : tout coller dans un chat grand public, ou lancer un appel d'offres matériel avant d'avoir une tâche. Les deux coûtent, l'un en risque, l'autre en temps. Le milieu, un pilote borné puis un lieu justifié, est moins spectaculaire et se défend devant un client comme devant un DPO.

Quelles limites de ce guide ?

Il ne donne pas de prix de serveur, de puissance en tokens par seconde, ni de classement de modèles open source. Ces chiffres bougent, et ceux que nous n'avons pas relevés sur une source primaire à une date précise n'ont pas leur place ici. Le tarif d'abonnement Claude, lui, est daté du 27 septembre 2026 et se revérifie sur la page officielle avant un achat.

Il ne dit pas que l'Europe est automatiquement hors d'atteinte d'une loi étrangère, ni qu'un éditeur américain avec un contrat de localisation devient un hébergeur public français. Ces qualifications se font dossier par dossier, avec le conseil juridique quand l'enjeu le demande. Notre page de conformité prévoit d'ailleurs un volet juridique avec un cabinet partenaire, distinct du paramétrage technique.

Il ne remplace pas la cartographie. Une PME qui a déjà plusieurs outils d'IA dans les postes, achetés par les métiers, n'a pas d'abord un problème de GPU. Elle a un problème d'inventaire. Le modèle local vient après cet inventaire, s'il a encore un sens.

Questions fréquentes

Qu'est-ce qu'une IA souveraine pour une PME ?

C'est un dispositif dont l'entreprise maîtrise trois points : le lieu où les données sont traitées, l'engagement du fournisseur de ne pas les réutiliser pour entraîner un modèle, et la capacité de récupérer ou d'arrêter le service. Un LLM installé en local peut répondre à ces points. Une API avec contrat, minimisation et hébergement européen aussi. Le mot seul ne désigne pas une architecture.

Un LLM local est-il conforme au RGPD par défaut ?

Non. Le règlement 2016/679 s'applique au traitement, pas à la marque du serveur. En local, il n'y a pas de sous-traitant modèle, mais les accès des administrateurs, les sauvegardes et la durée de conservation restent à écrire. Une décision automatisée sur une personne reste encadrée par l'article 22, que le calcul ait lieu dans un placard ou dans un cloud.

L'AI Act dispense-t-il les modèles hébergés en Europe ?

Non. L'article 50, sur la transparence, est applicable depuis le 2 août 2026, y compris pour un système que vous exploitez vous-même. L'annexe III, pour le haut risque, court jusqu'au 2 décembre 2027. Le montant de 35 M€ ou 7 % vise les pratiques interdites de l'article 99. Choisir un hébergeur européen ne coche aucun de ces articles à votre place.

Faut-il un GPU pour une PME qui veut un LLM local ?

Pour un modèle capable de tenir un long contexte ou du code sérieux, un poste de bureautique ne suffit pas : il faut une machine adaptée, achetée ou louée, et quelqu'un pour l'exploiter. JAIKIN ne publie pas de prix de carte dans ce guide, parce qu'un tarif sans devis serait faux en quelques semaines. Le chiffrage vient après la preuve sur vos documents, pas avant.

Un modèle open source local égale-t-il Claude ou un autre modèle de pointe ?

Pas en général, et pas de façon stable dans le temps. Il peut suffire sur une tâche fermée, mesurée sur vos pièces. Il décroche souvent sur le raisonnement long. JAIKIN compare les deux sur un même jeu de documents, avec une grille d'erreurs, et ne retient le local que si la qualité et le coût d'exploitation tiennent ensemble. Un classement public ne remplace pas ce jeu.

Par où commencer si la direction demande de l'IA souveraine ?

Par la liste des traitements, pas par un bon de commande de serveur. On retire les données inutiles, on classe le risque, puis on choisit API, hébergement européen ou modèle dans le périmètre. JAIKIN pose un critère d'arrêt avant l'achat matériel. Un questionnaire client sur le lieu des données se traite souvent par le contrat et la minimisation, sans cluster.

Victor Gless-Krumhorn

Victor Gless-Krumhorn

Fondateur & Consultant IA — JAIKIN

Expert en implémentation IA et automatisation pour PME et ETI. Accompagne des entreprises en France, en Allemagne et en Suisse, de la cartographie des processus à la mise en production.

1 à 3 tâches automatisables identifiées — diagnostic gratuit

30 minutes avec un expert, un plan d'action écrit sous 24 h.

Réserver 30 min

Réservez 30 min — sans engagement

Vous préférez en parler de vive voix ? +33 6 32 93 97 18