Aller au contenu

IA appliquée · Intégration technique · Alsace

Brancher un LLM sur vos données, sans les faire sortir

Ingénieur .NET, pas plateforme : j'installe un RAG, une extraction de documents ou un serveur MCP à l'intérieur de vos applications existantes, et je vous dis où vont les données et ce que coûte l'infrastructure avant de commencer.
  • MCP
  • SDK MCP C#
  • Microsoft.Extensions.AI
  • Mistral (Apache 2.0)
  • vLLM · llama.cpp
  • pgvector
  • Mistral OCR 4
Format
Régie ou mission courte cadrée, au même TJM qu'une mission .NET
Stack
.NET 10 LTS, SDK MCP C#, Microsoft.Extensions.AI, Postgres + pgvector
Modèles
Mistral sous licence Apache 2.0 - Ministral 3, Small 4, Large 3 - et Mistral OCR 4
Hébergement
Vos serveurs, une API européenne ou un GPU dédié : le choix est documenté avant de signer
Cadre
AI Act article 50 depuis le 2 août 2026 · recommandations CNIL du 18 juillet 2024

Par où commencer

Le frein n'est ni le budget ni le RGPD. Sur plus de 4 700 entreprises interrogées par Bpifrance Le Lab (13 janvier 2026), 65 % des dirigeants qui n'utilisent pas l'IA générative disent ne pas parvenir à identifier un cas d'usage. En Alsace, 28 % des entreprises utilisent l'IA et 14 % l'envisagent. Le problème n'est donc pas le choix du modèle : c'est de savoir sur quoi le brancher.

On part de l'autre bout. Un processus qui coûte du temps tous les jours, appuyé sur des documents que vous possédez déjà : contrats, procédures, cahiers des charges, comptes rendus d'intervention, catalogue technique. On mesure le temps passé aujourd'hui, on installe le minimum qui répond, on remesure. Un cadrage se termine parfois par « ce cas d'usage ne justifie pas d'IA » - c'est un résultat, pas un échec, et c'est moins cher qu'un pilote abandonné au bout de six mois.

Le reste de cette page dit comment je le fais. Les autres domaines d'intervention- .NET, modernisation d'existant, Next.js - sont sur la page Expertises.

Ce que je livre

Quatre briques, toutes écrites en .NET 10 LTS, supporté jusqu'en novembre 2028. Chaque étape est versionnée, testée et rejouable : aucune plateforme no-code dans la chaîne.

01

Un RAG dont chaque réponse cite sa source

Un assistant documentaire hébergé sur votre infrastructure : les poids du modèle et l'index vectoriel restent sur vos machines. Chaque réponse cite le document et le paragraphe d'où elle vient, ce qui la rend vérifiable par la personne qui la lit. L'index vit dans Postgres avec l'extension pgvector et un index HNSW - PostgreSQL 18 n'a pas de moteur vectoriel natif, l'extension reste la bonne réponse.

Postgres + pgvector · modèles Mistral sous licence Apache 2.0

02

L'extraction de documents, sans envoi à un tiers

Mistral OCR 4 se livre en conteneur auto-hébergé : vos PDF ne sortent pas du réseau. La sortie est structurée, relue par un humain sur les champs qui engagent - montant, date, référence, numéro de contrat - et rejouable sur un lot entier le jour où le modèle change. Une extraction qui n'est pas rejouable n'est pas un produit, c'est une démonstration.

Mistral OCR 4 · conteneur unique sur votre serveur

03

Un assistant métier branché sur l'ERP par MCP

Un serveur MCP maison expose votre ERP ou votre GED à un client LLM : périmètre borné aux opérations que vous décidez, droits repris de votre annuaire, chaque appel journalisé. La spécification MCP du 28 juillet 2026 est gouvernée par la Linux Foundation et le SDK C# 2.2 est sous licence Apache 2.0 : c'est du code .NET, versionné et testé comme le reste de votre SI.

SDK MCP C# 2.2 · spécification 2026-07-28

04

Le cadre réglementaire tenu, sans dramatisation

L'article 50 de l'AI Act s'applique depuis le 2 août 2026 : signaler qu'on parle à une IA, marquer les contenus générés. Les obligations « haut risque » sont, elles, reportées à décembre 2027. Cela laisse le temps de construire proprement plutôt que dans l'urgence - à condition de savoir dès maintenant dans quelle catégorie tombe votre usage, et de l'écrire.

AI Act article 50 · applicable depuis le 2 août 2026

À quoi ça ressemble en service

Une question métier, les passages retrouvés dans vos documents, la réponse et ses sources. Le bandeau du bas dit le modèle, l'hébergement et le trafic sortant : c'est ce qu'une DSI regarde en premier.

assistant-documentaire · votre serveur

question

Quelle est la durée de garantie contractuelle sur la gamme extrusion pour le client BX-2041 ?

recherche · 3 passages retrouvés (pgvector, HNSW)

  • contrats/BX-2041/CGV-2025.pdf§ 7.2 Garantie
  • contrats/BX-2041/avenant-03.pdfart. 2
  • qualite/procedure-SAV-extrusion.docx§ 4

réponse

24 mois à compter de la mise en service, portés à 36 mois par l'avenant n° 3 du 12/03/2025 pour les têtes de marquage. Les consommables sont exclus (procédure SAV § 4).

sources : CGV-2025 § 7.2 · avenant-03 art. 2 · procédure SAV § 4

1,9 s · 0 appel sortant

  • modèle : Ministral 3 14B (Apache 2.0)
  • hébergement : votre serveur, Alsace
  • sortie réseau : aucune

Où vont vos données

« Vos données ne partent jamais aux États-Unis » est une phrase qu'on ne peut pas tenir en branchant un modèle américain. Il y a trois choix techniques, et chacun a des conséquences différentes sur la résidence des données, sur le coût et sur ce que le système sait faire. Le vôtre est écrit noir sur blanc avant la signature.

Où vont vos données selon le choix technique
API hors UEAPI européenneAuto-hébergé
Où vont les donnéesChez l'éditeur, stockage aux États-Unis (ex. Anthropic)Chez un éditeur européen, en UE (ex. Mistral)Sur vos serveurs ou chez Sanfytech (OVHcloud, France) : elles ne sortent pas
CoûtAu token, en dollarsAu token, en euros : le moins cher en dessous de quelques dizaines de millions de tokens par moisUn GPU dédié, de l'ordre de 600 à 1 400 € HT par mois selon la charge
Ce que ça permetLes modèles les plus puissantsModèles ouverts et compétitifs, contrat de sous-traitance européenDocuments sensibles, RAG interne, aucun appel sortant, traçabilité complète
Quand je le recommandeJamais pour des données personnelles ou des documents confidentielsPour la plupart des cas d'usage PMEQuand la CNIL le conseille : données personnelles ou documentation sensible
Pour des données personnelles ou une documentation sensible exploitées en RAG, la CNIL écrit qu'une solution sur site est « plus conseillée et plus sûre », et que le RAG « offre une meilleure traçabilité » - questions-réponses du 18 juillet 2024.

Si vous n'avez ni serveur ni équipe d'exploitation, l'hébergement peut passer par Sanfytech, le studio que j'ai cofondé à Strasbourg, sur des serveurs OVHcloud en France. Ce qui n'est pas couvert : ni SecNumCloud, ni HDS. Si votre projet l'exige, l'hébergement part chez un opérateur qualifié, nommé avant de signer.

Ce que ça coûte

Des ordres de grandeur, pas un devis : le chiffrage exact dépend du volume de documents et du nombre d'utilisateurs simultanés. Ce qui compte, c'est que vous le sachiez avant, et pas au moment de la mise en production.

  • API européenne- Mistral facture 0,50 $ par million de tokens en entrée. En dessous de quelques dizaines de millions de tokens par mois, c'est moins cher qu'un GPU dédié. Le dire fait partie du travail, même quand cela retire une ligne à la facture d'infrastructure.
  • GPU dédié- un L40S 48 Go, de l'ordre de 1 050 à 1 400 € HT par mois, tient une charge de cinq utilisateurs simultanés sur un RAG interne. Un L4 24 Go coûte moins cher mais s'effondre à ce même palier de cinq utilisateurs (benchmark du 20 février 2026). C'est la différence entre un pilote qui passe en production et un pilote qu'on enterre.
  • Licences de modèle - aucune. Les modèles Mistral utilisés ici sont sous licence Apache 2.0 : auto-hébergeables, affinables, exploitables sans redevance au token.
  • Mes jours - un seul TJM, communiqué dans ma première réponse, avec ma disponibilité. En régie ou en mission courte cadrée, facturé sur les jours réellement travaillés, déplacements inclus sur l'axe Strasbourg - Sélestat.

Ce qui relève de la hype

Autant le dire avant de travailler ensemble : trois promesses courantes ne sont pas tenables aujourd'hui, et je ne les vendrai pas.

  • « Des agents autonomes de bout en bout »- les mesures de METR donnent moins de 10 % de réussite sur les tâches de plus de quatre heures. Gartner prévoyait dès le 25 juin 2025 l'abandon de plus de 40 % des projets d'IA agentique d'ici fin 2027. Un assistant bridé à un périmètre étroit, lui, fonctionne.
  • « Notre LLM privé égale GPT »- non. Un modèle de 8 à 14 milliards de paramètres auto-hébergé est très bon sur un domaine borné avec un RAG derrière ; il n'égale pas les plus gros modèles hébergés sur du raisonnement général. Les deux usages ne se comparent pas.
  • « 10× de productivité »- aucun chiffre de ce genre ne résiste à une mesure avant/après sur votre propre processus. C'est précisément pour cela qu'on mesure.

Ce qui marche, en revanche, et que je livre : un RAG qui cite ses sources, une extraction de documents relue par un humain, un assistant borné à un périmètre, des automatisations courtes, journalisées et rejouables en .NET, et un gain de temps mesuré sur un pilote avant d'élargir.

FAQ

Questions fréquentes

Faut-il acheter un GPU pour commencer ?

Non, et c'est souvent une erreur de commencer par là. Une API européenne suffit pour prouver un premier cas d'usage : en dessous de quelques dizaines de millions de tokens par mois, elle revient moins cher qu'un GPU dédié. Le GPU se justifie quand les documents ne doivent pas sortir de votre réseau, ou quand le volume dépasse ce seuil. Dans les deux cas, le budget d'infrastructure est annoncé au démarrage.

Comment savoir si la réponse du modèle est juste ?

Par la citation et par la recette. Chaque réponse renvoie au document et au paragraphe utilisés : la personne qui lit peut vérifier en un clic. Et avant la mise en service, on constitue un jeu de questions dont vous connaissez déjà la réponse, on mesure le taux de réponses correctes et le temps passé avant et après. Sans ce jeu de questions, personne ne peut dire si l'assistant s'améliore ou se dégrade.

Qu'apporte un serveur MCP par rapport à une intégration maison ?

Un connecteur réutilisable au lieu d'un branchement jetable. La spécification MCP du 28 juillet 2026 est gouvernée par la Linux Foundation et le SDK C# 2.2 est sous licence Apache 2.0 : le même serveur qui expose votre ERP sert à plusieurs clients LLM, et il reste un projet .NET normal - compilé, testé, versionné, déployé par votre chaîne d'intégration continue.

Est-ce que ça tient avec plusieurs utilisateurs simultanés ?

C'est la question que personne ne pose avant la mise en production, et celle qui fait échouer les pilotes. Un benchmark du 20 février 2026 mesure un GPU L4 24 Go qui s'effondre à cinq utilisateurs simultanés, là où un L40S 48 Go tient. Côté logiciel, vLLM sert le multi-utilisateurs, llama.cpp convient à un poste isolé. Le dimensionnement est chiffré au cadrage, pas découvert au lancement.

Que devient le code de l'intégration en fin de mission ?

Il est à vous. Le code, le dépôt et les secrets sont chez vous dès le premier commit, les poids des modèles auto-hébergés aussi. L'intégration est écrite en .NET 10 LTS, supporté jusqu'en novembre 2028 : ce n'est pas un prototype Python à réécrire dans un an, c'est un composant de votre SI que votre équipe peut reprendre.

Un cas d'usage à prouver ?

Décrivez vos documents, votre SI et ce que vous attendez de la machine. Je réponds avec ma disponibilité réelle - ou avec les raisons pour lesquelles ce cas d'usage ne justifie pas d'IA.

Décrire votre besoin

Réponse sous 24 h ouvrées, avec ma disponibilité réelle