Systèmes LLM en production · MCP, agents, évals
Livrés en production. Et vraiment utilisés.
Je pars d'un problème métier, je le mène jusqu'à un système d'IA en production, et je le fais adopter. Head of AI chez Crème de la Crème, où je mène le cadrage, je conçois l'architecture, j'écris le code et je livre.
Résultats mesurés
Ce que ces systèmes ont changé
Pas une liste de livrables, mais une liste d'usages installés. Chaque chiffre ci-dessous vient d'un système livré, mesuré, et utilisé par des équipes qui ne sont pas les miennes.
des candidatures entrantes tranchées par l'IA, un humain gardant les cas ambigus
candidatures déjà tranchées à la main sur lesquelles le pipeline est tombé d'accord, avant la mise en service
le juge LLM du moteur de matching est borné et parallélisé : coût et latence par brief restent plats quand le vivier grandit
par extraction de données, en self-service, sans passer par un ingénieur
rendues au Product Manager par le pipeline de décision human-in-the-loop
commerciaux de plus sur un outil d'expert que des licences réservaient à quelques-uns
Travaux sélectionnés
Systèmes en production
Conçus et codés de bout en bout, front et back, livrés et utilisés quotidiennement chez Crème de la Crème.
Ouvrir le back-office d’une entreprise au langage naturel
N’importe qui dans l’entreprise demande une chose en langage courant et elle est faite, sans traverser cinq écrans, et sans jamais voir une ligne à laquelle il n’a pas droit.
chacun répondant sous les droits de la personne qui demande, jamais ceux d’un compte de service
Recherche hybride, scoring et jugement LLM borné
Un moteur de matching qui devait battre celui déjà en production, brief par brief, avant d’avoir le droit d’être livré.
un juge borné et parallélisé : le coût et la latence par brief restent plats quand le vivier grandit
Décision human-in-the-loop sur les candidatures entrantes
Le modèle tranche les cas nets. Un humain garde les cas ambigus, et c’est précisément ce qui rend l’automatisation acceptable.
des candidatures entrantes tranchées sans humain dans la boucle
Méthode
D'un problème métier à un système que les gens utilisent
Cadrage avec ceux qui utiliseront le système, architecture avec les arbitrages écrits, le code lui-même, un chemin vers la production qui survit à l'erreur, et l'adoption suivie après la mise en service. Les évals, les garde-fous et le contrôle des coûts sont des sujets de premier plan, pas des ajouts de fin de projet.
Cadrage
Je mène le cadrage avec les dirigeants et avec les équipes qui vivront avec le résultat, et j'en tire un portefeuille de cas d'usage resserré : critères de décision, un responsable, une mesure de succès, une liste de blocages. Y compris les cas qu'il vaut mieux abandonner.
Tenu face à six métiers aux tolérances au risque différentes.
Architecture
Modèles, données, intégration, identité, confidentialité, gouvernance, évaluation, déploiement. Chaque décision structurante est écrite avec ce qu'elle coûte.
32 arbitrages actés avant la première ligne du serveur MCP.
Preuve de valeur
Un prototype sur de vraies données, tôt, pour que la décision d'aller plus loin repose sur des faits plutôt que sur une démo qui ne marche que sur le chemin heureux.
Un harnais d'éval qui devait battre la baseline de production, brief par brief.
Build
J'écris le code, front et back, en travaillant avec des agents de code, et ce qui part en production passe par la revue de l'équipe engineering du client. Quand une brique demande une expertise que je n'ai pas, je fais venir quelqu'un qui l'a, et j'écris qui en devient propriétaire une fois qu'il repart.
Six systèmes construits ainsi, front et back, sur la même mission.
Production et gouvernance
Des évals contre la baseline en place, des garde-fous câblés plutôt que suggérés, l'autorisation et l'audit conçus dès le départ. Ce qui se passe quand le système se trompe est répondu avant la livraison.
Les prédictions d'isolation écrites avant chaque bascule de rôle, puis vérifiées.
Adoption
Les usages suivis après la mise en service, le build documenté pour qu'un autre ingénieur puisse le reprendre, et les systèmes arrêtés quand un éditeur comble le manque.
Déployé auprès des Sales avant l'ouverture générale.
- 01
Cadrage
Je mène le cadrage avec les dirigeants et avec les équipes qui vivront avec le résultat, et j'en tire un portefeuille de cas d'usage resserré : critères de décision, un responsable, une mesure de succès, une liste de blocages. Y compris les cas qu'il vaut mieux abandonner.
Tenu face à six métiers aux tolérances au risque différentes.
- 02
Architecture
Modèles, données, intégration, identité, confidentialité, gouvernance, évaluation, déploiement. Chaque décision structurante est écrite avec ce qu'elle coûte.
32 arbitrages actés avant la première ligne du serveur MCP.
- 03
Preuve de valeur
Un prototype sur de vraies données, tôt, pour que la décision d'aller plus loin repose sur des faits plutôt que sur une démo qui ne marche que sur le chemin heureux.
Un harnais d'éval qui devait battre la baseline de production, brief par brief.
- 04
Build
J'écris le code, front et back, en travaillant avec des agents de code, et ce qui part en production passe par la revue de l'équipe engineering du client. Quand une brique demande une expertise que je n'ai pas, je fais venir quelqu'un qui l'a, et j'écris qui en devient propriétaire une fois qu'il repart.
Six systèmes construits ainsi, front et back, sur la même mission.
- 05
Production et gouvernance
Des évals contre la baseline en place, des garde-fous câblés plutôt que suggérés, l'autorisation et l'audit conçus dès le départ. Ce qui se passe quand le système se trompe est répondu avant la livraison.
Les prédictions d'isolation écrites avant chaque bascule de rôle, puis vérifiées.
- 06
Adoption
Les usages suivis après la mise en service, le build documenté pour qu'un autre ingénieur puisse le reprendre, et les systèmes arrêtés quand un éditeur comble le manque.
Déployé auprès des Sales avant l'ouverture générale.
Compétences
Ce que je construis vraiment
Les briques qui décident si un système peut tourner sans surveillance sur des données de production.
Rappel & scoring
Rappel multi-signaux (BM25, recouvrement de compétences, kNN vectoriel sur embeddings OpenAI stockés dans pgvector, index d'expériences) fusionné par Reciprocal Rank Fusion, puis scoring déterministe pondéré, puis une couche de LLM-as-a-judge bornée à coût et latence constants par requête. Un brief coûte pareil à traiter que le vivier contienne mille profils ou cinquante mille.
Agents & MCP
Serveurs MCP au-dessus de vrais systèmes de production, avec OAuth 2.1, conception de tools et allowlists, sub-agents, skills packagées, et agents de code (Codex, Claude Code) comme mode de travail normal. Agent Builder et ChatKit quand une surface hébergée vaut mieux qu'une sur mesure. Un agent agit avec les droits de la personne qui demande, jamais ceux d'un compte de service partagé.
Évals & fiabilité
Golden datasets, harnais d'éval qui doivent battre la baseline de production avant toute livraison, sorties structurées validées par schéma, et verdicts multi-états notés axe par axe pour que chaque décision reste explicable.
Gouvernance & autorisation
Autorisation à trois couches, personas aux périmètres calculés en données, projection champ par champ des payloads, gardes RGPD déterministes hors du chemin du modèle, et audit trails requêtables à conservation bornée. Ce qu'un salarié qui part peut encore voir se répond par une date, pas par une supposition.
Stack
TypeScript et Python, React et Node, PostgreSQL avec pgvector, Vercel, PostHog. Les agents de code sont ma façon de construire : l'architecture est la mienne, ce qu'ils produisent est corrigé plutôt qu'accepté, et ce qui part en production est relu par les ingénieurs du client. La Responses API, les sorties structurées et les embeddings tournent ici en production ; plusieurs fournisseurs frontier tournent côte à côte, choisis selon la tâche plutôt que par défaut.
Adoption
Cadrage avec des interlocuteurs non techniques, documentation et passation, usages suivis après la mise en service, et systèmes arrêtés quand l'éditeur en place comble le manque.
Descomposantsmodulaires,desatomes,recombinésensystèmespluslarges.C'estpourcelaquemasociétés'appelleAtomly AI.
Ils m'ont fait confiance
Des équipes avec lesquelles j'ai travaillé
Douze ans au contact des clients : discovery technique avec les dirigeants, PoC d'IA générative passés en pipelines de production, et plus de 1 000 professionnels formés à l'IA générative appliquée.
Ce que je fais
IA appliquée, du problème métier à la production
J'interviens comme responsable technique d'un portefeuille IA : cadrage avec ceux qui utiliseront le système, architecture avec les arbitrages écrits, le code lui-même, la mise en production, puis l'adoption. Trois façons de travailler ensemble.
Architecture & delivery IA
Intégré à votre équipe comme responsable technique d'un système IA : cadrage, architecture, code, production, adoption. Le format est celui d'un forward-deployed engineer : j'écris le code, je travaille avec vos ingénieurs, et je reste jusqu'à ce que le système soit utilisé tous les jours.
Témoignages
Ce que disent mes clients
Sur le versant accompagnement du métier, la partie qui décide si un système survit à son premier mois.
“Pierre est un formateur de très très haut niveau qui sait rendre l'IA générative passionnante et accessible à tous. Son expertise pointue, combinée à une capacité rare à s'adapter aux industries et métiers des participants, fait de chaque session une expérience sur mesure. Ses formations sont dynamiques, inspirantes et toujours parfaitement alignées avec les enjeux concrets des clients. Avec un suivi attentif et des retours d'une grande précision, Pierre allie excellence professionnelle et plaisir d'apprendre !”
Christophe Conceicao
Directeur Pédagogique & Excellence opérationnelle, Maria Schools
“Au delà d'être un des meilleurs experts IA du moment, Pierre est très pédagogue ce qui rend les formations qu'il dispense aussi utiles qu'intéressantes ! Il transmet sa passion pour l'IA avec énergie et conviction, et essaie systématiquement de rattacher les exemples à des cas tirés de l'industrie des participants.”
Guillaume Coulomb
Co-fondateur, On Train
Missions
Missions récentes
Au-delà des systèmes en production : diagnostics, ateliers et programmes de formation menés auprès d'équipes techniques et métier.
Crème de la Crème
Responsable technique du portefeuille IA : cadrage avec les équipes Sales, Produit et Engineering, architecture, code et mise en production. Serveurs MCP, moteur de matching hybride, décision human-in-the-loop, accès aux données sous gouvernance.
Client direct
BHG Conseil
Coaching de dirigeant sur les usages de l'IA générative, avec un focus sur l'optimisation des différentes tâches liées au conseil. Exploration approfondie de la création d'Agents IA pour automatiser et améliorer les processus de conseil.
Client direct
Cube School
Création d'un programme e-learning complet avec plus de 10 heures de contenus vidéo. Développement d'un parcours pédagogique structuré offrant une introduction complète à l'IA générative pour les étudiants.
Client direct