Tous les travaux
Plateformes2025Ongoing since 2025

Exfinity

Une plateforme de commerce IA multi-tenant pour le secteur des expériences et de la billetterie. Les marchands se connectent une seule fois et vendent les expériences de nombreux fournisseurs en langage naturel, via une recherche unifiée, des agents de réservation IA et des widgets intégrables, le tout sous leur propre marque. Conçue pour Exfinity GmbH.

Client: Exfinity GmbH

En bref

8
Agents IA spécialisés
27
Outils MCP gouvernés
8
Services de plateforme sur AWS
6
Couches d'isolation des tenants

Le défi

Le marché des expériences est fragmenté. Chaque marchand reconstruit de zéro les mêmes connexions fournisseurs, les catalogues fournisseurs arrivent dans des formats disparates, et personne ne peut proposer une recherche ou une réservation assistée par l'IA sans d'abord bâtir ses propres systèmes d'IA. Il n'existe aucun moyen unique et sûr de chercher chez tous les fournisseurs à la fois, ni de laisser un agent IA réserver au nom d'un client.

Notre approche

Exfinity fonctionne comme un Stripe des expériences. Un marchand se connecte une seule fois et obtient la recherche, la réservation et le support sur l'ensemble des fournisseurs, le tout sous sa propre marque. Derrière cette simplicité, les catalogues fournisseurs sont récupérés automatiquement, nettoyés dans un format commun unique et rendus consultables par le sens, pas seulement par mots-clés. Une équipe de huit agents IA gère la découverte, la réservation et le support, et ces agents ne peuvent agir qu'à travers un ensemble contrôlé d'outils, avec des règles strictes par marchand, des limites de débit et une piste d'audit complète. Tout tourne dans l'UE, à Francfort, et les données personnelles sont masquées avant même d'atteindre un modèle d'IA.

Architecture système

Chargement du diagramme...

Architecture système: Suppliers: API, crawler, feeds, Ingestion, Kafka: ProductFetched, Processor: normalize and embed, OpenSearch: keyword and vector, Merchant site and embeddable widgets, Search API, AI Runtime: Mastra agents, ex-mcp: 27 governed tools, Checkout, SQS FIFO, Supplier connector

Couche IA

La couche IA est le cœur d'Exfinity : un runtime d'agents Mastra, un serveur d'outils Model Context Protocol, une récupération sensible aux permissions et une boucle d'apprentissage par tenant, le tout conçu pour une sécurité de niveau RGPD.

Runtime et agents

Un runtime Mastra exécute un orchestrateur maître et sept spécialistes (recherche, réservation, assistance, recommandation, opérations, copilote PIM et optimisation des prix). Les modèles sont routés entre Anthropic Claude et OpenAI, les réponses sont diffusées en flux via server-sent events, et chaque tour est borné par des plafonds d'étapes, de délégation et de tokens.

Couche d'outils MCP

Le serveur ex-mcp expose 27 outils couvrant le commerce, les recommandations, l'analytique, le contenu, la connaissance, les opérations et la veille marché, via HTTP streamable et server-sent events. Chaque appel est contrôlé par la politique du tenant, limité en débit et audité, et les écritures échouent en mode fermé.

Récupération et RAG

La recherche produit est hybride, mots-clés et vecteurs, sur OpenSearch avec des embeddings à 1024 dimensions. Une base de connaissances par tenant est découpée en fragments, vectorisée et interrogée dans le périmètre du tenant, alimentant un pipeline de contexte à sept couches où toutes les données récupérées sont cloisonnées comme entrées non fiables.

Mémoire et contexte

La mémoire des agents repose sur LibSQL, avec messages récents, mémoire de travail et rappel sémantique cloisonnés par tenant et par principal. Les longs fils sont compactés, et un graphe de connaissances par tenant, avec huit types de nœuds et neuf types d'arêtes, fait remonter les produits populaires et les questions restées sans réponse.

Mémoire en graphe de connaissances

Un graphe de connaissances par tenant sur LibSQL enregistre requêtes, réponses, produits, documents et appels d'outils sous forme de huit types de nœuds reliés par neuf types d'arêtes. Le poids des arêtes décroît avec le temps, si bien que le graphe fait émerger les produits réellement populaires et les questions auxquelles l'assistant n'a pas su répondre, alimentant à la fois la récupération et la boucle d'apprentissage par tenant.

Sécurité et gouvernance

Les données personnelles sont tokenisées avant chaque appel de modèle, le contenu récupéré est cloisonné contre l'injection de prompt, les prix et les réservations restent sous autorité du serveur, et des validations humaines retiennent les actions sensibles. Des plafonds de coût par palier bornent les dépenses, et une boucle d'auto-apprentissage route les réponses à faible confiance vers une revue humaine avant qu'elles ne deviennent des connaissances.

Chargement du diagramme...

Couche IA: User message, Auth and tenant scope, Context assembly: 7 fenced layers, Master agent: intent and delegate, Specialist agent, MCP tool call, Policy and rate limit, Denied, Policy error, Allowed, Tool: search, RAG, checkout, Hybrid search and tenant KB, LLM: Claude or GPT, Guarded response, Audit log: long retention, Knowledge graph and auto-learn

Infrastructure et déploiement

Exfinity tourne entièrement sur AWS à Francfort (eu-central-1), provisionné en tant que code et déployé sur des comptes isolés : la plateforme est ainsi reproductible, résidente dans l'UE et sûre à faire évoluer.

Calcul

Les chemins de requête sans état s'exécutent comme fonctions AWS Lambda (API cœur, checkout, notifications, génération de PDF). Les services de longue durée et en streaming (ingestion, recherche, le runtime IA, le serveur MCP et le tableau de bord) tournent en conteneurs sur ECS Fargate. Il n'y a aucun serveur à patcher, et chaque charge de travail se met à l'échelle indépendamment.

Données et recherche

DynamoDB héberge le plan de contrôle et les tables opérationnelles (tenants, commandes, politiques, audit, usage). OpenSearch sert la recherche hybride mots-clés et vecteurs. ElastiCache Redis met en cache les requêtes, les disponibilités et l'état des limites de débit. S3 stocke les bons d'échange, les instantanés de crawl et l'archive d'audit à longue rétention, tandis que la mémoire des agents et le graphe de connaissances vivent dans Turso, un LibSQL hébergé.

Streaming et messagerie

Les catalogues ingérés transitent par un flux Kafka sur Amazon MSK. Le traitement des commandes et des notifications passe par des files SQS FIFO et standard, chacune dotée d'une file de lettres mortes, et EventBridge planifie les crawls et les contrôles de fraîcheur. Les emails transactionnels partent via Amazon SES et les SMS via SNS.

Authentification, edge et secrets

AWS Cognito émet des jetons à portée de rôle. Un Application Load Balancer et API Gateway sont en frontal des services, CloudFront et Route53 gèrent l'edge et le DNS, et chaque secret réside dans AWS Secrets Manager sous KMS. CloudWatch et des identifiants de corrélation offrent un traçage de bout en bout.

Infrastructure as code et livraison

Chaque ressource est définie dans Terraform avec Terragrunt, avec état distant et verrouillage, si bien que les environnements sont reproductibles et vérifiables. Bitbucket Pipelines déploie sur des comptes séparés de développement, de staging et de production, la production étant protégée par une approbation manuelle.

SDK et intégration

La surface orientée client est livrée comme un SDK de widgets intégrables : six Web Components Lit 3.0 (recherche, chat, checkout, assistance, recommandations et copilote) avec isolation Shadow DOM, gestion de thèmes et six langues, servis depuis CloudFront. Le contrat Protobuf est généré en clients Go, TypeScript et Python, si bien que chaque service et chaque intégration parlent les mêmes types.

Chargement du diagramme...

Infrastructure et déploiement: CloudFront and Route53, ALB and API Gateway, Lambda: core API, checkout, notifications, ECS Fargate: search, AI runtime, ex-mcp, ingestion, DynamoDB, OpenSearch, ElastiCache Redis, Turso LibSQL: memory and graph, Kafka on MSK, SQS FIFO, SES email and SNS SMS, Terraform and Terragrunt, Bitbucket CI/CD

Décisions d'ingénierie

MCP comme frontière de capacités

Les agents ne touchent jamais directement aux magasins de données. Ils appellent des outils via le serveur ex-mcp, où résident la politique par tenant, les limites de débit et l'audit. Cette frontière unique rend explicite et vérifiable ce qu'un agent est autorisé à faire.

Protobuf comme contrat de données

Un schéma canonique unique couvre l'ingestion, le traitement, la recherche et le checkout, généré en Go, TypeScript et Python. Les services se construisent sur le même contrat au lieu de dériver vers des formats incompatibles.

Les données récupérées sont non fiables par construction

Chaque résultat de catalogue, fragment de connaissance et sortie d'outil est cloisonné au rôle utilisateur et déclaré non autoritatif par les règles de la plateforme, ce qui ferme la surface d'injection de prompt que la plupart des systèmes d'agents laissent ouverte.

Le RGPD dès le départ, pas après coup

Infrastructure exclusivement dans l'UE, données personnelles tokenisées avant l'inférence, audit résistant à la falsification et à longue rétention, effacement par fil de conversation : autant de contraintes de conception dès le premier commit, pas une mise en conformité a posteriori.

Technologies

Backend
TypeScriptHonoGoNode.jsProtobuf
Infrastructure
AWSECS FargateLambdaDynamoDBOpenSearchElastiCache RedisKafka (MSK)SQSS3CognitoCloudFrontSESTerraformTerragruntBitbucket CI
IA / ML
MastraAnthropic ClaudeOpenAIMCPOpenSearch kNNTurso / LibSQL
Frontend
LitNext.jsReact

Résultats clés

  • Une seule intégration remplace des semaines de raccordement fournisseur par fournisseur pour un marchand
  • Les agents n'agissent qu'à travers une couche d'outils MCP gouvernée, jamais directement sur les données
  • La recherche hybride par mots-clés et vecteurs renvoie des résultats sous un objectif p95 de 200 millisecondes
  • RGPD dès la conception : infrastructure exclusivement dans l'UE, données personnelles tokenisées, audit à longue rétention

Le résultat

Une seule intégration donne au marchand une recherche, une réservation et un support assistés par l'IA sur tous les fournisseurs connectés. La plateforme est construite selon des standards de production dès le premier jour : recherche rapide, séparation stricte des données de chaque marchand, et une boucle d'apprentissage qui transforme les réponses faibles en connaissances validées au fil du temps. Conçue et développée pour Exfinity GmbH depuis 2025.

Ce qu'Exfinity révèle de notre façon de construire

Exfinity est une plateforme IA multi-tenant complète : elle illustre les disciplines que nous apportons à un projet d'IA ou de commerce.

  • Une isolation multi-tenant pensée dès la première couche, pas ajoutée après coup
  • Des capacités IA placées derrière une frontière d'outils gouvernée, avec politiques et audit
  • Une boucle d'apprentissage qui transforme les réponses à faible confiance en connaissances validées
  • La résidence des données dans l'UE et la conformité RGPD traitées comme de l'architecture, pas comme de la paperasse