Outiller les équipes, pas remplacer leur jugement.
Cinq prestations, un même contrat : ce qui sort d’une mission doit pouvoir être relu, reproduit et signé par un ingénieur interne. Un livrable sans procédure de reprise n’est pas un livrable.
Ce qui tourne en production, et ce que chaque brique fait. Le choix se fait sur la contrainte du client, pas sur une préférence — une pile qu’une équipe interne ne sait pas reprendre n’est pas une pile.
Stockage, requête, transformation et restitution. Le choix se fait sur la contrainte du client — contrat cloud existant, souveraineté, compétences internes — pas sur une préférence.
Moteur de requête SQL qui lit directement les fichiers posés sur S3, sans base à charger ni serveur à maintenir. La facturation se fait à la quantité de données lues, ce qui met le partitionnement au centre de la conception plutôt qu’à la fin.
Grappes Hadoop, Spark et Trino provisionnées à la demande, pour les traitements qui ne tiennent pas sur une machine. On y porte du code Spark existant sans le réécrire — c’est souvent la raison de le retenir.
Le service serverless d’Azure : du code déclenché par un fichier déposé, un horaire ou un appel HTTP, sans serveur à dimensionner. Convient aux étapes courtes d’une chaîne ; écarté pour les traitements longs, où la facturation à la durée devient le sujet.
Le moteur relationnel de Microsoft, très présent dans les systèmes d’entreprise en place. Dans une migration c’est presque toujours la source à lire et la contrainte à respecter, rarement la cible.
La cible par défaut quand rien n’impose un moteur propriétaire : licence libre, portable d’un cloud à l’autre. Ses extensions — PostGIS pour le géospatial, pgvector pour la recherche vectorielle — évitent d’ajouter un second système pour un seul besoin.
Les modèles GPT, appelés par API directement ou via Azure OpenAI pour rester dans le périmètre contractuel d’Azure. Utilisés pour l’extraction, la classification et la rédaction assistée ; jamais pour trancher une décision d’ingénierie à la place d’un ingénieur.
Les modèles Claude d’Anthropic, appelés par API directe ou à travers AWS Bedrock, Google Vertex AI et Microsoft Foundry — le fournisseur cloud déjà en place ne dicte donc pas le choix du modèle. Employés pour l’analyse documentaire, la rédaction assistée et les agents outillés.
Deux produits sous un même nom : GitHub Copilot pour l’assistance au code dans l’éditeur, et Microsoft Copilot — avec Copilot Studio — pour les agents métier sur Azure. C’est le second qui sert de socle aux agents construits chez Egis Group.
Entrepôt qui sépare le stockage du calcul : on dimensionne l’un sans l’autre et on paie le calcul à l’usage. Disponible sur les trois grands clouds, ce qui évite d’attacher l’entrepôt au fournisseur d’infrastructure.
Plusieurs familles de modèles exposées derrière une API unique, sans que les données sortent du compte AWS. Le modèle retenu reste une décision d’architecture — documentée et révisable — pas un réglage.
Ingestion, entrepôt, notebooks et restitution dans un seul produit, sur un stockage commun (OneLake). L’intégration est le gain ; l’attachement à l’écosystème Microsoft est le prix, et il se décide au cadrage.
Modèles sémantiques, rapports et tableaux de bord — la couche que les métiers manipulent eux-mêmes. C’est aussi là qu’une définition de métrique ambiguë devient visible, ce qui en fait un bon révélateur de la qualité du modèle en amont.
Trois langages, choisis parce qu’une équipe interne peut les relire sans formation particulière.
Le langage des traitements de données et du machine learning, du script d’ingestion au service de modèle. Son écosystème — pandas, PySpark, scikit-learn — couvre la chaîne entière sans changer d’outil en cours de route.
Le seul langage que les équipes métier et technique lisent toutes les deux. Une transformation écrite en SQL reste relisible des années après ; c’est rarement vrai d’un pipeline écrit en code.
Décrit l’infrastructure cloud dans des fichiers versionnés, appliqués de façon reproductible. Sans lui, la configuration d’une plateforme n’existe que dans une console : ni relisible, ni reprenable, ni auditable.
Deux fournisseurs pratiqués en production. Le troisième — GCP — est certifié mais pas retenu ici, faute de mission récente à produire en référence.
Le catalogue le plus large en services de données : S3, Athena, EMR, Bedrock. C’est la voie par défaut quand l’entreprise n’a pas déjà un contrat Microsoft qui décide à sa place.
Le fournisseur des entreprises déjà équipées en Microsoft 365 et Entra ID : l’identité, la facturation et la conformité y sont déjà réglées. Fabric, Functions App et Azure OpenAI en sont les briques de données courantes.
La même chaîne dans toutes les missions. Un seul point de bascule : c’est là que se prend la décision, et c’est le seul endroit qu’on instrumente.
- Une décision d’ingénierie automatisée sans cadre de responsabilité.
- Un livrable qu’aucun ingénieur interne ne peut relire.
- Un chiffre annoncé sans source mesurable.
- Une mise à l’échelle avant qu’un pilote ait tenu trois mois.