Embeddings et recherche vectorielle à partir des tables Datasphere et HANA Cloud
À jour au 2026-09-25
Qu'est-ce que Embeddings et recherche vectorielle à partir des tables Datasphere et HANA Cloud ?
La capacité vectorielle de SAP ne réside pas dans Datasphere comme un service séparé — elle réside dans la base HANA Cloud sous-jacente, qui stocke de véritables données vectorielles aux côtés des lignes métier ordinaires et permet de joindre, en SQL, une recherche de similarité par plus proches voisins à des données métier relationnelles. Ce seul fait — vecteurs et faits relationnels dans la même requête, pas deux systèmes cousus ensemble — est ce qui rend l'embedding d'une table modélisée dans Datasphere différent de l'embedding d'un tas de PDF.
Où réside réellement la capacité vectorielle
Une mauvaise lecture courante consiste à chercher « le vector store de Datasphere » comme un produit distinct. Ça n'en est pas un : la capacité vectorielle se trouve dans SAP HANA Cloud, la base de données sur laquelle Datasphere est construit (C001). La description propre de SAP du moteur vectoriel de HANA Cloud nomme trois choses qu'il fait : générer un embedding vectoriel à partir de texte, exécuter une recherche par plus proches voisins utilisant la similarité cosinus exprimée directement en SQL, et enrichir les résultats en joignant la sortie de la recherche vectorielle à des données métier relationnelles ordinaires. Ce troisième point mérite qu'on s'y attarde : une recherche de similarité ici ne renvoie pas une liste isolée de correspondances comme le ferait une base vectorielle autonome — elle renvoie des lignes qui peuvent être jointes, dans la même requête, aux mesures, hiérarchies et contexte métier qui vivent déjà dans une table modélisée dans Datasphere.
Pourquoi c'est important
- Le moteur vectoriel de SAP rejoint les résultats de recherche de similarité à des données métier relationnelles dans la même requête SQL — une différence structurelle par rapport à une base vectorielle autonome qui change ce que « le grounding sur vos propres tables » peut livrer.
- Intégrer en vecteur des données métier structurées (cette fiche) et le grounding documentaire (C116) sont des pipelines différents avec un outillage différent ; les cadrer comme le même travail sous-livre sur les deux.
- Où vit un embedding — HANA Cloud contre une recherche vectorielle côté Databricks (C351) — est une décision de gouvernance autant que technique, puisqu'elle décide si une seconde copie non gouvernée de la donnée est créée.
Points clés
- La capacité vectorielle se trouve dans HANA Cloud, la base de données sous Datasphere — pas dans un produit vectoriel séparé, spécifique à Datasphere.
- SAP nomme trois capacités du moteur vectoriel : génération de texte vers embedding, recherche par plus proches voisins via similarité cosinus en SQL, et jointure des résultats vectoriels avec des données métier relationnelles.
- Cette fiche couvre l'intégration en vecteur de données de table structurées (descriptions de produits, retours, notes d'incident) ; le grounding documentaire (PDF, SharePoint) est un pipeline séparé (C116).
- Garder les embeddings à l'intérieur de HANA Cloud préserve la gouvernance — le vecteur reste au même endroit contrôlé en accès que la ligne dont il est dérivé.
- SAP associe le moteur vectoriel à un moteur de knowledge graph sur la même base de données pour une récupération hybride (C110) : parcours, agrégation SQL et similarité vectorielle sans déplacer de donnée.
- Choisir entre HANA Cloud et la recherche vectorielle Databricks Mosaic AI (C351) selon où tourne l'application consommatrice, pas selon la capacité brute.
- Mélanger les sorties de deux modèles d'embedding différents dans un même index casse silencieusement la recherche de similarité (C154) — une erreur de conception courante et évitable.
Termes employés sur cette page
- Moteur vectoriel HANA Cloud
- La capacité de SAP HANA Cloud à stocker de véritables données vectorielles, générer des embeddings de texte, et exécuter une recherche par plus proches voisins par similarité cosinus en SQL, joignable à des données relationnelles.
- Embedding de donnée structurée
- Transformer une colonne de texte déjà stockée dans une table métier gouvernée en vecteur aux côtés de sa ligne, par opposition à l'embedding de documents.
- Grounding hybride
- Combiner recherche de similarité vectorielle avec parcours de knowledge graph et agrégation SQL sur la même base de données (C110).
- Incompatibilité de modèles d'embedding
- L'erreur consistant à mélanger des vecteurs de deux modèles d'embedding différents dans un même index, ce qui casse silencieusement les comparaisons de similarité.
Sources
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · les pièges courants et leur correctif · l'aide-mémoire · les chiffres à citer.