Inférence LLM en Edge — Apple Silicon, NPU, On-Device
À jour au 2026-07-23
Qu'est-ce que Inférence LLM en Edge — Apple Silicon, NPU, On-Device ?
L'inférence LLM en edge a franchi un seuil pratique en 2026 — un MacBook M4 Pro fait tourner Llama-3.1-8B à 40-60 tokens/s — mais quatre contraintes (quantification obligatoire, contexte borné par le KV-cache, autonomie batterie de 20-30 %/h, logistique de mise à jour de flotte) restent déterminantes.
De quoi il s'agit
L'inférence LLM on-device déplace le modèle d'un cluster GPU distant vers l'ordinateur portable, le téléphone ou la passerelle industrielle de l'utilisateur. En 2026 la technologie a franchi un seuil pratique : un MacBook M4 Pro exécute Llama-3.1-8B en quantification 4 bits à 40-60 tokens/s; un iPhone 16 Pro exécute le modèle de fondation on-device 3B d'Apple à 20-30 t/s sur le Neural Engine; les Snapdragon 8 Gen 4 et Intel Lunar Lake embarquent des NPU dans la plage 40-50 TOPS. Pour les consultants SAP cela compte car une classe croissante d'usages — documents RH sensibles, données salariés sous Mitbestimmung allemande, diagnostics service après-vente sur site — ne peuvent légalement ou économiquement faire l'aller-retour vers un LLM cloud.
Trois substrats matériels dominent la pile edge. L'architecture de mémoire unifiée d'Apple Silicon permet au GPU et au Neural Engine de lire directement dans le même pool de 16-128 Go sans copie PCIe — uniquement bien adapté aux LLMs dont les poids écrasent les tenseurs d'activation typiques. Les frameworks MLX et Core ML d'Apple exposent cela directement; le backend Metal de llama.cpp est l'équivalent open-source. Les GPU laptop RTX de NVIDIA exécutent la pile CUDA standard (TensorRT-LLM, llama.cpp CUDA) — débit absolu le plus rapide mais consommation élevée. Les NPU dédiés (Apple Neural Engine, Qualcomm Hexagon, Intel NPU 4, AMD XDNA) sont éco-efficients à 40-50 TOPS mais limités à des graphes à forme fixe en INT8/INT4 — ils accélèrent bien le prefill, moins le décodage.
Pourquoi c'est important
- Une classe croissante d'usages SAP — documents RH sensibles, données salariés sous Mitbestimmung allemande, diagnostics service après-vente sur site — ne peut légalement ou économiquement faire l'aller-retour vers un LLM cloud.
- La mémoire unifiée d'Apple Silicon permet au GPU et au Neural Engine de lire le même pool de 16-128 Go sans copie PCIe, particulièrement adapté aux LLM dont les poids écrasent les tenseurs d'activation ; les NPU dédiés accélèrent bien le prefill, moins le décodage.
- Pousser une mise à jour de modèle de 5 Go vers une flotte de 50 000 appareils exige une bande passante CDN et une discipline de déploiement échelonné que la plupart des DSI sous-estiment.
Points clés
- Un MacBook M4 Pro exécute Llama-3.1-8B 4 bits à 40-60 tokens/s ; un iPhone 16 Pro exécute le modèle 3B on-device d'Apple à 20-30 t/s ; les laptops NPU (Snapdragon, Lunar Lake) embarquent 40-50 TOPS.
- Le pool de mémoire unifiée d'Apple Silicon donne à la plateforme une avance structurelle pour les LLM — pas de copie PCIe entre GPU et Neural Engine.
- La quantification est obligatoire : GGUF/MLX 4 bits divise la mémoire par 4 avec 1-3% de perte de qualité ; 2 bits viable pour 70B sur Macs 64 Go mais qualité dégradée.
- Le cache KV domine le budget mémoire en contexte long — 128k sur modèle 8B = ~16 Go de cache à lui seul.
- L'autonomie et la logistique de mise à jour des modèles sont les coûts sous-estimés ; pousser 5 Go à une flotte de 50 000 appareils exige une discipline de rollout par étapes.
- Usages adaptés : résidence des données contrainte, fiabilité hors-ligne, autocomplétion basse latence. Restez cloud pour raisonnement frontière + concurrence en pics.
Termes employés sur cette page
- Unified memory
- Architecture Apple Silicon où le CPU, le GPU et le Neural Engine partagent un seul pool de mémoire physique — aucun transfert PCIe, idéale pour les charges LLM gourmandes en poids.
- MLX
- Le framework de machine learning d'Apple optimisé pour Apple Silicon ; inférence LLM native avec tenseurs en mémoire partagée et accélération Metal.
- NPU
- Neural Processing Unit — accélérateur d'inférence dédié à basse consommation (Apple Neural Engine, Qualcomm Hexagon, Intel NPU, AMD XDNA) évalué en TOPS.
- GGUF
- Format de fichier de modèle quantifié utilisé par llama.cpp ; prend en charge la quantization des poids de 2 à 8 bits avec métadonnées pour la sélection au runtime.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, métriques, entités et règles d'accès utilisée par les outils et les équipes.
- Control plane
- La couche qui applique la politique, les accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
- Evidence grade
- Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- Apple — On-Device Foundation Models Technical Report
- Apple MLX Framework Documentation
- llama.cpp — Inference Engine
- Qualcomm — Snapdragon 8 Gen 4 AI Engine Brief
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP HANA Platform — Help Portal
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.