AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Inférence LLM en Edge — Apple Silicon, NPU, On-Device

Inférence LLM en Edge — Apple Silicon, NPU, On-Device — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Inférence LLM en Edge ?

L'inférence LLM en edge a franchi un seuil pratique en 2026 — un MacBook M4 Pro fait tourner Llama-3.1-8B à 40-60 tokens/s — mais quatre contraintes (quantification obligatoire, contexte borné par le KV-cache, autonomie batterie de 20-30 %/h, logistique de mise à jour de flotte) restent déterminantes.

De quoi il s'agit

L'inférence LLM on-device déplace le modèle d'un cluster GPU distant vers l'ordinateur portable, le téléphone ou la passerelle industrielle de l'utilisateur. En 2026 la technologie a franchi un seuil pratique : un MacBook M4 Pro exécute Llama-3.1-8B en quantification 4 bits à 40-60 tokens/s; un iPhone 16 Pro exécute le modèle de fondation on-device 3B d'Apple à 20-30 t/s sur le Neural Engine; les Snapdragon 8 Gen 4 et Intel Lunar Lake embarquent des NPU dans la plage 40-50 TOPS. Pour les consultants SAP cela compte car une classe croissante d'usages — documents RH sensibles, données salariés sous Mitbestimmung allemande, diagnostics service après-vente sur site — ne peuvent légalement ou économiquement faire l'aller-retour vers un LLM cloud.

Trois substrats matériels dominent la pile edge. L'architecture de mémoire unifiée d'Apple Silicon permet au GPU et au Neural Engine de lire directement dans le même pool de 16-128 Go sans copie PCIe — uniquement bien adapté aux LLMs dont les poids écrasent les tenseurs d'activation typiques. Les frameworks MLX et Core ML d'Apple exposent cela directement; le backend Metal de llama.cpp est l'équivalent open-source. Les GPU laptop RTX de NVIDIA exécutent la pile CUDA standard (TensorRT-LLM, llama.cpp CUDA) — débit absolu le plus rapide mais consommation élevée. Les NPU dédiés (Apple Neural Engine, Qualcomm Hexagon, Intel NPU 4, AMD XDNA) sont éco-efficients à 40-50 TOPS mais limités à des graphes à forme fixe en INT8/INT4 — ils accélèrent bien le prefill, moins le décodage.

Pourquoi c'est important

  • Une classe croissante d'usages SAP — documents RH sensibles, données salariés sous Mitbestimmung allemande, diagnostics service après-vente sur site — ne peut légalement ou économiquement faire l'aller-retour vers un LLM cloud.
  • La mémoire unifiée d'Apple Silicon permet au GPU et au Neural Engine de lire le même pool de 16-128 Go sans copie PCIe, particulièrement adapté aux LLM dont les poids écrasent les tenseurs d'activation ; les NPU dédiés accélèrent bien le prefill, moins le décodage.
  • Pousser une mise à jour de modèle de 5 Go vers une flotte de 50 000 appareils exige une bande passante CDN et une discipline de déploiement échelonné que la plupart des DSI sous-estiment.

Points clés

  • Un MacBook M4 Pro exécute Llama-3.1-8B 4 bits à 40-60 tokens/s ; un iPhone 16 Pro exécute le modèle 3B on-device d'Apple à 20-30 t/s ; les laptops NPU (Snapdragon, Lunar Lake) embarquent 40-50 TOPS.
  • Le pool de mémoire unifiée d'Apple Silicon donne à la plateforme une avance structurelle pour les LLM — pas de copie PCIe entre GPU et Neural Engine.
  • La quantification est obligatoire : GGUF/MLX 4 bits divise la mémoire par 4 avec 1-3% de perte de qualité ; 2 bits viable pour 70B sur Macs 64 Go mais qualité dégradée.
  • Le cache KV domine le budget mémoire en contexte long — 128k sur modèle 8B = ~16 Go de cache à lui seul.
  • L'autonomie et la logistique de mise à jour des modèles sont les coûts sous-estimés ; pousser 5 Go à une flotte de 50 000 appareils exige une discipline de rollout par étapes.
  • Usages adaptés : résidence des données contrainte, fiabilité hors-ligne, autocomplétion basse latence. Restez cloud pour raisonnement frontière + concurrence en pics.

Termes employés sur cette page

Unified memory
Architecture Apple Silicon où le CPU, le GPU et le Neural Engine partagent un seul pool de mémoire physique — aucun transfert PCIe, idéale pour les charges LLM gourmandes en poids.
MLX
Le framework de machine learning d'Apple optimisé pour Apple Silicon ; inférence LLM native avec tenseurs en mémoire partagée et accélération Metal.
NPU
Neural Processing Unit — accélérateur d'inférence dédié à basse consommation (Apple Neural Engine, Qualcomm Hexagon, Intel NPU, AMD XDNA) évalué en TOPS.
GGUF
Format de fichier de modèle quantifié utilisé par llama.cpp ; prend en charge la quantization des poids de 2 à 8 bits avec métadonnées pour la sélection au runtime.
TOPS (Tera Operations Per Second)
La métrique marketing standard des NPU — opérations théoriques de multiplication-accumulation INT8 par seconde au pic. Ne prédit pas directement le débit réel de décodage LLM, généralement limité par la bande passante mémoire plutôt que par le calcul brut ; deux NPU aux TOPS similaires peuvent différer d'un facteur 2 en tokens/s soutenus.
Quantization (Q4/Q8/Q2)
Compresser les poids d'un modèle de virgule flottante 16 bits à 4, 8, ou 2 bits par poids pour tenir dans la mémoire de l'appareil et augmenter le débit ; le 4 bits est le défaut standard en edge (1-3 % de perte de qualité pour une réduction mémoire ×4), le 2 bits n'est utilisé que quand la mémoire est la contrainte dominante et qu'une certaine perte de qualité est acceptable.
Core ML
Le compilateur et runtime de modèles on-device d'Apple ; convertit un modèle entraîné dans un format que le Neural Engine, le GPU et le CPU peuvent tous exécuter, en routant automatiquement chaque opération vers le moteur le plus rapide disponible.
Model fleet management
La discipline opérationnelle de versionnement, de mise en scène et de déploiement des mises à jour de modèle sur une large population d'appareils edge, sans point de terminaison d'inférence central à simplement redéployer — inclut des cohortes de déploiement par étapes, un budget de bande passante, et un repli explicite pour les appareils qui manquent un cycle de mise à jour.

Sources

  1. Apple MLX Framework Documentation
  2. llama.cpp — Inference Engine
  3. Qualcomm — Snapdragon 8 Gen 4 AI Engine Brief
  4. Apple Machine Learning Research — Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU
  5. GitHub — ml-explore/mlx (Apple's array framework for Apple Silicon)
  6. Apple Open Source — MLX project page
  7. Apple Developer Documentation — Core ML
  8. Qualcomm — Snapdragon leads the agentic AI age with two of the world's fastest mobile SoCs (press release, 2026-09)
  9. Google Developers Blog — Unlocking Peak Performance on Qualcomm NPU with LiteRT
  10. GitHub — ggml-org/ggml, GGUF file format specification
  11. ONNX Runtime — official documentation
  12. Android Authority — Qualcomm Snapdragon 8 Elite Gen 6 NPU coverage (press, 2026-09)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →