Photographie computationnelle, reconnaissance vocale, traduction instantanée hors ligne : ces usages grand public s’appuient sur la puce NPU de votre téléphone, pas sur un serveur distant. Le NPU (Neural Processing Unit) est une puce dédiée à l’exécution de modèles d’apprentissage automatique. Qualcomm, Google et Apple en intègrent dans leurs familles de puces pour exécuter des tâches d’IA localement.

Le test tient en un geste : le mode avion.

À retenir
  • La puce NPU exécute localement la retouche photo, l’isolation vocale et la traduction sans envoyer de données au serveur
  • La génération d’images fonctionne en 2 à 4 secondes sur l’appareil, occupant plus de 30 % du stockage des smartphones haut de gamme
  • Apple, Google et Samsung appliquent différemment le traitement local : certaines tâches restent toujours liées au cloud selon le constructeur

Ce que la puce fait sans rien demander

Coupez le réseau et regardez ce qui survit. Le mode nuit, autrefois réservé au haut de gamme, est désormais accessible sur de nombreux modèles, et il n’a pas besoin de connexion pour éclaircir une photo prise dans un couloir. Côté son, Voice Focus isole votre voix sur iPhone et Samsung, et Live Caption sous-titre n’importe quel audio, appels et vidéos sans sous-titres compris. Ces fonctions tournent sur la puce, sans envoi de fichier.

Cette répartition a une logique physique. Un NPU serait 10 à 50 fois plus efficace qu’un processeur classique pour les tâches d’IA, pour une consommation bien moindre, d’après un comparatif publié fin août 2026. Il réduit aussi les transferts vers la mémoire vive, ce qui diminue la latence et la consommation.

La génération d’images suit le même chemin. Pixel Studio, Image Playground sur iPhone et les outils de Samsung produisent désormais une image en local, en 2 à 4 secondes pour un format 512×512, sans rien envoyer au cloud. Tout cela a un coût : selon une estimation, les modèles d’IA embarqués occuperont plus de 30 % du stockage des smartphones haut de gamme d’ici fin 2026, soit plus de 75 Go sur un modèle de 256 Go.

Ce qui part quand même dans le cloud

Le terme « on-device » sert de slogan marketing, alors qu’Apple, Google et Samsung l’appliquent chacun à leur manière. Chez Apple, une requête passe soit par un modèle local, soit, pour les tâches plus difficiles, par Private Cloud Compute, des serveurs conçus pour que les données personnelles ne soient accessibles à personne.

Circle to Search exige toujours une connexion, selon la documentation de Samsung.

Le constructeur coréen trace la frontière avec une précision rare. Le filtrage d’appels, Now Nudge et la détection d’arnaques sont traités entièrement sur l’appareil, via le composant sécurisé Knox Vault. La retouche générative de Creative Studio et l’intégration de Gemini passent par le cloud. Un réglage, « traiter les données uniquement sur l’appareil », sacrifie les fonctions dépendantes du cloud pour garantir un traitement local. Du côté d’Apple, les nouveaux modèles, conçus avec Google et ses modèles Gemini, tournent à la fois sur l’appareil et sur les serveurs de Private Cloud Compute, dont certains hébergés sur Google Cloud avec des processeurs graphiques Nvidia.

Tous les téléphones ne jouent pas dans la même catégorie

Apple Intelligence fonctionne sur l’iPhone 15 Pro et les modèles plus récents.

Sur Android, la carte est plus morcelée. La dernière version de Gemini Nano exigerait 12 Go de RAM et une puce haut de gamme de génération 2026, ce qui laisse de côté des téléphones pourtant récents. Les applications destinées au grand public prévoient donc une solution de repli pour le matériel plus ancien, en général le cloud ou un modèle local plus simple. Votre ancien téléphone n’est pas en panne d’IA : il l’envoie simplement ailleurs.

Les modèles embarqués restent cantonnés à des tâches précises, comme la correction grammaticale, les suggestions de réponse ou le résumé de documents locaux. Côté développeurs, les API GenAI de ML Kit sont toutes encore en bêta, et la reconnaissance vocale en alpha.

Refaire le test chez soi

Activez le mode avion, puis prenez une photo en faible lumière, dictez un message et lancez une traduction (après avoir téléchargé les langues concernées). Ce qui fonctionne tourne sur la puce, ce qui échoue dépend d’un serveur. Sur un Galaxy, le réglage de traitement uniquement local permet de pousser l’expérience jusqu’au bout.

Pour les utilisateurs français, une nuance pèsera dans les mois à venir : Siri AI est annoncé en bêta avant la fin 2026 sur les appareils compatibles en anglais, avec des limites initiales pour les utilisateurs de l’Union européenne. Le partage entre local et cloud dépendra donc aussi de votre pays, pas seulement de votre puce.

Notez ce post