Comment exécuter un modèle de langue locale important sur votre téléphone : et pourquoi vous pourriez vouloir le faire

Découvrez comment exécuter un modèle de langage étendu (LLM) localement sur votre téléphone portable et quels avantages vous tirerez de cette expérience.

Les choses les plus importantes que vous devez savoir

  • L'exécution locale de modèles de langage volumineux sur votre téléphone garantit une confidentialité totale et un accès hors ligne, réduisant ainsi la dépendance aux services cloud.
  • Pour exécuter efficacement les modèles LLM localement, votre téléphone nécessite au moins 6 Go de RAM, de préférence 8 Go ou plus pour les modèles plus volumineux, les modèles de 1 à 2 milliards de paramètres étant le meilleur choix pour les téléphones disposant de moins de mémoire.
  • Des applications telles qu'Atomic Chat ou PocketPal AI peuvent être utilisées pour exécuter des modèles de langage simples (SLM) tels que Gemma, Llama ou Phi-4, en se concentrant sur des modèles avec moins de paramètres pour obtenir une meilleure compatibilité et de meilleures performances sur le téléphone.

Il existe désormais des modèles de langage de grande taille (LLM) suffisamment gratuits pour que leur exécution locale sur un ordinateur devienne courante, et même, à certains égards, une meilleure idée : ils sont plus confidentiels, car vous n'avez rien à envoyer sur le cloud, et ils fonctionnent hors ligne.

L'exécution de ces modèles d'IA avancés sur les téléphones n'a pas toujours été simple (c'est pourquoi les fonctionnalités les plus sophistiquées de Siri nécessitent un iPhone récent), mais nous sommes désormais arrivés à un point où la plupart des téléphones mobiles sont suffisamment puissants, et certains modèles suffisamment compacts et performants, pour que cela soit tout à fait possible. Pour plus de détails, consultez notre article sur l'exécution d'un modèle d'IA local sur iPhone.

Comment exécuter un modèle de langue locale important sur votre téléphone : et pourquoi vous pourriez vouloir le faire

Les avantages sont similaires à ceux d'un ordinateur de bureau : vous disposez d'un modèle de langage (LLM) volumineux, toujours disponible et privé, sans transmettre aucune donnée à Google, OpenAI, Anthropic ou tout autre tiers. En revanche, les performances de votre IA seront moindres et plus limitées, car vous utilisez des modèles plus petits et moins puissants, et l'autonomie de la batterie pourrait être impactée (ces conversations avec l'IA peuvent être très gourmandes en ressources).

Même avec ces compromis, l'IA native que vous pourrez exécuter sur votre téléphone sera toujours capable d'effectuer les tâches quotidiennes et les conversations avec une grande efficacité, ce qui signifie que vous pouvez mettre de côté Gemini ou Siri (et éventuellement vos autres abonnements à l'IA).

Le téléphone dont vous avez besoin pour exécuter un modèle de langage local étendu (LLM)

Tout iPhone ou téléphone Android sorti ces deux dernières années devrait être capable d'exécuter correctement un modèle de langage local étendu (LLM) ; l'essor de l'intelligence artificielle a incité les fabricants à concevoir leurs appareils en tenant compte de ce type d'utilisation. Les téléphones plus anciens peuvent également fonctionner, mais il vous faudra peut-être des modèles plus petits et les performances seront moindres.

La mémoire vive (RAM) est en réalité plus importante que les performances du processeur (chipset) pour l'exécution d'un modèle d'IA. Il vous faut au moins 6 Go de RAM pour des performances satisfaisantes, et 8 Go ou plus sont préférables pour les modèles plus volumineux. Si votre RAM est inférieure à 8 Go, privilégiez les modèles comportant entre 1 et 2 milliards de paramètres (B), où B signifie « milliard » et désigne le nombre de paramètres du modèle (qui reflète essentiellement son intelligence et sa polyvalence).

GooglePixel 11 Pro
Les téléphones comme le Pixel 11 Pro sont dotés de modèles d'IA intégrés, mais ceux-ci ne sont pas directement accessibles à l'utilisateur.

Concernant l'espace de stockage, inutile de trop s'inquiéter. Même les modèles les plus volumineux, utilisant 7 à 8 milliards de paramètres, n'occuperont pas plus de 5 Go sur votre téléphone. Vous pouvez donc installer plusieurs modèles d'IA sur votre appareil et passer de l'un à l'autre selon vos besoins.

Si vous achetez aujourd'hui un nouvel iPhone ou smartphone Android haut de gamme, il sera livré avec des modèles d'IA natifs préinstallés pour les tâches rapides pouvant être effectuées hors ligne (sans connexion Internet). Cependant, ces modèles, créés par Apple et Google, ne sont pas directement accessibles à l'utilisateur ; ils sont utilisés lorsque Siri et Gemini les jugent les plus pertinents.

Applications et modèles nécessaires à l'exécution d'un modèle de langage local étendu (LLM)

Plusieurs applications permettent d'utiliser des modèles d'IA sur votre téléphone. Parmi les plus populaires, citons Atomic Chat ( pour Android ou iOS ) et PocketPal AI ( pour Android ou iOS ). Elles présentent quelques différences : par exemple, Atomic Chat est plus facile à adapter aux modèles LLM sur ordinateur, tandis que PocketPal AI est légèrement plus léger. Cependant, les deux sont excellentes pour une première approche de l'IA native sur mobile.

Quant aux modèles eux-mêmes (parfois appelés SLM ou Small Language Models, car ils sont conçus pour fonctionner dans des environnements limités), vous disposez également de nombreuses options. Par exemple, Gemma est le terme générique désignant les modèles open source fournis gratuitement par Google, dont certains sont spécifiquement conçus pour fonctionner dans des espaces restreints et avec peu de ressources (comme votre téléphone).

Application PocketPal AI
PocketPal AI vous guidera vers le modèle local adapté à vos besoins.

Meta propose ses propres modèles d'IA open source appelés Llama, tandis que Microsoft propose les modèles Phi-4, également très performants. Pour trouver les versions les mieux adaptées à votre téléphone, recherchez celles dont le nombre de paramètres précédant la lettre « B » est minimal (ou celles dont le nom contient le mot « mini »).

Actuellement, ces petits modèles de langage (SLM) sont principalement textuels, bien que certains modèles plus récents, plus grands et plus avancés puissent analyser des images et des fichiers. Si vous souhaitez créer des images et des vidéos, vous devrez utiliser des modèles d'IA traditionnels basés sur le cloud, au moins jusqu'à la prochaine avancée technologique majeure.

Expérimenter avec un modèle de langage local étendu (LLM) sur votre téléphone

Pour tester l'utilité de ces modèles d'IA natifs sur un téléphone, j'ai installé PocketPal AI et l'un des modèles Gemma de Google sur mon Pixel 9 Pro – un téléphone qui n'est plus un modèle haut de gamme, mais qui reste récent. J'ai été impressionné par l'assistant de sélection intuitif de PocketPal AI, qui vous oriente directement vers le modèle d'IA le plus adapté à votre téléphone.

Une fois quelques modèles téléchargés et installés, leur chargement et leur utilisation se font en toute simplicité. PocketPal AI propose également des « compagnons » optionnels (d'où le nom de l'application) capables de personnaliser les modèles d'IA selon vos besoins. L'option Pip, par défaut, offre une alternative intéressante aux applications d'IA classiques comme Gemini ou Siri . Les fonctions de guidage et de suivi sont parfaitement fluides, et votre historique de conversations est enregistré par défaut.

Application PocketPal AI
Ces modèles de langage à grande échelle (LLM) plus petits sont mieux adaptés aux réponses rapides et aux demandes d'informations.

On constate une lenteur notable (et prévisible) des réponses lors de l'exécution de modèles LLM sur votre téléphone, ainsi qu'une nette différence selon la taille des modèles d'IA : opter pour un modèle plus petit vous permettra d'obtenir des réponses beaucoup plus rapides, même s'il est moins intelligent ou complet. Il est conseillé d'expérimenter avec plusieurs modèles afin de trouver le compromis optimal entre performance et rapidité qui vous convient.

Face à l'absence de fonctionnalités de recherche web ou de connaissances à jour, cette option est idéale pour le brainstorming, l'analyse et l'amélioration de textes existants, la création de nouveaux textes, la collecte rapide d'informations ou les comparaisons (par exemple : « Suggérer un film similaire à… »). Comme toujours, il convient de se méfier des « hallucinations » que peuvent produire ces modèles, et aucune information fournie par l'IA ne doit être considérée comme garantie d'exactitude.

Les commentaires sont fermés.