NVIDIA simplifie l’IA locale sur RTX avec Hermes, OpenClaw et Perplexity

0
8
PUBLICITÉ

L’installation d’un agent d’intelligence artificielle en local reste aujourd’hui réservée aux utilisateurs avertis : il faut choisir un modèle, trouver un moteur d’inférence compatible, configurer la quantification et gérer les mises à jour. NVIDIA entend bien changer la donne en travaillant directement avec des projets populaires pour rendre cette expérience aussi simple que l’installation d’une application classique.

Une initiative avec trois projets majeurs

Les premières solutions concernées sont Hermes Agent, OpenClaw et Perplexity Portable Computer. Toutes s’appuieront sur llama.cpp et les optimisations NVIDIA pour simplifier la configuration sur les systèmes compatibles.

Perplexity Portable Computer : exécution locale et cloud contrôlé

Prévu pour septembre sur les GPU NVIDIA RTX disposant d’au moins 24 Go de VRAM, sous Windows et Linux, Perplexity Portable Computer permettra d’exécuter des flux de travail complets directement sur la machine, sans consommer de crédits cloud. Lorsque nécessaire, il pourra déléguer certaines tâches à plus de 15 modèles frontier disponibles dans le cloud, mais uniquement après avoir obtenu l’autorisation de l’utilisateur. Cette approche hybride permet par exemple d’analyser localement des documents financiers sensibles, puis de recourir aux services en ligne uniquement pour des recherches ou des capacités de raisonnement supplémentaires.

Hermes Agent : configuration automatique en un clic

Développé par Nous Research, Hermes Agent bénéficiera d’une procédure de configuration locale simplifiée à l’extrême sur les systèmes RTX et DGX sous Windows et Linux. Le programme détectera automatiquement le GPU NVIDIA présent, choisira un modèle et une configuration adaptés, et utilisera llama.cpp intégré avec les optimisations NVIDIA. L’utilisateur n’aura plus à télécharger manuellement le modèle ni à ajuster les principaux paramètres. Une fois lancé, Hermes conservera le contexte des activités, mémorisera des informations entre les sessions et créera des compétences réutilisables.

OpenClaw : une collaboration pour Windows

OpenClaw suit une voie similaire : NVIDIA, Microsoft et l’équipe du projet collaborent sur la version Windows de l’application, qui simplifiera la configuration d’un modèle local optimisé pour les RTX dotées d’au moins 24 Go de VRAM. NVIDIA qualifie OpenClaw de plus grand projet dédié à l’IA sur GitHub, avec plus de 380 000 étoiles au moment de la publication du document.

Des performances en hausse pour llama.cpp et vLLM

NVIDIA continue également de collaborer avec les communautés de llama.cpp et vLLM pour améliorer l’inférence sur ses plateformes. Sur une GeForce RTX 5090, les dernières optimisations de llama.cpp permettent d’atteindre un débit jusqu’à 1,9 fois supérieur. NVIDIA attribue ce gain aux interventions sur les noyaux, aux nouvelles techniques de décodage spéculatif et à un préremplissage plus rapide.

vLLM affiche de son côté une amélioration de 1,2 fois sur la RTX PRO 6000 Blackwell Workstation Edition et jusqu’à 1,4 fois en utilisant deux systèmes DGX Spark. Ces progrès reposent sur de nouveaux noyaux XQA dédiés à l’attention dans FlashInfer ainsi que sur d’autres optimisations du backend. Ils sont d’ores et déjà accessibles via LM Studio, Ollama, llama.cpp et vLLM.

Un point sur les modèles locaux récents

NVIDIA a profité de cette annonce pour récapituler plusieurs modèles locaux sortis ces dernières semaines. On y trouve notamment Nemotron 3.5 Lightning (30 milliards de paramètres), GLM-5.3-Flash de Z.ai, Qwen3.8-Flash-Next et Qwen3.8-27B, ainsi que le modèle vidéo LTX 2.5. La liste comprend aussi MiniMax-H3 pour la génération vidéo avec audio synchronisé, Muse Glimmer de Meta pour le codage et les tâches d’agents, et DeepSeek v4 Flash, un modèle Mixture-of-Experts de 284 milliards de paramètres totaux (13 milliards actifs) exécutable localement sur DGX Station.

PUBLICITÉ