LLMs open-weight en local : jusqu'où peut-on aller avec un seul GPU A100 ?
L'essor des LLMs a ouvert de nouvelles perspectives pour toutes les organisations — mais toutes ne souhaitent pas, ou ne peuvent pas, externaliser leurs données vers un service tiers. Les modèles open-weight comme Gemma ou Qwen offrent aujourd'hui une alternative crédible pour un déploiement entièrement local. Reste la question essentielle : sont-ils suffisamment capables pour être réellement utiles au quotidien — et si oui, comment mettre en place un tel service ? Pour y répondre, nous nous appuierons sur un projet concret né d'une collaboration entre l'Institut de Mathématiques de Toulouse (IMT), la délégation régionale DR14 du CNRS et le mésocentre de calcul CALMIP. Concrétisée dans le cadre d'un stage, cette collaboration a abouti à un assistant conversationnel de type RAG (Retrieval-Augmented Generation) s'appuyant sur OpenWebUI et vLLM, conçu pour accompagner l'ensemble des assistants de prévention du CNRS dans la rédaction de leur Document Unique d'Évaluation des Risques Professionnels (DUERP) — en interrogeant des bases documentaires internes, sans aucun appel vers l'extérieur. Ce retour d'expérience abordera les questions concrètes que se pose toute équipe technique avant de franchir le pas : Les modèles open-weight sont suffisamment performants pour un usage en production ? Jusqu'où peut-on aller avec un seul GPU A100 ? Faut-il nécessairement un GPU A100, ou avec que du CPU peut-il suffire pour une expérience utilisateur acceptable ? Quelles performances attendre sur des tâches de recherche documentaire en français ? Quels outils — Ollama, vLLM, LangChain, frameworks d'évaluation — sont réellement prêts pour un déploiement en production ? Et surtout : la confidentialité se paie-t-elle au prix de la performance ? Nos tests portent actuellement sur Gemma 4 et Qwen, mais le domaine évolue à un rythme soutenu. Nous intégrerons les nouveaux modèles dès leur sortie, afin de présenter au DevFest un panorama honnête et actualisé de ce que peut réellement accomplir une équipe disposant de ressources GPU raisonnables.

