Accueil  /  Blog & Insights  /  Architecture et développement

Un modèle de 27 milliards de paramètres sur une seule carte graphique : ce que la compression change pour la confidentialité des PME

Un modèle ouvert de 27 milliards de paramètres pèse 54 Go en pleine précision. Compressé, il tient dans 13 Go en conservant, selon la mesure de son auteur, plus de 99 % de ses résultats. La CNIL recommande le déploiement sur site pour les données sensibles, mais constate qu'il coûte cher : c'est précisément ce coût que la compression fait baisser.

Conclusion opérationnelle

Une PME qui veut confier à une IA générative des contrats, des dossiers clients ou des données RH se heurte à un dilemme décrit par la CNIL elle-même. Pour des données personnelles ou une documentation sensible, il est « généralement plus opportun et plus sécurisé » de déployer la solution sur site, ce qui limite les risques d'extraction de données auprès d'un tiers. Mais le coût d'installation et d'exploitation d'un tel système rend souvent plus simple le recours au cloud.[1]

Ce coût vient de la mémoire. Un modèle de 27 milliards de paramètres stocké en pleine précision, à deux octets par paramètre, occupe environ 54 Go : il faut plusieurs cartes graphiques de centre de données pour le faire tourner. En septembre 2026, deux publications montrent que la compression change cet ordre de grandeur. Le modèle ouvert Qwen3.8 27B, publié sous licence Apache 2.0, tient dans 13,1 Go en conservant, selon la mesure de son auteur, 99,63 % de ses résultats de référence.[2] [3] Une variante plus agressive descend à 5,9 Go.[4]

Autrement dit : un modèle de cette classe s'exécute désormais sur une seule carte graphique de 16 à 24 Go, installée dans un poste de travail ou un petit serveur de l'entreprise.[2]

Décision recommandée : pour les usages qui manipulent des données personnelles ou stratégiques, réévaluez l'option du déploiement local : elle n'est plus réservée aux grandes organisations. Mais décidez sur vos propres tâches, pas sur les benchmarks publiés, et comptez l'exploitation, pas seulement le matériel.

1. Ce que « compresser un modèle » veut dire

Un modèle de langage est, pour l'essentiel, une très grande collection de nombres : ses paramètres, ou poids. En pleine précision, chacun est stocké sur 16 bits. La quantification consiste à les représenter avec moins de bits, en acceptant une petite perte d'exactitude.

Les deux publications de septembre illustrent deux stratégies différentes.

ByteShape (ShapeLearn) choisit un format de représentation différent pour chaque tenseur du modèle, selon sa sensibilité à la perte de précision. Le fichier recommandé, surnommé « GPU-5 », utilise en moyenne 3,84 bits par poids et pèse 13,1 Go.[2] [3]

PrismML (Bonsai 2) va beaucoup plus loin : chaque poids ne prend que trois valeurs, −1, 0 ou +1, complétées par des facteurs d'échelle par groupe. Le modèle descend à 1,76 bit effectif par poids, soit 5,9 Go, plus de neuf fois moins que l'original. Il conserve une fenêtre de contexte de 262 000 tokens et accepte texte et images en entrée.[4]

Les deux partent du même modèle de base, Qwen3.8 27B, et les deux sont distribués sous licence Apache 2.0, qui autorise l'usage commercial.[3] [4] [5]

Un socle commun : llama.cpp. Pour faire tourner ces modèles, les deux publications s'appuient sur llama.cpp, un logiciel libre publié sous licence MIT qui exécute un modèle de langage sur du matériel ordinaire.[8] ByteShape distribue ses fichiers au format GGUF, celui de llama.cpp, et les a mesurés avec la version standard du logiciel.[2] [3] PrismML fournit sa propre version modifiée de llama.cpp, la version standard ne sachant pas lire ses fichiers, ainsi qu'une voie distincte pour les appareils Apple.[4] [10] La compression elle-même relève de méthodes propres à chaque acteur ; llama.cpp fournit par ailleurs son propre outil de compression, accessible à tous.[9] Parce que son code est ouvert, une entreprise peut l'installer, l'examiner et l'exploiter sans dépendre d'un éditeur ni payer de licence.

2. Les chiffres, et comment les lire

Les deux auteurs annoncent des taux de conservation élevés. Ils ne mesurent pas la même chose, et le détail compte.

Version Taille Conservation annoncée par l'auteur Mesure de ByteShape
Qwen3.8 27B, pleine précision ~54 Go référence 100 %
ByteShape GPU-5 13,1 Go 99,63 % 99,63 %
ByteShape GPU-4 11,0 Go 98,72 % 98,72 %
PrismML Bonsai 2 (ternaire) 5,9 Go 98,2 % 91,4 %

Sources : ByteShape[2], PrismML[4].

Le 98,2 % de PrismML est la moyenne de ses propres résultats sur un ensemble de benchmarks couvrant le raisonnement, les mathématiques, le code, le suivi d'instructions, la vision et l'usage d'outils.[4] ByteShape a évalué la même variante ternaire sur son protocole et obtient 91,4 % des résultats du modèle de référence, tout en la classant comme la plus rapide et la plus compacte de toutes les versions testées, sur chacune des six cartes graphiques. Elle exige toutefois une version modifiée du logiciel d'exécution llama.cpp : la version standard ne la fait pas tourner.[2] Aucune des deux mesures n'est fausse : elles ne portent pas sur les mêmes tâches. Mais un écart de sept points sur un même fichier suffit à montrer qu'un taux de conservation n'a de sens qu'avec son protocole.

Une autre réserve s'impose.

Les auteurs sont aussi des vendeurs. ByteShape mesure ses propres fichiers et ceux de ses concurrents avec son propre protocole ; PrismML mesure le sien. Ce ne sont pas des évaluations neutres, même si elles sont documentées.[2] [4] Raison de plus pour tester sur vos propres tâches avant de décider.

3. Ce qui devient exécutable, et sur quoi

ByteShape a mesuré ses fichiers sur six cartes graphiques, de 16 Go de mémoire pour les modèles grand public à 96 Go pour une carte professionnelle. Les plus accessibles sont celles de 16 et 24 Go.[2]

Carte Mémoire Version recommandée Débit mesuré
RTX 4090 24 Go GPU-5 (13,1 Go) 59,2 tokens/s
RTX 3090 24 Go GPU-5 (13,1 Go) 45,8 tokens/s
RTX 4080, RTX 5060 Ti 16 Go GPU-5 si le contexte le permet, sinon GPU-4 —

Source : ByteShape[2].

Un débit de 45 à 60 tokens par seconde dépasse la vitesse de lecture humaine : pour un usage conversationnel ou de synthèse documentaire, le modèle répond sans attente perceptible.

Une précision est indispensable : la taille du fichier n'est pas la mémoire nécessaire. Le modèle doit aussi stocker le contexte de la conversation en cours (le « cache KV ») et des tampons de calcul. ByteShape le dit explicitement : qu'un modèle figure dans ses mesures n'établit pas que toute longueur de contexte ou toute configuration de service tiendra dans la mémoire disponible.[2] Un fichier de 13 Go sur une carte de 16 Go laisse peu de marge pour analyser de longs documents ; une carte de 24 Go en laisse davantage.

4. Ce que cela change pour la confidentialité

La CNIL distingue deux situations.[1]

Pour des usages non confidentiels, un service grand public peut être envisagé avec des garanties : comptes créés avec des adresses professionnelles dédiées, et réutilisation des données d'usage par le fournisseur désactivée lorsque c'est possible.

Pour des données personnelles — clients, collaborateurs — ou une documentation sensible ou stratégique, par exemple lorsqu'on alimente le modèle avec ses propres documents (RAG), la CNIL considère le déploiement sur site comme généralement plus sûr, parce qu'il limite les risques d'extraction de données auprès d'un tiers. Elle renvoie sur ce point aux recommandations de sécurité de l'ANSSI.[1] [6]

Le frein identifié par la CNIL était économique : le coût d'installation et d'exploitation d'un système sur site. Elle admet d'ailleurs que les petites structures aux ressources limitées recourent à une infrastructure mutualisée, dès lors que les transferts de données sont encadrés et leur sécurité assurée.[1]

La compression ne supprime pas ce frein, mais elle en réduit fortement la partie matérielle. Une seule carte graphique de bureau remplace une grappe de cartes de centre de données. Pour une PME, cela ouvre une architecture qui n'était pas réaliste il y a quelques mois : les données sensibles restent dans l'entreprise, et seul ce qui ne l'est pas part vers un service en ligne. PrismML décrit d'ailleurs cette architecture hybride comme l'un des usages visés par les modèles compressés.[4]

5. Ce que le déploiement local ne règle pas

Exécuter un modèle chez soi ne rend pas un traitement conforme par nature.

Le RGPD s'applique toujours. La CNIL rappelle que tout déploiement doit être précédé d'une analyse des risques et d'une stratégie de gouvernance, quel que soit le mode de déploiement.[1] Un modèle local qui lit des dossiers RH reste un traitement de données personnelles, avec sa base légale, sa durée de conservation et ses droits des personnes.

La sécurité change de mains. Chez un fournisseur, la protection du service lui incombe en grande partie. Sur site, elle revient à l'entreprise : contrôle des accès au modèle et aux documents, journalisation des requêtes, mises à jour du logiciel d'exécution. Les recommandations de l'ANSSI pour un système d'IA générative décrivent ces mesures.[6]

L'exploitation a un coût. Le matériel est la dépense visible ; la maintenance, la supervision et la montée de version du modèle sont les dépenses durables. Une PME sans compétence interne devra les confier à un prestataire, ce qui réintroduit un tiers — mais un tiers qui intervient sur une machine de l'entreprise, sous contrat, et non un service qui reçoit les données.

Le modèle n'est pas le meilleur du marché. Un modèle de 27 milliards de paramètres, même bien compressé, n'égale pas les plus grands modèles accessibles en ligne sur les tâches les plus complexes. L'arbitrage n'est pas « local ou cloud » dans l'absolu, mais : quelle tâche exige quelles données, et quel niveau de capacité ?

L'origine du modèle reste une question. Qwen est développé par Alibaba Cloud.[7] Exécuté sur site, le modèle traite les données dans l'entreprise : elles ne transitent pas par son éditeur, et la confidentialité des traitements n'en dépend pas. Le choix d'un modèle et de sa provenance relève en revanche d'une question de souveraineté plus large, que nous traiterons dans un prochain article.

6. Plan d'action pour une PME

  1. Classer les usages par sensibilité des données, selon la distinction de la CNIL : non confidentiel d'un côté, données personnelles ou stratégiques de l'autre. Seule la seconde catégorie justifie l'effort d'un déploiement local.
  2. Choisir un cas pilote unique et mesurable, par exemple la recherche dans la documentation interne ou la synthèse de dossiers clients.
  3. Évaluer sur vos propres exemples. Constituez une vingtaine de questions réelles avec les réponses attendues, et comparez le modèle local au service que vous utilisez aujourd'hui. Les benchmarks publiés ne remplacent pas ce test.
  4. Dimensionner la mémoire avec une marge pour le contexte : la taille du fichier n'est qu'un plancher.
  5. Traiter la sécurité dès le départ : accès, journalisation, mises à jour, en s'appuyant sur les recommandations de l'ANSSI.
  6. Documenter le traitement au registre RGPD, comme pour tout autre outil qui manipule des données personnelles.

Recommandation finale

La compression ne rend pas les grands modèles superflus. Elle fait sortir le déploiement local de la catégorie des projets réservés aux grandes organisations. Pour une PME, la question n'est plus « pouvons-nous nous le permettre ? » mais « quelles données justifient de rester chez nous ? ».

Le bon point de départ est modeste : un cas d'usage sensible, un modèle compressé sur une carte graphique, et un test sur vos propres documents. Les chiffres des auteurs donnent un ordre de grandeur ; seul votre test dira si le modèle suffit à votre besoin.

llama.cpp mérite à lui seul un article : nous y reviendrons prochainement, avec ce qu'il faut savoir pour l'installer et l'exploiter dans une PME.

Où en êtes-vous de votre conformité ?

SOTELI accompagne les entreprises dans le diagnostic de leurs usages d'IA générative, la mise en conformité avec l'EU AI Act et la mise en place de processus maîtrisés.

Demander un diagnostic

Cette note constitue une analyse technique et opérationnelle générale ; elle ne constitue ni un avis juridique ni une recommandation d'achat. Les performances citées proviennent des publications de leurs auteurs et ont été mesurées sur leurs propres jeux d'évaluation ; elles ne préjugent pas des résultats sur vos cas d'usage. Les obligations applicables dépendent de vos traitements, de vos données et de votre secteur.

  Tous les articles