Commentaires : Six semaines sans cloud : j'ai confié tout mon travail à une IA locale à 4 500 €

Ollama est facile d’accès, mais plus lent que Llama.
Pour le code, on utilise en général llama-server en local, et l’IDE VSCode avec un plugin (Cline ou Continue).

Ex :

  • hf download unsloth/Qwen3.5-9B-GGUF --include « Qwen3.5-9B-Q5_K_M.gguf » --local-dir ~/models
  • llama-server -m ~/models/qwen3.5-9b-instruct-q4_k_m.gguf --port 8080 --host 127.0.0.1 -c 8192 -ngl 99 --flash-attn on

Intéressant - pour ceux qui voudrait trouver cette version compressée, elle s’appelle Ternary Bonsai 27B (5.9 GB).
Ce modèle tiendra facilitent en VRAM, mais il a quand même 27 milliards de paramètres à exécuter. Ceux l’ ayant testé parle d’un certain lag avant le début du résultat, puis une bonne vitesse de génération.

Je trouve intéressant d’aligner un ensemble de modèle chinois sans problème pour parler de milieux professionnels. Des expériences précédentes montrent une dérive possible par des biais. C’est d’ailleurs la limite qui n’est pas posée dans le test sur le mélange incongru d’une IA chinoise en local avec un objectif de souveraineté.

Ci-dessous le retour en question:
https://www.lemonde.fr/pixels/article/2026/06/25/ia-le-test-d-un-modele-chinois-a-la-direction-generale-du-tresor-interrompu-a-cause-de-reponses-orientees-ou-biaisees_6715445_4408996.html

Et j’ai zappé quand même de faire une remarque sur Grok et ses biais tout aussi problèmatique.

Je suis en train de tester continue le plugin n’est pas clair du tout. J’ai lié à Ollama ça semble être lié correctement puisque ça m’affiche le bon Qwen qu’il fait tourner mais c’est Claude Sonnet qui répond qui est malheureusement incapable de lire mon projet.
Cline ça a l’air de marcher mon PC turbine mais il me dit encore qu’il s’appelle Claude.

Un test simple : couper internet et voir si ça fonctionne encore.
Normalement dans les options de l’extension, le choix entre un modèle local ou en ligne est très clair.

Par contre je préfère Llama à Ollama : vitesse de génération des réponses 15% à 20% plus rapide.

EDIT - une config qui fonctionne pour Cline avec Llama:

Terani bonsaï (5.9go), et bonzai 1 biT (4go)
le site officiel
https://prismml.com/

Il y a aussi le modèle flux klein 2 qui a été fait bonsai image qui est tres légé et peut tourner facile sur GPU basique, flux garde comme default l’aspect plastique de la peau.
Autre modèle mais pas fait par prism ml , z image turbo peut tourner sur des 8go vRAM et bonne generation d’image

Par contre il faut une version de llama.cpp patchée pour supporter de nouveaux formats de tensors ajoutées par PrismLM (ggml type ID 142).

Et certains retours ne sont pas si favorables : pas mal, mais Qwen3.5 ou Gemma4 avec des poids stockés sur plus de bits fait mieux pour certains.
https://www.reddit.com/r/LocalLLaMA/comments/1uz0z0t/user_experience_of_bonsaiternary27b_on_4060ti/
https://www.reddit.com/r/LocalLLaMA/comments/1uws8sr/is_anyone_having_any_luck_with_the_ternary_bonsai/


The good: it works. Tool calls do not fail randomly due to bad JSON or missing params. The model can reason its way around obstacle and find alternative tools. The vision also works okay (I gave it some FR charts of IEMs to read, and it read and analyse the iEM sound signature just fine).

All and all, on the « happy » path when you are not too restrictive about what the LLM does, and do not push back and tell it to adjust the plan, it’s pretty … alright.

The meh:

The KV cache still eats up quite a bit of space. I only managed to fit 100k context at f16. If I use Q8_0 KV cache, I can fit up to 150k.

  • The speed: prefill is only around 600-700tk/s. Decode is 20tk/s without dspark speculative decoding. I was hopping for closer to 1000tk/s prefill.

The dspark is having issue with the current version of PrismML llamacpp fork. For some reason, the prediction size of the dspark is connected to the max context of the main model. So, if I set the -c of the main model to 150k, dspark would also want to have 150k context rather than 4k, and blow up the CUDA memory allocation. When dspark works, it does push the decode to closer to 40tk/s.

The bad:

  • This model has problem with nuances and details in the instruction. For example, in my system prompt, there is a few place emphasising that wheneve the model deals with productivity related workload, it needs to load a particular skill first. Only one in maybe 10 runs that the model activate the skill on its own. The model still finds a way to do the task, but just not the way I want it to do, written in my skill.

  • The biggest issue, for me, is that both Gemma 4 and the Qwen 3.6 35B consistently activate the skill without being asked.

  • This lack of nuances and instruction following manifests itself in various subtle ways. This model can indeed gets things done, but just not in the right way.


I’m a bit disappointed, because I was hoping that I would have something as reliable as the 35B A3B, but with the prefill speed of Gemma 4 12B on my rig. The bonsai 27B failed to provide either. The best option for me right now is still the 35B A3B, accepting the 300tk/s prefill, and update my Gemma 4 models with the new prompt template from google, which they promised to fix the lazy « edge case » behaviour of the model.

EDIT - bref, dans les petits modèles pour ~12gb de VRAM ou moins, Qwen 3.5 9B semble rester le meilleur, pour son rapport qualité x vitesse.

Pas encore testé sur lmstudio, de plus lmstudio vient de sortir en open source bionic qui génère des doc,…

Je testerais quand j aurais du temps mais pour du basic ca fera certainement le job, comme le qwen 3.5 q4km fait deja du correct sur ma petite rtx 4060.

Mais en tout cas c est bien de voir l ia local avancer, et beaucoup d open source. Faut il que les gens s y interresse

Bonjour à toutes et à tous,
Je suis enseignant dans l’Éducation Nationale et je souhaite proposer au niveau de mon établissement l’utilisation d’une IA locale.
Mes préoccupations :

  • Je suis un newbee sur l’IA locale (mais j’apprends…) ;
  • Je voudrais que mon IA locale puisse répondre à une charge de 50 utilisateurs simultanés max ;
  • Je voudrais faire du RAG (fiches eduscol + cours profs du collège par exemple) ;
  • Je voudrais fine tunner cette IA locale (si ça vaut le coup) ;
  • Je voudrais que l’IA locale cadre les usages (par exemple : ne réponds pas à comment réaliser une bombe en utilisant du papier d’alu et de l’acide… Mais plus sérieusement en ne donnant pas un résultat mais une piste pour comprendre = l’IA ne devient pas un agent mais reste un outil pour accompagner la compréhension).
    Etc…
    Bref, ça sort un peu du cadre strict de l’article, mais je suis ouvert à vos propositions en terme d’hardware + software (moi, je fais joujou avec LMStudio sous Linux et Gemini 4 12B QK4 ou un truc du genre = Je suis un newbee que je vous dis ! avec un i5 7ème génération + 32 Go + Geforce 1050 2 Go… On ne rit pas au fond !) etc…
    Merci d’avance !

La limite va être la quantité de VRAM : il faut y stocker le modèle plus le contexte de toutes les discussions en cours. Peut-être 8gb pour un bon modèle, et 0,5gb par contexte de discussion, ça va vite monter à plusieurs dizaines de gb. Grosses carte graphique haut de gamme recommandée.

Merci pour votre réponse.
C’est une de mes questions (encore trop nombreuses !) : Faut-il aller nécessairement vers un GPU à carte graphique dédiée ou bien plutôt de la mémoire unifiée « rapide » (par exemple en STRIX HALO ok 3 fois moins rapide que celle de Mac mais possibilité d’avoir 128 Go si le projet l’exige et pas avec un Macbook pro mais sur un fixe) et donc un iGPU ?
En d’autres termes privilégier la mémoire au CPU/GPU, ou bien est-ce une erreur pour les dimmensions du projet (50 utilisateurs simultanés) ?

Honnêtement, c’est au dessus de mon expérience. Je suppose qu’un Mac avec assez de mémoire pourrait faire l’affaire, mais à confirmer…
Demander à un LMM en ligne permettrait de s’informer plus en détails.

Salut, je t’encourage à te rapprocher de ta DSI (au niveau du rectorat si ça n’a pas changé). Et à ne surtout pas le faire toi et encore moins en solo.

Parce que ça ça fonctionne pas très bien. Les modèles frontières on des IA devant les chatbots qui permettent de faire attention mais ce n’est pas la même pour les modèles open source/weight.

Fais un fil dans la section du forum (demande aux modos là ou c’est le mieux) et on peut continuer là bas si tu veux, parce qu’en fonction de tes intentions ça peut tout changer. Par exemple on peut déjà expliquer le fonctionnement d’un modèle sans utiliser des trucs super puissant et qui tournent sur un téléphone (bon ok par n’importe quel téléphone ^^)

Par exemple : https://forum.clubic.com/c/uncategorized/

1 « J'aime »

Bravo et merci pour le temps de retour et rédaction.
Je n’ai pas pris le temps de lire tous les commentaires.

Mais j’ai pour ma part installé chez des clients des architectures hybrides…

Selon moi, 80% des tâches d’une entreprise peuvent aujourdui être traitées en local.
En segmentant micro tâches d’une tâche sur plusieurs agents.

Prenons une veille d’actualités. Nul besoin d’un modèle cloud pour la recherche, le scoring, le crawl, et l’envoi vers un rag.
Mais plusieurs agents locaux dédiés à chaque tâche.
Et des crons pour automatiser la nuit.

Une entreprise n’a pas besoin de la veille à la minute.
Ce qui serait d’aileurs générateur de l’effet inverse attendu : le gain de productivité.

Par contre, qu’un modèle cloud sache requeter un rag et analyser, classifier, et sortir un debrief dirigeant tous les matins, voilà il me semble la bonne hybridification.

Lire un mail et le categoriser, Gemma 4 sur 64 go suffit très largement.
Mais un modèle cloud est nécessaire pour comprendre le contexte dans lequel s’insère le mail : compréhension dossier historique, client etx.

Donc rêver d’une ia locale qui serait tout faire à 80 tokens secondes n’est pas près d’arriver encore…
Mais savoir combiner les facultés de chaque système, avec des solutions hybrides, et vous baisser déjà le coût d’exploitation d’au moins 50%

Et aujourd’hui, dire à une entreprise que ses données sont souveraines, sur ses serveurs, que 60% des tâches ia sont assurées en local, avec 0 coûts et confidentialité totale, et que oui, on utilise des modèles par API pour les opérations de raisonnement, en utilisant notamment les modèles qui acceptent le paramètre de non utilisation des données, et vous rendez déjà un dirigeant serein et confiant.

Donc sincèrement, aujourd’hui, et cela n’engage que moi, je me fou un peu des capacités d’un modèle. Je ne l’utilise que pour ce qui sait faire.
Et sur des tâches complexes qu’on donne en général à un modèle cloud, on peut déjà sacrément mieux lui premacher le travail avec de petits modèles locaux.
Et sans doute même bien mieux que si on lui avait filé l’entièreté de la tâche.

Ce n’est ni plus moins que le flux existant dans toutes les entreprises. Des collaborateurs saisissent, rédigent, préparent de la data, et le dirigeant analyse et décide.

C’était un point de vue parmi tant d’autres.

Pas compris ce passage. C’est quoi la différence entre les capacités d’un modèle et « ce qu’il sait faire » (j’imagine que c’est une typo)

Article très intéressant merci! J’ai hésité pendant des mois à acheter un meilleur ordi que mon mac mini 24gb, mais les augmentations de prix récentes ont tranché. Je DGX a doublé de prix et les mac studio sont introuvables… Mais grâce a vous je vais essayer Gemma4, merci.
En revanche pour ma petite enterprise de 5 personnes je me suis orienté vers une automatisation au maximum des interfaces entre moi et mes clients/fournisseurs/ l’état, je fais faire le code à Codex et ensuite tout tourne sans avoir besoin d’AI du tout, je me rends compte que pour 90% de mes besoins la possibilité d’écrire du code avec le forfait à 20USD + un stack open source Dolibarr/Metabase/NAS et une petite formation en python/bash/linux m’a permis d’aller très loin sans avoir besoin de local…

Finalement, mon favori actual est ~Qwen… 2.5 Coder~, pas 3.5.

  • Qwen3.5-9B-Q5_K_M : s’entête dans des impasses ne fonctionnant pas; si on lui interdit explicitement d’utiliser un truc ou de faire une connerie, il finit par y retourner.
  • Gemma4 E4B : plus malin que Qw3.5; mais fonctionne mal avec VsCode/Cline - ce dernier qui n’arrive pas à comprendre des réponses de Gemma - surtout quand il lance des outils, ce qui bloque les investigations avancées.
    Faut utiliser Continue, un peu plus difficile à mettre en place.
  • qwen2.5-coder-14b-instruct-q4_k_m : le modèle est plus large, et demande plus de tuning (notamment de compresser plus ses cache de clés et valeurs) pour tenir dans ma vram.
    Mais ça marche au final. Donc le meilleur par KO technique.

En terme de vitesse, sur une RTX 3600 12gb : Gemma vers 50 à 80 token/s, Qwen3.5 vers 50tk/s, Qwen2.5 vers 25tk/s.

EDIT encore - pour éviter de remonter cette conversation dans les messages récents, pour ceux que ça n’intéresse pas. Qwen 2.5 Coder est trop buté; je lui dis de ne pas utiliser un outil, il va tourner en rond quelques minutes puis essayer de repartir discrètement avec le même outil. Poubelle, inutilisable pour les développements avancés. Gemma E4B reste mon préféré en qualité de réflexion.

Au final : par rapport à des LLMs larges Clause/GTP/Gemini et co., il faut bien plus tenir la main des LLMS locaux. Plus difficile d’avoir une équipe de dév-AIs que l’on manage. Il faut plus de micromanagement. Et déçu par les Qwens, qui peuvent finir comme des stagiaires ne voulant ni apprendre ni s’adapter.