L’intelligence artificielle (IA) générative devait devenir moins chère à mesure qu’elle grandirait. C’est tout l’inverse qui se produit, et la facture commence à peser lourd, jusque chez les géants de la tech.
Le problème c’est surtout que les tokens sont facturés peut importe le résultat. Il faut parfois 10 prompts pour arriver à un résultat sans erreur et les corrections sont facturées alors que dans un système normal avec un artisan par exemple c’est gratuit puisque ce n’est pas de la faute du client.
Avec l’offre gratuite de Claude il m’arrive souvent d’être obligé d’attendre pour avoir trop consommé sans avoir de résultat utilisable.
Je pense que la prochaine étape va être de déporter une partie du calcul sur les postes des clients, pour exploiter les NPU sans consommer trop sur les serveurs. Le problème c’est que c’est long à faire, car complexe techniquement et qu’en plus les gens sont encore peu équipés du hardware adéquat. Et vu la concurrence de folie dans le domaine, il faut pour l’instant continuer à faire grossir les modèles quitte à être déficitaire et à mobiliser tout le monde sur cette partie plutôt que d’optimiser la consommation de ressources.
Et on note quelques « cost killer » dans l’approche quand même, DeepSeek, Moonshot… qui pourraient sérieusement changer la donne.
« Je pense que la prochaine étape va être de déporter une partie du calcul sur les postes des clients, pour exploiter les NPU sans consommer trop sur les serveurs. Le problème c’est que c’est long à faire »
Ca serait logique (on peut déjà le faire, soit avec des « petits » modèles, soit avec de smodèles 1bits comme ceux de Ms et maintenant de Apple/Prisml, soit ce que vend Mistral avec le serveur local).
MAIS cela contredit les besoins financiers et d’information: si on s’engage dans l’IA locale, les datacenters qui ont tellement hypé ne seront donc pas tous rentables ou même faits, ce qui serait une catastrophe financière - et de plus les US n’auront pas la totalité des informations du monde.
Peut-on parler de défaut technique et d’inefficacité quand c’est inhérent au système et à son fonctionnement? Ils le savent depuis longtemps du coup ça ne devrait pas être un critère…
Si les IA locales se développent de plus en plus et tournent sur du matériel grand public, cela peut réduire les besoins en datacenters. Quand on voit que des modèles légers comme Gemini Flash font déjà ce que la majorité des gens attendent d’une IA, on peut se demander s’il y a encore un si grand besoin de courir après les datacenters.
On peut aussi ajouter des modèles comme le dernier GLM, qui peuvent être installés en interne par de grands groupes : même s’il faut du gros matériel au départ, cela leur fait faire de grosses économies au final.
Il faudra donc toujours des datacenters, mais peut-être pas avec cette course frénétique actuelle. Les très gros modèles restent très utiles pour des tâches poussées comme la programmation, mais tout le monde ne code pas. Sans parler des IA spécialisées dans des domaines précis.
Et le local tuera la bulle IA, pas forcement Nvidia.
C’est toujours rigolo de se plaindre de la facturation quand on utilise une offre gratuite ![]()
Plus sérieusement, si tu as des résultats si mauvais que tu arrives souvent à la limite avant d’avoir quelque chose qui convient, c’est probablement que tu as un problème avec tes prompts…
Et un artisan, s’il doit faire 20 aller-retours d’échanges avec toi pour définir ton besoin correctement avant d’arriver enfin à comprendre ce que tu veux et te le faire, tu peux être sûr qu’il te facturera d’une manière ou d’une autre tout ce temps qu’il a consacré à te faire formuler correctement ta demande.
Non, l’idée ne serait pas de déporter toute la puissance de calcul sur les NPU, mais de traiter le plus facile en local et de réserver les datacenters aux tâches lourdes, avec une connexion complètement transparente pour l’utilisateur.
Un peu comme les modèles modulaires arrivent à avoir x milliards de paramètres mais n’en solliciter qu’une partie à la fois, l’IA locale utiliserait son modèle et choisirait d’externaliser les calculs plus complexes quand c’est nécessaire.
Donc, l’IA continuerait d’en permettre toujours plus, sans pour autant consommer plus de ressources pour l’éditeur de service. Plus le temps passera et plus il y aura d’exécution locale effectivement, mais plus on en fera avec aussi, donc l’ensemble du paradigme aura changé.
On le voit d’ailleurs aujourd’hui, la seule solution pour répondre aux attentes, c’est de rajouter du serveur, et on y arrive pas. Demain, ça sera sûrement d’en faire plus avec les mêmes serveurs (comme on augmente la bande passante de la même fibre, on optimise l’encodage des vidéos à bitrate équivalent, etc.).
Puis même en on device, ça n’enlève rien à la valeur des modèles qui demandent aussi beaucoup de ressources et qui sont ceux qui changent tout à l’efficacité.
Justement, ceux qui sauront tirer leur épingle du jeu sont pas forcément ceux qui feront le moins cher, mais ceux en feront le plus à prix équivalent.
Un énorme problème, c’est que si on fait du codage avec des solutions telles que Claude Pro, il se passe quoi si le président en cours des USA décide de couper l’accès car on est devenu un pays non fréquentable ?
Les USA ayant décidé de pouvoir couper le robinet de ce qu’ils fournissent, ce n’est pas forcément une bonne idée de faire affaire avec eux.
Sans compter qu’ils pourraient accéder au savoir faire technologique qu’une entreprise aurait confié à une IA américaine.
Pas toujours. Il arrive souvent que ça plante et que je doive copier coller l’erreur pour qu’il corrige et parfois l’erreur reste il faut insister.
Ca m’invente aussi souvent des menus qui n’existent pas sur différents sites comme github ou autre.
avec un artisan par exemple c’est gratuit puisque ce n’est pas de la faute du client.
Sauf que c’est toi l’artisan là.
Peut-être bien que tes prompts sont tellement inefficaces qu’il te faut le double ou le triple d’un autre pour arriver au même résultat, pourquoi donc tu aurais le droit à un tarif préférentiel dans ce cas ?
Non là je suis le donneur d’ordre. Je dis fait moi « un chantier » comme cela.
L’IA est un outil, pas une entité vivante.
Tu ne donnes pas d’ordre à un outil, tu l’utilises.
Et que tu l’utilises mieux qu’un autre ou pas ne dépend pas de celui qui met au point et te vend ou loue cet outil.
Claude a un quota gratuit tres faible, ce n est pas une question de bon ou mauvais prompt, donc on avance quasi par 2 prompt par jour, il faut bien cibler.
Perso je fais comme ca car pas pressé et pour l audio, c est l ia qui me donne le plus de satisfaction, gemini a la ramasse, et ChatGPT bon techniquement en code mais claude prend plus d aspect musicales donc bien meilleur.
Par contre si c est pour du code de base de données etc la glm est en gratuit une alternative le quota est plutôt important, et est tres bon aussi, qwen moins bon meme si j ai pas testé le 3.8. mais sur un prompt de traduction il comprenait pas , la ou gemini flash glm claude ou autres pas de problème.
À long terme, l’IA quantique réglera ces problèmes économiques et énergétiques. Et là ce sera vertigineux.