· publié sur LinkedIn

Non, tu ne feras pas tourner Claude en local sur ton Mac Studio

Les maths que personne ne fait sur les modèles locaux : RAM, bande passante, débit. Le fond du problème est physique, pas logiciel.

Non, tu ne feras pas “tourner Claude en local sur ton Mac Studio”. Désolé, fallait que ça sorte.

Je vois passer des mecs très sérieux qui t’expliquent qu’ils ont divisé leur facture IA par X en faisant tourner leurs agents en local. Que les API, c’est fini.

Mon copain, 2 minutes.

Oui, pour du traitement de docs en asynchrone, c’est pas con. Mais c’est une part infime de ce que les gens font vraiment au boulot. Pour le reste (temps réel, à plusieurs, du vrai agentique), faut parler d’ordres de grandeur.

Un million de secondes, ça fait 11 jours. Un milliard ? 32 ans. Le cerveau capte pas la diff, elle est pourtant énorme.

Les modèles, pareil. Des gens font tourner Llama 70B en local, et ça marche. 70 milliards de paramètres. Du coup d’autres t’expliquent qu’il suffit d’un Mac Studio pour faire tourner GLM-5.2, le meilleur open-source. 750 milliards. Dix fois plus. Et ce “dix fois”, personne le visualise.

Comment ça rentre sur un Mac Studio ? En le compressant. En pleine précision, GLM pèse 1,5 To (de RAM). En 4-bit (version allégée), ~375 Go. Sur un Mac Studio 512 Go (~10 000 € si pas en rupture), ça passe.

Ton MacBook à 3 000 €, il a 32 Go. Là on parle de 512.

Reste ~130 Go pour le contexte. Or GLM gère 1M de tokens : une seule grosse session agentique peut en bouffer 100 Go. Traduction : ta machine à 10 000 balles est saturée par UNE conversation. Un poste mono-tâche, pas un serveur.

Et la vitesse ? 819 Go/s pour le Studio, 3,35 To/s pour une H100. 4 fois plus lent. En async tu t’en fous. En agentique temps réel c’est dead.

« Bon, alors un modèle plus light. »

Teste, t’as pas besoin d’attendre : prends Haiku, le petit modèle d’Anthropic, fais-le tourner 10 minutes et dis-moi ce que tu peux vraiment lui déléguer dans ton taf sans repasser derrière.

Le fond du problème est physique, pas logiciel.

Et notre appétit pour les tokens explose plus vite que le hardware. À sa sortie, ChatGPT te répondait à UNE question en 15 secondes, et c’était déjà fou. Aujourd’hui, un seul prompt lance 5 cycles de réflexion “ultrahard” suivis d’un workflow de 4 phases, 3 à 5 agents chacune, qui tourne pendant 1h30. Pour UNE tâche. Le matos progresse, mais ce qu’on lui demande va beaucoup plus vite.

Et pour servir un tel modèle en prod (pas le charger : le servir, avec du débit), il faut un nœud entier genre 8 cartes B200, 1,44 To de VRAM, ~500 000 $. Le prix d’une maison. Et même lui tient quelques dizaines de sessions en parallèle. Pas des milliers.

Multiplie par des millions de gens, chacun lançant plusieurs agents. Voilà pourquoi un data center, c’est des centaines de milliers de GPU (xAI en aligne 500 000+ sur un seul site).

Le local remplace pas les datacenters. Confondre les deux, c’est juste pas savoir lire les ordres de grandeur.