Connexion Premium

T@LC : on a voulu tester Kimi K3 (1 562 Go) en « local », on a failli finir ruinés

Heu… 43 800 euros en note de frais, ça passe ?

T@LC : on a voulu tester Kimi K3 (1 562 Go) en « local », on a failli finir ruinés

Illustration : Flock

Installer le modèle open source Kimi K3 en « local » c’est faisable ? Non… Et en louant des GPU pour rester maître de ses données ? En théorie, oui… mais la facture risque de vous faire mal au porte-monnaie avec plus de 1 000 euros… par jour.

C’est donc aujourd’hui que Moonshot AI publie les poids de son dernier modèle Kimi K3, avec pas moins de 2 800 milliards de paramètres. Il est donc possible de l’installer et de l’utiliser en local ou bien sur une machine louée. Vous pouvez rester maître de vos données et prompts, sans passer par les serveurs de l’entreprise.

Est-ce facile à déployer sur une machine ? Réponse simple : non. Quelles sont les performances ? Excellentes… pour vider rapidement votre porte-monnaie. Cela mérite des explications.

Le point crucial est la mémoire. Pour utiliser dans de bonnes conditions un modèle, il faut pouvoir charger ses paramètres en mémoire – idéalement dans celle du GPU, même s’il est possible de composer aussi avec celle du CPU au prix de performances moindres. Les paramètres, ce sont les poids des neurones. À la place des poids, on peut aussi parler des nombres.

Avec un modèle aussi gros, louer des instances GPU pour le faire tourner nous couterait plusieurs dizaines de milliers d’euros par mois, comme nous allons le voir.

Il reste 70% de l'article à découvrir.

Cadenas en colère - Contenu premium

Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.

Accédez en illimité aux articles

Profitez d'un média expert et unique

Intégrez la communauté et prenez part aux débats

Partagez des articles premium à vos contacts

Commentaires (39)

votre avatar
Ce qui serait intéressant c'est de savoir combien d'utilisateurs simultanés une telle instance permettrait de gérer de façon "confortable".
10 ? 100 ? 1000 ?

Il faut ensuite rapporter ça à combien coûterait pour ces mêmes utilisateurs des abonnements aux différents LLM providers pour valider l'équilibre économique de la chose.

Autre élément d'étude, les tokens/s qui sont gérés, et l'acceptabilité d'un traitement plus "lent" dans le cadre d'un traitement "autonome" (comprendre hors LLM-provider).
votre avatar
La remarque est pertinente, il faut ajouter qu’il n’y a pas que l’aspect « coût financier », il y a également l’aspect sécurité et souveraineté.
Par exemple, les banques françaises préfèrent déployer leur propre LLM, même si ça coûte quelques millions, plutôt que de risquer d’envoyer des données sensibles à l’extérieur de leur bastion.
votre avatar
J’ai pas cette info, faudrait à minima un bench avec le nombre de tokens/s sur 8x B300. De ve que je vois avec k2.x, l’ordre de grandeur semble être quelques dizaines. Mais c’est du gros doigt mouillé :/
votre avatar
S'il y a besoin de monde pour prompter pour un test grandeur nature, tu peux toujours lancer un appel à candidature ici, dans les commentaires de Next. Genre sur une journée, c'est open bar, faites vos prompts, éventuellement avec une heure précise où ce serait "allez-y à fond, on veut mettre le système en PLS" :D
votre avatar
Va falloir augmenter le coût de l'abonnement Next pour faire passer 43800€ en note de frais.
votre avatar
Sur une journée, ce n'est "que" 1 440 euro ;) Et encore, une journée complète. En faisant genre de 8h à 18h, on réduit encore la facture.

Seb a bien été payé pour naviguer sur des sites porno... (oui, ca va rester cette histoire :mdr:)
votre avatar
V’la la journée : 8h-18h IA, 18h-8h porn :o
JE MANGE QUAND :o
votre avatar
Ben de 8h à 18h. Quand l'IA bosse, tu es libre :p
Et puis c'est tellement surfait de manger... :francais:
votre avatar
JE MANGE QUAND :o
Une perfusion et basta.
votre avatar
14h de porno d'affilée ? Tous les jours ?
'faut avoir l'habit(r)ude.
votre avatar
Tout dépend du cas d'usage que tu vise

Le moteur d'inférence joue pour beaucoup, vLLM par exemple, est optimisé pour faire du concurrent users et l'équivalent du HA pour du service web

Il est possible de déléguer une partie du KV cache a de la mémoire secondaire (hors VRAM GPU) pour l'économiser et swap rapidement entre les mémoires par requête utilisateur

Si c'est pour faire de l'usage type chatbot avec un TTFT (Time To First Token) assez faible, ça va pas être bien glorieux en termes d'user concurrent que tu peut mettre dessus

En revanche, pour des workflows agentique dit "long horizons" qui demandent beaucoup moins d'intervention humaine et donc ou tu peut te permettre de le laisser tourner sans avoir un clampin qui se tourne les pouces en regardant le flux de messages dans l'éventualité de steer le modèle mid-run (aucune ressemblance avec une méthodologie que nous pratiquons en interne), tu peut potentiellement en faire tourner quelques jobs différents en parallèle

Pour plus de détails sur l'ingénierie d'inférence, je recommande cet excellent livre
votre avatar
Comptez 60 euros de l’heure tout de même pour cette instance… soit 1 440 euros par jour et jusqu’à 43 800 euros par mois.
Soit le TJM d'un manager de transition, de directeur de programme parisiens, par exemple.

À la différence qu'il ne travaillera pas 730 heures par mois, mais plutôt 20 jours ouvrés en moyenne, donc quasi deux fois moins cher ;)
votre avatar
Ah le fameux manager ou DSI de transition. On sait pas ce qui a transité entre l'avant et l'après mais il coûte quand même un rein 🤣
votre avatar
Bah des quelques sources retrouvées çà et là, le rein est plutôt à la hauteur du coût mensuel du serveur, selon l'origine.

@SébastienGavois , pour info, si jamais tu cherches des idées de financement. 😇
votre avatar
1400 pour Paris c'est un manager de transition en alternance ça.
Les projets sur lesquels j'ai bossé les directeurs de programme était vendu le double.
votre avatar
En combien de temps un tel modele est il capable de dev seul une appli et tout ce que cela comporte (schéma, doc, tests unitaires/régression, IAM, sécu etc) . Si en un mois il en est capable et que le projet permet de générer bien plus que 50k€, je ne doute pas que certains le feront.
votre avatar
En mode "dev moi une appli ppir devenir riche" aucune chance. Donc il faut compter le salaire des devs qui vont devoir le baby sitter, relire le code, corriger les bugs, tester l'application.
votre avatar
Les derniers LLM au mieux de leurs performances et ce qu'ils génèrent commencent à montrer que les développeurs ne seront plus si indispensables dans le futur, Fable/GPT 5.6 Ultra/Kimi K3 font de l'excellent travail, et ça pourrait passer en tout cas pour ce qui relève du... Divertissement/contribution.
Pour les outils de productions, qui nécessitent de sérieuses garanties par contre, c'est autre chose, le droit à l'erreur n'est pas une option ici, vu la criticité.
votre avatar
Je travaille tous les jours avec Fable 5 et Opus 5, on ne risque pas d'être remplacé de si tôt, sans personnes pour les guider ni les contraindre, ils restent "idiot". Se sont d'excellent perroquet, je ne dis pas le contraire.
votre avatar
tester l'application.
:roule:

Tester c'est douter, m'voyons.
votre avatar
Non je ne parle de ce genre de débilité visible sur les réseaux. Je parle d'un socle de travail, au delà du mvp, permettant de pouvoir commencer a vraiment bosser.
votre avatar
ça, clairement, sans l'intuition humaine ou raisonnement, c'est loupé dès que ça se complexifie un peu.
votre avatar
Je serai curieux de savoir si les résultats sont corrects si vous essayez de coder un jeu de Flock avec cette IA.
votre avatar
@SébastienGavois

Je comprend mieux le mail pour pousser les gens à se réabonner, soit disant par erreur (la faute du presta, du stagiaire, de la mite...), vous avez besoin d'argent, car il n'y avait plus rien dans les fonds de tiroirs !

Tout cela pour vous amuser un peu, puis nous concocter un très bon dossier là dessus 😋
votre avatar
Damned, je suis démasqued !
votre avatar
Je ne suis pas stagiaire, j'étais en CDI au moment des faits ! :pleure:
votre avatar
T’es de nouveau stagiaire, tu savais pas ?
votre avatar
De la famille ou un collègue de formation au Crédit Agricole peut-être ?
votre avatar
A mettre en parallèle des abonnements à 20€/mois que des boites proposent pour utiliser les dits modèles qui tournent chez eux. Quelque chose me dit que c’est pas prêt d’être rentable ces affaires…
votre avatar
Prochain T@acl : faire tourner des IA en local avec du matos genre l'Asus Ascent GX10 :D
votre avatar
Je dois avoir en archives une carte video CL avec 8 MO de ram, si ça peut aider :D
votre avatar
Matrox Millennium FTW !!! Ça charge Kimi K3 trois fois et ça sert infinite +1 tokens/s en multiusers j’suis sur …!!!
votre avatar
allez, chiche !
votre avatar
[quote]mais on passe à « seulement » 10 Go en FP8 et 5 Go en FP4 (ou en INT4, c’est pareil sur l’espace occupé en mémoire, vous suivez ?).[/quote]
10 ou même 40Go, c'est accessible sur un PC avec plusieurs GPU "grand public", non ? Ou alors il faut que la qté de mémoire soit dispo sur un seul gpu ?
votre avatar
C'est possible et même courant :)
Il faut simplement séparer le traitement (par couche, répartir les neurones du modèle…). Deux cartes graphiques avec 24 Go de mémoire peuvent charger un modèle de 40 Go.
Par contre les échanges passent par le bus PCIe, plus lent que le NVLink des GPU DC (NVLink est dispo sur les 3090 mais pas les 4090/5090 par contre pour le grand public).
votre avatar
60€ de l'heure pour une IA de pointe

En comparaison le minitel c'était 60 Francs de l'heure je crois. Donc on a "que" un facteur x6, sans compter l'inflation.
votre avatar
De mémoire je crois qu'il y avait de site à prêt de 9Fr (genre 8,90Fr) la minute.

PS : J'ai retrouvée ce site. Je confonds surement avec les audiotel.
titibilou.free.fr Free
votre avatar
Une société tourne entre 9h et 17h, du lundi au vendredi, hors jour férié. louer ce genre d'infrastructure uniquement en heure ouvrable réduirait les coûts tout en promouvant le droit à la déconnexion (askip personne sait plus rien faire sans IA de nos jours).

Après, il y a deux trois petits trucs à prendre avec des pincettes

  • Je ne connais pas grand monde qui télécharge les poids depuis une machine payée 1€ la miniute, on préfère prendre un vps random à qq centimes auquel on ajoute un disque qu'on rattachera ensuite à la machine ^^').

  • Si tu veux vraiment faire tourner h24, tu va te tourner vers un investissement de quelques centaines de millier d'euro (tu va viser min 2To de vram, soit 1 HGX B300 avec 8 Blackwell pour 2.3To de vram soit +/- 400K€, rentabilisé en moins d'un an par rapport à une loc h24 )



my2cents,
votre avatar
Sinon, un tuto qui serait sympa, histoire d'arrêter de nous vendre des trucs ricains tout pourris : utiliser Opencode et les API d'un hébergeur de confiance pour réduire sa dépendance aux modèles SaaS dont la confidentialité des API est une épreuve de foi.