T@LC : on a voulu tester Kimi K3 (1 562 Go) en « local », on a failli finir ruinés
Heu… 43 800 euros en note de frais, ça passe ?
Illustration : Flock
Le 27 juillet à 17h37
Installer le modèle open source Kimi K3 en « local » c’est faisable ? Non… Et en louant des GPU pour rester maître de ses données ? En théorie, oui… mais la facture risque de vous faire mal au porte-monnaie avec plus de 1 000 euros… par jour.
T@LC : on a voulu tester Kimi K3 (1 562 Go) en « local », on a failli finir ruinés
Heu… 43 800 euros en note de frais, ça passe ?
Illustration : Flock
Installer le modèle open source Kimi K3 en « local » c’est faisable ? Non… Et en louant des GPU pour rester maître de ses données ? En théorie, oui… mais la facture risque de vous faire mal au porte-monnaie avec plus de 1 000 euros… par jour.
Hardware
Hardware
7 min
C’est donc aujourd’hui que Moonshot AI publie les poids de son dernier modèle Kimi K3, avec pas moins de 2 800 milliards de paramètres. Il est donc possible de l’installer et de l’utiliser en local ou bien sur une machine louée. Vous pouvez rester maître de vos données et prompts, sans passer par les serveurs de l’entreprise.
Est-ce facile à déployer sur une machine ? Réponse simple : non. Quelles sont les performances ? Excellentes… pour vider rapidement votre porte-monnaie. Cela mérite des explications.

Le point crucial est la mémoire. Pour utiliser dans de bonnes conditions un modèle, il faut pouvoir charger ses paramètres en mémoire – idéalement dans celle du GPU, même s’il est possible de composer aussi avec celle du CPU au prix de performances moindres. Les paramètres, ce sont les poids des neurones. À la place des poids, on peut aussi parler des nombres.
Avec un modèle aussi gros, louer des instances GPU pour le faire tourner nous couterait plusieurs dizaines de milliers d’euros par mois, comme nous allons le voir.
Il reste 70% de l'article à découvrir.
Déjà abonné ou lecteur ? Se connecter
Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.
Accédez en illimité aux articles
Profitez d'un média expert et unique
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
expert et sans pub.
Commentaires (39)
Le 27 juillet à 17h44
10 ? 100 ? 1000 ?
Il faut ensuite rapporter ça à combien coûterait pour ces mêmes utilisateurs des abonnements aux différents LLM providers pour valider l'équilibre économique de la chose.
Autre élément d'étude, les tokens/s qui sont gérés, et l'acceptabilité d'un traitement plus "lent" dans le cadre d'un traitement "autonome" (comprendre hors LLM-provider).
Le 27 juillet à 18h06
Par exemple, les banques françaises préfèrent déployer leur propre LLM, même si ça coûte quelques millions, plutôt que de risquer d’envoyer des données sensibles à l’extérieur de leur bastion.
Le 27 juillet à 20h45
Le 28 juillet à 08h31
Le 28 juillet à 09h46
Le 28 juillet à 10h00
Seb a bien été payé pour naviguer sur des sites porno... (oui, ca va rester cette histoire
Le 28 juillet à 10h54
JE MANGE QUAND :o
Le 28 juillet à 10h56
Et puis c'est tellement surfait de manger...
Le 28 juillet à 18h56
Le 29 juillet à 00h43
'faut avoir l'habit(r)ude.
Modifié le 27 juillet à 22h08
Le moteur d'inférence joue pour beaucoup, vLLM par exemple, est optimisé pour faire du concurrent users et l'équivalent du HA pour du service web
Il est possible de déléguer une partie du KV cache a de la mémoire secondaire (hors VRAM GPU) pour l'économiser et swap rapidement entre les mémoires par requête utilisateur
Si c'est pour faire de l'usage type chatbot avec un TTFT (Time To First Token) assez faible, ça va pas être bien glorieux en termes d'user concurrent que tu peut mettre dessus
En revanche, pour des workflows agentique dit "long horizons" qui demandent beaucoup moins d'intervention humaine et donc ou tu peut te permettre de le laisser tourner sans avoir un clampin qui se tourne les pouces en regardant le flux de messages dans l'éventualité de steer le modèle mid-run (aucune ressemblance avec une méthodologie que nous pratiquons en interne), tu peut potentiellement en faire tourner quelques jobs différents en parallèle
Pour plus de détails sur l'ingénierie d'inférence, je recommande cet excellent livre
Modifié le 27 juillet à 17h57
À la différence qu'il ne travaillera pas 730 heures par mois, mais plutôt 20 jours ouvrés en moyenne, donc quasi deux fois moins cher ;)
Le 27 juillet à 18h06
Le 27 juillet à 18h37
@SébastienGavois , pour info, si jamais tu cherches des idées de financement. 😇
Le 29 juillet à 13h53
Les projets sur lesquels j'ai bossé les directeurs de programme était vendu le double.
Modifié le 27 juillet à 18h04
Le 27 juillet à 18h19
Le 27 juillet à 18h38
Pour les outils de productions, qui nécessitent de sérieuses garanties par contre, c'est autre chose, le droit à l'erreur n'est pas une option ici, vu la criticité.
Le 27 juillet à 19h03
Le 27 juillet à 18h39
Tester c'est douter, m'voyons.
Le 27 juillet à 19h16
Le 27 juillet à 19h23
Le 27 juillet à 20h04
Modifié le 27 juillet à 22h13
Je comprend mieux le mail pour pousser les gens à se réabonner, soit disant par erreur (la faute du presta, du stagiaire, de la mite...), vous avez besoin d'argent, car il n'y avait plus rien dans les fonds de tiroirs !
Tout cela pour vous amuser un peu, puis nous concocter un très bon dossier là dessus 😋
Le 27 juillet à 22h15
Le 27 juillet à 22h17
Le 27 juillet à 22h24
Le 27 juillet à 23h50
Le 28 juillet à 06h54
Le 28 juillet à 08h30
Le 28 juillet à 09h03
Le 28 juillet à 09h51
Le 28 juillet à 10h41
Le 28 juillet à 10h18
10 ou même 40Go, c'est accessible sur un PC avec plusieurs GPU "grand public", non ? Ou alors il faut que la qté de mémoire soit dispo sur un seul gpu ?
Le 28 juillet à 10h53
Il faut simplement séparer le traitement (par couche, répartir les neurones du modèle…). Deux cartes graphiques avec 24 Go de mémoire peuvent charger un modèle de 40 Go.
Par contre les échanges passent par le bus PCIe, plus lent que le NVLink des GPU DC (NVLink est dispo sur les 3090 mais pas les 4090/5090 par contre pour le grand public).
Le 28 juillet à 14h34
En comparaison le minitel c'était 60 Francs de l'heure je crois. Donc on a "que" un facteur x6, sans compter l'inflation.
Le 29 juillet à 10h52
PS : J'ai retrouvée ce site. Je confonds surement avec les audiotel.
Modifié le 28 juillet à 18h19
Après, il y a deux trois petits trucs à prendre avec des pincettes
my2cents,
Le 29 juillet à 18h18
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?