InscriptionConnexion
Ben la Cimmérie
:Conan_zieute:
Merci de ton soutien
:Conan_Sourire:
« Si Dieu est pour nous, qui sera contre nous ? » - Romains 8-31
:jcb:
il y a 3 heures
Vous êtes tous beaux les gars qui utilisez Linux
:choque5:


Maintenant go mettre KimiK3 sur un serveur
:choque5:
il y a 3 heures
C'est génial sur d'ancienne machine et je suis justement passé sous win10 car l'administration système aussi passionnante soit-elle ne fait plus partie de mes hobbies
:conan_tasse_cafe:
Outre attendre que tes logiciel compilent, qu'est ce qui était chronophage dessus ? Qu'est ce que tu trouves chronophage sur linux en général ?
MP pour devenir païen
:hap:
il y a 3 heures
Vous êtes tous beaux les gars qui utilisez Linux
:choque5:


Maintenant go mettre KimiK3 sur un serveur
:choque5:
Fais un tuto
:chatintrigue:
il y a 3 heures
Merci de ton soutien
:Conan_Sourire:
:cononche:
il y a 3 heures
Fais un tuto
:chatintrigue:
Tuto :

Déployer Kimi K3 sur un serveur


Kimi K3 est le modèle open-weight de Moonshot AI, sorti fin juillet 2026. C'est un MoE (mixture of experts) de 2,8 trillions de paramètres au total, avec 104 milliards de paramètres activés par token, contexte natif jusqu'à 1M de tokens. Attention, ce n'est pas un modèle qu'on fait tourner sur une becane perso, c'est un projet d'infra à part entière.
:oui:



Prérequis matériel

Il faut au minimum un noeud de 8x GPU haut de gamme (H100 ou H200) pour tourner en quantization MXFP4. Sans quantization, en pleine précision, comptez plutôt 64 accélérateurs et plus (8 noeuds de 8x H100), le poids total des weights dépasse le TB de VRAM. Si vous avez du Blackwell ou du MI400 avec support MXFP4 natif, un seul noeud de 8 GPU suffit pour du service en latence interactive.
:ok:



Récupération des poids

Les weights officiels sont sur le repo Hugging Face de Moonshot AI. Ne prenez jamais un mirroir non officiel, le risque de poids trafiqués existe. Vérifiez aussi la licence Kimi K3, ce n'est pas du MIT classique, lisez les conditions avant tout usage commercial.
:oui:



Installation du serveur d'inférence

vLLM est le moteur de service recommandé pour K3, avec support natif du format MXFP4 et de l'attention KDA du modèle. Commande de lancement type :
python -m vllm.entrypoints.openai.api_server \
--model /chemin/vers/kimi-k3-mxfp4 \
--trust-remote-code \
--dtype float8_e4m3fn \
--quantization mxfp4 \
--max-model-len 131072 \
--tensor-parallel-size 8 \
--gpu-memory-utilization 0.92 \
--port 8000 \
--host 0.0.0.0


:ok:


Test de l'API

Une fois le serveur lancé, l'endpoint est compatible OpenAI Chat Completions. N'importe quel client OpenAI SDK pointé sur http://votre-serveur:8000/v1 fonctionne directement, il suffit de passer kimi-k3 comme nom de modèle.
:oui:



Point de vigilance

Sizer le cache KV en fonction de la concurrence réelle attendue, pas juste le poids des paramètres, sinon vous allez OOM en prod dès la première charge un peu sérieuse. Gardez aussi un harness d'évaluation actif après déploiement pour détecter une dérive de quantization dans le temps.
:ok:
il y a 3 heures
Tuto :

Déployer Kimi K3 sur un serveur


Kimi K3 est le modèle open-weight de Moonshot AI, sorti fin juillet 2026. C'est un MoE (mixture of experts) de 2,8 trillions de paramètres au total, avec 104 milliards de paramètres activés par token, contexte natif jusqu'à 1M de tokens. Attention, ce n'est pas un modèle qu'on fait tourner sur une becane perso, c'est un projet d'infra à part entière.
:oui:



Prérequis matériel

Il faut au minimum un noeud de 8x GPU haut de gamme (H100 ou H200) pour tourner en quantization MXFP4. Sans quantization, en pleine précision, comptez plutôt 64 accélérateurs et plus (8 noeuds de 8x H100), le poids total des weights dépasse le TB de VRAM. Si vous avez du Blackwell ou du MI400 avec support MXFP4 natif, un seul noeud de 8 GPU suffit pour du service en latence interactive.
:ok:



Récupération des poids

Les weights officiels sont sur le repo Hugging Face de Moonshot AI. Ne prenez jamais un mirroir non officiel, le risque de poids trafiqués existe. Vérifiez aussi la licence Kimi K3, ce n'est pas du MIT classique, lisez les conditions avant tout usage commercial.
:oui:



Installation du serveur d'inférence

vLLM est le moteur de service recommandé pour K3, avec support natif du format MXFP4 et de l'attention KDA du modèle. Commande de lancement type :
python -m vllm.entrypoints.openai.api_server \
--model /chemin/vers/kimi-k3-mxfp4 \
--trust-remote-code \
--dtype float8_e4m3fn \
--quantization mxfp4 \
--max-model-len 131072 \
--tensor-parallel-size 8 \
--gpu-memory-utilization 0.92 \
--port 8000 \
--host 0.0.0.0


:ok:


Test de l'API

Une fois le serveur lancé, l'endpoint est compatible OpenAI Chat Completions. N'importe quel client OpenAI SDK pointé sur http://votre-serveur:8000/v1 fonctionne directement, il suffit de passer kimi-k3 comme nom de modèle.
:oui:



Point de vigilance

Sizer le cache KV en fonction de la concurrence réelle attendue, pas juste le poids des paramètres, sinon vous allez OOM en prod dès la première charge un peu sérieuse. Gardez aussi un harness d'évaluation actif après déploiement pour détecter une dérive de quantization dans le temps.
:ok:
C'est pas parce que tu rajoutes des smiley qu'on voit pas que ça vient 100% de l'IA
:chatintrigue:
il y a 3 heures
C'est pas parce que tu rajoutes des smiley qu'on voit pas que ça vient 100% de l'IA
:chatintrigue:
Je lui ai dit de rajouter
:ok:
et
:oui:
et des balises html gras pour rendre plus lisible.
:emotion_vive:


Cout estimé : 100k minimum de matos pour Kimik3
il y a 3 heures
Linux Mint Debian Edition (pas la cuckbuntu) avec Cinnamon.

J'ai aussi Manjaro avec KDE mais j'aime moins que Mint, faudrait je teste CachyOS.
Mais en vrai je reste sous mon windaube 10 pour l'ergonomie, les logiciels que j'utilise et les jeux.
:risi_sad:
il y a 2 heures
Outre attendre que tes logiciel compilent, qu'est ce qui était chronophage dessus ? Qu'est ce que tu trouves chronophage sur linux en général ?
Lire les news, les migrations, réparer ce qui casse après changement gcc et compagnie, conflit de SLOT(suicide) les fusion etc-update à s'arracher la tête, les serveurs (que je ne ferais plus que sur du bsd d'ailleurs), certaines architecture ne supportant pas dxvk, logiciel proprio + jeux (avant j'étais 100% libre maintenant jencule le libre
:ok:
),les dettes zutomask, certains flags nique ton instal en produisant des problème rare non reproductible de merde bref j'ai mis tout ça en brouillon mais j'ai vraiment pas envie de faire d'exposer c'est de la merde..

Je veux tout oublier
:cadavre:
« Si Dieu est pour nous, qui sera contre nous ? » - Romains 8-31
:jcb:
il y a 2 heures
Kali
:Lunettesrisitas:
Image
il y a 2 heures
Fedora me tente bien c'est vrai, mais j'ai la flemme de désinstaller Mint et de devoir réinstaller tous les logiciels
:risichomeur:
Je te comprends
Perso à chaque fois que j'ai changé de distribution c'est quand j'ai flingué mon linux en faisant n'imp comme désinstaller des trucs qui fallait pas
:janerire:
il y a 2 heures
Fedora
:canadagoosebonnet:
il y a une heure
Manjaro. Mais je passerai à Debian quand j'achèterai un nouvel ordi
🛌
il y a 29 minutes