Sujet résolu
L'auteur a trouvé une solution à son problème.
Ben la Cimmérie
Merci de ton soutien
« Si Dieu est pour nous, qui sera contre nous ? » - Romains 8-31
il y a 3 heures
Sponsorisé
Connectez-vous pour masquer les pubsVous êtes tous beaux les gars qui utilisez Linux
Maintenant go mettre KimiK3 sur un serveur
Maintenant go mettre KimiK3 sur un serveur
il y a 3 heures
C'est génial sur d'ancienne machine et je suis justement passé sous win10 car l'administration système aussi passionnante soit-elle ne fait plus partie de mes hobbies
Outre attendre que tes logiciel compilent, qu'est ce qui était chronophage dessus ? Qu'est ce que tu trouves chronophage sur linux en général ?
MP pour devenir païen
il y a 3 heures
Vous êtes tous beaux les gars qui utilisez Linux
Maintenant go mettre KimiK3 sur un serveur
Maintenant go mettre KimiK3 sur un serveur
Fais un tuto
il y a 3 heures
Fais un tuto
Tuto :
Déployer Kimi K3 sur un serveur
Kimi K3 est le modèle open-weight de Moonshot AI, sorti fin juillet 2026. C'est un MoE (mixture of experts) de 2,8 trillions de paramètres au total, avec 104 milliards de paramètres activés par token, contexte natif jusqu'à 1M de tokens. Attention, ce n'est pas un modèle qu'on fait tourner sur une becane perso, c'est un projet d'infra à part entière.
Prérequis matériel
Il faut au minimum un noeud de 8x GPU haut de gamme (H100 ou H200) pour tourner en quantization MXFP4. Sans quantization, en pleine précision, comptez plutôt 64 accélérateurs et plus (8 noeuds de 8x H100), le poids total des weights dépasse le TB de VRAM. Si vous avez du Blackwell ou du MI400 avec support MXFP4 natif, un seul noeud de 8 GPU suffit pour du service en latence interactive.
Récupération des poids
Les weights officiels sont sur le repo Hugging Face de Moonshot AI. Ne prenez jamais un mirroir non officiel, le risque de poids trafiqués existe. Vérifiez aussi la licence Kimi K3, ce n'est pas du MIT classique, lisez les conditions avant tout usage commercial.
Installation du serveur d'inférence
vLLM est le moteur de service recommandé pour K3, avec support natif du format MXFP4 et de l'attention KDA du modèle. Commande de lancement type :
python -m vllm.entrypoints.openai.api_server \
--model /chemin/vers/kimi-k3-mxfp4 \
--trust-remote-code \
--dtype float8_e4m3fn \
--quantization mxfp4 \
--max-model-len 131072 \
--tensor-parallel-size 8 \
--gpu-memory-utilization 0.92 \
--port 8000 \
--host 0.0.0.0
Test de l'API
Une fois le serveur lancé, l'endpoint est compatible OpenAI Chat Completions. N'importe quel client OpenAI SDK pointé sur http://votre-serveur:8000/v1 fonctionne directement, il suffit de passer kimi-k3 comme nom de modèle.
Point de vigilance
Sizer le cache KV en fonction de la concurrence réelle attendue, pas juste le poids des paramètres, sinon vous allez OOM en prod dès la première charge un peu sérieuse. Gardez aussi un harness d'évaluation actif après déploiement pour détecter une dérive de quantization dans le temps.
Déployer Kimi K3 sur un serveur
Kimi K3 est le modèle open-weight de Moonshot AI, sorti fin juillet 2026. C'est un MoE (mixture of experts) de 2,8 trillions de paramètres au total, avec 104 milliards de paramètres activés par token, contexte natif jusqu'à 1M de tokens. Attention, ce n'est pas un modèle qu'on fait tourner sur une becane perso, c'est un projet d'infra à part entière.
Prérequis matériel
Il faut au minimum un noeud de 8x GPU haut de gamme (H100 ou H200) pour tourner en quantization MXFP4. Sans quantization, en pleine précision, comptez plutôt 64 accélérateurs et plus (8 noeuds de 8x H100), le poids total des weights dépasse le TB de VRAM. Si vous avez du Blackwell ou du MI400 avec support MXFP4 natif, un seul noeud de 8 GPU suffit pour du service en latence interactive.
Récupération des poids
Les weights officiels sont sur le repo Hugging Face de Moonshot AI. Ne prenez jamais un mirroir non officiel, le risque de poids trafiqués existe. Vérifiez aussi la licence Kimi K3, ce n'est pas du MIT classique, lisez les conditions avant tout usage commercial.
Installation du serveur d'inférence
vLLM est le moteur de service recommandé pour K3, avec support natif du format MXFP4 et de l'attention KDA du modèle. Commande de lancement type :
python -m vllm.entrypoints.openai.api_server \
--model /chemin/vers/kimi-k3-mxfp4 \
--trust-remote-code \
--dtype float8_e4m3fn \
--quantization mxfp4 \
--max-model-len 131072 \
--tensor-parallel-size 8 \
--gpu-memory-utilization 0.92 \
--port 8000 \
--host 0.0.0.0
Test de l'API
Une fois le serveur lancé, l'endpoint est compatible OpenAI Chat Completions. N'importe quel client OpenAI SDK pointé sur http://votre-serveur:8000/v1 fonctionne directement, il suffit de passer kimi-k3 comme nom de modèle.
Point de vigilance
Sizer le cache KV en fonction de la concurrence réelle attendue, pas juste le poids des paramètres, sinon vous allez OOM en prod dès la première charge un peu sérieuse. Gardez aussi un harness d'évaluation actif après déploiement pour détecter une dérive de quantization dans le temps.
il y a 3 heures
Tuto :
Déployer Kimi K3 sur un serveur
Kimi K3 est le modèle open-weight de Moonshot AI, sorti fin juillet 2026. C'est un MoE (mixture of experts) de 2,8 trillions de paramètres au total, avec 104 milliards de paramètres activés par token, contexte natif jusqu'à 1M de tokens. Attention, ce n'est pas un modèle qu'on fait tourner sur une becane perso, c'est un projet d'infra à part entière.
Prérequis matériel
Il faut au minimum un noeud de 8x GPU haut de gamme (H100 ou H200) pour tourner en quantization MXFP4. Sans quantization, en pleine précision, comptez plutôt 64 accélérateurs et plus (8 noeuds de 8x H100), le poids total des weights dépasse le TB de VRAM. Si vous avez du Blackwell ou du MI400 avec support MXFP4 natif, un seul noeud de 8 GPU suffit pour du service en latence interactive.
Récupération des poids
Les weights officiels sont sur le repo Hugging Face de Moonshot AI. Ne prenez jamais un mirroir non officiel, le risque de poids trafiqués existe. Vérifiez aussi la licence Kimi K3, ce n'est pas du MIT classique, lisez les conditions avant tout usage commercial.
Installation du serveur d'inférence
vLLM est le moteur de service recommandé pour K3, avec support natif du format MXFP4 et de l'attention KDA du modèle. Commande de lancement type :
python -m vllm.entrypoints.openai.api_server \
--model /chemin/vers/kimi-k3-mxfp4 \
--trust-remote-code \
--dtype float8_e4m3fn \
--quantization mxfp4 \
--max-model-len 131072 \
--tensor-parallel-size 8 \
--gpu-memory-utilization 0.92 \
--port 8000 \
--host 0.0.0.0
Test de l'API
Une fois le serveur lancé, l'endpoint est compatible OpenAI Chat Completions. N'importe quel client OpenAI SDK pointé sur http://votre-serveur:8000/v1 fonctionne directement, il suffit de passer kimi-k3 comme nom de modèle.
Point de vigilance
Sizer le cache KV en fonction de la concurrence réelle attendue, pas juste le poids des paramètres, sinon vous allez OOM en prod dès la première charge un peu sérieuse. Gardez aussi un harness d'évaluation actif après déploiement pour détecter une dérive de quantization dans le temps.
Déployer Kimi K3 sur un serveur
Kimi K3 est le modèle open-weight de Moonshot AI, sorti fin juillet 2026. C'est un MoE (mixture of experts) de 2,8 trillions de paramètres au total, avec 104 milliards de paramètres activés par token, contexte natif jusqu'à 1M de tokens. Attention, ce n'est pas un modèle qu'on fait tourner sur une becane perso, c'est un projet d'infra à part entière.
Prérequis matériel
Il faut au minimum un noeud de 8x GPU haut de gamme (H100 ou H200) pour tourner en quantization MXFP4. Sans quantization, en pleine précision, comptez plutôt 64 accélérateurs et plus (8 noeuds de 8x H100), le poids total des weights dépasse le TB de VRAM. Si vous avez du Blackwell ou du MI400 avec support MXFP4 natif, un seul noeud de 8 GPU suffit pour du service en latence interactive.
Récupération des poids
Les weights officiels sont sur le repo Hugging Face de Moonshot AI. Ne prenez jamais un mirroir non officiel, le risque de poids trafiqués existe. Vérifiez aussi la licence Kimi K3, ce n'est pas du MIT classique, lisez les conditions avant tout usage commercial.
Installation du serveur d'inférence
vLLM est le moteur de service recommandé pour K3, avec support natif du format MXFP4 et de l'attention KDA du modèle. Commande de lancement type :
python -m vllm.entrypoints.openai.api_server \
--model /chemin/vers/kimi-k3-mxfp4 \
--trust-remote-code \
--dtype float8_e4m3fn \
--quantization mxfp4 \
--max-model-len 131072 \
--tensor-parallel-size 8 \
--gpu-memory-utilization 0.92 \
--port 8000 \
--host 0.0.0.0
Test de l'API
Une fois le serveur lancé, l'endpoint est compatible OpenAI Chat Completions. N'importe quel client OpenAI SDK pointé sur http://votre-serveur:8000/v1 fonctionne directement, il suffit de passer kimi-k3 comme nom de modèle.
Point de vigilance
Sizer le cache KV en fonction de la concurrence réelle attendue, pas juste le poids des paramètres, sinon vous allez OOM en prod dès la première charge un peu sérieuse. Gardez aussi un harness d'évaluation actif après déploiement pour détecter une dérive de quantization dans le temps.
C'est pas parce que tu rajoutes des smiley qu'on voit pas que ça vient 100% de l'IA
il y a 3 heures
C'est pas parce que tu rajoutes des smiley qu'on voit pas que ça vient 100% de l'IA
Je lui ai dit de rajouter
et
et des balises html gras pour rendre plus lisible.
Cout estimé : 100k minimum de matos pour Kimik3
Cout estimé : 100k minimum de matos pour Kimik3
il y a 3 heures
Linux Mint Debian Edition (pas la cuckbuntu) avec Cinnamon.
J'ai aussi Manjaro avec KDE mais j'aime moins que Mint, faudrait je teste CachyOS.
Mais en vrai je reste sous mon windaube 10 pour l'ergonomie, les logiciels que j'utilise et les jeux.
J'ai aussi Manjaro avec KDE mais j'aime moins que Mint, faudrait je teste CachyOS.
Mais en vrai je reste sous mon windaube 10 pour l'ergonomie, les logiciels que j'utilise et les jeux.
il y a 2 heures
Outre attendre que tes logiciel compilent, qu'est ce qui était chronophage dessus ? Qu'est ce que tu trouves chronophage sur linux en général ?
Lire les news, les migrations, réparer ce qui casse après changement gcc et compagnie, conflit de SLOT(suicide) les fusion etc-update à s'arracher la tête, les serveurs (que je ne ferais plus que sur du bsd d'ailleurs), certaines architecture ne supportant pas dxvk, logiciel proprio + jeux (avant j'étais 100% libre maintenant jencule le libre
),les dettes zutomask, certains flags nique ton instal en produisant des problème rare non reproductible de merde bref j'ai mis tout ça en brouillon mais j'ai vraiment pas envie de faire d'exposer c'est de la merde..
Je veux tout oublier
Je veux tout oublier
« Si Dieu est pour nous, qui sera contre nous ? » - Romains 8-31
il y a 2 heures
Sponsorisé
Connectez-vous pour masquer les pubsFedora me tente bien c'est vrai, mais j'ai la flemme de désinstaller Mint et de devoir réinstaller tous les logiciels
Je te comprends
Perso à chaque fois que j'ai changé de distribution c'est quand j'ai flingué mon linux en faisant n'imp comme désinstaller des trucs qui fallait pas
Perso à chaque fois que j'ai changé de distribution c'est quand j'ai flingué mon linux en faisant n'imp comme désinstaller des trucs qui fallait pas
il y a 2 heures
En ligne
262
Sur ce sujet0
















