Kimi K3 : paramètres, fenêtre de contexte et tokens de sortie max
Specs de Kimi K3 : 2,8 billions de paramètres, 16 experts actifs sur 896 par token, une fenêtre de contexte de 1M tokens et jusqu'à 1 048 576 tokens de sortie.
Lire en MarkdownKimi K3 compte 2,8 billions de paramètres et active 16 de ses 896 experts pour chaque token. Sa fenêtre de contexte est de 1 048 576 tokens, et une seule réponse peut atteindre 1 048 576 tokens, même si la limite par défaut est de 131 072. Moonshot AI le présente comme « le premier modèle open source au monde de la classe des 3 billions de paramètres » et a publié l'intégralité des poids. Il raisonne toujours, lit du texte et des images, et écrit du texte.
Kimi K3 en un coup d'œil
| Caractéristique | Valeur |
|---|---|
| Développeur | Moonshot AI |
| Paramètres au total | 2,8 billions |
| Experts | 896, dont 16 actifs par token |
| Architecture | Mixture of experts avec Kimi Delta Attention et Attention Residuals |
| Fenêtre de contexte | 1 048 576 tokens |
| Sortie maximale | 1 048 576 tokens, raisonnement inclus |
| Limite de sortie par défaut | 131 072 tokens |
| Raisonnement | Toujours actif ; low, high ou max (par défaut max) |
| Entrée | Texte et images (images en base64 uniquement) |
| Sortie | Texte |
| Poids | Publiés par Moonshot AI |
| ID du modèle sur SeedRouter | kimi-k3 |
Combien de paramètres compte Kimi K3 ?
2,8 billions. Le quickstart de Moonshot AI présente Kimi K3 comme son « modèle phare le plus performant à ce jour, avec 2,8 billions de paramètres » et « le premier modèle open source à atteindre 2,8 billions de paramètres ».
Combien de paramètres actifs compte Kimi K3 ?
Le quickstart de Moonshot AI ne donne pas de nombre de paramètres actifs. Il indique en revanche que le modèle « active efficacement 16 experts sur 896 » grâce à son framework Stable LatentMoE. Seule une petite part des 2,8 billions de paramètres travaille donc pour chaque token, ce qui limite le calcul par token. Tous les poids doivent tout de même être chargés, c'est pourquoi exécuter Kimi K3 soi-même demande du matériel multi-GPU de niveau data center.
Quelle architecture utilise Kimi K3 ?
Un modèle mixture-of-experts construit sur deux changements d'attention. Selon Moonshot AI, il « repose sur Kimi Delta Attention (KDA), un mécanisme d'attention linéaire hybride, et sur les Attention Residuals ». Moonshot AI affirme que ces changements, avec une disposition d'experts plus clairsemée et de nouvelles méthodes d'entraînement, donnent à Kimi K3 « environ 2,5 fois l'efficacité de scaling globale de K2 ». Tous les détails sont attendus dans le rapport technique de Kimi K3.
Quelle est la fenêtre de contexte de Kimi K3 ?
1 048 576 tokens, souvent écrit 1M. Le prompt, les images, l'historique de la conversation et la réponse partagent cette unique fenêtre.
Quelle est la sortie maximale de Kimi K3 ?
Jusqu'à 1 048 576 tokens par requête, définie avec max_completion_tokens. La valeur par défaut est de 131 072. Le quickstart de Moonshot AI : « max_completion_tokens vaut 131072 par défaut et peut être réglé jusqu'à 1048576. »
Deux choses à savoir :
- Le raisonnement compte dans la limite. Kimi K3 raisonne toujours, et ses tokens de raisonnement utilisent le même budget que la réponse.
max_tokensest l'ancien nom, déprécié, de la même limite. Utilisezmax_completion_tokens.
Si une réponse est coupée, augmentez max_completion_tokens ou baissez reasoning_effort pour qu'une moindre part du budget parte dans la réflexion. Fenêtre de contexte vs tokens de sortie max explique comment repérer une réponse tronquée dans chaque format d'API.
Peut-on désactiver le raisonnement de Kimi K3 ?
Non. Kimi K3 raisonne toujours. Vous pouvez régler reasoning_effort sur low, high ou max ; la valeur par défaut est max, la plus lente et celle qui consomme le plus de tokens de sortie. high convient à la plupart des tâches et low aux étapes rapides et simples. Le raisonnement revient dans reasoning_content, à côté de content, et il est facturé comme tokens de sortie.
Quels réglages sont fixes ?
Moonshot AI fixe l'échantillonnage de Kimi K3 : temperature 1,0, top_p 0,95, n 1, presence_penalty 0 et frequency_penalty 0. Toute autre valeur renvoie une erreur, laissez donc ces champs hors de la requête.
Kimi K3 lit-il les images ?
Oui, mais uniquement sous forme de data URI en base64. Une URL d'image publique n'est pas acceptée et renvoie 400, comme sur l'API de Kimi elle-même. La sortie est toujours du texte.
Comment appeler Kimi K3 ?
Sur SeedRouter, Kimi K3 accepte les formats OpenAI Chat Completions, OpenAI Responses et Anthropic Messages avec la même clé et l'ID de modèle kimi-k3. Le guide de l'API Kimi K3 accompagne la première requête, la configuration pour Claude Code et Codex propose des configurations testées, et la référence API de Kimi K3 liste chaque paramètre. Les prix actuels sont sur la page Kimi K3.
Questions fréquentes
Quelle est la taille de Kimi K3 ?
2,8 billions de paramètres au total, avec 16 experts actifs sur 896 par token.
Kimi K3 est-il open source ?
Moonshot AI a publié l'intégralité des poids du modèle. Kimi K3 est-il gratuit ? explique ce qu'implique de les exécuter soi-même.
Pourquoi Kimi K3 s'arrête-t-il à 131 072 tokens ?
C'est la limite de sortie par défaut. Réglez max_completion_tokens jusqu'à 1048576 pour des réponses plus longues.
Qui développe Kimi K3 ?
Moonshot AI, l'entreprise chinoise à l'origine de l'assistant Kimi.



