Kimi K2.7-Code : Modèle de codage open source avec une meilleure efficacité des tokens

Moonshot AI a publié Kimi K2.7-Code, un modèle de codage open-source disponible sur Hugging Face sous l'espace de noms moonshotai/Kimi-K2.7-Code. Le modèle est étiqueté comme image-texte-texte et utilise la bibliothèque Transformers. Il se positionne comme une alternative économe en tokens pour la génération et la compréhension de code.
Caractéristiques principales
- Fournisseurs d'inférence : Novita propose le modèle avec un statut en direct, la prise en charge des appels d'outils (
toolCalling: true), et une sortie structurée actuellement indisponible. Le débit mesuré est de 36,1 tokens/seconde. - Architecture du modèle : Le modèle est divisé en 64 fragments (format safetensors :
model-00001-of-000064.safetensors). - Efficacité des tokens : Le modèle utilise un modèle de chat personnalisé qui préserve le contenu du raisonnement (
preserve_thinking: true) et optimise l'utilisation des tokens en séparant les messages d'historique et de suffixe. Le modèle inclut des tokens spéciaux comme<|im_user|>,<|im_assistant|>, et<|im_system|>pour la gestion des rôles, et des blocs<think>/</think>pour encapsuler le raisonnement en chaîne de pensée. - Appels d'outils : Prise en charge native des appels d'outils avec un formatage structuré des arguments, utilisant les marqueurs
<|tool_call_begin|>et<|tool_call_end|>. - Engagement de la communauté : 334 likes sur Hugging Face, avec 4 commentaires HN et 41 points au moment de la publication.
Implications pratiques
La conception du modèle évite explicitement d'intégrer les tokens de raisonnement dans l'historique lorsque preserve_thinking est faux, réduisant ainsi le contexte supplémentaire. Pour les développeurs utilisant des agents de codage IA, cela signifie une consommation de tokens réduite par interaction — particulièrement bénéfique pour les longues boucles d'agents où les chaînes de raisonnement se répètent. Le format d'appel d'outils est aligné sur JSON, ce qui facilite l'intégration avec les pipelines d'appel de fonctions existants.
Le modèle est disponible pour une utilisation immédiate via Novita, et le dépôt Hugging Face comprend la configuration complète du tokenizer et la source du modèle.
📖 Lire la source complète : HN AI Agents
👀 See Also

L'inférence IA est clairement rentable : analyse des aspects économiques
Les fournisseurs d'inférence IA de pointe déclarent des marges brutes de 70 à 80 %. Les estimations de coûts montrent qu'il en coûte environ 1 dollar par million de tokens pour servir un modèle de 70B, tandis que les prix des API sont de 4,50 dollars ou plus par million de tokens.

Résultats de référence pour les modèles Qwen3.5 avec un contexte de 2K à 400K sur RTX 4090
Un développeur a testé plusieurs variantes du modèle Qwen3.5 sur une RTX 4090, mesurant les performances sur des fenêtres de contexte allant de 2 048 à 400 000 tokens. Les benchmarks incluent des métriques de temps jusqu'au premier token et révèlent des problèmes avec certains modèles nécessitant des tests de déchargement KV.

34 ans de ThinkPad : De l'IBM 700C aux stations de travail AI Lenovo
ThinkPad est commercialisé en continu depuis 1992 sous IBM et Lenovo, avec une continuité visuelle allant de la 700C à la P14s Gen 6 AMD de 2026, capable d'exécuter localement des charges de travail LLM de 70B.

La bulle IA n'est pas comme la bulle Internet — les travailleurs ne feront pas entrer l'IA en fraude comme ils l'ont fait avec les tableurs
Cory Doctorow soutient que la bulle de l'IA diffère fondamentalement de l'ère dot-com : les travailleurs ont importé clandestinement des outils internet sur les réseaux d'entreprise parce que ces outils les aidaient à faire leur travail. Personne n'importe clandestinement d'agents IA — ils sont imposés par la direction.