这几天,全球AI代码生成的竞争格局,迎来了新的拐点。
在编程领域,曾被视为王者的Anthropic,似乎正在一步步失去昔日的锋芒,地位开始动摇。
这一方面源于OpenAIGPT-5系列模型的强势崛起,在与ClaudeCode的对战中大有「后来者居上」之势,AI大神Karpathy现身说法并开始安利GPT-5Pro的强大代码能力。
另一方面则是Anthropic自身的一系列迷之操作,先是放任并承认自家模型(包括ClaudeOpus4.1和Opus4)降智,本周又宣布向包括中国在内的部分地区限制其AI产品和服务的使用。
在这个微妙的时间节点,多家国产大模型厂商向Anthropic发起了一波正面狙击。月之暗面发布了Kimi-K2-0905版本、阿里发布了超万亿参数的Qwen3-Max-Preview。
前者作为Kimi-K2系列模型的最新版本,将上下文长度扩展到了256k,针对前端开发等实际编程任务做了优化,长代码生成中的正确性、稳定性和逻辑一致性较以往版本有了提升。后者是阿里迄今最大的模型,同样提升了通用知识、数学推理、编程等多种任务的表现。
可以看到,国产大模型厂商近来集中在代码生成任务上发力。Kimi-K2-0905强调了工具调用能力,并提升了模型与Agent框架(如RooCode)的集成性。
在使用该模型调用外部工具时,格式正确率现在可以达到100%,不再需求人工修正。它还完全兼容AnthropicAPI,方便接入与迁移。对WebSearchTool的支持,可以通过实时信息检索提升任务效果。
随着0905版本的发布,近30天Kimi-K2系列模型在HuggingFace中的下载量超过了39万。
对于最新的Kimi-K2-0905,有人直言「终于不用再为处理复杂的长任务而感到挫败了。」
此消彼长,随着国产大模型在代码生成领域持续发力,全球竞争的格局也许真的要变一变了。
作为KimiK2系列中最新的版本,Kimi-K2-0905与其他国产大模型厂商的新模型(如Qwen3-Max-Preview)一样,向曾经的王者Claude的传统优势区间发起挑战,强调智能编程领域的性能提升。
从技术细节上来看,Kimi-K2-0905沿用了目前主流的MoE架构,参数规模为万亿级别,在推理时实际被激活的参数为320亿。
参数概览
从该模型与ClaudeSonnet4在SWE-benchVerified等真实编程基准的对比中发现,Kimi-K2-0905在部分测试中(如多语言环境、命令行/终端交互)甚至超过了这个竞争对手。
实战表现究竟如何?我们用它做了个经典小游戏。
指令很简单:「制作一个和微信***类似的网页小游戏,需要美观,好玩,功能齐全。」
Kimi-K2-0905生成游戏代码(部分截图)
在网页端实现的效果堪称惊艳,不仅实现了浩瀚星空的背景,高速移动的拖影,概率出现的回血道具,还有不同颜色的敌人爆炸效果,甚至玩得好的话还有连击加分。
我们试着玩了好一会儿,困难模式真的挺难的。
根据知名博主「karminski-牙医」的测试,Kimi-K2-0905前端水平有了显著的提升,空间理解能力和召回能力都有所增强。
在需要生成超过一千行代码的「鞭炮连锁爆炸测试」中,Kimi-K2-0905表现优秀。
原贴地址:https://x.com/karminski3/status/1963834619276709933?s=46
Kimi-K2-0905此次还在API定价上打出了竞争性优势。
据我们了解,Kimi开放平台上架的kimi-k2-0905-preview模型API,定价与上一代一致,计费方案为缓存未命中时每百万输入tokens/4元,缓存命中时每百万输入tokens/1元,每百万输出tokens/16元。详细的定价策略参考下图:
以美元计价的价格与国内价格比较接近。
相较于Anthropic堪称夸张的定价,Kimi等国产编程模型称得上是「开源Claude平替」,并且能够实现全方位兼容AnthropicAPI和ClaudeCode,延续开发者曾经的使用习惯。
尤其是在Anthropic对国内和其他地区「断供」的大背景下,让现有项目和工作流平稳落地的重要性不言而喻。
在AI编程领域,国内的AI厂商都有自己的理解。大概分为两个方向,一部分厂商在产品和用户体验侧发力;另一部分则是打磨基础模型。
例如腾讯和字节对自家编码产品的更新主要集中在产品侧,字节更新TraeSolo版本、腾讯发布CodeBuddyIDE等等,都是试图超越Cursor核心竞争力的尝试。
与之对应,以月之暗面为代表的AI新势力,选择了一条更为直接的发展道路:通过技术创新与极限性能打磨,力求在大模型核心能力上与国际一线厂商(如Anthropic)一较高低。
无论是上下文窗口的持续扩展,还是针对真实编程任务、Agent工具调用等的专门优化,国内玩家正在取得逼近甚至超越海外同类产品的表现。
同时,主流AI编程工具,如Cursor、Windsurf、Trae、Cline等,以及第三方Agent产品,如flowith和Genspark等,也都在主动接入国内优秀的大模型,中国AI新势力已深度融入主流开发与应用生态。
如今,国产大模型不仅能在性能参数上赶超国际领先者,也能在实际开发体验上获得更多认可。这样的「正反馈循环」一旦形成,则有望快速积累开发者口碑,创建更繁荣的应用生态,进一步撬动更广阔的市场。
本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:冷猫、杜伟,经授权发布。
最新发现
相关资讯
科大讯飞总裁吴晓如:大模型协同大过竞争
科大讯飞总裁吴晓如:大模型协同大过竞争产业端特别是传统产业,尚不能感受大模型发展带来的变革?吴晓如表示,接受大模型较快的是数字化程度较高的领域,它们有丰富的数据;其次是应用价值较大的领域,它们对数
2025-10-14 11:11:47
清华系前腾讯Robotics X核心成员创业,业内首款能“单手玩手机”的灵巧手来了|涌现新项目
一款能把脉、操作鼠标的“六边形”产品。
2025-09-17 11:00:00
华为全新小艺拟人化实时音视频对话功能适配机型公布,含MateXTs三折叠等
华为小艺智慧助手已在今年8月底推送了1137300版本升级,部分机型在更新该版本的小艺智慧助手后,新增支持“小艺看世界”功能。目前华为官网已公布该功能适配机型,包含MateXTs三
2025-09-17 10:30:00
通义千问系列最强大的语言模型:Qwen3-Max-Preview上线
阿里通义千问今日在官网和OpenRouter上线了最新的Qwen-3-Max-Preview模型。根据官网描述,该模型是通义千问系列中最强大的语言模型。
2025-09-17 10:00:00
AMD谈AI显卡:没有性能就没有人买推理一直有优势
9月5日消息,GPU显卡不仅决定了游戏性能,也是AI领域各大厂商竞争的焦点,NVIDIA一家占了90%以上的份额,AMD也紧追不舍。AMDCFO首席财务官JeanHu日前在花旗TMT大会上也谈到了
2025-09-17 09:30:00
支持百万卡扩展,中科曙光发布国内首个开放架构AI超集群系统
该系统以GPU为核心,实现了“算、存、网、电、冷、管、软”一体化紧耦合设计,可为万亿参数大模型训练推理、行业大模型微调、多模态大模型开发、AI4S等场景提供算力底座。
2025-09-17 09:00:00
今日热榜
当AI制药不再讲故事
2025-03-12 17:29:46ZCOOLxCanva可画:Canva可画创作者大赛“变飞为宝计划”,4/3截止征集
2025-06-21 13:01:44“AI+养老”,晚年更美好
2025-01-15 18:30:24东信集团发布首个AIGC营销大模型,赋能智能营销
2025-04-30 11:31:48美国人工智能政策与中国应对策略
2025-05-06 11:25:29男子用AI造谣“女儿被抱走”:内容是编的图是网上找的
2025-08-07 09:20:35AI体育训练场“常驻”京张遗址公园
2025-02-11 14:50:36深圳人工智能先锋城市建设加速推进
2025-05-04 19:56:38“国内AIApp产品TOP100”榜单揭晓美图秀秀斩获第三名
2025-02-24 16:54:27爱奇艺融入AI搜索,首次将生成式AI(AIGC)应用于剧情搜索等三大场景
2025-07-06 13:00:48热门推荐