Kimi k3是真碉,但太不经用,也有拉跨点!

作者:甲维斯日期:2026/7/19

K3 已测,确实强,但要命的是配额太少了!

一天不到,一周的配额已经烧完了,大概就生成了 5 个测试页面!

从五个例子中,可以知道,有些确实很强,有些呢又差点意思,有些比较糟糕。

我不是那种收钱办事儿只会吹牛逼的博主,我也不会针对 Kimi 只说它的缺点。我会依次给大家展现测试结果,同时和其它国产模型,和国外的 GPT 5.6 和 Fable 5 做一个对比,尤其是 Fable 5!

下面我就一点一点来说,看完这篇文章大家应该对K3有一个相对全面的解了。


这篇文章,我要先从这张图片说起:

我第一眼看到这张图,以为是 AI 生成的。这个数据实在是太离谱了!

Kimi-K3 已经把强到可怕的 Fable 5 按在地上摩擦了!

如果这个图片是真实的,我还买啥 Fable5,直接续一波 K3 就好了。

这成功勾起了我的好奇心和“打假”的欲望!说实话,我是完全不信这个排名的!

所以,必须自己测一下,才有数。

1、只有99+才能玩!

当我产生兴趣之后,准备开测的时候,发现一个很尴尬的事情:

我的初级套餐,不配使用 K3 模型,只有 99 以上套餐才可以使用。我就有点犹豫了,因为 Kimi 家的配额全网最少,我已经打算弃坑了,但是数据很亮眼,讨论也很热烈,很多人催我测试,搞得我也很想试试它的深浅。

大家确实也很关心这一点:K3 是否值得购买

这次直接从 2.7 干到了 3.0,也算是大版本升级了!那就买呗,99 元又不是花不起!

买完之后才发现 1M 上下文需要 199 元才能玩,我 C#@¥@#%¥@%!

Moderate 这一档上下文居然只有 256,要到 Allegretto 才有 1M 上下文,°(°¯᷄◠¯᷅°)°!我感觉 K3 已经有点“高攀不起”了!

2、基准数据和特点

根据开发者后台的提示:这次 K3 的卖点是 1M 上下文,擅长编程、游戏 3D 和知识任务!

这不是巧了么!

我最近刚好让 Fable 5 制作了很多前端的 3D 和游戏项目,专业对口啊!

按照国际惯例,我们先看一下官方发布的技术博客。

官方博客中是这个概括这个模型的:

具备原生视觉功能和 100 万个 token 的上下文窗口。它是全球首个开放式 3T 级模型,专为跨长期编码、知识工作和推理的前沿智能而设计。

它对自身的评价是这样的:

虽然其整体性能仍然落后于最强大的专有模型 Claude Fable 5 和 GPT 5.6 Sol,但 Kimi K3 在我们的评估套件中表现出了前沿水平的性能,始终优于其他受测模型。

这个看起来还是很低调客观的,其实有点小傲娇。内涵是:我们只是比最强的 Fable 5 和 GPT 5.6 Sol 差一点点,其他嘛,我不说,你们去品!哈哈!

接下来看两张基准数据。

一张是编程(Coding)能力:

一张是通用智能体(Agents)能力:

这里有很多基准,我就不解释了。大家可能看不懂这些概念,但是都能看得出来排名。

整体来说,有种除了 Fable 5 和 GPT-5.6 之外,我就可以横着走的感觉,Opus 4.8 就是个弟弟,只能坐另外一桌了。

另外还有一个很关键的点就是模型参数量:

K3 这个 2.8T 确实有点分量的

这个参数量确实来到了一个很恐怖的位置,比之前所有的开源模型要大很多,比 1.6T 的 DeepSeek Pro大了 1.2T!

众所周知,模型参数大了之后,脑子就会好很多,然后会贵很多。

插一句:

其实几个星期前,Kimi 的人就接触过,当时感觉会有比较重要的发布。因为我已经非常确信,我不会接商单的,我要直接开发游戏和软件,并分享实战经验。所以就没有深入聊了!

另外再补充一点小知识:模型发布第一天,就能发文章的人,都是参与内测的,而内测的人 99% 会说好话,而且其中大概率包含商单或者其他合作。

所以,头几天的新闻得谨慎看待!

我对 Kimi 的印象还可以,今天就来实测一下这个模型。看看它的基准数据是否靠谱,以及大模型竞技场的排名第一是否靠谱。

其实稍微懂点逻辑的,就发现一个小问题了:Kimi 自己说不如 Fable 5,而竞技场却比 Fable 5 强。出现不等式了,哪里有问题?

3、测试工具

接下来介绍一下测试工具,我之前都比较喜欢用 Claude Code,但是遇到 Kimi 我一般会用它们自家的 KimiCode,这次也不例外。

用官方的 KimiCode + K3 Thinking 应该能发挥最强的能力。

具体用法是:直接打开终端,输入 kimi 启动,会自动升级到最新版!

然后选 K3,然后把 Thinking 打开,目前只有开关,还没有其他等级。

然后,我们就可以开搞了。

我大概会展示 4 个例子,这几个例子,有经典游戏复刻,有概念融合,也有一些原创的老题目和新题目。

因为 Kimi 最强的就是前端,所以这次测前端合情合理,最后一个题目会涉及联网游戏,可能复杂一点。

1、甲维斯的车库

因为 K3 的特点是模型比较大,开发、3D 前端、世界知识比较强。所以就先来做一个甲维斯的车库吧!这是一个新题目,之前测试 GPT 5.6 Sol 和 Fable 的时候引入的。

题目如下:

1我在网上看到一个很有意思的例子,就是有人做了一个在线车库,可以快速切换车库中的各种车辆,以及显示这个载具的数据,中间显示具体的内容,可以通过鼠标拖动查看不同角度,然后可以切换涂漆,可以切换视角,可以自动旋转展示!网页配色,布局,内容我希望你尽可能还原参考图 2.png,不同之处在于车库里的车子,以及骑车的人,以及车库的名字。
2
3车子我希望你做一辆自行车,一辆电瓶车,一辆机车,一辆三蹦子,一辆五菱宏光,一辆特斯拉,一辆小米,一辆保时捷,一套钢铁侠的经典战甲。具体型号你自己定,要主流的型号。
4
5骑车开车的人物根据参考图 1.jpg 的头部形象进行设计,做一个 3D Q 版卡通想象。车库的主人是 Jarvis。
6
7我的需求就是这样,细节你来完成,我只负责验收。使用单个 HTML 和前端技术完成,只输出最终结果页面。
8

这个题目其实是不简单的,现在很多模型都是做不到及格分的。

因为这个题目是多维度的考验,首先必须具备的是多模态能力,因为我会给参考图,而且是两张参考图。

这个题目的核心要求如下:

关键的考察点如下:

这种题目其实不存在侥幸的,如果某一个环节的能力不行,最终结果就是完全没法看。只有你每个维度的能力都还可以,最终才能呈现出一个还可以的结果。但是目前没有模型可以做到特别优秀。

题目说清楚了,我们就可以开始测试了:

测试之前看一下我的配额情况:

全部都是全新的,周配额,小时配额都是满的。

经过极其漫长的等待(大概5+个小时),终于出结果了:

下面是它的“三蹦子”:

它做的 Model 3:

整体来说做的非常好! (甲维斯发型设计拉跨)

首先网页复刻,从布局来看是非常到位的,证明它的多模态能力确实国内最强!

而且网页上的功能点都是能正常工作的,调速的那个滑动条是完全正常的,这已经超过很多选手了!

另外,3D建模能力确实也非常不错了。首先车子是车子,人是人,没有扭曲分离。

其次,特斯拉的全景天幕和半透明效果都做出来了。

它对不同车型的整体理解也是对的。

整个任务的规划也还不错:

它是先写完全部代码,然后做语法检查,然后截图做图片识别。然后根据图片修复问题。最后全部复查一遍。

这个思路非常清晰,而且中间也没有犹豫和反复。

2.7 的时候感觉是烧 Token 补救智商不足的问题,这次明显运筹帷幄,参数大了就是聪明了很多。

没有对比大家可能对这个问题还不是很清晰,我贴一下 K2.7 和其他模型的效果图,你们就很清楚了。

下面是自家老版本K2.7的特斯拉:

这应该是出了车祸之后的样子吧!

腾讯混元3的特斯拉:

第一次JS错误,修改一次之后才得到上面的结果。 这个外形肯定不是特斯拉。

国产最强“盲人”模型 GLM 5.2 的特斯拉:

配色全崩,功能点也很多不到位,建模也是很抽象。

Grok 4.5 的特斯拉:

Grok 4.5 太不应该了,你忘了你的出身了么?你忘了你们老板的老本行了么?

GPT 5.6 Sol 的特斯拉:

这是它的第二版,第一版没有理解 3D,做了纸片人,这是给它明确提示词之后的效果。GPT 5.6 的前端还是不太行,其他模型有很多错位的地方,空间感差点意思。

Fable 5 的特斯拉:

布局和色彩还原很到位,所有功能点都正常,整体建模也不错,但是默认没有做半透明的侧窗玻璃,头发有点穿模。

单从这次测试来比较的话,K3确实有点东西了。

本来测下来 Fable 5 的建模能力和空间感最好。看了 K3 之后,好像确实有点比 Fable 5 还好的感觉啊~~!

但是我必须指出一个非常严重的问题,Kimi K3 配额消耗太猛了!为了测试上面的例子,我大概消耗了两个五小时周期,我这已经是 99 元的套餐了。49 元的套餐基本上就不要用了,秒射……不对……是秒没。

2、超级玛丽

刚才那个例子测试了多模态、世界知识、3D 等能力。下面测试一下老游戏还原能力,让它给我复刻一个超级玛丽的游戏。

下面是它的最终效果:

这是 Fable 5 的最终效果:

实话实说,K3 的完成度已经非常高了,几乎没有硬伤,地图像模像样,有很多经典内容,然后操作手感也很到位,然后它第一次就把蘑菇的回弹和鸭子给做出来了。Fable 5 在主角还原上要比 K3 好一些。

在这个例子里,我感觉是不分伯仲,都表现得出类拔萃。

3、赛博朋克版清明上河图

第一个题目是复刻网页和3D效果,第二个是复刻老游戏。这些内容其实都是可以“抄的” ,做得好,可能是“抄”的能力比较强!下面来一个我原创的题目《赛博朋克版清明上河图》

这个题目的重点是风格和内容的融合。

K3 的结果如下:

这是 Fable 5 的结果:

从这个例子来说,K3 整体表现比较平淡,而 Fable 5 内涵比较丰富,它不光是一个简单的街道。还有古装的人,还有桥,还有船和倒影。还有拉车的驴,还有两种刻画精致的飞行器。它是真的刻画出了一个古赛结合、内涵非常丰富的画面。

其实这种宏观视野和元素结合是非常难的,这个靠简单死记硬背是做不出来的。

4、3D台球

上面的题目,我都提供了比较多的提示词,而且很多题目其实可能是被做了优化训练的!然后我就想了一个开放题。我就说我想做个 “3D 台球”游戏。

然后问它有什么想法,然后根据它的推荐的线路来实现。

这个题目,我没有做任何预设和限制,也没有提示它用什么技术框架,也没有告诉它什么坑是要避免的。我只说了,要3D,要好玩,视觉效果要好,走拟真路线,可以联网玩。

K3 大概消耗了一个五小时周期,结果如下:

这个是主界面,它设计了三种模式,分别是单人练习、本地双人、在线对战。

然后我打开单人练习看了一眼:

这个例子,就崩得有些厉害了!

有两个非常严重的问题。一个是建模的问题,这个台球桌没有 6 个落球的口子,这就有点离谱了。另外一个问题是它这个杆子非常晃,操作手感极其离谱,很容易晕。

我也用同样的方式测了 Fable 5:

这个主界面应该是比 Kimi 的设计感好很多,而且功能也丰富很多。还做了玩法说明。最有意思的是它把这个游戏叫做“神杆”!而 K3 只是无情叫它“经典台球”!

然后看一下主界面:

可以调整抬杆角度和打击点:

可以调整第三视角和第一视角,以及顶视图:

除此之外还有音乐控制,菜单控制,打击之后镜头切换等效果。

这个例子,高下立判了!

而且差的不是一丁半点!

另外我还在配额的夹缝里测了一个我自创的项目《天文机械表》。

这个例子,样式也还可以,月相也是正确的,计时器、地区这些都做得不错。但是它把秒表的指针放到了大表盘,这样就会和秒钟有点冲突,然后该有的小表盘就没有了,还有一个就是不同地区的日落日出表盘里显示有点问题,另外大表盘上的数字看不太清楚!

这一题整体不如 Fable 5!Fable 5 各种细节都做得不错,几乎满分💯!

我本来想多测几个场景,但是奈何配额已经见底!

这个配额的问题真的非常严重:

我做完第一个例子,居然用掉了 37% 的周配额,差不多 2 个五小时周期,也就是说为了这个“例子”,我起码需要 5+ 小时!而且它的周配额只有 5 倍,非常少啊。

这TM能干嘛呢~~!

我已经是 100 一个月了啊,听说 199 也不怎么顶用。

我之前跑同样的例子,Fable 5 连五小时配额都没用完,Claude 的周配额一般是 5 小时配额的 10 倍,现在应该能到 15 倍。

这么一比,K3 有点高攀不起,只能用 Fable 5 勉强度日了😄~

作为用户,模型变强了是好事儿,但是也得考虑“量”和“价”,我们毕竟是真的拿来干项目,这点配额,项目没干完,先破产了。

总结一下:Kimi K3 是真的强了好多,有些例子表现非常出众,但是有些又很拉跨。而 Fable 5 发挥稳定,整体感觉更稳、更全面,自主性更强,自我发挥环节表现出众,相比而言配额都更多……离谱!

作为国内用户,如果你不差钱的话,K3 是个非常好的模型,不用翻山越岭去用 Fable 5 了。

其实我是非常想做一个更全面的测试的,但是我的魔法冷却时间为一周,一周过后可能没人关心K3是什么了。

今天跑了一天高速太累了,没录视频效果。上面的例子最好是看动态效果,我会把相关的例子传到网站上。

大家可以直接对比,网址:topai.jarvisuni.com/

有用过K3的,也可以来说说优点和缺点!


Kimi k3是真碉,但太不经用,也有拉跨点!》 是转载文章,点击查看原文


相关推荐


【中阶·安全】大模型逆向攻击与数据隐私保护深度解析:从模型反演到差分隐私防御的全链路实战
AI智能专家2026/7/10

【中阶·安全】大模型逆向攻击与数据隐私保护深度解析:从模型反演到差分隐私防御的全链路实战 专栏:《AI 工程与安全深度实战》· 第6轮·第2篇 前言 核心痛点:大模型不仅记住了训练数据中的知识——在某些条件下,攻击者可以通过模型输出反推出训练数据中的敏感信息(个人身份、医疗记录、专有代码),这对模型发布方的隐私合规和用户信任构成根本性挑战 适配人群:AI 安全工程师、隐私合规负责人、对模型隐私保护有深度学习需求的 ML 工程师和安全研究员 收获能力:读


暑假CSP-S NOIP集训学生要做哪些内容,集训完如何消化所学的知识
dllglvzhenfeng2026/7/2

暑假是 CSP-S 向 NOIP 进阶的‌黄金窗口期‌,集训核心在于‌体系化构建高阶算法能力‌与‌实战应试策略‌。以下是针对 CSP-S/NOIP 层级学生的集训内容及赛后消化方案: 一、暑假集训核心内容 集训需遵循“理论精讲 + 专项刷题 + 全真模考”闭环,重点突破以下模块: 1、‌高阶算法深度攻坚‌ (1)、‌动态规划(DP)‌:         从线性 DP 延伸至树形 DP、区间 DP、状压 DP 及斜率/四边形优化,重点训练状态设计与转移方程推导 。


Unity之使用火山引擎实现流式语音合成|优化版本
心前阳光2026/6/23

初始版本 Unity之使用火山引擎实现流式语音合成 优化版本 优化内容: 原始版本使用NativeWebSocket插件,无法获取X-Tt-Logid,使用WebSocketSharp插件解决这个问题提取两个插件的共性,可依据需要替换 示例 通信类 websocket通信基类 using UnityEngine; using System; /// <summary> /// 文字转语音 /// </summary> public abstract class BaseTextT


LLM —— 多模态(文本、图片、音频、视频)
kishu_iOS&AI2026/6/15

目录 一、什么是多模态 二、常见模态分类 三、多模态原理 单模态 vs 多模态 四、文本 五、图片 核心原理: 流程:         ① 图像预处理(统一输入格式)         ② 加载预训练视觉编码器         ③ 前向传播,抽取特征向量         ④ 向量归一化(L2 归一化,必做)         ⑤ 持久化存储 方案代码: 关键细节         ① 向量维度怎么选?         ② 相似度计算方式 容易出错点 其他轻量化


别再乱套ScrollViewer了!WPF中ItemsControl滚动条失效的3个隐藏坑与终极修复方案
许筱淳2026/6/8

WPF中ItemsControl滚动条失效的深度剖析与实战解决方案 当你在WPF项目中遇到ItemsControl滚动条"罢工"时,是否也经历过这样的场景:明明按照标准做法添加了ScrollViewer,滚动条却像被施了隐身术一样消失不见?或者鼠标滚轮在嵌套控件中滑动时毫无反应?这些问题往往源于WPF视觉树和事件路由机制的深层特性。本文将带你深入这些"坑"的本质,并提供真正有效的解决方案。 1. 为什么简单的ScrollViewer包裹会失效? 许多开发者第一次遇到ItemsControl


python爬虫-基本库-urllib库(常用速查)
bigfootyazi2026/6/1

urllib库 库的用途四个基本模块request模块error模块parse模块robotparser模块 库的用途 实现HTTP请求的发送 扩展:基本HTTP库有urllib、requests、httpx等 四个基本模块 request 基本的HTTP请求模块error 异常处理模块parse 工具模块,提供URL的处理方法robotparser 识别网站的robost.txt文件 request模块 urlopen (function) def urlopen(


📱随时随地大小编:TraeSolo 移动端初体验
海石2026/5/12

1、前言 最早认识Trae SOLO 还是在Trae IDE 内测 SOLO 模式的时候 (大概是2025年的11月) 这一转眼,Trae SOLO 居然都已经单独出了 桌面端 和 移动端 了 除了劳动节那阵联动星巴克☕吸引我之外不是 咳咳,最有魅力的还是双端协同这一点上 本文就是一篇“利用Trae SOLO的双端协同能力,进行随时随地开发微信小程序”的实践分享文章, 非常欢迎掘友们一起交流交流,共同探讨Trae SOLO的最佳使用“范式”~ 2、结果先行 1、移动端可以随时查看微信


window管理开发环境篇 - 持续更新
pe7er2026/5/2

我个人非常喜欢那种一键部署开发环境的方式,但时间一长,我们会淡忘如何部署开发环境,它会让我们失去对开发环境的控制。 下面我记录window环境下我是如何管理开发环境的。 安装Scoop 设置前提条件 Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser 典型安装 irm get.scoop.sh | iex 使用代理安装 iex "& {$(irm get.scoop.sh -Proxy 'http://<ip:


NineData 新增支持 GaussDB 到 StarRocks 实时数据复制能力
NineData2026/4/23

很多企业在完成核心系统国产化之后,业务已经稳定跑在 GaussDB 上,但很快会进入下一阶段:经营分析、实时看板、主题查询、风控报表、数据服务层都需要尽快接上。 如何实现呢?把业务数据实时复制到数仓即可。但通常会有如下挑战: 历史数据需要快速初始化到位。 业务持续写入时,目标端要持续、稳定地追平变化。 任务运行出了问题,要能第一时间感知,如果等到下游发现数据不对那就晚了。 正式上线前,要能全自动化对复制结果做核验,人工抽样费时费力还容易出错。 这个时候,一条能长期稳定的实时数据复制链路就很


告别 Python 依赖!用 LangChainGo 打造高性能大模型应用,Go 程序员必看!
GetcharZp2026/4/14

想用 Go 语言开发大模型应用却找不到好用的框架?本文深度解析 LangChainGo,手把手教你快速上手,涵盖 RAG、智能体等核心场景,助你轻松跨入 AI 开发大门! 在人工智能大行其道的今天,提到 LLM(大语言模型)应用开发,很多人脑海中浮现的第一反应就是 Python。确实,Python 拥有得天独厚的生态。但随着 AI 应用进入“工程化”下半场,开发者们开始面临新的挑战:并发性能瓶颈、部署环境复杂、内存消耗大…… 这时候,Go 语言的优势便凸显了出来。其天生的并发处理能力(Gor

首页编辑器站点地图

本站内容在 CC BY-SA 4.0 协议下发布

Copyright © 2026 聚合阅读