摘要
Anthropic 亮出“最危险”的模型 Mythos 时,它的 CEO、坚定的反华头子 Dario Amodei 判断:中国模型追上这类能力还需 6 至 12 个月。 但后来的事情大家已经知道了,智谱反手推出 GLM-5.2 追赶编程前沿,Kimi 又反反手拿出出 2.8 万亿参数的 K3,华尔街一度重演“DeepSeek 时刻”。 紧接着,阿里巴巴推出了 2.4 万亿参数的 Qwen3.8-Max-Preview。按官方说法:其综合性能仅次于 Fable 5,在全栈开发、数据分析和 Office 工作流中已能对垒前沿模型。 Qwen3.8-Max-Preview 能把中国开源模型叙事讲下去么? 我们决定试一试,让近几个月三款旗舰级的中国开源模型 GLM-5.2、K3 和 Qwen3.8-Max-Preview 一起合作,开发我们硅星人/品玩正在改版的新网站。 为了弱化 Harness 的影响,我们的工作方式采用了“模型+opencode”的组合。 值得指出的是:正在改版的硅星人网站是个半成品。网站项目已经包含 Next.js 前端、Payload CMS、Anime.js 页面动效等,也已经积累了现成的设计规范、历史代码和工作文档。 这个网站的问题很大,历史上多次进行前端和后台的开发和维护,屎山代码堆积,结构臃肿,前端交互混乱、虚假的不可用的功能很多……问题散在各个角落,前端和后端 bug 交缠在一起,一句话,历史上的品玩网站,是你能见到的最糟糕的网站开发的范本。 它必须被改变。对模型来说,空白项目没有历史包袱和屎山代码,往往可以自如发挥;而半路项目通常是模型最严厉的父亲。它要求模型看得懂项目在当下状态,还要在不破坏现有功能的情况下,进行精确的修改,属于屎上雕花的高难度操作。 接下来就交给 GLM 5.2、K3 和 Qwen 3.8- Max-Preview 了。这次网站改版眼下需要解决六个问题,我们逐一测试 谁看懂了项目当前的进展? 结果: No.1 Qwen 3.8-Max No.2 Kimi K3 No.3 GLM 5.2 这轮对应网站改版的第一个诉求:分清“现在有什么”和“文档里曾经想做什么”。
相关事件
暂无数据