摘要
刚刚,Anthropic放出藏了俩月的大杀器——Claude Fable 5和Mythos 5,无异于扔下一枚炸弹。 现在压力直接给到OpenAI。 同一时间,GPT-5.6也泄露了。 上周开始,OpenAI已测试内部代号为kepler和kindle的两个新检查点。kindle-alpha被曝已选为发布候选。 GPT-5.6的内部测试版本,开始在海外开发者和泄露圈里被疯狂实测。代号、候选版本、跑分体感,全被翻了出来。 无论是争抢IPO,还是旗舰模型撞车,两家「你递表我也递表」「你发新模型我也发新模型」。 纯纯是打得不可开交。 但问题是,GPT-5.6真的能打过Mythos吗?? GPT-5.6浮出水面 截至目前,OpenAI对GPT-5.6还是零官宣,尚未正式发布。 不过,海外不少网友已经对还没公开的「内部检查点」做了探针测试。 所谓检查点(checkpoint),就是模型在训练过程中某个时间点存下的一份参数快照。 OpenAI内部会存很多份,横向比较,再从里面挑一个认为「够好、可以拿去发」的版本,这个版本就叫发布候选版(RC)。 从上周开始,OpenAI内部正在测两个新检查点,代号分别是kindle和kepler。其中kindle-alpha被选为发布候选版。 从流出的体感来看,GPT-5.6这次最被反复提及的升级,是前端/UI生成。 网友Pankaj Kumar的说法是,kindle-alpha的前端生成能力大幅提升,不需要复杂的提示词或额外技巧,就能直接产出更强的界面输出。 此外,它的视觉能力也很能打,在图像理解和图像引用类任务上表现不错,整体在推理、编码、UI生成上都有明显改善。 这是网友Chris实测kindle的效果,使用medium档位: 而这是另一位网友此前在非推理版本Joule上实测的效果: 可以看出前者精美很多。 但网友Leo拿同一个prompt、在xhigh档位上分别实测了kepler和kindle两个版本。 发现kindle比起kepler,反而还退步了。 嗯…这效果确实很难评。 他甚至判断,OpenAI很可能还会继续打磨,不排除最后弃用kindle这个候选版。