神秘模型Ox Alpha在OpenRouter匿名上线,编程测试中击败Claude Fable 5等头部模型,但身份成谜。指纹分析指向智谱GLM系列,可能是其下一代变体。模型免费开放,日供百万亿Token,引发关于算力来源和训练数据采集的猜测,截至8月22日无人认领。
阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。
马斯克的Grok4在编程测试中表现优异,成功通过小球测试并生成动画文字。Epic创始人称其为AGI,Grok4在法律问题和代码翻译等任务中优于其他模型,最终完成了8个任务,并展示了数学公式可视化和SVG绘图能力,表现令人惊讶。
本研究提出了一种“软思维”方法,克服了推理模型在离散语言中的局限性。该方法通过在连续概念空间中生成抽象概念令牌,提高了数学和编程测试的准确性与效率,展现了突破离散语言推理瓶颈的潜力。
完成下面两步后,将自动完成登录并继续当前操作。