➡️
继续阅读
-
Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。
Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确...
-
SenseNova-U1.5-8B-MoT 统一生成与理解,解锁原生多模态创作;DeepSeek-V4-Flash-Vision-Exp 拓展视觉理解新能力
商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程...
-
AGI,你想它是什么,它就是什么
本期《Vergecast》播客讨论OpenAI发布GPT-6 Astra并宣称进入“AGI时代”,Nvidia收购Hugging Face,苹果新CEO及...
-
把Agent放进真实尺度香港,上交大/新加坡国立大学/美团等提出UrbanGround,测试多模态模型城市探索能力
该文章介绍了一项关于多模态大语言模型(MLLM)在城市导航中能力的研究。研究团队构建了基于香港真实地理数据的URBANGROUND交互环境,评测了GPT-...
-
OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统
文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6...
-
2026年可用的5个免费LLM API提供商
本文介绍了五个提供免费LLM API的服务商:GroqCloud(高速推理)、OpenRouter(多模型试用)、Cloudflare Workers A...