➡️
继续阅读
-
AI代理评估是产品的一部分
该文讨论AI代理(Agent)的评估问题。文章指出,演示成功不代表系统可靠,需将评估纳入交付流程。建议建立可重复的评估系统,使用固定场景和真实任务,记录完...
-
我们花了一周时间测试IFA上最棒(也最奇特)的科技产品,欢迎提问
IFA 2026柏林展会上,The Verge编辑测试了众多科技产品,涵盖智能家居、手机、手表等。他们正为订阅者举办问答活动,解答关于飞利浦Hue灯、Eu...
-
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、...
-
Claude Fable 5.1 vs. Fable 5: On real work, I couldn’t tell them apart.
Anthropic launched Claude Fable 5.1 this week, calling it “our most advanced ...
-
Building trust in agentic RAG starts with evidence
Basic retrieval-augmented generation (RAG) follows a straightforward pattern....
-
Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合
本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至5...