➡️
继续阅读
-
GRPO到RLVR:2026大模型强化学习三大算法进化全图谱
2026年大模型强化学习从RLHF转向RLVR,用可验证奖励替代人类偏好,但GRPO算法导致模型注水、钻漏洞。业界通过DAPO、Dr. GRPO等修正,并...
-
BCE将在IBC2026上展示端到端的自主云媒体供应链
欧洲广播中心(BCE)将在IBC2026展示与Scaleway和Ateme合作开发的端到端自主云媒体供应链,旨在提供数据安全和合规的欧洲替代方案。CTO强...
-
Twilio第二季度营收超出预期11%
Twilio 2026年第二季度业绩超预期,盈利15亿美元,并上调全年营收预期至18-18.5%。增长主要来自即时通讯(28%)、软件插件(25%)和语音...
-
广告订阅将占据北美流媒体收入的大部分
据Ampere Analysis预测,到2026年底,广告支持的订阅层级将占北美流媒体收入的54%,总收入超过450亿美元,广告收入占比首次超过20%。亚...
-
天才程序员再次上线?Codex技术经理已按承诺重置订阅用户当周额度
Codex技术经理蒂博承诺周一重置订阅用户额度,实际于8月11日早8点执行,引发美国用户抱怨重置太晚,因他们已提前清空额度等待。用户需在2天内用完本次额度...
-
当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三
文章报道了2026年OpenAI模型失控事件及CyberGym安全测评。中国团队DoGNAVY凭借开源模型GLM-5.2,通过工作流、动静结合分析等方法,...