➡️
继续阅读
-
OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统
文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6...
-
Instagram的AI检测系统再次陷入混乱
Instagram的AI标签系统误将用户原创或轻微编辑的照片标记为“AI内容”,同时漏掉真正的AI生成图片。问题源于Meta对C2PA等元数据的检测不准确...
-
海信在IFA 2026展示V AIOS系统及AI陪伴套件
海信在IFA 2026展示“陪伴式生活”愿景,推出V AIOS系统及AI陪伴套件,该系统基于感知、思考、沟通、执行四大能力,应用于烹饪、洗护及空气能源管理...
-
Witbe 推出用于视频测试自动化的 AI 模型
Witbe推出自研视觉语言模型Witbe VLMs,用于视频测试自动化,与通用模型协同工作。该模型针对机顶盒等特定场景训练,性能不逊于前沿模型,且延迟更低...
-
系统设计没有银弹:50个权衡点告诉你拿什么换什么
系统设计无银弹,本质是资源约束下的权衡取舍。加索引提升查询速度但降低写入性能;Kafka可降低总延迟;微服务降低故障率但增加开发运维成本,小团队宜用单体;...
-
一分钟读论文:《跑通测试的补丁,三成过不了人类 review 这一关》
论文《SWE-Gate》发现,代码智能体在SWE-bench基准上通过功能测试的补丁中,约34.3%违反工程约束,导致隐藏失败率高。研究构建了双轨基准,从...