➡️
继续阅读
-
OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统
文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6...
-
微软构建了提示注入检测器,却意外捕获了一场钓鱼攻击。
微软披露一种利用Unicode标签字符的钓鱼攻击,攻击者将隐形字符插入“funding”等金融词汇,绕过垃圾邮件过滤和AI分类器,单日检测量超230万。该...
-
AI代理评估是产品的一部分
该文讨论AI代理(Agent)的评估问题。文章指出,演示成功不代表系统可靠,需将评估纳入交付流程。建议建立可重复的评估系统,使用固定场景和真实任务,记录完...
-
Kimi K3 模型结构(0):一张图看懂 Kimi K3
Kimi K3是2.78T参数、104.2B激活的93层MoE模型,支持1M上下文及图像视频输入。其结构创新分三方面:序列用KDA与Gated MLA混合...
-
Minmax H3中英提示词效果差异测试 - 蝈蝈俊
对于MiniMax H3,使用中文和英文提示词时,能看到都在说,英文提示词通常能带来更好的生成效果。但是我实际测试下来,感觉差别不大。 我的测试是基于北京...
-
OpenAI承认德国维基‘事件’
OpenAI says it needs to overhaul how and when it reports instances of AI mode...