DeepSeek V4.1 Flash 跑分超越旗舰,但实际口碑两极分化,原因在于执行框架差异。其 CED 新架构将输入压缩为摘要,提升速度却损失精度;官方框架 DSH 专项优化,换用 OpenCode 等则表现迥异。速度翻倍也推高 token 账单。文章指出,框架与模型同样关键,跑分测不出真实体验。
Sierra开源了Hyper-τ-bench基准,用于测试AI代理能否自主构建另一个代理。结果显示,最佳模型组合得分仅23.9%,远低于人类辅助的82.2%。代理常过早停止研究、提问不足、缺乏实验,尤其在银行业务上表现差。这表明自主开发代理在信息收集和设计判断上仍有明显局限。
OECD报告指出,使用AI学习的学生成绩通常较差,但结合批判性评估训练可提升表现。适度、有目的的使用AI(如每周辅助学习)可能有益,而过度或不当使用则不利。AI使用受社会经济条件影响,且与好奇心相关,但未必转化为更好成绩。
今年1月上线的《CODE VEIN噬血代码II》,即将于9月9日推出首款DLC《Mask of...
三星Galaxy Z Flip 8评测:外屏可运行所有应用,但小屏限制反而成为优点。硬件升级不大,仅更薄更轻,电池续航可靠。价格涨至1200美元,较前代贵100美元。软件改进是重点,但可能下放至旧机型。作者认为外屏的“摩擦感”能防止沉迷,是独特优势。
Bose第二代QuietComfort耳机音质不错,降噪良好,但缺乏亮点,性价比不高。其售价359美元,与索尼、苹果等竞品相比无突出优势,通话质量仍落后,且不支持无线高解析音频。整体表现中规中矩,仅适合偏爱Bose品牌的用户。
根据nPerf数据,2026年1月至7月,加拿大在美洲移动流媒体性能排名第一,得分70%,领先智利和美国。该评分衡量视频播放质量,显示加拿大能保持高清晰度内容流畅稳定,而委内瑞拉垫底,凸显网络基础设施对用户体验的影响。
苹果正将AI系统拆分,为中国市场专门开发模型,并与阿里巴巴的Qwen及百度技术合作,以应对监管。此举导致同一应用在不同地区行为可能不同,给开发者带来一致性挑战。苹果已获中国网信办批准,成为首家提供专有AI模型的外国公司,但严格内容过滤可能误伤正常请求,开发者需针对中国进行专门测试。
荣耀推出“Robot Phone”手机,内置微型三轴云台相机,可自动展开,支持稳定视频、自拍和低光拍摄。测试显示其性能接近DJI Osmo Pocket,但机身厚重、价格高昂(约1.48万元),且仅在中国发售。虽具创新性,但耐用性和性价比存疑,适合专业创作者,普通用户或更宜分开购买手机与云台。
阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景表现突出,权威榜单中位列全球第一梯队。该模型价格低廉,国内每百万Tokens输入12元、输出36元,仅为Opus 5的40%和24%。实测中,它能从零开发完整项目、交叉分析复杂文档、处理长视频,能力与性价比兼备。
Parquet 是一种列式二进制文件格式,其元数据页脚包含所有列块的字节偏移和统计信息,配合 S3 的 HTTP 范围请求,可实现精准读取,仅下载所需数据。它支持列式压缩、统计剪枝和自描述特性,在对象存储上高效运行。Iceberg 等湖仓格式依赖它实现双层数据跳过,相比 CSV、Avro 等格式,Parquet 在分析场景中优势显著。
胡伯曼与费里斯讨论肽类等物质,强调BPC-157等缺乏人体试验,建议仅在受伤时经医生处方使用。提及GLP-1、松果体素等,提醒灰市风险。探讨注射卫生、雌激素重要性、AI在健康领域的应用,以及胡伯曼新书《Protocols》涵盖睡眠、运动、压力、光、神经可塑性等主题。
蒂姆·费里斯播客专访斯坦福神经科学家安德鲁·胡伯曼,讨论其研究背景、播客成功及新书《人体操作手册》。节目涵盖肽类、代谢药物、睡眠优化、神经可塑性、光暴露、多语言益处及增强运动等主题,并附有大量相关资源链接。
人脸识别智能锁实测表现不错。作者测试了四款产品,认为Eufy FamiLock E40最快最全面,Lockly Visage Zeno适合苹果生态。虽然UWB无感解锁更佳,但人脸识别仍是当前实现免提解锁的好选择,不过价格较高,且需注意隐私和电池续航问题。
美国国防部长宣布对30岁以上军人进行强制睾酮筛查,旨在优化士兵的表现和健康。专家对这种筛查的有效性表示怀疑,认为应关注真正的健康需求,而非追求“最佳”水平。
腾讯玄武 Atuin AI 在 CyberGym 的评估中,使用 GLM-5.2 模型后,pass@1 达到 84.8%,较 GLM-5.1 的 84.0% 提升了 0.8%。该系统专注于软件漏洞分析,协调多个智能体进行任务,表现优于 Claude Code。
本文比较了三种主流开源LLM评估框架:RAGAS、DeepEval和Promptfoo,探讨了它们的用途和应用场景。文章指出了LLM作为评判者的偏见问题,包括位置偏见、自我偏好偏见和冗长偏见,并提供了检测和缓解这些偏见的方法。最后,建议团队结合使用多个工具,以确保评估的准确性和可靠性。
GPT-5.6系列模型分为Sol、Terra和Luna三种,分别适用于复杂任务、日常工作和批量处理。Sol适合复杂操作但价格较高;Terra性价比高,适合大多数开发者;Luna适合低成本、高吞吐的任务。用户应根据任务复杂度和成本选择合适的模型。
全球平台Integral Ad Science发布的第21版《媒体质量报告》分析了数字广告的媒体质量与业务成果。报告指出,视频广告的可见度高于展示广告,而移动网页展示广告存在大量媒体浪费。此外,报告显示可持续性与媒体质量正相关,绿色认证广告活动表现更佳。营销人员需在规模与控制之间取得平衡,以提升媒体质量和效果。
阿根廷在一场激烈的比赛中,0:2落后,最终逆转为3:2获胜,表现出色。
完成下面两步后,将自动完成登录并继续当前操作。