小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
DeepSeek V4.1 Flash吐槽:换不同壳表现差异巨大

DeepSeek V4.1 Flash 跑分超越旗舰,但实际口碑两极分化,原因在于执行框架差异。其 CED 新架构将输入压缩为摘要,提升速度却损失精度;官方框架 DSH 专项优化,换用 OpenCode 等则表现迥异。速度翻倍也推高 token 账单。文章指出,框架与模型同样关键,跑分测不出真实体验。

DeepSeek V4.1 Flash吐槽:换不同壳表现差异巨大

极道 极道 · 2026-09-11T22:08:00Z
Claude在新基准测试中表现最佳,该基准用于测试构建代理的代理,但其通过率仍不足四分之一。

Sierra开源了Hyper-τ-bench基准,用于测试AI代理能否自主构建另一个代理。结果显示,最佳模型组合得分仅23.9%,远低于人类辅助的82.2%。代理常过早停止研究、提问不足、缺乏实验,尤其在银行业务上表现差。这表明自主开发代理在信息收集和设计判断上仍有明显局限。

Claude在新基准测试中表现最佳,该基准用于测试构建代理的代理,但其通过率仍不足四分之一。

The New Stack The New Stack · 2026-09-09T20:14:09Z
使用人工智能的学生通常在学校表现更差

OECD报告指出,使用AI学习的学生成绩通常较差,但结合批判性评估训练可提升表现。适度、有目的的使用AI(如每周辅助学习)可能有益,而过度或不当使用则不利。AI使用受社会经济条件影响,且与好奇心相关,但未必转化为更好成绩。

使用人工智能的学生通常在学校表现更差

The Verge The Verge · 2026-09-09T12:05:01Z

今年1月上线的《CODE VEIN噬血代码II》,即将于9月9日推出首款DLC《Mask of...

《CODE VEIN噬血代码II》即将推出DLC,新角色表现抓眼

游戏研究社 游戏研究社 · 2026-09-03T16:00:00Z
三星Galaxy Z Flip 8在存在摩擦时表现最佳

三星Galaxy Z Flip 8评测:外屏可运行所有应用,但小屏限制反而成为优点。硬件升级不大,仅更薄更轻,电池续航可靠。价格涨至1200美元,较前代贵100美元。软件改进是重点,但可能下放至旧机型。作者认为外屏的“摩擦感”能防止沉迷,是独特优势。

三星Galaxy Z Flip 8在存在摩擦时表现最佳

The Verge The Verge · 2026-08-29T13:00:00Z
第二代Bose QuietComfort耳机表现不错,但缺乏亮点

Bose第二代QuietComfort耳机音质不错,降噪良好,但缺乏亮点,性价比不高。其售价359美元,与索尼、苹果等竞品相比无突出优势,通话质量仍落后,且不支持无线高解析音频。整体表现中规中矩,仅适合偏爱Bose品牌的用户。

第二代Bose QuietComfort耳机表现不错,但缺乏亮点

The Verge The Verge · 2026-08-26T12:00:00Z
数据显示:加拿大在美洲移动流媒体表现最佳

根据nPerf数据,2026年1月至7月,加拿大在美洲移动流媒体性能排名第一,得分70%,领先智利和美国。该评分衡量视频播放质量,显示加拿大能保持高清晰度内容流畅稳定,而委内瑞拉垫底,凸显网络基础设施对用户体验的影响。

数据显示:加拿大在美洲移动流媒体表现最佳

实时互动网 实时互动网 · 2026-08-25T03:23:48Z
苹果的新AI拆分意味着你的iOS应用在中国可能表现不同

苹果正将AI系统拆分,为中国市场专门开发模型,并与阿里巴巴的Qwen及百度技术合作,以应对监管。此举导致同一应用在不同地区行为可能不同,给开发者带来一致性挑战。苹果已获中国网信办批准,成为首家提供专有AI模型的外国公司,但严格内容过滤可能误伤正常请求,开发者需针对中国进行专门测试。

苹果的新AI拆分意味着你的iOS应用在中国可能表现不同

The New Stack The New Stack · 2026-08-14T19:21:28Z
荣耀的机器人手机,其内置云台表现超乎手机应有的水准

荣耀推出“Robot Phone”手机,内置微型三轴云台相机,可自动展开,支持稳定视频、自拍和低光拍摄。测试显示其性能接近DJI Osmo Pocket,但机身厚重、价格高昂(约1.48万元),且仅在中国发售。虽具创新性,但耐用性和性价比存疑,适合专业创作者,普通用户或更宜分开购买手机与云台。

荣耀的机器人手机,其内置云台表现超乎手机应有的水准

The Verge The Verge · 2026-08-12T12:30:00Z
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景表现突出,权威榜单中位列全球第一梯队。该模型价格低廉,国内每百万Tokens输入12元、输出36元,仅为Opus 5的40%和24%。实测中,它能从零开发完整项目、交叉分析复杂文档、处理长视频,能力与性价比兼备。

刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

量子位 量子位 · 2026-08-03T05:41:02Z

Parquet 是一种列式二进制文件格式,其元数据页脚包含所有列块的字节偏移和统计信息,配合 S3 的 HTTP 范围请求,可实现精准读取,仅下载所需数据。它支持列式压缩、统计剪枝和自描述特性,在对象存储上高效运行。Iceberg 等湖仓格式依赖它实现双层数据跳过,相比 CSV、Avro 等格式,Parquet 在分析场景中优势显著。

为什么选择 Parquet,以及它为何在 S3 上表现如此出色

Kimserey Lam’s website, Software Development blog posts, videos and tutorials Kimserey Lam’s website, Software Development blog posts, videos and tutorials · 2026-08-01T05:00:00Z
蒂姆·费里斯秀文字记录:安德鲁·胡伯曼博士——肽类、表现与方案(第876期)

胡伯曼与费里斯讨论肽类等物质,强调BPC-157等缺乏人体试验,建议仅在受伤时经医生处方使用。提及GLP-1、松果体素等,提醒灰市风险。探讨注射卫生、雌激素重要性、AI在健康领域的应用,以及胡伯曼新书《Protocols》涵盖睡眠、运动、压力、光、神经可塑性等主题。

蒂姆·费里斯秀文字记录:安德鲁·胡伯曼博士——肽类、表现与方案(第876期)

The Blog of Author Tim Ferriss The Blog of Author Tim Ferriss · 2026-07-23T06:30:56Z
安德鲁·胡伯曼博士——肽类、表现与方案(第876期)

蒂姆·费里斯播客专访斯坦福神经科学家安德鲁·胡伯曼,讨论其研究背景、播客成功及新书《人体操作手册》。节目涵盖肽类、代谢药物、睡眠优化、神经可塑性、光暴露、多语言益处及增强运动等主题,并附有大量相关资源链接。

安德鲁·胡伯曼博士——肽类、表现与方案(第876期)

The Blog of Author Tim Ferriss The Blog of Author Tim Ferriss · 2026-07-22T18:54:49Z
惊喜!人脸识别智能锁实测表现不错

人脸识别智能锁实测表现不错。作者测试了四款产品,认为Eufy FamiLock E40最快最全面,Lockly Visage Zeno适合苹果生态。虽然UWB无感解锁更佳,但人脸识别仍是当前实现免提解锁的好选择,不过价格较高,且需注意隐私和电池续航问题。

惊喜!人脸识别智能锁实测表现不错

The Verge The Verge · 2026-07-18T14:00:00Z
男性圈的睾酮热潮正向军队袭来

美国国防部长宣布对30岁以上军人进行强制睾酮筛查,旨在优化士兵的表现和健康。专家对这种筛查的有效性表示怀疑,认为应关注真正的健康需求,而非追求“最佳”水平。

男性圈的睾酮热潮正向军队袭来

The Verge The Verge · 2026-07-17T14:00:00Z

腾讯玄武 Atuin AI 在 CyberGym 的评估中,使用 GLM-5.2 模型后,pass@1 达到 84.8%,较 GLM-5.1 的 84.0% 提升了 0.8%。该系统专注于软件漏洞分析,协调多个智能体进行任务,表现优于 Claude Code。

Xuanwu Atuin AI 在 CyberGym 上的表现:GLM-5.2 更新结果

腾讯安全玄武实验室 腾讯安全玄武实验室 · 2026-07-17T00:00:00Z
LLM评估框架比较:如何实际衡量您的模型表现

本文比较了三种主流开源LLM评估框架:RAGAS、DeepEval和Promptfoo,探讨了它们的用途和应用场景。文章指出了LLM作为评判者的偏见问题,包括位置偏见、自我偏好偏见和冗长偏见,并提供了检测和缓解这些偏见的方法。最后,建议团队结合使用多个工具,以确保评估的准确性和可靠性。

LLM评估框架比较:如何实际衡量您的模型表现

MachineLearningMastery.com MachineLearningMastery.com · 2026-07-14T12:00:29Z
GPT-5.6系列模型的社区反馈、基准表现和使用建议

GPT-5.6系列模型分为Sol、Terra和Luna三种,分别适用于复杂任务、日常工作和批量处理。Sol适合复杂操作但价格较高;Terra性价比高,适合大多数开发者;Luna适合低成本、高吞吐的任务。用户应根据任务复杂度和成本选择合适的模型。

GPT-5.6系列模型的社区反馈、基准表现和使用建议

浮云翩迁之间 浮云翩迁之间 · 2026-07-12T11:42:26Z
报告:视频可见度表现优于展示广告

全球平台Integral Ad Science发布的第21版《媒体质量报告》分析了数字广告的媒体质量与业务成果。报告指出,视频广告的可见度高于展示广告,而移动网页展示广告存在大量媒体浪费。此外,报告显示可持续性与媒体质量正相关,绿色认证广告活动表现更佳。营销人员需在规模与控制之间取得平衡,以提升媒体质量和效果。

报告:视频可见度表现优于展示广告

实时互动网 实时互动网 · 2026-07-10T02:32:52Z

阿根廷在一场激烈的比赛中,0:2落后,最终逆转为3:2获胜,表现出色。

真行啊阿根廷🇦🇷

安志合的学习博客 安志合的学习博客 · 2026-07-07T19:01:22Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码