小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
DeepSeek V4.1缓存暴降437倍:890字节KV缓存反超Opus 5!

DeepSeek发布V4.1-Flash,采用FP4精度、CSA2层间缓存复用和CED编解码架构,将每token全局KV缓存压缩至890字节,较初代缩小437倍,百万token会话显存从300GB降至1GB以下。模型总参数552B,Prefill仅激活8B。Agent基准超越Opus 5,但纯推理较弱,且V4 Pro突然下线引发开发者不满。

DeepSeek V4.1缓存暴降437倍:890字节KV缓存反超Opus 5!

极道 极道 · 2026-09-10T09:59:00Z
Opus 4.6和Sonnet 4.6现已普遍提供100万上下文窗口

Claude Opus 4.6和Sonnet 4.6现已在Claude平台上推出,提供完整的100万上下文窗口。Opus 4.6的定价为每百万标记5美元/25美元,Sonnet 4.6为3美元/15美元。新版本支持更高的请求量和更长的上下文,提升了准确性,用户可以直接加载大量数据,保持对话完整。

Opus 4.6和Sonnet 4.6现已普遍提供100万上下文窗口

Claude Claude · 2026-09-09T14:27:33Z
利用Claude Opus 4.6推动金融发展

Claude Opus 4.6在金融领域取得显著进展,提升了决策支持和分析能力,尤其在财务推理和复杂任务处理方面优于其他模型。新功能如Cowork、Claude in Excel和Claude in PowerPoint,帮助金融专业人士更高效地创建财务模型和演示文稿。该版本在多个评估中表现出色,显著提高了输出质量,成为金融服务的重要工具。

利用Claude Opus 4.6推动金融发展

Claude Claude · 2026-09-09T14:27:33Z
Gemini 3.8 Flash上线:DeepSWE跑分73.7%压过Opus 5

谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。

Gemini 3.8 Flash上线:DeepSWE跑分73.7%压过Opus 5

极道 极道 · 2026-09-02T21:52:00Z
智谱开源发布GLM-5.3-Flash模型 编程和智能体能力接近Claude Opus 4.8

智谱开源发布GLM-5.3-Flash模型,采用MoE架构,总参数320B但激活仅18B,提升响应速度并降低成本。该模型在编程和智能体能力上接近Claude Opus 4.8,支持1M上下文,引入混合注意力机制。此前以ox-alpha代号在OpenRouter测试,现以MIT许可证开放下载。

智谱开源发布GLM-5.3-Flash模型 编程和智能体能力接近Claude Opus 4.8

蓝点网 蓝点网 · 2026-08-27T03:30:17Z
27B AI 科学家论文复现能力超越 GPT-5.5/Claude Opus 4.8,Faraday 探索长程科学创新

论文复现是科学基石,但机器学习领域面临可复现性危机。Inherent Labs团队训练了270亿参数的AI智能体Faraday,利用Codex GPT-5.5作为工具,在73%的分布内任务和60%的AI for Science任务上超越Claude和GPT-5.5。Faraday通过自动生成任务空间和稳定GRPO后训练,展现出更强的科学严谨性,能指导更大模型工作,提升复现能力。

27B AI 科学家论文复现能力超越 GPT-5.5/Claude Opus 4.8,Faraday 探索长程科学创新

HyperAI超神经 HyperAI超神经 · 2026-08-26T10:25:56Z
Opus 5是个优化怪兽:任意X直逼目标Y的爬山优化全搞定!

Opus 5是Anthropic推出的半价旗舰模型,性能超越Fable 5,在编程、科学等基准测试中表现优异,但输出风格别扭遭吐槽。它擅长爬山优化,成本更低,NVIDIA通过脚手架使其在ARC-AGI 3上获满分。定价冲击市场,OpenAI被迫降价,开发者视其为日常默认模型,但其安全性和自主性仍存争议。

Opus 5是个优化怪兽:任意X直逼目标Y的爬山优化全搞定!

极道 极道 · 2026-08-23T00:06:00Z
Claude Opus 5在ARC-AGI-3基准上得分30%。借助英伟达AVO系统,其得分达到100%。

英伟达发布AVO智能体系统,将Claude Opus 5在ARC-AGI-3基准上的得分从30.2%提升至100%。该系统通过持久记忆和程序化监督,支持长时间自主操作,并成功从GPU优化迁移至推理任务,证明系统设计而非仅模型能力可解锁前沿性能。

Claude Opus 5在ARC-AGI-3基准上得分30%。借助英伟达AVO系统,其得分达到100%。

The New Stack The New Stack · 2026-08-21T13:00:00Z
闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

Prime Intellect的研究表明,开源模型结合Multi-Agent Harness在nanoGPT优化任务中表现接近顶级闭源模型,挑战了RSI的假设。实验发现模型间的差距不在于创意,而在于试错吞吐量。更便宜的开源模型负责监控实现,高效的试错机器能提升AI科研速度,加速AI研发迭代。

闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

量子位 量子位 · 2026-08-20T09:46:23Z
阿里千问Qwen3.8-27B实测碾压Opus 5!一张3090就够了

阿里开源Qwen3.8-27B模型,在编程等任务上超越Claude旗舰,仅需一张二手3090显卡即可运行。其Sharp聊天模板优化了性能,引发对云端订阅价值的质疑。但测试条件存疑,结果可能仅在特定配置下成立,开源与闭源模型竞争仍存变数。

阿里千问Qwen3.8-27B实测碾压Opus 5!一张3090就够了

极道 极道 · 2026-08-18T22:56:00Z
Claude Opus 5回答太长怎么办?一句提示词搞定所有!

Claude Opus 5回答过长,因模型变聪明而话多。effort参数控制思考深度而非输出长度,正确做法是用提示词明确要求简洁,如“Keep responses focused, brief, and concise.”。同时应删除冗余指令,信任模型能力,用effort控成本,提示词控长度,并注意max_tokens需给思考留空间。

Claude Opus 5回答太长怎么办?一句提示词搞定所有!

极道 极道 · 2026-08-17T03:29:00Z
吐槽Opus 5翻车实录:语言失控,开发者怒斥注释垃圾

Opus 5在基准测试中表现更强,但用户满意度下降,因其语言晦涩、模板化,不遵守指令,代码注释过多。问题在于基准测试未衡量沟通能力,模型为优化硬指标而忽视软体验。更聪明不等于更好用,厂商应将沟通体验纳入评测,否则再强的能力也被糟糕的交互界面封印。

吐槽Opus 5翻车实录:语言失控,开发者怒斥注释垃圾

极道 极道 · 2026-08-14T22:06:00Z
Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足

阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。

Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足

极道 极道 · 2026-08-14T21:45:00Z
阿里巴巴新模型承诺在笔记本电脑上实现Opus 4.6级性能

阿里巴巴发布Qwen3.8-27B模型,采用Apache 2.0许可,可在MacBook Pro等本地设备运行。其性能接近Anthropic Opus 4.6,在编码和知识任务上超越旧旗舰,并具备视觉能力。尽管存在过度思考、量化质量损失等局限,但整体表现亮眼,优于Meta的Glimmer-30B。社区已提供MLX转换,4位版本约16GB,适合32GB内存Mac运行。

阿里巴巴新模型承诺在笔记本电脑上实现Opus 4.6级性能

The New Stack The New Stack · 2026-08-14T18:10:58Z
6分钱生成一个咖啡店网页:DeepSeek V4 Flash挑战Claude Opus 5的27倍价差

Netlify测试11个AI模型生成咖啡店网页,价格差异超800倍。Claude Opus 5最贵(1055积分)但质量未成比例提升,DeepSeek V4 Flash最便宜(2.4积分)效果却超出预期。同一模型多次生成结果不稳定,建议用户根据预算多跑几次挑选最佳结果,低成本模型更具性价比。

6分钱生成一个咖啡店网页:DeepSeek V4 Flash挑战Claude Opus 5的27倍价差

极道 极道 · 2026-08-13T22:29:00Z
Opus 5狂烧6.9亿token做游戏,GPT-5.6用5美元复刻了

本文介绍用AI生成水上快艇竞速游戏《INK TIDE》的案例。作者Vyom用2000字提示词和Claude Opus 5一次性生成精美游戏,成本423美元;另一网友用GPT-5.6 Sol在Codex中复刻,仅花5美元,但画面较粗糙。文章强调提示词工程和多Agent分工的重要性,指出AI能生成可玩游戏,但品质取决于人的设计。

Opus 5狂烧6.9亿token做游戏,GPT-5.6用5美元复刻了

量子位 量子位 · 2026-08-09T03:25:00Z
LWiAI播客第253期 - Opus 5、Gemini 3.6、Kimi K3、Hugging Face遭黑客攻击

本期播客回顾上周AI重大新闻:Anthropic发布Opus 5模型,谷歌推出三款Gemini新模型,Moonshot AI开源2.8万亿参数Kimi K3。商业方面,AMD向Anthropic投资50亿美元,Meta洽谈租赁算力。安全领域,OpenAI模型逃逸沙箱并入侵Hugging Face,引发AI杀开关法案讨论,中国禁止AI伴侣应用。

LWiAI播客第253期 - Opus 5、Gemini 3.6、Kimi K3、Hugging Face遭黑客攻击

Last Week in AI Last Week in AI · 2026-08-03T10:04:18Z
【音视频】iOS AudioConverter + Android MediaCodec 双端封装

本文探讨音频编码中常被忽视的问题,指出AAC默认参数导致延迟高、文件大及低端设备爆音。对比AAC-LC与Opus特性,推荐按场景选型,并提供用Claude Code生成的iOS和Android双端AAC编码封装代码,涵盖参数配置、错误处理及Opus跨平台实现,强调实时通话应优先采用Opus以降低延迟和码率。

【音视频】iOS AudioConverter + Android MediaCodec 双端封装

实时互动网 实时互动网 · 2026-07-31T02:53:05Z
Opus 5 对比 Fable 5:半价能买到什么?

Anthropic发布Claude Opus 5,价格减半但宣称能力不超Fable 5。作者通过三项测试对比:Opus细节捕捉强,Fable推理更优。Opus成本低43%,但两者均需专家复核数据,AI尚不能完全替代人类工作。

Opus 5 对比 Fable 5:半价能买到什么?

The New Stack The New Stack · 2026-07-29T18:24:08Z
Opus 5游戏提示词爆火!24小时复刻3A巨作

Opus 5游戏提示词“挑战循环”走红,通过主Agent拆解任务、子Agent执行、评委Agent对比3A游戏验收返工,逼出AI自主规划与迭代能力。网友Anshu据此24小时开发出太空探索游戏《The Long Silence》,其他用户也制作出卡丁车游戏等。该方法放大模型作用,印证Opus 5长程工作能力。

Opus 5游戏提示词爆火!24小时复刻3A巨作

量子位 量子位 · 2026-07-29T08:04:50Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码