小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

OpenAI发布了GPT 5.6系列模型,包括旗舰Sol、均衡Terra和低价Luna,标志着AI从“回答工具”进化为“智能体”。新模式“Max”和“Ultra”提升了推理能力和协作效率。ChatGPT与Codex合并,增强了编程功能,以满足更广泛的市场需求。AI行业竞争转向性价比,消费者将受益于更优服务和更低价格。

GPT 5.6 来了,但 OpenAI 最大的杀招不是模型本身

王佳冬中文博客
王佳冬中文博客 · 2026-07-15T03:05:09Z
在线教程|9B 小模型也能复杂推理,基于 Qwen3.5-9B,Qwythos 融合 Claude 推理经验实现能力跃升

Empero 开源了 Qwythos-9B-Claude-Mythos-5-1M,这是一款增强推理能力的小模型,拥有 90 亿参数。该模型通过高质量数据提升复杂推理任务的表现,支持长上下文和工具调用,拓展了多模态应用。HyperAI 提供了快速部署和测试的资源,方便开发者使用。

在线教程|9B 小模型也能复杂推理,基于 Qwen3.5-9B,Qwythos 融合 Claude 推理经验实现能力跃升

HyperAI超神经
HyperAI超神经 · 2026-07-14T05:59:31Z
AI论文评审:自一致性提升语言模型中的链式思维推理

自一致性是一种新型解码策略,通过生成多个独立推理路径并选择最一致的答案,显著提升大型语言模型的推理能力。该方法克服了传统链式思维的局限,允许模型在选择答案前探索多种可能性,从而提高准确性。实验表明,自一致性在算术、常识和符号推理任务中表现优异,证明更好的推理不一定依赖于更大的模型或额外的训练。

AI论文评审:自一致性提升语言模型中的链式思维推理

freeCodeCamp.org
freeCodeCamp.org · 2026-07-08T18:55:53Z
ChatGPT、Gemini与Claude的区别

本文比较了ChatGPT、Gemini和Claude三种模型的架构差异。三者均基于变换器架构,但在训练方法、密度、多模态处理、上下文窗口和对齐方式上存在显著不同。Gemini采用专家混合模型,支持多模态输入;OpenAI通过人类反馈强化学习优化模型;Anthropic使用宪法AI进行自我修正。尽管起点不同,三者在推理能力上逐渐趋同,均采用显式推理令牌以提升性能。

ChatGPT、Gemini与Claude的区别

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-07-07T15:31:10Z
Claude的脑子里,也长出了一块「意识」

Anthropic的研究发现,Claude模型内部存在类似人脑的“J-space”,用于处理意识和潜意识的思维。实验验证了J-space的可报告性、可操控性和推理能力。尽管Claude在多步推理中表现不佳,但其基本功能正常。研究表明Claude的思维结构与人脑相似,但并不具备真正的意识。

Claude的脑子里,也长出了一块「意识」

量子位
量子位 · 2026-07-07T01:38:18Z

人类最后考试(HLE)是评估现代AI系统推理和知识能力的基准,包含2500多个专家级问题,涵盖多个学科。尽管HLE被认为有用,但专家意见分歧,部分人认为其过于学术化,无法真实反映AI在实际生活中的表现。HLE旨在克服以往测试的局限性,尽管一些问题存在错误。总体来看,HLE被视为识别最佳AI模型的重要工具。

人类最后考试是一种干扰

KDnuggets
KDnuggets · 2026-07-02T12:00:59Z
京东 Oxygen xLLM 大模型推理引擎正式捐赠开放原子开源基金会,共建国产 AI Infra 生态

京东在开放原子开源基金会捐赠仪式上,将自主研发的大模型推理引擎Oxygen xLLM捐赠给基金会,旨在推动国产AI基础设施的智能化发展。该引擎采用服务-引擎解耦架构,提升资源利用率和性能,已在多个行业成功应用。未来,京东将与更多合作伙伴共同构建生态,推动国产推理能力的标准化和规模化应用。

京东 Oxygen xLLM 大模型推理引擎正式捐赠开放原子开源基金会,共建国产 AI Infra 生态

京东科技开发者
京东科技开发者 · 2026-06-25T12:34:08Z

GLM-5.2是新一代开放权重模型,性能接近顶级闭源模型GPT-5.5,成本仅为其三分之一。该模型拥有7000亿参数,实际运行时激活400亿,推理能力显著提升。推理过程消耗token较多,最大强度下需42000个token。用户可通过调整推理强度优化性价比,日常任务使用中等强度即可。尽管在非幻觉率测试中表现优异,但缺乏视觉输入能力,API稳定性需改进。

开放权重模型新王者GLM-5.2:顶级性能平民价格

极道
极道 · 2026-06-17T12:02:00Z
Grok 4.3现已在Amazon Bedrock上正式可用

xAI的Grok 4.3模型已在Amazon Bedrock上线,成为其模型供应商之一。该模型专注于推理能力,适用于客户支持和网站开发等企业场景,具备高效的工具调用和指令遵循能力,能够在高并发情况下控制成本。Grok 4.3运行于Amazon Mantle引擎,支持结构化输出和流式响应。

Grok 4.3现已在Amazon Bedrock上正式可用

量子位
量子位 · 2026-06-17T05:59:53Z
人工智能论文评审:链式思维提示激发大型语言模型的推理能力

大型语言模型在多步推理任务中的表现有限。研究提出了“链式思维提示”,鼓励模型展示推理过程后再给出答案,从而显著提升推理能力。这一方法无需额外训练,适用于算术、常识和符号推理任务,尤其在大型模型中效果显著。研究表明,适当的提示可以激发推理能力,改变了对语言模型推理的理解。

人工智能论文评审:链式思维提示激发大型语言模型的推理能力

freeCodeCamp.org
freeCodeCamp.org · 2026-06-15T22:43:25Z

谷歌推出NotebookLM的升级版,增强了聊天功能和推理能力,支持复杂的研究项目。新系统具备安全云计算能力,能够生成PDF报告和数据可视化。用户可以从初步想法开始,NotebookLM帮助构建资料库并进行可靠的信息搜索。这些更新已全球推出,旨在提升研究效率。

使用NotebookLM进行更高效的研究

The Keyword
The Keyword · 2026-06-08T16:00:00Z
DeepSeek V4 Pro在精度方面胜过 GPT-5.5 Pro

DeepSeek V4 Pro在精度和指令遵循方面优于GPT-5.5 Pro,尤其在复杂任务处理上表现更佳。测试显示,DeepSeek在日志处理和邮件生成等任务中更能准确执行要求,而GPT常常添加多余信息。尽管DeepSeek成本低廉,但推理深度仍不及GPT。社区对评估方法提出质疑,认为样本量小且缺乏科学性。总体来看,DeepSeek提供了“足够好”的性能,但顶尖推理能力仍由GPT和Claude掌握。

DeepSeek V4 Pro在精度方面胜过 GPT-5.5 Pro

极道
极道 · 2026-06-08T12:26:00Z
他们是由权重构成的:一篇让你重新思考AI与人类的文章

本文探讨了大语言模型的核心原理,强调知识和推理能力分布在权重网络中,而非独立模块。通过类比人类大脑,讨论了意识的涌现理论及人类对AI的情感投射,指出人类对自身智能的理解仍存在许多未解之谜。

他们是由权重构成的:一篇让你重新思考AI与人类的文章

极道
极道 · 2026-06-04T06:01:00Z
Claude Opus 4.8在ARC-AGI-3互动推理测试中得分超1%

Claude Opus 4.8在ARC-AGI-3测试中得分超过1%,尽管分数较低,但显示出AI开始具备原始推理能力。该测试要求AI在新规则下进行自适应推理,避免死记硬背,得分表明AI在陌生环境中尝试理解规则,展现出学习潜力,尽管仍有不足。这一进展被视为通向通用人工智能的重要一步。

Claude Opus 4.8在ARC-AGI-3互动推理测试中得分超1%

极道
极道 · 2026-06-01T22:40:00Z
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

快手发布了多模态大模型Keye-VL-2.0-30B-A3B,具备深度视频理解能力,采用DSA机制处理超长视频上下文,提升推理效率和准确性。该模型能够精准识别视频细节,提供高情商建议,并在复杂任务中展现强大的逻辑推理能力,标志着快手在多模态理解和自动化调度方面的重大进展,推动内容生产智能化。

将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

量子位
量子位 · 2026-05-26T10:17:39Z
李飞飞再出手,空间智能的ImageNet来了

李飞飞团队发布了ESI-Bench,这是一个用于评测具身空间智能的新基准。该基准要求AI主动探索以获取信息,研究显示当前AI在空间智能方面,尤其是主动探索和推理能力上仍存在不足。ESI-Bench包含3081个任务实例,覆盖人类核心空间认知能力,旨在提升AI的空间推理能力。

李飞飞再出手,空间智能的ImageNet来了

量子位
量子位 · 2026-05-22T08:25:25Z
上交x创智x瑞金联合发布CX-Mind:胸片诊断进入“可验证推理”时代

CX-Mind是首个将胸片诊断转化为可验证推理链的多模态大模型,提升了医学影像AI的推理能力,解决了传统AI模型的黑箱问题。该模型在多个评测中表现优异,尤其在真实世界测试中获得医生高度认可,标志着医学AI从视觉模型向推理模型的转变。

上交x创智x瑞金联合发布CX-Mind:胸片诊断进入“可验证推理”时代

量子位
量子位 · 2026-05-18T06:57:10Z
美团 LongCat 开源 General 365:树立推理评测新标尺

大模型在逻辑推理方面存在短板,尽管在专业知识测试中表现良好,但在日常场景的通用推理中准确率较低。美团LongCat团队发布的General 365基准测试揭示了当前模型的真实能力,强调推理能力与专业知识的解耦。测试结果显示,主流模型普遍未能达到及格线,反映出其在复杂逻辑任务中的不足。

美团 LongCat 开源 General 365:树立推理评测新标尺

美团技术团队
美团技术团队 · 2026-05-15T00:00:00Z
迈向自主化:深度解析什么是 Agentic AI(代理式人工智能)

代理式人工智能(Agentic AI)是具备自主性、推理能力和执行能力的系统,能够独立完成复杂任务。与传统生成式AI不同,Agentic AI能自主规划、调用外部工具并自我修正。其核心架构包括规划、记忆、工具使用和多代理协作,应用于软件开发、自动化营销和个人助理等领域。尽管面临安全性和成本控制挑战,Agentic AI标志着人工智能向行动式的重大转变。

迈向自主化:深度解析什么是 Agentic AI(代理式人工智能)

极客技术博客’s Blog
极客技术博客’s Blog · 2026-05-12T21:41:35Z
从事物的位置到它们的用途:多模态大语言模型的空间–功能智能基准评估

本文介绍了空间功能智能基准(SFI-Bench),用于评估多模态大语言模型的高级推理能力。SFI-Bench包含1700多个基于视频的问题,重点评估结构化空间推理和功能推理。实验结果显示,现有模型在整合空间记忆与功能知识方面存在瓶颈,强调了提升多模态智能代理的必要性。

从事物的位置到它们的用途:多模态大语言模型的空间–功能智能基准评估

Apple Machine Learning Research
Apple Machine Learning Research · 2026-05-06T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码