➡️
继续阅读
-
DeepSeek Harness教程全解:模型、工具、循环全可插拔!
DeepSeek Harness是一个开源项目,其核心公式为Agent=模型+Harness,通过将模型与工具、循环等组件解耦,实现“一切皆插件”。它基于...
-
DeepSeek MLA+MoE+FP8三招破局:系统级优化六个狠招
DeepSeek通过系统级创新,用2048块H800和557.6万美元完成训练,成本仅为GPT-4o的二十分之一。它未发明新技术,但优化了MLA压缩KV缓...
-
智谱开源发布GLM-5.3-Flash模型 编程和智能体能力接近Claude Opus 4.8
智谱开源发布GLM-5.3-Flash模型,采用MoE架构,总参数320B但激活仅18B,提升响应速度并降低成本。该模型在编程和智能体能力上接近Claud...
-
谷歌发布Gemini 3.5 Transcribe语音转文字模型 提升实时转写准确率和多语言能力
谷歌发布Gemini 3.5 Transcribe语音转文本模型,提升实时转写准确率、降低延迟,支持85种语言,自动去除口头语并修正表达,可区分说话者。流...
-
一分钟读论文:《把题目改错,模型的推理链纹丝不动》
埃因霍温理工大学与Dana-Farber合作研究医疗领域的链式推理,发现模型答案正确但推理链常与作答解耦。通过30种扰动测试14个模型,CDR达72.9%...
-
中国模型Engram/N-Gram记忆体引爆AI新竞赛
DeepSeek与阿里通义推出Engram/N-Gram记忆模块,为Transformer增加“记忆硬盘”,将固定知识查找从计算中分离,提升推理效率。实验...