本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash routing替代稠密层;增加极小序列级平衡损失;SwiGLU加硬截断防离群值。模型采用FP4量化,61层全MoE,每token激活6个expert,稀疏度64,总参数约49B。
本文批判静态用户画像的局限,主张用动态行为特征提升预测模型。核心方法包括:测量行为速度与加速度、评估功能使用深度、计算决策摩擦,并借鉴线下购物心理学映射线上信号。针对稀疏数据,采用零膨胀嵌入和频繁子轨迹挖掘。最后以零售需求预测为例,展示从数据采集到特征工程的实践路线,强调动态特征优于静态快照。
本文介绍了三种压缩大型语言模型的技术:量化、剪枝和知识蒸馏,它们能在不显著降低智能水平的前提下减小模型规模。这些技术可叠加使用,但各有取舍,如量化可能损失细微理解力,剪枝影响复杂逻辑,蒸馏可能缺乏原创性。选择哪种技术取决于模型的具体应用目标。
AQuA系统由普林斯顿、蚂蚁和斯坦福团队开发,用于自主量化交易研究。它通过分离数据路径与评价规则,防止数据泄漏和过拟合,使Agent能可靠积累证据。实验显示,因子研究IC达0.190,模型预测IC为0.0843,样本外Sharpe达2.50。该系统强调研究过程的可靠性,而非仅依赖模型智能。
推理软件栈的微小差异(如注意力后端、KV缓存量化、权重量化、张量并行度)会导致本地部署的大模型在长上下文中输出不同token,甚至工具调用失败。实验显示,INT4 KV缓存和NVFP4量化翻转率最高,而BF16和特定INT8方案更稳定。这些数值漂移累积后,模型可能做出致命错误决策,且难以排查。
本文介绍量化和剪枝两种模型压缩技术,用于减小大语言模型体积、降低成本并提升推理速度。量化降低权重精度(如4位),剪枝删除冗余权重。文中详述五种方法:bitsandbytes、GPTQ、AWQ、SparseGPT和Wanda,并建议先剪枝后量化,根据需求选择合适方法,以在保持性能的同时实现高效部署。
该研究将大语言模型视为信息处理规则,通过贝叶斯更新偏差衡量其内部一致性。实验发现,非贝叶斯启发式更新常优于精确贝叶斯更新,表明模型世界模型存在错误设定。该度量可用于诊断LLM推理系统问题。
本文讨论检索系统中候选深度(candidate depth)的调优方法。建议先设置基线,测试100-200的limit值,并对比近似搜索与精确搜索的召回率。增加候选可提升最佳可能分数,但需权衡延迟。当RAM受限时,优先考虑量化而非降低深度。hnsw_ef仅在召回率未饱和时调整。最后根据最佳可能分数与当前分数的差距,决定优化排序或检索。
本文介绍如何在普通笔记本电脑上构建无需云端的RAG系统。核心方法包括:量化模型降低内存占用、使用紧凑嵌入模型和本地向量存储。系统涵盖文档分块、嵌入索引、检索和本地生成等步骤。可靠性通过引用来源、相似度阈值、评估集和查询日志实现。推荐使用llama.cpp、LangChain、FAISS等轻量工具,并建议从小规模开始逐步调优。
阿里开源Qwen3.8-27B模型,270亿参数,支持262K上下文,性能接近闭源旗舰。社区实测在双RTX 3090上达105 tok/s,通过量化、MTP加速等技术实现。模型Apache 2.0协议,48小时下载86万次。但速度受场景、配置影响大,多卡未必更快,且长上下文需量化KV缓存牺牲质量。
通义千问发布2.4万亿参数开源模型Qwen3.8-2.4T,权重达4.9TB,普通硬件无法运行。量化压缩至FP8仍超消费级显卡极限,且无QAT优化,性能受损。开源版剥离视觉功能、缩短上下文,实为商业引流。1bit压缩虽减至397GB,但精度损失严重。模型性能跑分高但实际存疑,价格战加剧硬件负担。大模型竞赛受物理限制,普通用户难以参与。
本文探讨大语言模型压缩的三种主要方法:量化、蒸馏和剪枝,它们分别作用于数值精度、训练目标和模型结构,因此不可直接比较。文章分析了GPTQ、AWQ、SmoothQuant等方法的假设差异,指出PPL指标在评估压缩效果时不可靠,且压缩可能损害推理能力、长上下文处理及安全行为,需根据具体应用场景谨慎选择压缩方法。
2026年本地部署大模型趋势显示,万亿参数模型如Kimi K3可通过流式加载在8GB内存CPU上运行,但速度极慢。部署关键取决于显存容量和内存带宽,8GB适合小模型,80GB以上可运行120B模型。DeepSeek V4 Flash经量化可在128GB内存设备运行。工具选择上,LM Studio适合新手,Ollama适合开发者,llama.cpp提供精细控制。本地部署需权衡成本、速度与隐私。
Unsloth团队将Kimi K3模型从1.56TB压缩至594GB,体积缩小近三倍,最小版本保留78.9%准确率。量化技术降低参数存储位数,使顶级模型可在个人电脑运行。文章还讨论剪枝技术、显存焦虑及低成本部署梦想,推动压缩技术发展,让AI从奢侈品变为消费品。
本文比较了Ollama、LM Studio和llama.cpp三种本地AI运行时。LM Studio适合初学者,提供图形界面和可视化量化控制;Ollama适合开发者,提供简洁CLI和API集成;llama.cpp适合追求极致控制的生产工程师,支持手动量化。三者共享同一推理引擎,用户可按需从LM Studio迁移至Ollama再至llama.cpp。
开源社区通过REAP修剪专家、GGUF量化、混合精度等技术,将7530亿参数的GLM-5.2模型压缩至消费级硬件可运行,体积削减80%,成本从7万美元降至1.5万美元,智商保留82%。KV缓存优化提升上下文至74万token,Moet方案实现2位权重运行。开源创新推动AI模型个人化,挑战高价硬件垄断。
大型语言模型(LLM)在自主解决现实任务中越来越重要,尤其是在函数调用方面。错误的函数调用可能导致严重后果,因此评估LLM对函数调用正确性的信心至关重要。本文首次探讨了不确定性量化(UQ)方法在LLM函数调用中的应用,结果显示多样本UQ方法在此场景中并未显著优于单样本方法。通过聚类输出和选择语义相关的标记,可以提升现有UQ方法的性能。
文章介绍了三种与加密货币衍生品市场自动化交易系统开发相关的技术职位:量化开发工程师、高级Rust开发工程师和量化交易系统工程师。要求应聘者具备计算机相关学历和丰富的后端开发经验,熟悉相关技术栈及交易所API。
具身智能行业正在分化,量化派专注于物理世界基础模型,推动机器人在不同场景的复用。政策要求机器人在现有条件下工作,量化派已在餐饮后厨完成多项技术验证,展示了其自主作业能力。其商业模式为“卖能力”,通过物理模型支持RaaS模式,降低边际成本。未来,数据积累和技术能力将决定其商业价值。
BGE-M3是一款全能型嵌入模型,支持密集、稀疏和多向量检索,覆盖100多种语言,最大输入长度为8192词元。其量化版bge-m3-q8_0在GPUNexus平台上线,显存占用减少,推理速度提升,适合RAG系统和多语言知识库。2026年第三季度可免费试用。
完成下面两步后,将自动完成登录并继续当前操作。