6GB显存可运行Qwen3.6-35B-A3B-NVFP4,但需32GB以上内存,依赖CPU和PCIe。配置建议:Triton attention、memory-ratio 0.92、Prefill 2048、512专家槽。性能低于8GB的39.3 tok/s,适合短上下文和编码实验。需Ampere架构,逐步调优专家缓存和KV,实测不同后端。
HyperAI平台推出三项更新:上线MCP服务器,支持在Claude Code和Cursor中通过自然语言管理算力、数据集等资源;新增AI顶会(如AAAI、CVPR)筛选功能,便于查找相关教程和数据集;推出系列教程,系统化覆盖AI基础、机器学习等方向,提升学习效率。
NVIDIA NeMo Switchyard是一个开源路由层,位于AI代理和模型之间,按请求智能选择模型以降低成本。教程演示了从随机路由到内容感知路由的升级,包括配置YAML、启动服务器、测试简单与复杂请求,以及基于进度或升级的路由策略。最后强调通过指标测量路由效果,优化质量与成本平衡。
Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还介绍了其函数triton.language.floor,用于逐元素向下取整,参数为Block类型的输入值。
本文介绍使用Hugo搭建静态网站:先安装Git、Go及Hugo Extended版,创建站点目录,用Git子模块安装PaperMod主题,编写Markdown文章并设置draft为false,通过hugo server预览,最后用hugo生成静态文件部署至Cloudflare Pages等平台。Hugo速度快、纯文本管理,适合个人博客。
作者通过ZeroTier组网、DNS域名解析、iStore Nginx反向代理及certd证书管理,构建了一套家庭服务访问方案。各服务通过域名映射至内网IP,Nginx按域名分发至后端端口,实现无警告、无拦截的安全访问。文中详述配置步骤、踩坑记录及优化体验,替代了原有HeoSafe拦截方案。
TVM 0.21.0 发布,中文文档同步更新。文章介绍 Relax 抽象,用于端到端优化机器学习模型,以两层神经网络为例,展示高层 Numpy 与 Relax 代码,及底层实现。关键元素包括结构信息、R.call_tir 调用底层函数、数据流块标记纯函数区域,便于编译器优化如算子融合。
DeepSeek Harness是一个开源项目,其核心公式为Agent=模型+Harness,通过将模型与工具、循环等组件解耦,实现“一切皆插件”。它基于Cordis元框架,支持热插拔、可逆副作用和四种运行模式,并具备安全审批、日志记录和子Agent功能。尽管存在安全漏洞,但展示了AI自主扩展能力的潜力。
本文介绍如何用CC Switch图形化工具将Codex接入Ace Data Cloud。先获取API Token,下载安装CC Switch,添加自定义模型提供方,填写名称、接口地址和密钥,生成配置文件。启用后重启Codex即可使用,支持终端和VS Code,并解答常见问题。
Raspberry Pi发布官方教程,指导用户自制“cyberdeck”迷你便携电脑。该趋势在TikTok等平台走红,教程包含零件清单和组装步骤,设计简单。因组件成本上涨,Pi 5价格已多次上调,但公司仍支持这一DIY市场。创作者如Annike Tan已用旧物改造出独特作品。
Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还介绍了其在线教程及函数triton.language.fdiv(x,y),用于计算x和y的逐元素快速除法。
该文章介绍了一种桌面Agent工作流,可将软件操作录屏自动转换为图文教程和SOP文档。它通过组合视频、语音和文字识别能力,对齐时间点生成带证据的步骤,并保留待确认项。个人和团队可借此减少重复劳动,但需确保视频授权,生成稿仅供复核,不自动发布。
中国用户需要使用VPN绕过防火墙才能访问基于人工智能技术的聊天工具ChatGPT。用户需要选择可靠的VPN供应商,连接到中国境外的服务器,访问ChatGPT网站并注册帐号。但最近很多VPN已经无法访问ChatGPT,需要选择一家可以访问ChatGPT的VPN服务商。ChatGPT凭借其强大的AI能力,可以成为中国用户构建更高级聊天机器人的强大工具。
作者利用AI Agent构建个人资讯筛选系统,以应对信息过载。他精选161个RSS源并按可信度分级,使用Folo管理,通过CLI让Agent读取。Agent根据偏好推送内容,生成HTML“赛博报纸”,并能追踪特定传闻(如折叠屏iPhone)并区分可信度。该系统有效过滤噪音,保留可靠信息,帮助用户重获信息控制权。
TVM 0.21.0 发布,中文文档同步更新。文章阐述图抽象在机器学习编译器中的关键作用,通过有向图表示模型结构和数据流,便于优化。重点介绍 Relax IR 的特性:符号形状追踪动态维度、多层次抽象支持跨层优化、可组合变换实现灵活定制,共同提升 TVM 对模型的端到端优化能力。
作者从零基础前端开发者,通过LFX导师计划成长为云原生工程师。他部署OpenTelemetry和Prometheus系统,解决真实故障,学会系统思维和自主解决问题。项目产出包括文档改进和部署蓝图,并建立了行业人脉。他认为该计划提供了生产环境、真实失败和架构思考,是超越教程的宝贵学习经历。
本文介绍作者用AI工具制作漫画的完整流程:写短文、用编程AI生成分镜和图片,月费25美元。但真正昂贵的是质检环节,需50美元以上,因为AI生成便宜而验证贵。作者将工作难题(AI验收)搬到漫画领域练习,建立AI质检系统,让生成与验证AI互相纠错,自己只做终审,以此打磨“AI质检AI”的流程。
Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还提供了在线教程链接及triton.language.exp2函数的说明,该函数用于计算逐元素以2为底的指数。
WebMCP是W3C孵化中的浏览器标准,由Chrome和Edge团队推动,让网页将自身功能注册为结构化工具供AI代理调用。它补充了MCP的盲区,管理前端界面。目前Chrome 146+可测试,149+支持Origin Trial,正式支持预计2026年中后期。文章还介绍了开发方式、注册工具示例及作者博客的15个工具应用。
TVM 0.21.0 更新后,本文介绍 Relax 程序转换。通过内置 Pass(如 LegalizeOps)将高层操作符转为低层,再经算子融合优化合并内核。同时展示自定义 Pass,用 Mutator 将 ReLU 替换为 GELU,实现灵活的程序变换。
完成下面两步后,将自动完成登录并继续当前操作。