Google has open-sourced Mantis, an AI-agent framework designed to automate the software vulnerability lifecycle, from identifying and validating vulnerabilities to reproducing and fixing them....
企业AI-Native转型需经历四级演进:先以Token治理和Spec-Driven交付奠定基础,再通过Agent Readable与DDD知识治理提升AI判断力,进而实现含双门检查的Autonomous Pipeline全流程自动化,最终构建Agentic OS系统。转型切忌跳层,需逐步搭建知识与控制面,方能释放AI生产价值。
OmaPilot插件使AI能直接操控Linux内核,基于Omarchy系统实现内核级控制。Omarchy 4.0获1074个插件和1000万美元投资,支持AI代理通过文本接口修改配置。开源工具如OpenCode等也推动AI代理接管开发环境,但存在权限边界和上下文管理问题。
Early experience implementing agentic workflows highlights emerging trade-offs that frontline leaders need to understand.
Deterministic rules safeguard hard metrics, but what about architectural intent? Discover how agentic fitness functions combine AI agents and versioned rubrics to evaluate complex, judgment-heavy...
Meta AI Research has introduced Muse Glimmer, a 30-billion-parameter open-weight model under the Apache 2.0 license, designed for local workflows. It enables autonomous agents and complex task...
Agentic Coding将AI编程从被动补全转向主动规划-执行-验证循环,SWE-bench成绩三年内从不足6%跃升至50%-70%+。核心包括规划器、执行引擎和验证器,实现多文件修改与自我修正。主流框架有Claude Code、Cursor、OpenHands和Aider,各有适用场景。但存在幻觉、回归错误和安全风险,需谨慎使用。
At their core, AI transformations are a reinvention of how work gets done. This requires change leadership, not just change management.
Agentic工作流是AI驱动的多步骤任务自动化流程,通过感知、推理、行动和学习循环,自主规划并执行复杂目标。它比传统自动化更灵活,能适应变化,但面临治理、成本和安全挑战。应用涵盖客户服务、欺诈调查和供应链优化,需结合人类监督以确保可靠性。
阿里Qwen3.8-Max在Artificial Analysis智能体能力排行榜中以55.4分超越Claude Opus5和GPT5.6,位列全球第一。该能力代表AI调用工具解决复杂问题的潜力,此前冠军多由Claude、GPT垄断,中国模型最佳成绩为Kimi K3的50.1分。
GitHub推出Agentic Workflows公开预览,允许在GitHub Actions中运行AI代理处理重复性任务,如问题分类。它通过Markdown文件定义工作流,编译为YAML,支持Copilot、Claude等引擎。安全模型为核心,采用只读令牌、零密钥、沙箱和受限输出。用户可编写或导入现成工作流,但调试和成本可见性仍待改进。
Organizations that create the most effective agentic HR functions don’t just scale pilots. They define the human–agent operating model for the function first, then work backward to implementation.
Arun Joseph shares real-world insights on scaling enterprise agentic platforms like Deutsche Telekom’s LMOS. He discusses bridging organizational fault lines, replacing tool sprawl with core...
ThinkingAI旗下Agentic Engine平台正推进生产落地,构建“可验证的增长闭环”,连接数据准备、目标识别、策略执行等环节。平台支持私有化部署,兼容Cursor等工具,整合内外部数据,让企业保留数据资产并供Agent调用。
Agentic RAG通过自我反思、自适应路由和多跳推理,将复杂问答的幻觉率降低30%-50%,但延迟增加2-4倍、Token消耗增加1.5-3倍。文章解析了Self-RAG、CRAG等五篇关键论文,提出四阶段迁移路径,并指出其适用边界:仅当存在大量多跳查询时才值得投入,简单场景传统RAG更优。
本文介绍如何利用Amazon Bedrock Claude与开源设备自动化框架构建Agentic游戏QA测试系统。该系统通过智能层(Claude规划决策)、辅助模型层(AutoGLM、SAM3识别UI元素)和执行层(Appium等控制设备)三层架构,将自然语言测试描述转化为自动执行步骤,大幅缩短黑盒测试时间,加快游戏发布周期,提升测试覆盖率与效率。
蚂蚁集团inclusionAI团队发布千亿参数MoE扩散模型LLaDA2.2,首次将扩散模型应用于长程Agent任务。该模型支持128K上下文,通过Levenshtein编辑、强化学习L-EBPO和BlockRouting机制,实现自我修正、环境反馈处理及高效推理。在七大基准上接近顶尖自回归模型,吞吐量达1.64倍,预示扩散与自回归模型将双轨并行。
UCLA、MIT和UCSD团队提出Agentic Real2Sim框架,利用视觉语言代理自动将真实物体-机器人交互转换为可仿真环境,无需人工干预。该框架通过视觉重建、物理参数推断等步骤,处理刚性、可变形物体及人形运动场景,使用开源VLM后端降低成本,提升机器人策略学习的可扩展性和效率。
无问芯穹作为AI Infra公司,与Kimi、智谱、MiniMax、阶跃星辰等头部模型厂商合作。通过准入测试保障模型精度,采用跨集群异构PD分离技术降低成本37.5%,智能体系统提升运维效率,并构建“前店后厂一中心”战略,覆盖算力调度、Token工厂及行业应用,旨在成为大模型时代的基础设施共同选择。
完成下面两步后,将自动完成登录并继续当前操作。