内容提要
IBM发布Granite 4.2系列开源大语言模型,参数规模3B、8B、30B,采用全注意力密集Transformer架构,支持推理与非推理模式。模型预训练于15万亿token,上下文窗口达512K,8B和30B版本经强化学习支持工具调用等智能体任务。虽基准测试表现一般,但IBM强调其在高吞吐智能体工作流中的高效与成本优势。
延伸解读
架构选择:密集Transformer的回归
IBM在Granite 4.2中坚持全注意力密集Transformer架构,放弃了此前尝试的混合Mamba/注意力或MoE设计。IBM认为这种更简单的架构在微调下游任务时更灵活。与Nvidia Nemotron 3等采用混合架构的竞品相比,Granite 4.2的选择体现了对部署便利性和可控性的侧重,但这也意味着在长上下文处理上可能不如混合架构高效。
推理模式的可选性
Granite 4.2支持思考和非思考模式,并引入低努力模式,以控制推理token的消耗。IBM此前认为推理模型效率不足,但如今将推理作为可选功能,兼顾了复杂任务的需求和成本控制。企业用户可以根据任务复杂度灵活选择模式,在性能与成本之间取得平衡,这尤其适合对延迟和费用敏感的智能体工作流。
小模型的性价比优势
8B模型在基准测试中接近30B模型的表现,且能在现代Mac和低端RTX GPU上运行,降低了硬件门槛。对于高吞吐量的智能体任务,小模型可能比前沿大模型更具成本效益。IBM强调Granite在真实工作流中的高效与低成本,但需注意其编码能力表现不稳定,基准测试并非全部。
Q&A
IBM Granite 4.2模型有哪些参数规模?
IBM Granite 4.2系列模型提供3B、8B和30B三种参数规模。
Granite 4.2模型采用什么架构?
Granite 4.2模型采用全注意力密集Transformer架构,是decoder-only模型,与一些采用混合Mamba/注意力架构的模型不同。
Granite 4.2模型支持哪些推理模式?
Granite 4.2模型支持思考模式、非思考模式以及低努力模式,低努力模式用于回答简单问题,只消耗少量推理token。
Granite 4.2模型的上下文窗口大小是多少?
Granite 4.2模型的上下文窗口为512K tokens,但发布配置原生支持128K。
Granite 4.2模型在智能体任务方面有什么特点?
8B和30B版本经过额外的智能体强化学习,支持工具调用、编辑和运行代码、终端操作和网页搜索,适合复杂的多步骤智能体工作流。3B模型也支持工具调用,但能力有限。
Granite 4.2模型在基准测试中的表现如何?
Granite 4.2模型在基准测试中表现一般,没有突破性成绩,但8B模型的结果接近30B模型,且易于在普通硬件上运行。相比Qwen 3.8 27B等模型,在编码等任务上表现不一致。
IBM强调Granite 4.2模型的主要优势是什么?
IBM强调Granite 4.2模型在高吞吐量智能体任务中的高效性和成本优势,适合企业构建能够推理、行动和适应实际工作流程的智能体。