内容提要
多模型网关路由中,标准回归评估模型质量存在混淆偏差,因路由规则与查询难度相关。本文介绍用工具变量法(IV)解决:以速率限制回退为工具,通过两阶段最小二乘法(2SLS)估计因果效应,并检查工具强度、理解局部平均处理效应(LATE),用自助法计算置信区间,避免误导性结论。
延伸解读
为什么标准回归会误导路由决策
在多模型网关中,路由规则通常基于查询的置信度或复杂度,这些因素本身也影响任务完成率。因此,简单回归将模型质量与查询难度混在一起,导致估计偏差。本文的模拟显示,OLS估计为+3.3个百分点,而真实因果效应为+6个百分点,偏差达2.7个百分点。这种偏差在标准回归诊断中不可见,容易让团队基于错误结论做出全量路由到高端模型的决策。
工具变量的适用条件与局限
工具变量法依赖四个关键假设:相关性、排他性、独立性和单调性。其中排他性和独立性无法从数据直接验证,需要基于系统逻辑论证。例如,速率限制回退必须仅通过改变路由影响结果,且与查询特征无关。若回退事件在高流量时段聚集,或用户因回退而放弃任务,则排他性可能被违反。此外,工具变量估计的是局部平均处理效应(LATE),仅适用于受工具影响的子群体,若该群体不具代表性,则不能推广到整体。
何时应优先选择A/B测试而非工具变量
工具变量法适用于无法进行随机化实验的场景,如路由规则已固化或历史数据不可改变。但如果系统支持强制路由随机化(如随机分配一部分查询到高端模型),则标准A/B测试更简单,且能直接估计全量平均处理效应(ATE)。工具变量法在估计精度上付出代价(置信区间更宽),且依赖难以验证的假设。因此,在可行时优先选择随机实验,工具变量作为备选方案。
Q&A
为什么标准回归评估多模型网关中的模型质量会有偏差?
因为路由规则与查询难度相关,复杂查询更可能被路由到高级模型,而查询难度本身也影响任务完成率。标准回归将模型质量的因果效应与查询难度的固有差异混在一起,导致估计偏差。
什么是工具变量?在本文中如何利用速率限制回退作为工具变量?
工具变量是一个影响内生变量(路由决策)但不直接影响结果(任务完成)的变量。本文中,速率限制回退作为工具变量,因为当高级模型达到速率限制时,网关会将查询路由到更便宜的模型,这与查询特征无关,提供了外生变异。
两阶段最小二乘法(2SLS)是如何消除混淆偏差的?
2SLS 分两步:第一阶段用工具变量和协变量预测路由决策,得到拟合值;第二阶段用拟合值预测结果。这样只利用工具变量带来的外生变异,剔除与未观测混淆因素相关的内生变异,从而得到因果效应。
如何检查工具变量的强度?F统计量的阈值是多少?
通过第一阶段回归的F统计量检查工具强度。通常F>10表示工具强(Staiger-Stock规则),F在4到10之间为边界弱,F<4为弱工具。本文中F=3780,表明工具很强。
什么是局部平均处理效应(LATE)?它与平均处理效应(ATE)有何区别?
LATE是工具变量影响的子群体(即因工具而改变路由的查询)的平均因果效应。ATE是所有查询的平均效应。当工具影响的子群体与总体在可观测特征上相似时,LATE可近似ATE,但若存在异质性效应,两者可能不同。
为什么手动2SLS的标准误偏小?如何获得正确的置信区间?
手动2SLS第二阶段将第一阶段预测值视为已知,忽略了第一阶段估计误差,导致标准误偏小。解决方法是用自助法(bootstrap)重采样整个两阶段过程,或使用linearmodels库计算正确的方差。
工具变量法在什么情况下会失效?
工具变量法失效的情况包括:弱工具(F<10)、排除性限制违反(工具直接影响结果)、LATE与ATE混淆(工具影响的子群体不具代表性)、单调性违反(存在违抗者)。其中排除性和独立性假设无法从数据检验,需逻辑论证。
在什么情况下应该使用工具变量法而不是A/B测试?
当无法进行随机化实验时,如路由规则已固化、不能故意路由到次优模型、或只能使用历史观测数据时,应使用工具变量法。如果系统支持强制随机路由,则A/B测试更简单且能估计全量ATE。