内容提要
文章以对话形式探讨指标问题:作者承认混淆了测量误差与统计差异,二者实为并列关系。讨论设置门槛与排序的公平性,指出指标由谁定、定多少难以回答。并以数据拟合类比:为求稳定规律需剔除误差过大的数据,但会牺牲信息,且受算力与过拟合限制;未来算力提升或可纳入更多数据。
延伸解读
测量误差与统计差异:并列而非递进
作者在对话中承认,自己此前将测量误差与统计差异混为一谈。文章指出,在指标讨论中,二者是并列关系,而非递进关系。这一澄清有助于读者理解:测量误差关注单次观测的偏差,统计差异则涉及群体分布的比较,两者在指标设定中各有作用,不能简单归为同一层次的问题。
门槛与排序:公平性难题
文章用“公共办公楼只修一个门”的比喻,说明资源有限时必然面临进入顺序问题。设置门槛的目的是防止无序进入并让符合条件者按序通过,但谁来决定顺序、指标由谁定、定多少,文章坦言难以回答。这提示读者,指标制定不仅是技术问题,更涉及公平与权力分配。
数据拟合的取舍:稳定与信息的权衡
作者以数据拟合类比指标筛选:为获得稳定且能解释大部分数据的规律,需剔除误差过大的数据,但这会牺牲信息。若纳入所有异常点,则需更多参数、更大算力,且易过拟合,导致公式只能解释当前观测而无法预测未来。文章认为,随着算力提升,未来或可囊括更多数据,拟合更完美的公式。
Q&A
测量误差和统计差异是什么关系?
在指标讨论中,测量误差和统计差异是并列关系,没有递进关系。作者承认之前将二者混为一谈是错误的。
为什么设置门槛和排序对指标公平性很重要?
设置门槛是为了防止想乱进的人进,并让能进的按顺序进。但门一次只能进少数人,如何公平排序就成了问题,这引出了指标由谁定、定多少的难题。
指标由谁定、定多少为什么难以回答?
文章指出,指标由谁定、定多少是一个很难回答的问题,作者表示自己答不了,只能尝试用数据误差反演误差来类比。
为什么在数据拟合中要剔除误差过大的数据?
剔除误差过大的数据是为了获得稳定的、可以解释大部分数据的关系(规律或公式)。但这样做会牺牲信息,因为异常点也能提供很多信息。
剔除数据后得到的公式有什么局限性?
公式基于筛选后的数据,只能解释选中的数据,对未来观测的指示和参考意义有限。而且拟合所有异常点需要更多参数和更大计算量,还存在过拟合风险,预测时可能失效。
未来算力提升对数据拟合有什么影响?
随着算力提升,也许可以囊括更多的数据,拟合出更完美的公式。