用一个任务的结果去判断两种类型的优劣,样本太少。使用代理IP时,任务本身的难度、时段、目标站点的差异都会影响结果。使用代理IP时把样本扩大,让不同类型的任务都有代表,比较才有说服力,结论也才敢往外推。
样本要覆盖什么
覆盖任务类型、时段与外部条件三类差异。使用代理IP时,只在一种任务上比较,结论最多适用于那一种任务。使用代理IP时把差异摊开,观察到的规律才站得住,也才敢往别的任务上推,样本不足的地方也一眼能看出来。
一个样本说明不了规律,只能说明一次经历。
样本要有差异,而不是要有数量。使用代理IP时,十个同质任务不如五个差异明显的任务有信息量。使用代理IP时按差异去挑样本,比按数量堆样本更有效,也更快看出分界,样本的价值也就出来了。
个案要不要讲
要讲,但要标注它是个案。使用代理IP时,典型案例很有说服力,也容易被当成普遍规律。使用代理IP时把个案的边界说清楚,既是提醒听众,也是提醒自己不要推得太远。
样本之外还要看什么
还要看样本之外的极端情形。使用代理IP时,常态样本看不出上限在哪里,少数极端情况反而更决定方案的成败。使用代理IP时把极端情形单独挑出来看,比较才称得上完整。
样本太少,结论就软。
样本变了对结论要重估。使用代理IP时,业务结构调整之后,原先的样本构成已经不同。使用代理IP时重新抽一轮样本,结论才不至于建立在过期数据之上,选择也更有依据,也省得日后再翻案。
