利基数据:小数据集什么时候能胜过大数据集

一个规模不大、但一直保持新鲜的数据集,可以胜过一个庞大而通用的数据集;它同样可能让你付出远超回报的成本。区别不在行数,而在于你的数据变错的速度,以及是否真的有人依据它采取行动。
下面这套方法,能让你在投入一个季度之前就分清这两种情况。
一句话要点
- 拥有数据本身不是护城河。以别人懒得维持的频率把它保持最新,才更接近护城河。
- 决定一切的数字是:你的数据每年有多大比例变错。买任何东西之前先测出它。
- 没有人据以行动的数据就是成本,不管质量多好。
- 当数据集边界清晰、内容最新、并且对应本周有人要做的某个决定时,小才会赢。
- 什么都不做是一个真实选项,在某个业务量以下,它同时胜过自建和采购。
先看反方证据
「我们的私有数据就是护城河」这个说法比听上去脆弱,而且怀疑者手里的证据更硬。
Andreessen Horowitz 研究过数据网络效应,发现多数其实只是规模效应,而规模效应会趋于平缓。在他们的客服机器人案例里,采集到大约 40% 的问题之后,再多的数据也不再带来任何优势(The Empty Promise of Data Moats)。
更大、更专用也不会自动获胜。BloombergGPT 用 3630 亿词的私有金融文本训练,通用模型仍在它专门针对的金融基准上胜出。IBM 花了数年、约 40 亿美元为 Watson Health 收集健康数据,最后把这些资产卖掉了。Zillow 在该业务板块单季亏损 4.22 亿美元后关掉了买房业务。
| 证据说明了什么 | 证据没有解决什么 |
|---|---|
| 数据很少是稀缺或无法复制的 | 你自己的第一方记录是否有替代品 |
| 数据越多,边际帮助越小 | 价值在于新鲜度而非体量的数据集 |
| 通用模型在很多任务上胜过专用模型 | 结构化查询,数据本身就是答案的场景 |
这些研究几乎都关于大模型训练。你多半不训练任何东西,而是把几千行数据喂给一个智能体,这是另一种情形,而且缺乏可靠测量。这一点对双方都成立:反对你的论据比看上去弱,支持你的论据同样弱。
唯一决定一切的数字
问自己:一年之内你的数据有多大比例会变错。价格会动,人会换工作,商品会下架,规则会修改。
要测量,不要猜。抽一批记录,几周后拿可信来源重新核对,数一数有多少变了。这一个数字同时告诉你三件事:多久刷新一次、刷新要花多少钱,以及别人偷走你的文件后还能用多久。
| 每年变错的比例 | 大约多久刷新一次 | 被偷走的副本还能用 |
|---|---|---|
| 5% | 12 个月 | 超过 13 年 |
| 10% | 6 个月 | 约 6 年 |
| 30% | 8 周 | 不到 2 年 |
| 60% | 3 周 | 约 9 个月 |
请仔细读最后一列,多数人在这里理解反了。变化慢的数据维护便宜,也极易被复制。变化快的数据维护昂贵,却很难被复制。「找维护成本低的数据」和「找有防御力的数据」是相反的指令,而多数团队同时收到这两条。
关于这张表还有一个诚实的提醒:这些节奏假设数据均匀老化。网络来源在第一年衰减最快,所以对你无法控制的来源,要比表里更早刷新。

合格的细分数据集小到可以逐行阅读:六个被跟踪的产品,各一个价格,外加一个能让你测量陈旧速度的时间戳。
投入前的五个问题
一周内就能跑完。如果某个来源卡在第 2 或第 4 题,到此为止。
| 问题 | 怎么测 | 通过线 |
|---|---|---|
| 1. 你能列全吗? | 用两条不同路径各采集一次,看重叠多少 | 你能说清缺了什么 |
| 2. 你能验证一条记录对不对吗? | 说出用于对照的独立来源,并给十条记录计时 | 每条不到十分钟 |
| 3. 刷新成本负担得起吗? | 变化率乘以单条核对成本,对比该决策一年的价值 | 低于其带来价值的 15% |
| 4. 真的有人据此行动吗? | 说出决策、决策者,以及数据多久会改变结论一次 | 至少每 50 次改变一次决策 |
| 5. 竞争对手能重建吗? | 用熟练工的工作日估算复制成本 | 数月,而不是数天 |
第 4 题淘汰掉大多数候选,也正是最常被跳过的一题。一份从不改变任何人决策的数据集不是资产,而是一笔订阅费。
自建、采购,还是什么都不做
多数比较只在自建与采购之间选,忘了第三个选项。什么都不做具有真实价值:你照旧决策,成本为零。
自建是否划算取决于业务量。举一个示例:4000 行数据,约 3 万美元建设,每年约 1.1 万美元维护,每个被改进的决策价值 60 美元。这些是工作假设而非测量值,但由此得出的形状才是有用的部分。
| 每年决策次数 | 更好的选择 |
|---|---|
| 少于约 900 | 什么都不做 |
| 约 900 到 1300 | 若对自己的数字有把握,就自建 |
| 多于约 1300 | 自建 |
任何一个输入变动,交叉点都会随之移动。要点不是这个具体数字,而是低频决策几乎永远收不回一个数据集的成本,无论它多好。
采购在一种情况下胜出:供应商在你这个细分领域的准确度接近你自己能做到的水平。签约前先验证。取他们在你细分领域内的 200 条记录,自己核对一遍。
细分数据真正取胜的地方
有四种情形能扛住上面所有反驳。
- 你记录的是只有你会做的决定。 结果这一列无法被抓取,只能一次次决策地挣来。
- 你观察到别人无法拼接的事件。 别人也许看得到事件本身,但只有你把它和你的上下文、你的结果连在一起。
- 数据变化快,而你把它当作持续成本。 移动的靶子偷不走一次就完,对手必须长期资助同一套刷新流程。
- 数据集小到可以完整核验。 几千行时一切可查;几十万行时没人愿意付这笔账。
不成立的情形:已有供应商把它当产品卖、数据几乎不变且公开、决策量太低,或者任务本质是推理而不是查询。
常见问题
我到底需要多少数据?
比你想的行数更少,比你想的新鲜度更高。一百行最新且经过核验的数据,只有在恰好覆盖你要做的那个决定时,才会胜过一百万行过期数据。覆盖决策比行数更重要。
采购数据集有对的时候吗?
有。当供应商在你的细分领域接近你自己的准确度、而你的决策量处在中间区间时。把谁都能复制的部分买下来,只自建别人做不出来的那一列。
怎样防止数据集悄悄过期?
给每一行加上最后核对时间,并优先刷新最旧的行。随机刷新无论花多少钱,总会留下一条很旧的长尾,而那正是会让你出丑的部分。
最常见的错误是什么?
先采集,再去找决策。如果你说不出谁依据这些数据行动、以及多久一次,那么答案就不是「更多数据」。
下一步
给它一周时间。测出数据变错的速度,跑完这五个问题,并确认真的有人因此改变了某个决定。如果这份来源合格,下一步就是把它接进一个能自己跑起来的流程:从数据集到自己运行的工作流。