全部文章
niche datastrategy

利基数据:小数据集什么时候能胜过大数据集

一台笔记本电脑展示着带有图表、地图和指标的分析仪表盘

一个规模不大、但一直保持新鲜的数据集,可以胜过一个庞大而通用的数据集;它同样可能让你付出远超回报的成本。区别不在行数,而在于你的数据变错的速度,以及是否真的有人依据它采取行动。

下面这套方法,能让你在投入一个季度之前就分清这两种情况。

一句话要点

  • 拥有数据本身不是护城河。以别人懒得维持的频率把它保持最新,才更接近护城河。
  • 决定一切的数字是:你的数据每年有多大比例变错。买任何东西之前先测出它。
  • 没有人据以行动的数据就是成本,不管质量多好。
  • 当数据集边界清晰、内容最新、并且对应本周有人要做的某个决定时,小才会赢。
  • 什么都不做是一个真实选项,在某个业务量以下,它同时胜过自建和采购。

先看反方证据

「我们的私有数据就是护城河」这个说法比听上去脆弱,而且怀疑者手里的证据更硬。

Andreessen Horowitz 研究过数据网络效应,发现多数其实只是规模效应,而规模效应会趋于平缓。在他们的客服机器人案例里,采集到大约 40% 的问题之后,再多的数据也不再带来任何优势(The Empty Promise of Data Moats)。

更大、更专用也不会自动获胜。BloombergGPT 用 3630 亿词的私有金融文本训练,通用模型仍在它专门针对的金融基准上胜出。IBM 花了数年、约 40 亿美元为 Watson Health 收集健康数据,最后把这些资产卖掉了。Zillow 在该业务板块单季亏损 4.22 亿美元后关掉了买房业务。

证据说明了什么证据没有解决什么
数据很少是稀缺或无法复制的你自己的第一方记录是否有替代品
数据越多,边际帮助越小价值在于新鲜度而非体量的数据集
通用模型在很多任务上胜过专用模型结构化查询,数据本身就是答案的场景

这些研究几乎都关于大模型训练。你多半不训练任何东西,而是把几千行数据喂给一个智能体,这是另一种情形,而且缺乏可靠测量。这一点对双方都成立:反对你的论据比看上去弱,支持你的论据同样弱。

唯一决定一切的数字

问自己:一年之内你的数据有多大比例会变错。价格会动,人会换工作,商品会下架,规则会修改。

要测量,不要猜。抽一批记录,几周后拿可信来源重新核对,数一数有多少变了。这一个数字同时告诉你三件事:多久刷新一次、刷新要花多少钱,以及别人偷走你的文件后还能用多久。

每年变错的比例大约多久刷新一次被偷走的副本还能用
5%12 个月超过 13 年
10%6 个月约 6 年
30%8 周不到 2 年
60%3 周约 9 个月

请仔细读最后一列,多数人在这里理解反了。变化慢的数据维护便宜,也极易被复制。变化快的数据维护昂贵,却很难被复制。「找维护成本低的数据」和「找有防御力的数据」是相反的指令,而多数团队同时收到这两条。

关于这张表还有一个诚实的提醒:这些节奏假设数据均匀老化。网络来源在第一年衰减最快,所以对你无法控制的来源,要比表里更早刷新。

一个 Trinyx 表格,装着一小份细分数据集:六个被跟踪的竞品 SKU,每行包含 sku、价格、标题、货币和最后一次观察的时间戳。

合格的细分数据集小到可以逐行阅读:六个被跟踪的产品,各一个价格,外加一个能让你测量陈旧速度的时间戳。

投入前的五个问题

一周内就能跑完。如果某个来源卡在第 2 或第 4 题,到此为止。

问题怎么测通过线
1. 你能列全吗?用两条不同路径各采集一次,看重叠多少你能说清缺了什么
2. 你能验证一条记录对不对吗?说出用于对照的独立来源,并给十条记录计时每条不到十分钟
3. 刷新成本负担得起吗?变化率乘以单条核对成本,对比该决策一年的价值低于其带来价值的 15%
4. 真的有人据此行动吗?说出决策、决策者,以及数据多久会改变结论一次至少每 50 次改变一次决策
5. 竞争对手能重建吗?用熟练工的工作日估算复制成本数月,而不是数天

第 4 题淘汰掉大多数候选,也正是最常被跳过的一题。一份从不改变任何人决策的数据集不是资产,而是一笔订阅费。

自建、采购,还是什么都不做

多数比较只在自建与采购之间选,忘了第三个选项。什么都不做具有真实价值:你照旧决策,成本为零。

自建是否划算取决于业务量。举一个示例:4000 行数据,约 3 万美元建设,每年约 1.1 万美元维护,每个被改进的决策价值 60 美元。这些是工作假设而非测量值,但由此得出的形状才是有用的部分。

每年决策次数更好的选择
少于约 900什么都不做
约 900 到 1300若对自己的数字有把握,就自建
多于约 1300自建

任何一个输入变动,交叉点都会随之移动。要点不是这个具体数字,而是低频决策几乎永远收不回一个数据集的成本,无论它多好。

采购在一种情况下胜出:供应商在你这个细分领域的准确度接近你自己能做到的水平。签约前先验证。取他们在你细分领域内的 200 条记录,自己核对一遍。

细分数据真正取胜的地方

有四种情形能扛住上面所有反驳。

  • 你记录的是只有你会做的决定。 结果这一列无法被抓取,只能一次次决策地挣来。
  • 你观察到别人无法拼接的事件。 别人也许看得到事件本身,但只有你把它和你的上下文、你的结果连在一起。
  • 数据变化快,而你把它当作持续成本。 移动的靶子偷不走一次就完,对手必须长期资助同一套刷新流程。
  • 数据集小到可以完整核验。 几千行时一切可查;几十万行时没人愿意付这笔账。

不成立的情形:已有供应商把它当产品卖、数据几乎不变且公开、决策量太低,或者任务本质是推理而不是查询。

常见问题

我到底需要多少数据?

比你想的行数更少,比你想的新鲜度更高。一百行最新且经过核验的数据,只有在恰好覆盖你要做的那个决定时,才会胜过一百万行过期数据。覆盖决策比行数更重要。

采购数据集有对的时候吗?

有。当供应商在你的细分领域接近你自己的准确度、而你的决策量处在中间区间时。把谁都能复制的部分买下来,只自建别人做不出来的那一列。

怎样防止数据集悄悄过期?

给每一行加上最后核对时间,并优先刷新最旧的行。随机刷新无论花多少钱,总会留下一条很旧的长尾,而那正是会让你出丑的部分。

最常见的错误是什么?

先采集,再去找决策。如果你说不出谁依据这些数据行动、以及多久一次,那么答案就不是「更多数据」。

下一步

给它一周时间。测出数据变错的速度,跑完这五个问题,并确认真的有人因此改变了某个决定。如果这份来源合格,下一步就是把它接进一个能自己跑起来的流程:从数据集到自己运行的工作流

把你的利基数据变成一个能用的自动化

在聊天里描述这份任务,Trinyx 就在你眼前构建出工作流。

免费开始