这是企业在选型阶段问得最多的一个问题,也是最容易被含糊带过的一个。很多方案书上写着”预测准确率显著提升”「准确率提升 30%」——从多少提到多少?什么口径?什么颗粒度?这三件事不说清楚,任何数字都无法验证。
这篇文章想把话说明白:合格线在哪里,我们自己的项目做到了什么水平,以及为什么能做到。
先说口径:不注明口径的准确率没有意义
谈准确率必须同时说清两件事,否则数字之间没有可比性。
第一是统计口径。我们采用 1-WAPE(加权绝对百分比误差的补数),这是需求计划领域最常用、也最不容易注水的口径之一。它对大销量商品的偏差更敏感,不会因为一堆低销量 SKU 碰巧预测得准,就把整体数字拉上去。
第二是颗粒度。准确率随颗粒度变粗而升高,这是数学规律,不是能力差异:
- 「总量 + 月」的准确率,天然比「SKU + 渠道 + 月」高十几个点
- 「月」的准确率天然比「周」高
- 所以只报一个数字、不说颗粒度的,基本可以不用看
合格线在哪里
以消费品行业、「SKU + 渠道 + 月」维度、1-WAPE 口径为基准:
- 70% 是可用门槛。低于这个水平,业务不会真正拿它去驱动采购和补货,系统最终会沦为一个昂贵的报表工具
- 80% 以上属于较好水平,可以支撑自动补货和产销协同
- 85% 左右是目前比较扎实的落地水平,我们已上线项目基本在这条线上
还有一个常被忽略的指标:稳定性。一个在 60% 和 90% 之间来回跳的模型,即便平均值好看,业务也不敢用——计划部门要的是一个可以据此排产、据此备货的可信基线,而不是某个月的高分。
三个已上线项目的实际水平
快消品细分行业龙头
年营收近 20 亿,ToB 与 ToC 渠道合计二十多个。上线前的核心问题不是”算不准”,而是根本没有专业的需求管理职能——预测靠销售提报、提报靠经验,渠道间库存严重不均衡,有的缺货、有的积压。
立项目标是整体准确率 70% 以上,实际达成约 85%,全 SKU 全渠道覆盖,且波动收敛在一个较窄的区间内。业务侧的直接结果是缺货率降到 3% 以内,采购与补货计划由系统自动生成。
全球头部消费品品牌
采用「先预测终端动销、再倒推发货计划」的两段式结构,整体准确率同样在 85% 左右。
这个项目里有一件事值得单独说:不同渠道的可预测性差异很大。线下渠道能稳定做到 85% 以上,而电商和餐饮娱乐渠道要低出十几到二十个点——前者受大促、直播、平台流量分配影响,后者受门店开关和天气影响,销售序列本身就更接近随机。
我们会把这个差异明确告诉客户,而不是只报一个混在一起的平均值。因为知道哪些渠道能到 85%、哪些只能到 65%,计划部门才能决定哪些渠道可以让系统直接驱动补货,哪些必须保留人工干预和更厚的安全库存。
国内饮料行业头部品牌
这个项目把销售预测、供应链管理、高阶排程三个平台整合到统一的算法平台和数据底座上,要解决的不只是”算得准”,还有需求与供应的节拍协同。
准确率是三个项目里最高的:分销预测 88%,总量口径 96%。业务收益是计划缺口率下降 10%,终端可按时提货,而且计划频次提升之后物流成本保持不变——这一条其实比准确率更难做到。
准确率不是目的
准确率本身不产生价值,它是降低安全库存、减少缺货、缩短周转的手段。从我们的项目看,准确率提升之后的典型业务结果是:缺货率降到个位数甚至千分位、期末库存量最高下降六成、库存周转天数下降两成以上、需求满足率接近 99%。
所以评估一个预测项目,不能只看准确率这一个数字。准确率提高了但库存没降下来,说明补货策略没有跟着调整;缺货率降了但库存涨了,那只是用库存换服务水平,算不上优化。
为什么能做到:MoE 混合专家架构
传统做法是选一个模型跑全部 SKU,或者让计划员手工为不同商品挑模型。前者必然在某些形态上失准,后者依赖人的经验、也无法规模化。
我们的预测大模型采用 MoE(Mixture of Experts,混合专家)架构,核心是四步:
- 数据清洗——促销还原、缺货填补、大单过滤,先把历史序列还原成”没有异常干扰时本该是什么样”
- 形态分类——按销售特征自动分为新品、稀疏、间歇、趋势、下降、平稳六类,判断平稳性、间歇性、季节性、价格弹性等
- 模型选择——不同形态进不同的专家池。稀疏和间歇品走 Croston、Holt 一类;平稳和趋势品走机器学习集成模型
- 择优与回退——用回测在候选模型之间比较,选不出可信结果时回退到保守模型,而不是硬给一个数
第四步的回退机制很关键。新品、极稀疏商品这类本来就缺乏可学习信号的场景,任何模型都给不出可靠预测。这时候诚实地回退到保守估计,比强行输出一个漂亮但不可信的数字更负责任。
算法白盒化:比准确率更重要的一件事
一个业务不敢用的预测系统,准确率再高也没有价值。所以系统把预测结果结构化拆解为基线值、季节性、节假日、营促销、人工调整五个部分,并把模型的选择过程可视化——计划员能看到系统为这个 SKU 选了哪个模型、为什么选它、回测准确率是多少。
这是我们在多个项目里反复验证过的:可解释性决定了系统能不能真正被业务采纳。黑盒模型给出的数字,计划员宁可用自己的经验覆盖掉,最后系统就白上了。
常见问题
SKU 级别的月度预测准确率,多少算合格?
消费品行业「SKU + 渠道 + 月」维度、1-WAPE 口径下,70% 是可用门槛,80% 以上属于较好水平,85% 左右是比较扎实的落地水平。低于 70% 时,业务通常不会真正依赖系统输出去做决策。
为什么不同项目的准确率差距这么大?
主要取决于三件事:颗粒度(SKU + 渠道 + 周 比 总量 + 月 难得多)、渠道特性(电商和餐饮的销售序列更接近随机)、以及 SKU 复杂度(几千个活跃 SKU 跨几十个基地,和一千个 SKU 单一工厂,完全不是一个难度)。
新品没有历史数据,怎么预测?
两条路径:一是迭代品关系,把被迭代商品的历史销售数据结构化关联过来,保证历史序列完整;二是相似品爬坡,关联相似商品并对其爬坡曲线建模。都不适用时,系统会回退到保守估计并标注置信度低,而不是硬给一个数字。
准确率提升了,业务上能拿到什么?
典型结果是缺货率显著下降、安全库存和期末库存下降、库存周转天数缩短、需求满足率提升。但这些收益不会自动发生——准确率提升之后,补货策略和安全库存参数必须跟着调整,否则只是把一个更准的数字放在那里而已。
写在最后
回到最初的问题:多少算合格?在明确口径和颗粒度的前提下,70% 是及格线,85% 是可以对标的水平。但更重要的是问清楚对方三件事——什么口径、什么颗粒度、稳定性如何。这三个问题问下去,大部分模糊的承诺就站不住了。
如果你正在评估销售预测系统,最直接的办法是拿自己的历史数据做一次离线回测。这是我们 MVP 阶段的标准动作——用你的真实数据跑出准确率,而不是让你看别人的案例。