销售预测系统的选型有个尴尬之处:每一家供应商都说自己准。
方案书上写着”预测准确率大幅提升””AI 驱动的智能预测引擎””行业领先的算法能力”——这些话听起来都对,但没有一句能拿来对比。等到系统上线才发现不合用,代价就是一整年的项目周期。
下面这七个问题,是我们在客户项目里反复见到、而且能真正把供应商区分开的。作为一家做这门生意的公司,我们把它写出来,是因为经得起这些问题的方案本来就不多,含糊其辞对谁都没好处。
问题一:准确率是什么口径、什么颗粒度?
这是最该先问、也最容易被绕过的问题。同一套预测结果,换个口径、换个颗粒度,数字可以差二三十个百分点。
- 统计口径是什么?1-WAPE、MAPE 还是别的?不同口径对大销量商品的敏感度完全不同
- 颗粒度是什么?「总量 + 月」天然比「SKU + 渠道 + 月」高十几个点,这是数学规律不是能力差异
- 稳定性如何?平均 80% 但在 60% 和 95% 之间跳,和稳定在 78%~82%,是两个完全不同的东西。计划部门要的是可以据此排产的基线
关于合格线在哪里、不同颗粒度下什么水平算正常,我们在另一篇文章里写得更细。
问题二:能不能用我们自己的数据先做一次回测?
这可能是整个选型过程中最有区分度的一个要求。
别人的案例再漂亮,也说明不了在你的数据上能跑成什么样。你的 SKU 结构、渠道构成、促销频率、数据质量,都和案例企业不同。唯一能回答”在我们这儿能做到多少”的方式,就是拿你自己的历史数据跑一次离线回测——用前面几年的数据训练,预测后面一段时间,再和实际发生的销量对比。
愿意做这件事的供应商,说明对自己的算法有底气;找各种理由推脱的,通常心里没数。这也是我们把 MVP 阶段前置的原因——在签合同之前先用真实数据把”算法能不能行”这个问题回答掉。
问题三:所有商品用同一个模型,还是分形态选模型?
这个问题能快速判断对方的技术底子。
企业的商品销售形态差异极大:有平稳走量的老品,有断断续续出货的间歇品,有刚上市没几个月的新品,有一年只在旺季卖的季节品。用一个模型跑全部 SKU,必然在某些形态上失准。
合理的做法是先对销售序列做形态分类,不同形态进不同的模型池——间歇和稀疏品适合 Croston 一类,平稳和趋势品适合机器学习集成模型,再通过回测在候选模型之间择优。我们的预测大模型采用 MoE(混合专家)架构,核心就是这个思路。
可以直接问:「你们对我们的 SKU 会怎么分类?不同类别分别用什么模型?」答不上来的,多半就是一个模型跑到底。
问题四:算法能不能解释?
一个业务不敢用的预测系统,准确率再高也没有价值。
计划员拿到一个数字,第一反应是”凭什么”。如果系统答不上来,他就会用自己的经验去覆盖,最后系统沦为一个昂贵的报表工具——这是我们见过最多的失败方式,比算不准更常见。
该问的是:
- 预测值能不能拆解?比如拆成基线、季节性、节假日、促销影响、人工调整几部分
- 能不能看到系统为这个 SKU 选了哪个模型、为什么选它?
- 历史版本和人工干预记录能不能追溯?
问题五:新品和稀疏商品怎么办?
这是大部分方案答得最含糊的地方,但对快消、美妆这类新品迭代快的行业,它往往是最要紧的场景。
新品没有历史数据,任何模型都学不到东西。可行的路径无非两条:把被迭代商品的历史数据结构化关联过来,或者关联相似品并对爬坡曲线建模。
更值得关注的是都不适用时会怎样。负责任的做法是回退到保守估计并明确标注置信度低,而不是硬给一个看起来很精确的数字。如果供应商说”新品我们也能预测得很准”,这句话本身就值得警惕。
问题六:和现有系统怎么对接?
预测系统不是孤岛,它要从 ERP、OMS、BI 取数,把结果送回采购和补货流程。这部分的工作量经常被低估。
要问清楚:数据怎么进来(接口、中间库还是文件)、要不要改动现有系统(改动越少风险越小)、主数据不一致怎么处理、历史数据脏了怎么办——促销扭曲、缺货截断、大单干扰,这些不清洗干净,再好的模型也白搭。
问题七:多久能看到第一个可验证的结果?
传统实施路径是「需求调研 → 蓝图文档 → 开发 → 测试 → UAT → 上线」,业务方要到 UAT 才第一次真正看到系统。需求偏差在那一刻集中爆发,返工成本也最高。
更合理的问法是:「在签合同之后、开发之前,我们能看到什么?」如果答案是”一份蓝图文档”,风险就比较高。如果能在早期拿到可交互的原型和用你自己数据跑出的回测结论,需求在开发之前就已经收敛了。
另外要问能不能分期交付。预测、协同提报、智能补货、库存仿真是可以拆开的,按业务优先级分批上线,每一批独立产生价值,比憋一个大版本安全得多。
几个危险信号
如果遇到下面这些说法,建议多问两句:
- 不提口径就承诺具体数字。「保证准确率 90%」——什么口径?什么颗粒度?不说清楚,这个数字没有意义
- 不愿意用你的数据做回测。理由通常是”数据准备太麻烦””要先签合同”
- 算法完全黑盒。问模型怎么选,回答是”这是我们的核心机密”
- 所有场景都说能做好。新品能准、电商能准、促销能准——真做过项目的人知道,不同场景的可预测性差异极大
- 只谈算法不谈流程。预测系统最终要嵌进销售提报、产销协同、补货审批的流程里,只讲模型不讲流程的方案,落地时会很痛苦
- 用别人的案例数据当承诺。案例说明能力上限,不说明在你这儿的结果
常见问题
选型时最该先问哪一个问题?
「能不能用我们自己的历史数据先做一次离线回测」。这个问题的区分度最高——它一次性检验了对方的算法底气、数据处理能力和合作诚意,而且结果是可验证的,不依赖任何口头承诺。
供应商说准确率能到 90%,可信吗?
要看口径和颗粒度。「总量 + 月」维度做到 90% 并不难,「SKU + 渠道 + 月」维度 1-WAPE 口径能稳定到 85% 已经是比较扎实的水平。听到任何具体数字,先追问这两件事。
数据质量不好,还能上预测系统吗?
可以,但要把数据治理算进项目范围。促销扭曲、缺货截断、大单干扰这些问题,需要在建模之前用规则识别和还原。如果供应商完全不提数据清洗,说明他们没认真看过你的数据。
应该先上预测,还是先上补货?
通常先预测。补货计算依赖需求预测作为输入,预测不准的情况下做自动补货,只会把错误放大。合理的顺序是预测先跑稳、准确率经过复盘验证,再把补货和库存策略接上去。
写在最后
这七个问题里,前两个是筛子——口径说不清楚、不肯做回测的,基本可以不用往下谈了。后面五个用来判断这家供应商到底做过多少真实项目:做过的人会主动告诉你哪些场景做不好,没做过的人会说什么都能做好。
如果你正在做选型,欢迎拿这份清单来问我们,也欢迎拿去问别家。能经得起追问的方案,才值得投入一整年的项目周期。