企业部署大模型时常问“该选哪个最强模型”,NVIDIA自己的供应链案例却给出另一个答案:一个针对业务决策训练的30B模型,在内部开发基准上明显超过更大的通用模型。差距不一定来自参数,而来自企业终于把专家当时看见什么、为什么这样选、结果如何,变成了可训练的数据。
发生了什么
NVIDIA在9月10日发布与Palantir合作的供应链技术案例。其硬件系统涉及大量零部件、供应商和制造地点,团队每周需要决定把稀缺材料分配到哪里,以缩短从零件到可用算力的时间。
量化部分由NVIDIA cuOpt处理,把问题表示成混合整数线性规划,考虑制造能力、物料依赖、到货时间和客户承诺。但历史回测显示,人类规划专家经常优于纯数学模型,因为他们还知道邮件沟通、天气、地缘事件和供应商会议中的信息。
团队因此记录每次分配决定、当时理由、预期结果和真实结果,再在治理环境中对Nemotron 3.5 Lightning 30B进行后训练。官方称,专用模型在内部开发基准上达到86.7%的分配决策准确率,比更大的Nemotron 3 Ultra高31.2个百分点。这个数字来自特定内部任务,不能外推为通用模型能力排名。
真正的资产是决策轨迹
传统企业数据通常只保存结果:买了多少、卖了多少、库存还有多少。模型若要学习专家判断,还需要保存决策发生时可见的证据、选择理由和后续结果。否则它只能看到“做了A”,不知道当时为什么没有做B。

评测方式也很关键。团队回放历史决策时,只给模型当时已经知道的信息,并隐藏未来结果,再比较模型建议、专家判断和实际表现。这避免了“拿未来信息回答过去问题”的数据泄漏。
为什么小模型可能胜过大模型
通用模型拥有广泛知识,却不了解一家公司的部件编码、制造约束和隐性决策习惯。专用模型参数更少,但任务边界更窄,训练样本更接近真实输入和评价标准。它不是整体更聪明,而是在一条明确跑道上接受了针对性训练。
这不代表每家公司都应该马上微调模型。很多团队甚至没有稳定记录专家理由,只有散落在聊天、邮件和个人经验中的结论。直接训练只会把口径不一、事后解释和历史偏见一起固化。
还要区分“专家做出的决定”和“后来证明有效的决定”。如果只拿历史操作做监督数据,模型学到的是组织过去怎么做;加入真实结果,才有机会判断那次选择是否值得复制。即便如此,结果也可能受运气和外部事件影响。训练样本最好同时保存可见证据、备选方案、置信度和事后结果,而不是把每次历史决定都贴上“正确答案”。
我的判断是,企业AI项目的第一步不应是采购训练集群,而是设计决策记录。让专家在工作过程中以低摩擦方式留下“输入、决定、理由、结果”,这份数据既能用于复盘,也能成为未来模型的评测集。没有评测集,就无法判断专用模型究竟在学习规律,还是复制历史习惯。
适用边界与实践建议
这套方法适合重复发生、结果可以观察、专家判断有规律可循的任务,例如库存分配、设备维护优先级和风险审核。不适合样本极少、结果多年后才出现,或价值判断无法压缩成统一正确答案的决策。
评测还应按时间切分,而不是随机打乱历史记录。相邻几周的供应链状态非常相似,随机划分可能让训练集和测试集包含几乎相同的局面,得到虚高分数。更可信的方法是用较早时期训练,用完整的后续时期测试,并在政策、供应商或产品世代发生变化后单独报告表现。企业数据会漂移,去年正确的经验可能正是今年需要摆脱的惯性。
团队可以先做一个不训练模型的版本:
- 选择每周重复出现的一类决策。
- 连续记录四周的输入、备选项、决定和理由。
- 事后补充结果,但保留当时信息快照。
- 用旧案例测试通用模型,并让专家盲评建议。
- 只有当错误模式稳定、数据足够一致时,再考虑后训练。
模型从人类反馈中学习,不等于模型在生产中自动重训。重要决策仍需版本控制、审批和回滚,不能让反馈闭环变成无人监管的自我强化。
你所在团队最值得沉淀成训练数据的专家判断是什么?
关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。
本文首发于 java4u.cn,转载请注明出处。

