企业最难复制的往往不是数据库,而是老师傅在邮件、天气、供应商语气和历史经验之间做出的判断。可引用的核心判断是:企业AI真正稀缺的数据,不只是“最后选了什么”,而是决策当时看到了什么、为何修改、后来结果怎样。NVIDIA与Palantir公开的供应链案例,把这条经验做成了一套可追溯训练闭环。
发生了什么
NVIDIA需要每周决定把短缺的GPU、CPU、HBM和其他组件分配到哪些制造地点。cuOpt先把问题写成混合整数线性规划,在产能、物料到货、客户承诺等约束下,最小化物料在厂停留的Time of Ownership。
但历史回测显示,人类规划师经常胜过纯数学模型,因为他们还掌握供应商邮件、天气、地缘事件和电话纪要。于是NVIDIA与Palantir把分配决定、理由、预期和真实产出统一写入Ontology,再用这些记录后训练一个开放权重的Nemotron 3.5 Lightning模型,为规划师提供建议。
关键事实与证据
据NVIDIA技术文章,所用模型约300亿参数,每次前向激活约30亿参数;训练通过LoRA只更新少量适配参数。官方称一次训练在两张B200上用数分钟完成。
在团队自建的开发集上,微调后模型的分配决策准确率为86.7%,高于Nemotron 3 Ultra的55.5%和未微调基座的17.5%。更值得看的是平衡准确率58.6%和Macro-F1 57.5%,远低于普通准确率,说明类别不均衡且少数决策仍难。官方也明确说,未来生产风险预测依然困难;这些内部成绩没有给出独立审计,不能外推成供应链整体效率提升。
技术原理:让每次决策都能回到当时
这套系统有两条互补链路。cuOpt处理能写成约束和目标函数的部分,给出分配方案与当前“卡脖子”约束;小模型处理非结构化证据和专家策略,给出建议范围、理由与风险。人仍做最终决定。
训练前先匿名化敏感字段,用合成数据补齐少见的增配、减配和中断场景,再做LoRA微调。评估采用时间点回放:只向模型展示那一天已经知道的信息,隐藏后来结果。这避免把未来信息泄漏进测试,也回答了更有业务意义的问题——如果模型当时已上线,它会不会作出正确建议。

一个具体场景
假设两家工厂都缺HBM。优化器按公开产能把更多物料给A厂;资深规划师却知道台风可能影响A厂物流,而且B厂刚在会议里承诺新增班次。传统系统只记录“改给B厂”,模型以后看不懂原因。若系统同时保存当时的天气预报、供应商纪要、人工修改和两周后的产出,就能形成一条可复核样本。
这不是把直觉神秘化,而是把直觉拆成证据与结果。模型学到的是受限决策策略,人也能反查建议依赖了哪条信息。
对岗位和开发者的影响
对业务专家,工作重点会从重复重建背景,转向解释例外、校正建议和定义风险边界。对数据与AI团队,任务不再只是接表训练,而是设计决策对象、时间点快照、反馈字段和权限链。最稀缺的新角色,可能是懂业务又能把“为什么”变成结构化记录的人。
这个案例也提醒开发者,小模型是否够用要看任务边界。明确的输入、有限的动作空间和稳定的评分规则,往往比盲目升级通用大模型更重要。
我的判断及依据
我的判断是,未来两年企业AI的分水岭会是“有没有高质量决策日志”,而不是“买了哪个模型”。依据是,案例中的通用大模型已经能读文本,却输给了经过领域记录微调的小模型;同时,普通准确率与Macro-F1差距又暴露出数据分布和少数场景的重要性。
适用边界与风险
这是NVIDIA与Palantir的自述案例,数据规模、样本划分和线上收益披露有限。历史决策也可能包含旧偏见;把专家选择当标签并不等于它总是正确。合成数据可能放大人为假设。反馈必须经过批次审核后再训练,不能让模型在生产环境里根据每次点击自动改写自己。
今天就能建立的决策日志
- 为一个高频决策记录时间、可见证据、可选动作、人工选择和理由。
- 延迟补录真实结果,并标明结果受到哪些外部因素影响。
- 回测时严格按时间切分,禁止使用决策日之后的信息。
- 同时看Macro-F1、少数类召回和高损失错误,不只看总体准确率。
- 先做只读建议和人工否决,再讨论自动执行。
你所在团队有哪些关键判断只存在于少数人的经验里,却从未连同依据和结果被系统记录?
关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。
本文首发于 java4u.cn,转载请注明出处。

