小米开源表格数据大模型Xiaomi-TabLDM

发布时间:2026-09-05 12:03  浏览量:2

IT时代网9月5日消息,小米正式发布通用表格数据基础大模型Xiaomi-TabLDM并宣布开源,模型权重、代码与技术报告已全部公开。它主打一次预训练之后,无需针对每一份数据集重新训练、调参或做模型集成,就能直接完成分类与回归预测,把基础模型范式带进金融、医疗、制造、物流等大量依赖表格结构化数据的领域。长期以来,表格数据处理依靠XGBoost、LightGBM这类传统机器学习工具,每拿到一份新业务表格就要重新训练调参,多套模型并存的维护成本不低。Xiaomi-TabLDM的目标就是打破一表一模型的现状。技术路线上,整套预训练完全基于结构因果模型生成的大规模合成数据完成,覆盖多样的数据规模、变量类型与函数关系;架构层面引入双流特征分组、轻量级注意力残差与稀疏混合专家机制,在扩大模型容量的同时避免计算量同步暴涨;推理阶段还支持Test-Time Scaling,不改模型参数、靠增加推理算力持续提升预测效果。成绩单上,在TALENT、OpenML-CTR23、BCCO、TabArena四大公开基准评测中,Xiaomi-TabLDM整体跻身第一梯队:OpenML-CTR23回归榜排名第一,TALENT二分类同样第一,BCCO总体第二、TabArena回归任务第二,多项指标超过主流基线方案。效率也有亮点,TabArena回归任务上拿到1900 Elo得分的同时,每1000样本验证耗时仅3.12秒;以TabArena为例,它取得第二高Elo评分的同时,训练时间比排名第一的方案少82%,预测时间减少68%。真实工业场景的验证更能说明问题。材料性能预测场景下无需微调,预测精度提升130%,减少约九成无效试模测试;零件重量预测相比XGBoost失误样本占比下降31%;生产组分预测平均误差降低54%,工况变化时仅需补充约30条新样本作为上下文,平均误差就能再降62%,小样本快速适配优势明显。模型提供scikit-learn兼容接口,可通过pip安装使用。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。