BAT 集体重做「AI 预训练」,补「脏数据」的坑

近半年来,国内多家头部AI模型厂商陆续启动预训练“返工”。

有厂商万亿参数模型因网页垃圾、重复语料、标注规则不清及评测集污染,实际表现甚至不及其1%规模的小模型,前期算力和人力投入被大量消耗。

业内人士认为,大模型竞争正从追求参数和数据规模,转向信息密度、语料质量及数据治理能力。随着优质预训练语料、专家数据和智能体长程轨迹日益稀缺,建立贯通数据获取、清洗、评测与训练的合规闭环,将成为AI企业构筑长期竞争力的关键。

https://www.leiphone.com/~
 
 
Back to Top