
今年WAIC逛下来,最大的感受是:AI圈终于不卷参数了。
7月19号那场「全球专家极致语料」人工智能高质量语料生态论坛,坐了一屋子平时很难凑齐的人:各领域的领军科学家、国家信息中心的研究者、头部大模型厂的技术负责人、专门投硬科技的投资人。这么多背景完全不同的人,坐了四个小时,没聊新模型,没聊大算力,就聊一件事:数据。
这不是这一场论坛的个例。从今年WAIC整体的风向,到全球AI巨头的动作,再到行业研究者的公开判断,所有人都在往同一个方向看。
这场论坛是GOMAX LAB骨码智元实验室主办的,全程没什么花活,没有炫酷的发布,没有夸张的口号,所有人坐下来聊真问题。
散场的时候不少人说,这可能是今年WAIC最实在的一场会——吵了三年,大家终于聊到AI的根上了。

说穿了,是卷参数卷不动了。
过去三年整个行业像打了鸡血一样比参数:你出70亿,我出1万亿;你买1万张卡,我买10万张,好像谁卡多谁就能先摸到AGI。
结果呢?参数堆到天上去,模型该幻觉还是幻觉,该算错还是算错,专业领域一问三不知。
这就像你给一辆三轮车加再多油,它也跑不过跑车——发动机不行,光加油没用。
大模型的发动机是什么?不是参数,是数据。
学界早有预警:按照现在大模型消耗数据的速度,公开互联网的高质量语言数据将在2026年耗尽。
现在所有大模型用的通用数据,基本都是从互联网上爬来的:网页、论坛、新闻、公众号……这些数据现在不仅爬完了,质量还烂得离谱:重复、错误、编故事、前后矛盾,什么垃圾都有。
模型越大,吃的垃圾越多,毛病就越明显:看起来什么都能聊,真让它算个翼型、配个化学方程式,立刻露馅。
Gartner的调研也印证了这一点:超过70%的企业AI项目最终卡在了数据环节,80%的AI项目失败,根源不是模型不行,是数据质量不过关。
更关键的是,AI不能永远当聊天玩具。接下来它要进实验室帮科学家做研究,要进工厂帮工人做制造,要进医院帮医生看片子——这些场景,靠互联网上的段子、八卦、百科,根本训不出能用的模型。
未来AI的革命关键在科学数据:超过70%的地学关键信息来自光谱、地震波等原始物理数据,不是论文里的文字,这些高价值的专业数据,才是AI做科学研究的核心。
这里有个90%的人都搞错的常识:高质量语料不是”洗干净的互联网文本”。
之前大家买数据跟买白菜似的,按TB称,觉得量越大越好。
现在才明白:一吨烂白菜,也不如一克黄金有用。
普通数据和高质量数据的区别,根本不是干不干净,是有没有”灵魂”——普通数据只是人类说话的记录,只能让模型学会怎么接话;高质量语料是带着专家完整推理逻辑的知识,能让模型学会怎么思考、怎么解决问题。
洗得再干净的聊天记录,也训不出能设计飞机的模型。
我跟几个头部大模型厂的技术负责人聊,现在他们的训练数据里,真正符合要求的高质量语料占比还不到5%,但就是这5%的数据,决定了模型在专业场景下能不能用,剩下95%的通用数据,只能让模型学会聊天。这就是为什么这么多顶尖的人凑到一起开这个会:大家都看明白了,接下来AI拼的根本不是谁参数大,是谁的数据底座硬。
高质量语料不是锦上添花,是AI能不能从玩具变成生产力的命门。

道理谁都懂,但为什么直到今天大家才开始聊?
因为做高质量数据真的太难了,四个门槛直接把99%的公司挡在了门外。
第一个坎:你根本拿不到真东西。
真正有价值的专业数据,根本不在网上。空气动力学的设计逻辑在专家几十年的研究积累里,化工的反应规律在实验室的记录里,制造的工况数据在工厂的生产线上,医疗的诊断经验在医生的临床里。

这些东西爬虫爬不到,花钱也买不到——总不能把专家一辈子的研究买过来吧?之前很多公司喊着做专业数据,最后发现连专家的门都敲不开。
第二个坎:这根本不是堆人就能干的活。
很多人觉得做数据就是找一堆大学生标图片、打标签,人多就行。大错特错。李振华也提到,高质量标注数据已经成为模型智能上限的核心瓶颈,尤其在专业领域,不是随便找个人就能标。
真正的高质量数据标注,比写代码还难:你得先懂这个专业,才能标对数据。怎么把专家脑子里的经验变成机器能懂的规则?怎么保证每一条数据的推理逻辑都对?怎么搭一个客观的测试集?每一步都是硬技术,得专家、算法、工程师拧成一股绳才能做,找一堆兼职根本玩不转。
之前有个公司想做航空领域的数据集,找了几百个大学生标了三个月,最后拿给专家一看,80%都是错的——连基本的专业概念都搞混了,标出来的数据根本没法用,几百万直接打了水漂。
第三个坎:太慢了,资本等不起。
做高质量语料是个慢活:搭团队、找专家、磨流程、建体系,可能一两年都看不到回头钱。
之前三年资本都疯抢大模型项目,几个月就能出模型开发布会,谁愿意投这种慢活、笨活?没有钱,光靠情怀根本撑不到商业化。
第四个坎:连个标准都没有。
直到今天,什么叫”高质量语料”都没个准数。
每家公司都说自己的数据是高质量的,到底高在哪?准确率多少?有没有专家背书?能不能真的提升模型效果?大家各说各的,客户也不知道信谁。没有标准,这个行业就永远是小打小闹。
就是这四座大山,把绝大多数人挡在了外面。
之前大家都在赚快钱,没人愿意啃硬骨头,直到现在参数卷不动了,才回头发现:原来最笨的活,才是最核心的活。

这次论坛最有价值的地方,就是把专家凑到一起,终于把怎么做好高质量语料这件事聊透了。

这五个方向不是哪家公司的口号,是全行业踩了三年坑踩出来的共识,也是今年WAIC整个数据板块的核心方向:
第一,领域要越做越宽,敢啃硬骨头
别再在通用文本里卷了,要往高壁垒的垂直领域走。
航空航天、先进制造、生物医疗、网络安全这些硬领域,才是AI真正要落地的地方,也是通用数据最缺的地方。这次论坛公布的九个联合研究方向,全是这些硬骨头,也给行业指了路:接下来做数据,不能再做低水平重复,要一个硬骨头一个硬骨头地啃。
第二,合作要越做越深,别拿专家当站台的
别再搞”专家挂名”那套了。
专家不是来开个会、拍个照就走的,要从最开始定标准、设计标注规则,到中间攻技术难点,再到最后审数据,全程扎进来。
普通标注员标出来的数据准确率不到60%;专家带着团队一起定规则、逐一审定,准确率能到99%以上——不是慢,是要对结果负责。
只有把专家的经验真正变成数据里的推理逻辑,做出来的东西才有用,不然就是打着专家旗号卖垃圾。
第三,技术要越来越硬,别靠堆人做小作坊
做数据不能再靠人海战术了,要走工业化的路。
全链路的质量控制、多模态数据处理、科学的测试集搭建,这些都得靠技术。复旦大学肖仰华教授也提到,现在很多千亿大模型有”水分”,大多数参数只是在编码零散的事实,和模型的真正智能关系不大——只有靠技术把数据质量提上去,模型才能真的变聪明。
只有把技术体系建起来,才能批量、稳定地生产高质量语料,不然永远是小作坊,做不大,也做不稳。
第四,生态要越来越全,不能靠情怀发电
做数据不能靠情怀,产业资本投长期基础设施,财务资本投技术团队,CVC带场景带落地,再把数据安全、合规的体系建起来,让做数据的公司能赚到钱,能持续投入,这个行业才能转起来,不然永远是一阵风。
第五,定位要越来越高,这是全行业的底座
高质量语料不是哪几家公司的生意,是整个AI行业的基础设施,就像互联网时代的电和网。
这个底座不能靠一家公司建,得科研机构、企业、资本一起搭,底座搭实了,上面的应用才能跑起来。
今年WAIC专门设了”基石筑底”数据与语料板块,国家级科技语料库也同步落地,就是这个原因——大家都明白,这是全行业共同的事。

说穿了:这五件事就是高质量语料的五根柱子,少一根都建不起这个生态。

前三年的百模大战,本质是圈地运动,大家先抢位置、比声音大;现在开始做数据,才是真正打地基——地基打多深,楼才能盖多高。我跟很多投资人聊,之前看AI项目先问你有多少卡,现在先问你有什么独家数据。
之前大家都觉得AI公司的壁垒是模型、是算力,现在慢慢都看明白了,最终的壁垒是数据——模型可以开源,算力可以买,但是你花几年攒出来的高质量语料集,别人拿不走。
接下来一两年,这个趋势会越来越明显:靠堆参数、刷榜单的公司会越来越难混,真正沉下心做数据、做底座的玩家会慢慢走到台前。
作为本次论坛的主办方,GOMAX LAB给全行业搭了个聊真问题的台子,也让大家看到了这个方向的清晰路径。
这条路不好走,要啃很多硬骨头,要花很多笨功夫,但至少现在方向对了,共识有了,有人开始往前走了。
吵了三年,AI终于开始干真正影响长远的正事了。

-END-
