中国输出AI数据抢攻发展中国家 美媒:北京论述进入全球知识体系

撰文: 许祺安
出版:更新:

美媒《纽约时报》报道,中国正积极向全球输出低成本人工智能模型及训练数据,并向数十个发展中国家提供数据资源,并称随着具“中国特色”的数据进入更多人工智能系统,中国官方宣传及北京论述亦可能随之进入全球AI知识体系。

《纽约时报》8月17日报道,ChatGPT早期推出时,北京研究人员曾测试聊天机械人处理中文问题的能力,结果出现不少错误,包括将篮球明星姚明形容为美国职篮首名女性华人球员,甚至分不清《西游记》与《红楼梦》。

北京理工大学研究人员2023年发表研究报告,指ChatGPT产生大量对中国带有偏见的论述,对中国政治问题亦不回避或拒绝回答。ChatGPT此后已推出多个版本,目前的回答与当时有何差异并不清楚。

《纽约时报》指出,这凸显中国打造人工智能强国所面对的一项问题。目前形塑人工智能系统的大量训练资料以英文为主,在北京眼中,这意味AI知识体系更多反映西方模式。

2026年4月15日,美国史丹福大学近日发表一项报道指,中美两国自主研发的人工智能(AI)模型之间的性能差距已几乎消失;美国的AI模型性能仅领先中国的AI模型2.7%。(史丹福大学人类中心人工智能研究院网站)

分析人士指出,对北京而言,AI领域的资讯不平衡是一项战略弱点,尤其在人权及台湾地位等议题上,西方观点可能占据优势。为缩小大数据差距,北京希望成为全球AI训练所需文字、影像及影片等数据的主要供应者。

报道介绍,中国国家数据局今年初公布蓝图,提出在2028年底前推动中国成为大数据强国,并计划在科研、制造、汽车等20多个领域建立向全球开放的高品质数据集。在上海举行的世界人工智能大会上,中方亦承诺向数十个发展中国家提供数据,并公布由官方实验室及国营媒体提供、可供全球下载的资讯。

分析人士认为,北京有两项主要目标,一是吸引更多人使用中国人工智能模型,二是缩小中国与美国在高品质AI训练数据上的差距。

此外,北京已将人工智能视为优先发展的关键战略科技,希望在相关领域与美国并进,同时藉AI带动中国经济。随着人工智能模型日益复杂,实验室亦需要数量更大、品质更高的训练资料。值得一提的是,中国表面上并不缺乏数据。政府拥有大规模监控系统,数以亿计民众亦使用本地数码平台,但相关资料分散于不同政府机构及企业,导致研究机构实际可取得及使用的数据仍然不足。

相较之下,美国企业面对的数据取得问题较少。数据供应商Mercor及Scale AI除聘用人员处理车辆及各类物件影像外,亦招聘数学家、律师等专业人士参与AI训练,以提高模型能力。

因此,为追赶相关进度,中国国家数据局亦开始推动数据标注产业由廉价人工标注转向“专家型数据标注”,要求大学发展相关课程,并鼓励社会新鲜人投入数据标注工作。

不过,中国大规模向海外输出数据亦引起外界对政治影响力的忧虑。《纽约时报》引述澳大利亚战略政策研究所数位研究员柯维尔(Alex Colville)表示,问题在于极权国家可能掌控AI聊天机械人内的价值观。

近期刊登于科学期刊《自然》(Nature)的一项研究亦指出,中国官方论述正快速进入训练美国ChatGPT及Claude等平台的数据。研究人员分别以中文及英文询问“中国是专制国家”、“习近平是好领导人”等问题,结果发现中文回答较英文回答明显倾向北京论述。

《纽约时报》引述大西洋理事会资深研究员狄博(Kenton Thibaut)指出,北京正致力打造低成本的“中国特色AI”模型,其功能接近美国投入巨额资金开发的平台。这类价格较低的AI产品对发展中国家用户具有吸引力,中国AI模型目前亦已在这些国家取得重大进展。