人民网
人民网>>贵州频道>>本网原创

李海洲:做好中文数据标注、夯实国产算力底座,让AI真正理解中国

2026年08月30日08:34 | 来源:人民网-贵州频道
订阅已订阅已收藏收藏小字号

人民网贵阳8月29日电 (记者李丽萍)“一个用英文训练出来的大模型,代表的不是中国文化,也不是我们的价值观。”8月28日晚,2026数博会DATA之夜活动中,新加坡工程院院士、香港中文大学(深圳)人工智能学院院长李海洲直言,中文数据标注和国产算力部署,是行业需要持续关注的两个方向。

李海洲作主旨演讲。主办方供图

李海洲作主旨演讲。主办方供图

“过去70年,人工智能的发展从来没有离开语言。”李海洲表示,语言数据是人工智能的根基。然而,全球公开网页语言数据中,英文占比约60.6%,中文仅占1.3%。这需要业界更多投入。

李海洲认为,更为紧迫的是,人类5000年积累的文本数据,将在2026至2032年被大模型“读完”。届时如何继续供给高质量数据,是行业必须面对的问题。

要破解这一难题,李海洲认为出路之一在于用算法生成数据,而不仅仅是依赖人类文本。他介绍了团队近期两项工作,一是在国产算力上完成DeepSeek V4.0 Pro的适配,标志着国产算力正在从推理部署和轻量化微调迈向万亿级超大模型全参数后训练。二是开发全双工语音大模型,实现“边说边听”的双向对话,通过算法生成交互数据进行训练。

“要让人工智能真正理解中国的历史、文化和价值观,我们必须把中文数据标注做扎实,把国产算力底座做厚实。”李海洲说。

(责编:吴锋、陈康清)

分享让更多人看到

返回顶部