人民網
人民網>>貴州頻道>>本網原創

李海洲:做好中文數據標注、夯實國產算力底座,讓AI真正理解中國

2026年08月30日08:34 | 來源:人民網-貴州頻道
訂閱已訂閱已收藏收藏小字號

人民網貴陽8月29日電 (記者李麗萍)“一個用英文訓練出來的大模型,代表的不是中國文化,也不是我們的價值觀。”8月28日晚,2026數博會DATA之夜活動中,新加坡工程院院士、香港中文大學(深圳)人工智能學院院長李海洲直言,中文數據標注和國產算力部署,是行業需要持續關注的兩個方向。

李海洲作主旨演講。主辦方供圖

李海洲作主旨演講。主辦方供圖

“過去70年,人工智能的發展從來沒有離開語言。”李海洲表示,語言數據是人工智能的根基。然而,全球公開網頁語言數據中,英文佔比約60.6%,中文僅佔1.3%。這需要業界更多投入。

李海洲認為,更為緊迫的是,人類5000年積累的文本數據,將在2026至2032年被大模型“讀完”。屆時如何繼續供給高質量數據,是行業必須面對的問題。

要破解這一難題,李海洲認為出路之一在於用算法生成數據,而不僅僅是依賴人類文本。他介紹了團隊近期兩項工作,一是在國產算力上完成DeepSeek V4.0 Pro的適配,標志著國產算力正在從推理部署和輕量化微調邁向萬億級超大模型全參數后訓練。二是開發全雙工語音大模型,實現“邊說邊聽”的雙向對話,通過算法生成交互數據進行訓練。

“要讓人工智能真正理解中國的歷史、文化和價值觀,我們必須把中文數據標注做扎實,把國產算力底座做厚實。”李海洲說。

(責編:吳鋒、陳康清)

分享讓更多人看到

返回頂部