隨著人工智能技術(shù)的飛速發(fā)展,數(shù)據(jù)作為AI系統(tǒng)的核心燃料,其治理問題日益凸顯。2022年,中國(guó)人工智能數(shù)據(jù)治理行業(yè)進(jìn)入深化發(fā)展階段,特別是在面向人工智能的數(shù)據(jù)治理及公共數(shù)據(jù)領(lǐng)域,呈現(xiàn)出新的趨勢(shì)與挑戰(zhàn)。本報(bào)告旨在系統(tǒng)梳理行業(yè)現(xiàn)狀,分析關(guān)鍵問題,并展望未來(lái)方向。
一、行業(yè)背景與發(fā)展驅(qū)動(dòng)
人工智能的廣泛應(yīng)用,尤其是大模型、自動(dòng)駕駛、智能醫(yī)療等領(lǐng)域的突破,對(duì)高質(zhì)量、大規(guī)模、合規(guī)的數(shù)據(jù)提出了更高要求。數(shù)據(jù)治理不再局限于傳統(tǒng)的質(zhì)量控制與安全管理,而是延伸至數(shù)據(jù)的采集、標(biāo)注、存儲(chǔ)、共享、流通與價(jià)值釋放的全生命周期。政策層面,國(guó)家《“十四五”數(shù)字經(jīng)濟(jì)發(fā)展規(guī)劃》、《關(guān)于構(gòu)建數(shù)據(jù)基礎(chǔ)制度更好發(fā)揮數(shù)據(jù)要素作用的意見》(“數(shù)據(jù)二十條”)等文件的出臺(tái),為數(shù)據(jù)要素市場(chǎng)化配置與公共數(shù)據(jù)開放利用提供了頂層設(shè)計(jì),直接推動(dòng)了AI數(shù)據(jù)治理行業(yè)的規(guī)范發(fā)展。
二、面向人工智能的數(shù)據(jù)治理:核心內(nèi)涵與挑戰(zhàn)
面向AI的數(shù)據(jù)治理,特指為滿足人工智能模型訓(xùn)練、優(yōu)化與部署需求,而對(duì)數(shù)據(jù)進(jìn)行的一系列管理活動(dòng)。其核心目標(biāo)是確保數(shù)據(jù)的可用性、質(zhì)量、安全與合規(guī),從而提升AI模型的性能與可靠性。
當(dāng)前面臨的主要挑戰(zhàn)包括:
- 數(shù)據(jù)質(zhì)量與標(biāo)注:AI模型對(duì)數(shù)據(jù)質(zhì)量極為敏感。現(xiàn)實(shí)中存在大量非結(jié)構(gòu)化、帶噪聲、有偏見的數(shù)據(jù),需要高效的清洗、標(biāo)注與增強(qiáng)技術(shù)。專業(yè)化、規(guī)模化的數(shù)據(jù)標(biāo)注服務(wù)需求激增,但行業(yè)標(biāo)準(zhǔn)不一,質(zhì)量參差不齊。
- 數(shù)據(jù)安全與隱私保護(hù):在數(shù)據(jù)采集與使用過程中,如何平衡數(shù)據(jù)利用與個(gè)人隱私、商業(yè)秘密保護(hù)是關(guān)鍵難題。匿名化、差分隱私、聯(lián)邦學(xué)習(xí)等技術(shù)得到應(yīng)用,但落地實(shí)踐仍需完善。
- 數(shù)據(jù)合規(guī)與倫理:數(shù)據(jù)來(lái)源的合法性、使用的合規(guī)性日益受到關(guān)注。AI倫理問題,如算法偏見、歧視等,其根源往往在于訓(xùn)練數(shù)據(jù)本身,需要從治理源頭進(jìn)行干預(yù)。
三、人工智能公共數(shù)據(jù)治理:機(jī)遇與探索
公共數(shù)據(jù),指各級(jí)政務(wù)部門及公共企事業(yè)單位在履職過程中產(chǎn)生的數(shù)據(jù),具有權(quán)威性、基礎(chǔ)性和高價(jià)值特點(diǎn)。其開放共享對(duì)于訓(xùn)練普惠性AI模型、推動(dòng)智慧城市建設(shè)、促進(jìn)科研創(chuàng)新具有重要意義。
2022年,該領(lǐng)域呈現(xiàn)以下特點(diǎn):
1. 開放進(jìn)程加速:各地政府?dāng)?shù)據(jù)開放平臺(tái)持續(xù)擴(kuò)容,數(shù)據(jù)開放的廣度(部門覆蓋)與深度(數(shù)據(jù)集粒度)有所提升,為AI企業(yè)提供了豐富的訓(xùn)練素材。
2. 治理模式創(chuàng)新:探索“原始數(shù)據(jù)不出域”、“數(shù)據(jù)可用不可見”的流通范式,通過建設(shè)數(shù)據(jù)沙箱、隱私計(jì)算平臺(tái)等方式,在保障安全的前提下促進(jìn)公共數(shù)據(jù)價(jià)值挖掘。
3. 應(yīng)用場(chǎng)景深化:公共數(shù)據(jù)在疫情防控、城市交通治理、環(huán)境監(jiān)測(cè)、普惠金融等領(lǐng)域的AI應(yīng)用案例增多,展現(xiàn)了其社會(huì)與經(jīng)濟(jì)價(jià)值。
挑戰(zhàn)同樣存在:公共數(shù)據(jù)開放標(biāo)準(zhǔn)不統(tǒng)一、質(zhì)量不一、授權(quán)使用機(jī)制不清晰、跨部門協(xié)同難等問題,制約了其規(guī)模化AI應(yīng)用。
四、未來(lái)展望與建議
中國(guó)AI數(shù)據(jù)治理行業(yè)將朝向更加規(guī)范化、專業(yè)化、技術(shù)化的方向發(fā)展:
- 標(biāo)準(zhǔn)體系構(gòu)建:亟需建立覆蓋數(shù)據(jù)質(zhì)量、標(biāo)注、安全評(píng)估、合規(guī)審計(jì)的行業(yè)標(biāo)準(zhǔn)與認(rèn)證體系。
- 技術(shù)融合創(chuàng)新:區(qū)塊鏈用于數(shù)據(jù)存證與溯源,隱私計(jì)算保障安全流通,自動(dòng)化工具提升治理效率,技術(shù)融合將成為突破治理瓶頸的關(guān)鍵。
- 生態(tài)協(xié)同發(fā)展:政府、企業(yè)、科研機(jī)構(gòu)需協(xié)同共建健康的數(shù)據(jù)要素市場(chǎng)生態(tài)。政府應(yīng)繼續(xù)推動(dòng)公共數(shù)據(jù)高質(zhì)量開放與制度創(chuàng)新;企業(yè)需加強(qiáng)合規(guī)能力建設(shè)與技術(shù)創(chuàng)新;學(xué)術(shù)界應(yīng)深化數(shù)據(jù)倫理與治理理論研究。
- 人才隊(duì)伍建設(shè):培養(yǎng)兼具AI技術(shù)、數(shù)據(jù)科學(xué)、法律合規(guī)知識(shí)的復(fù)合型數(shù)據(jù)治理人才將成為行業(yè)發(fā)展的基礎(chǔ)支撐。
面向人工智能的數(shù)據(jù)治理,特別是公共數(shù)據(jù)的有效治理與利用,是釋放數(shù)據(jù)要素價(jià)值、推動(dòng)AI產(chǎn)業(yè)健康可持續(xù)發(fā)展的基石。2022年是承前啟后的一年,行業(yè)在挑戰(zhàn)中不斷探索前行,為構(gòu)建可信、可控、可用的AI數(shù)據(jù)基礎(chǔ)設(shè)施奠定了重要基礎(chǔ)。