智源研究院發(fā)布超大規(guī)模智能模型“悟道1.0”

【獵云網(wǎng)北京】3月20日報(bào)道
3月20日,北京智源人工智能研究院舉辦“智源悟道1.0 AI研究成果發(fā)布會暨大規(guī)模預(yù)訓(xùn)練模型交流論壇”。會上,智源研究院發(fā)布超大規(guī)模智能模型“悟道1.0”。
據(jù)悉,“悟道1.0”是我國首個(gè)超大規(guī)模智能模型系統(tǒng),由智源研究院學(xué)術(shù)副院長、清華大學(xué)唐杰教授領(lǐng)銜,帶領(lǐng)來自北京大學(xué)、清華大學(xué)、中國人民大學(xué)、中國科學(xué)院等單位的100余位AI科學(xué)家團(tuán)隊(duì)聯(lián)合攻關(guān),取得了多項(xiàng)國際領(lǐng)先的AI技術(shù)突破,形成超大規(guī)模智能模型訓(xùn)練技術(shù)體系,訓(xùn)練出包括中文、多模態(tài)、認(rèn)知、蛋白質(zhì)預(yù)測在內(nèi)的系列模型,勇闖通用智能發(fā)展前沿,構(gòu)建我國人工智能應(yīng)用基礎(chǔ)設(shè)施。同時(shí),與龍頭企業(yè)共同研發(fā)工業(yè)級示范性應(yīng)用,加快大規(guī)模智能模型應(yīng)用生態(tài)建設(shè)。
此外,為了更好地推動“悟道”大模型的研發(fā),保持研發(fā)過程中技術(shù)的領(lǐng)先性,此次發(fā)布上,還同時(shí)成立了由9位來自學(xué)術(shù)界和產(chǎn)業(yè)界的頂尖科學(xué)家組成的“悟道”大模型技術(shù)委員會。委員會主任由清華大學(xué)唐杰教授擔(dān)任,委員會成員包括:北京大學(xué)鄂維南院士、清華大學(xué)魯白教授、中國人民大學(xué)人工智能信息學(xué)院院長文繼榮教授、清華大學(xué)計(jì)算機(jī)系長聘副教授劉知遠(yuǎn)、清華大學(xué)計(jì)算機(jī)系長聘副教授黃民烈、北京大學(xué)王選計(jì)算機(jī)研究所萬小軍研究員、一流科技創(chuàng)始人袁進(jìn)輝、循環(huán)智能聯(lián)合創(chuàng)始人楊植麟。
“悟道”模型:旨在從更加本質(zhì)的角度進(jìn)一步探索通用智能
會上,智源研究院院長黃鐵軍教授介紹了“悟道”模型研發(fā)的初衷。據(jù)他介紹,本輪人工智能浪潮的基本特點(diǎn)是“數(shù)據(jù)+算力+算法=模型”,模型濃縮了訓(xùn)練數(shù)據(jù)的內(nèi)部規(guī)律,是實(shí)現(xiàn)人工智能應(yīng)用的載體。近年來人工智能的發(fā)展,已經(jīng)從“大煉模型”逐步邁向了“煉大模型”的階段,通過設(shè)計(jì)先進(jìn)的算法,整合盡可能多的數(shù)據(jù),匯聚大量算力,集約化地訓(xùn)練大模型,供大量企業(yè)使用,這是必然趨勢。

智源研究院院長 黃鐵軍
智能模型不僅要規(guī)模大(主要體現(xiàn)為參數(shù)量),還要智商高,才能滿足各種應(yīng)用需要,這需要突破大量技術(shù)挑戰(zhàn)。例如:如何使得預(yù)訓(xùn)練模型具備像人類一樣的符合邏輯、意識和推理的認(rèn)知能力?如何實(shí)現(xiàn)對圖、文和視頻等多模態(tài)數(shù)據(jù)和信息的理解和建模的統(tǒng)一?如何將中文融入預(yù)訓(xùn)練模型,推動中文應(yīng)用背景下的人工智能的發(fā)展?如何使得預(yù)訓(xùn)練模型深入融入自然科學(xué)研究,在目前基礎(chǔ)上進(jìn)一步實(shí)現(xiàn)對超長/復(fù)雜蛋白質(zhì)序列的建模和預(yù)測?
作為以人工智能源頭創(chuàng)新為使命的新型研究機(jī)構(gòu),智源研究院2020年10月正式啟動超大規(guī)模智能模型“悟道”項(xiàng)目,研發(fā)既博大又精深的超大規(guī)模訓(xùn)練模型,從更加本質(zhì)的角度進(jìn)一步探索通用人工智能。同時(shí),構(gòu)建大規(guī)模智能模型應(yīng)用生態(tài),推動相關(guān)機(jī)構(gòu)和個(gè)人開發(fā)者基于模型研發(fā)各類新型智能應(yīng)用,服務(wù)我國實(shí)體經(jīng)濟(jì)產(chǎn)業(yè)升級。
“悟道1.0”:我國首個(gè)超大規(guī)模智能模型
會上,“悟道”模型技術(shù)委員會主任、智源研究院學(xué)術(shù)副院長唐杰教授介紹了“悟道”模型的戰(zhàn)略布局及階段性成果。據(jù)介紹,“悟道1.0”先期啟動了4個(gè)大模型的研發(fā)。

智源學(xué)術(shù)副院長唐杰 介紹”悟道”大模型團(tuán)隊(duì)
1.悟道·文源:面向中文的預(yù)訓(xùn)練語言模型
“悟道·文源”是“以中文為核心的大規(guī)模預(yù)訓(xùn)練模型”,目標(biāo)是構(gòu)建完成全球規(guī)模最大的以中文為核心的預(yù)訓(xùn)練語言模型,在中英文等多個(gè)世界主流語言上取得最好的處理能力,在文本分類、情感分析、自然語言推斷、閱讀理解等多個(gè)任務(wù)上超越人類平均水平,探索具有通用能力的自然語言理解技術(shù),并進(jìn)行腦啟發(fā)的語言模型研究。
目前,“悟道·文源”模型參數(shù)量達(dá)26億,具有識記、理解、檢索、數(shù)值計(jì)算、多語言等多種能力,并覆蓋開放域回答、語法改錯(cuò)、情感分析等20種主流中文自然語言處理任務(wù),技術(shù)能力已與GPT-3實(shí)現(xiàn)齊平,達(dá)到現(xiàn)有中文生成模型的領(lǐng)先效果。
2.悟道·文瀾:首個(gè)公開的中文通用圖文多模態(tài)預(yù)訓(xùn)練模型
“悟道·文瀾”是“超大規(guī)模多模態(tài)預(yù)訓(xùn)練模型”,目標(biāo)是突破基于圖、文和視頻相結(jié)合的多模態(tài)數(shù)據(jù)的預(yù)訓(xùn)練理論難題,并最終生成產(chǎn)業(yè)級中文圖文預(yù)訓(xùn)練模型和應(yīng)用,并在多個(gè)評測應(yīng)用上超過國際最高性能。
目前,“悟道·文瀾”模型參數(shù)量達(dá)10億,基于從公開來源收集到的5000萬個(gè)圖文對上進(jìn)行訓(xùn)練,是首個(gè)公開的中文通用圖文多模態(tài)預(yù)訓(xùn)練模型。目前,該模型性能已到達(dá)國際領(lǐng)先水平,在中文公開多模態(tài)測試集AIC-ICC的圖像生成描述任務(wù)中,得分比冠軍隊(duì)高出5%;在圖文互檢任務(wù)中,得分比目前最流行的UNITER模型高出20%。
“悟道·文瀾”模型已對外開放API。發(fā)布會上,為了展示如何使用“悟道·文瀾”模型,智源研究院聯(lián)合中國人民大學(xué)高瓴人工智能學(xué)院和一覽群智公司,推出了兩款基于該模型的小應(yīng)用,其中“賦魂”AI小程序,可以為用戶上傳的照片配文,“AI心情電臺”小程序可以利用圖片和歌詞的相關(guān)性,為用戶上傳的照片搭配最合拍的音樂。

“悟道·文瀾”模型根據(jù)圖片自動搭配歌曲
3.悟道·文匯:我國首個(gè)具有認(rèn)知能力的超大規(guī)模預(yù)訓(xùn)練模型
“悟道·文匯”為“面向認(rèn)知的超大規(guī)模新型預(yù)訓(xùn)練模型”,致力于從認(rèn)知的角度研究通用人工智能中一系列更本質(zhì)問題,側(cè)重進(jìn)一步提升和發(fā)展預(yù)訓(xùn)練模型基于邏輯、意識和推理的認(rèn)知能力,目標(biāo)是研發(fā)出千億至萬億級別參數(shù)量的、更通用且性能超越國際水平的預(yù)訓(xùn)練模型,搭建預(yù)訓(xùn)練模型體系,同時(shí)形成認(rèn)知智能生態(tài)。
目前,“悟道·文匯”模型的參數(shù)規(guī)模達(dá)113億,在多項(xiàng)任務(wù)中“悟道·文匯”的表現(xiàn)已經(jīng)接近突破圖靈測試,通過簡單微調(diào)就已經(jīng)實(shí)現(xiàn)AI作詩、AI作圖、AI制作視頻、圖文生成、圖文檢索、復(fù)雜推理。
例如,“悟道·文匯”模型可以應(yīng)用在電商行業(yè)自動撰寫商品文案等場景,在阿里電商場景下進(jìn)行微調(diào),輸入以下圖片。
“悟道·文匯”模型可以生成以下文字:
旗袍是一種古典的風(fēng)格,它不僅能夠彰顯出女性優(yōu)雅氣質(zhì),而且還具有很好的修飾身形。這款旗袍采用了經(jīng)典的圓領(lǐng)設(shè)計(jì),穿著舒適自在,同時(shí)又能夠展現(xiàn)出女性柔美的頸部線條,讓你更加的迷人。精致的繡花工藝,使得整件衣服看起來更加的精致,也更加的凸顯出女性的魅力。

“悟道·文匯”模型基于圖片自動撰寫商品文案
另外,“悟道·文匯”在圖靈測試中已取得接近人類的作詩水平。

“悟道·文匯”模型實(shí)現(xiàn)的自動作詩
“悟道·文匯”模型還可以實(shí)現(xiàn)“以文生圖”,自動作畫。

“悟道·文匯”模型實(shí)現(xiàn)的“以文生圖”
4.悟道·文溯:超大規(guī)模蛋白質(zhì)序列預(yù)測預(yù)訓(xùn)練模型
“悟道·文溯”是“超大規(guī)模蛋白質(zhì)序列預(yù)測預(yù)訓(xùn)練模型”,最終目標(biāo)是以基因領(lǐng)域認(rèn)知圖譜為指導(dǎo),研發(fā)出十億參數(shù)規(guī)模、可以處理超長蛋白質(zhì)序列的超大規(guī)模預(yù)訓(xùn)練模型,在基本性能、可解釋性和魯棒性等多個(gè)方面達(dá)到世界領(lǐng)先水平。
目前,“悟道·文溯”已在蛋白質(zhì)方面完成基于100GB UniParc數(shù)據(jù)庫訓(xùn)練的BERT模型,在基因方面完成基于5-10萬規(guī)模的人外周血免疫細(xì)胞(細(xì)胞類型25-30種)和1萬耐藥菌的數(shù)據(jù)訓(xùn)練,同時(shí)搭建訓(xùn)練軟件框架并驗(yàn)證其可擴(kuò)展性。
據(jù)唐杰教授介紹,此次發(fā)布的“悟道”大模型1.0版本,已經(jīng)完成了百億和千億參數(shù)規(guī)模的預(yù)訓(xùn)練,在多個(gè)國際評測中取得世界第一,在部分任務(wù)上具有一定認(rèn)知能力。今年,還將陸續(xù)發(fā)布后續(xù)迭代版本,面向產(chǎn)業(yè)界開放使用。
“悟道1.0”:構(gòu)建了超大規(guī)模預(yù)訓(xùn)練模型技術(shù)體系,取得多項(xiàng)國際領(lǐng)先的AI技術(shù)突破
在科研方面,“悟道1.0”模型正在逐步搭建并完善超大規(guī)模預(yù)訓(xùn)練模型技術(shù)體系,取得了多項(xiàng)國際領(lǐng)先的AI技術(shù)的突破。
1.基礎(chǔ)性能方面,在自然語言理解和生成、跨視覺和文字的理解與檢索等多項(xiàng)任務(wù)上取得更好表現(xiàn)
(1)“悟道·文匯”提出了全新的預(yù)訓(xùn)練范式GLM,以生成為核心,打破BERT和GPT瓶頸,歷史上首次實(shí)現(xiàn)單一模型在理解、生成、seq2seq三種任務(wù)上取得最優(yōu)效果;相同訓(xùn)練量下,超越BERT、RoBERTa、T5等常見預(yù)訓(xùn)練模型。
(2)“悟道·文瀾”發(fā)布首個(gè)公開中文通用圖文多模態(tài)預(yù)訓(xùn)練模型,能夠懂得基于圖文弱相關(guān)的“內(nèi)涵信息”。
2.針對預(yù)訓(xùn)練模型有效使用,提出高效算法
(1)“悟道·文匯”提出基于連續(xù)向量的微調(diào)方法P-Tuning,歷史上首次實(shí)現(xiàn)自回歸模型在理解任務(wù)上超越自編碼模型,并在知識抽取(LAMA)、少樣本學(xué)習(xí)(Superglue Fewshot)等10多個(gè)任務(wù)上取得世界第一,性能提升超20%;
(2)“悟道·文匯”提出Inverse Prompting算法,顯著改善了對語言模型生成結(jié)果的控制,效果大幅度超越當(dāng)前最好方法,在問答和詩歌生成任務(wù)中接近人類水平,并首次實(shí)現(xiàn)根據(jù)現(xiàn)代題材創(chuàng)作古體詩;
(3)“悟道·文源”發(fā)布開源的中文預(yù)訓(xùn)練模型CPM,并進(jìn)一步開源了微調(diào)算法代碼。以此為基礎(chǔ)的模型蒸餾技術(shù)CPM-Distill,實(shí)現(xiàn)語言困惑度降低38%,在下游任務(wù)上獲更好效果;
(4)“悟道·文瀾”不同于OpenAI的CLIP模型,采用更先進(jìn)的跨模態(tài)對比學(xué)習(xí)算法:給定某一圖文對,基于MoCo思想,對每種模態(tài)擴(kuò)大負(fù)樣本數(shù)目,特別是區(qū)分難度大的負(fù)樣本,進(jìn)一步提高神經(jīng)網(wǎng)絡(luò)的表達(dá)能力。
3.進(jìn)一步實(shí)現(xiàn)規(guī)模和性能的擴(kuò)增中面臨的挑戰(zhàn)
(1)“悟道·文溯”發(fā)布并開源了萬億參數(shù)模型訓(xùn)練的基石FastMoE,是首個(gè)支持PyTorch框架的高性能MoE(混合專家模型)系統(tǒng),不再受限于谷歌軟硬件,支持多種硬件,只需一行代碼即可完成MoE化改造,相比傳統(tǒng)PyTorch實(shí)現(xiàn),模型訓(xùn)練速度提升47倍;
(2)“悟道·文瀾”可以方便地把圖像和文本的編碼器替換成最先進(jìn)的單模態(tài)預(yù)訓(xùn)練模型,隨即達(dá)到增大模型表達(dá)能力的目的,在預(yù)測階段,速度是UNITER模型的20倍,容易部署。
4.建設(shè)并開放了全球最大中文語料數(shù)據(jù)庫WuDaoCorpora
WuDaoCorpora數(shù)據(jù)集的數(shù)據(jù)規(guī)模達(dá)2TB,超出之前全球最大的中文語料庫CLUECorpus2020十倍以上,同時(shí)著重去除了數(shù)據(jù)中包含的隱私信息,防止了隱私泄露。另外,WuDaoCorpora的數(shù)據(jù)來源豐富,包括新聞咨詢、評論、百科、論壇、博客、學(xué)術(shù)論文等,使得該數(shù)據(jù)集能夠適用于不同種類的自然語言處理任務(wù),訓(xùn)練出的模型泛化性更強(qiáng)。此外,WuDaoCorpora數(shù)據(jù)標(biāo)簽的完備性較高,語料中包含醫(yī)療、法律、金融等領(lǐng)域標(biāo)簽,可以依據(jù)需求抽取某個(gè)特定領(lǐng)域的數(shù)據(jù),用于訓(xùn)練該領(lǐng)域的模型,也可以用于對大模型進(jìn)行微調(diào),構(gòu)建某一特定領(lǐng)域的應(yīng)用。
該數(shù)據(jù)集不僅為“悟道”項(xiàng)目提供了數(shù)據(jù)支撐,還可被用于中文自然語言處理領(lǐng)域的多種任務(wù)模型訓(xùn)練,包括文本生成模型、詞嵌入模型、問答對話模型等,對于國際自然語言處理領(lǐng)域的發(fā)展將有著積極的促進(jìn)作用。
應(yīng)用生態(tài)“三步走”:探索“悟道”大模型生態(tài)發(fā)展
在模型研發(fā)的同時(shí),智源研究院也在同步探索“悟道”模型的應(yīng)用生態(tài)建設(shè)模式。據(jù)唐杰教授介紹,后續(xù)“悟道”模型將以開放API(應(yīng)用程序接口)的形式對外提供服務(wù),用戶通過申請并經(jīng)授權(quán)后可以基于模型API開發(fā)各類智能化應(yīng)用。另外,也會開源模型的社區(qū)版本,服務(wù)我國AI科研發(fā)展。

智源研究院學(xué)術(shù)副院長 唐杰
據(jù)唐杰教授介紹,下一步,“悟道”模型應(yīng)用生態(tài)建設(shè)分為三個(gè)主要階段,分別關(guān)注示范應(yīng)用、API生態(tài)及社區(qū)運(yùn)營維護(hù)等。第一階段為示范性應(yīng)用搭建,將構(gòu)建面向電子商務(wù)、智能文本服務(wù)、垂直領(lǐng)域以及數(shù)個(gè)獨(dú)立的示范性應(yīng)用,將開放幾個(gè)高質(zhì)量的應(yīng)用Demo,支持用戶在平臺頁面上使用及測試。第二階段為API及平臺生態(tài)構(gòu)建,將設(shè)計(jì)多個(gè)API,支持對模型的不同請求方式,構(gòu)建支持高并發(fā)、高速推理的API接口,分別支持企業(yè)級用戶、個(gè)人獨(dú)立開發(fā)者對模型或特定功能的請求。第三階段為社區(qū)運(yùn)營及迭代,將逐步增量擴(kuò)大在線評測,構(gòu)建開發(fā)者及使用者社區(qū),建立完善的使用反饋機(jī)制,并作為模型迭代的參考標(biāo)準(zhǔn),同時(shí)加強(qiáng)社區(qū)維護(hù)及管理,加快模型迭代。
目前,智源研究院已啟動第一階段的示范性應(yīng)用搭建,正與快手、搜狗、360、阿里、智譜華章、一覽群智、循環(huán)智能、新華社等機(jī)構(gòu)就模型的應(yīng)用進(jìn)行洽談,聯(lián)合構(gòu)建一批工業(yè)級示范性應(yīng)用。
下一步,智源研究院將加強(qiáng)用戶的開發(fā),做好用戶服務(wù),與AI龍頭企業(yè)共同研發(fā)更多工業(yè)級示范性應(yīng)用,并將加快推動API生態(tài)構(gòu)建及社區(qū)運(yùn)營迭代工作,通過舉辦學(xué)術(shù)交流、技術(shù)挑戰(zhàn)賽等活動提高“悟道”模型的影響力,吸引更多AI企業(yè)、研究機(jī)構(gòu)、個(gè)人開發(fā)者等開展基于模型的應(yīng)用開發(fā)工作,推動構(gòu)建國際領(lǐng)先的超大規(guī)模智能模型應(yīng)用生態(tài)。
核心關(guān)鍵字: 人工智能| 留言與評論(共有 0 條評論) |



