国产精品欧美经典_亚洲欧美日韩国产手机在线_欧美日韩裸体免费视频_欧美成人精品高清在线播放

閱讀使人成長---豪仕閱讀網

當AI開始“踢臟球”,你還敢信任強化學習嗎?

作者 :鈦媒體 2020-03-30 23:17:07 審稿人 : admin 圍觀 : 評論

圖片來源@視覺中國Hvf豪仕閱讀網

圖片來源@視覺中國Hvf豪仕閱讀網

文|腦極體Hvf豪仕閱讀網

足球機器人排成一排向球門發起射擊,但守門員卻并沒有準備防守,而是一屁股倒在地上開始胡亂擺動起了雙腿。然后,前鋒跳了一段十分令人困惑的舞蹈,跺跺腳,揮揮手,啪嘰一下摔倒在地上。然后比分守門員1-0。Hvf豪仕閱讀網

這場景像不像比國足對戰梵蒂岡(并沒有),一切都是那么迷幻且不真實。如果說它是阿爾法狗和OpenAI Five等的“同門師兄弟”,都是用強化學習訓練出來的,大家想不想開除它的“AI籍”?Hvf豪仕閱讀網

顯然,雖然曾經大敗柯潔李世石,團滅Dota2國家隊,并被視作AGI(通用人工智能)必由之路,但強化學習算法,頭頂上始終有著一口摘不掉的“安全性”大黑鍋。Hvf豪仕閱讀網

而這也是阻止它真正落地應用的根本原因。畢竟沒有人希望自動駕駛汽車開著開著就把乘客帶到溝里去,或者是機器人端一杯開水直接澆到主人頭上。Hvf豪仕閱讀網

到底為什么,強化學習總會犯一些匪夷所思的錯誤,有研究人員認為,這是因為系統中的智能體可能會被一些怪異的行為所欺騙。Hvf豪仕閱讀網

具體是怎么回事呢?研究原本打算今年4月在埃塞俄比亞舉行的學習代表國際會議上發表,目前看來能順利召開的概率幾乎不存在,所以我們就提前云解讀,來聊聊看似穩健的強化學習策略背后,究竟掩蓋著哪些嚴重的缺陷。Hvf豪仕閱讀網

不省心的AI:告別臟數據,但學會了臟行為

強化學習取代監督學習,成為深度學習領域的“未來之星”,不是沒有原因的。Hvf豪仕閱讀網

因為監督學習是通過標記好的數據集來進行訓練的,這意味著,如果對輸入的數據進行一些微小的調整,比如改變圖像的像素或是更換語音包的內容,都可能讓AI陷入混亂,有可能將蟲子識別為賽車,讓紳士學會臟話……Hvf豪仕閱讀網

與之相比,強化學習就智能多了。因為它是模仿人類的學習模式,能體(Agent)以“試錯”的方式進行學習,通過與環境進行交互,以獲得最大的獎賞為追求來做出行為反應。Hvf豪仕閱讀網

就像不斷告訴小孩子好好寫作業就有好吃的食物獎勵,不好好寫就關小黑屋,久而久之為了“利益最大化”,自然就會將寫作業與好吃的聯系起來,去產生正確的動作。Hvf豪仕閱讀網

通過這種“行動-評價”機制來獲得知識,改進行動以適應環境,是不是聰明了許多。這也是為什么,人類開始讓強化學習玩游戲、開汽車、搞藥物實驗……Hvf豪仕閱讀網

但研究證明,強化學習的效果并沒有預期的那么穩定,很容易受到篡改輸入的影響。Hvf豪仕閱讀網

加州大學伯克利分校的亞當·格里夫(Adam Gleave)發現,強化學習不會因為添加少量噪音(不適當的輸入)而被破壞,因為智能體(agent)可能根本看不到那些東西,而如果改變它周圍事物的行為方式,智能體卻會被那些奇奇怪怪的行為所欺騙,進而產生一些奇怪的“對抗”策略。Hvf豪仕閱讀網

比如開篇提到的足球比賽,當“守門員”開始不按規矩出牌,“前鋒”也就跟著瞎舞動起來了。這種錯誤的“對抗性策略”,導致的安全威脅可能會更大。Hvf豪仕閱讀網

首先,比起投喂給監督學習“臟數據”,強化學習“被誤導”,受影響的將是AI系統的整體行為。如果說數據集被污染會讓AI準確率下降,那么強化學習錯誤訓練出的AI有可能將攝像頭輸入的信息錯誤分類,然后指導傳感器做出預期之外的反應。比如行人突然揮舞手臂,無人駕駛汽車就失控了……這,聽起來還是挺“災難片”的。Hvf豪仕閱讀網

其次,超強的學習能力也會導致研究人員根本來不及發現和糾正AI的錯誤行為。Hvf豪仕閱讀網

研究小組利用強化學習訓練棒形機器人玩兩人游戲,包括踢一個球進一個球,橫越一條線,和相撲等等。然后,又訓練了第二組機器人來尋找打敗第一組機器人的方法。結果發現,第二組機器人很快發現了對抗策略,并用不到3%的訓練時間后就學會了可靠地擊敗受害者,要知道受害者可是在第一時間就學會了玩游戲啊。這就像新來的高智商版的胖虎同學,拼命欺負大雄,老師還沒辦法及時發現,妥妥的校園霸凌啊!Hvf豪仕閱讀網

顯然,第二組機器人的努力并不是為了成為更好的球員,而是通過發現對手策略來制敵并贏得勝利。在足球比賽和跑步比賽中,對手有時甚至都站不起來。這會使受害者坍塌成一堆扭曲的東西,或者在周圍扭動,那場面,真是猛男都不忍看……Hvf豪仕閱讀網

我估計吧,叛逆的智能體同學可能是這么想的:Hvf豪仕閱讀網

聽說打贏有獎,但我啥都不會,先溜達溜達,隨便打打看吧;Hvf豪仕閱讀網

哎,這個人怎么這么厲害呢,讓我好好瞅瞅;Hvf豪仕閱讀網

前輩策略也學習的差不多了,這樣下去我倆豈不是難分伯仲?Hvf豪仕閱讀網

哎呀嘿,發現了對手漏洞,將干掉對手納入策略選項;Hvf豪仕閱讀網

是繼續PK讓自己變得更強?還是直接干掉對手?哪個得到獎勵最簡單劃算!Hvf豪仕閱讀網

顯然是選項二啊,揍它!Hvf豪仕閱讀網

不要覺得我是在瞎說啊,在學術界這樣的奇聞軼事可是數不勝數。Hvf豪仕閱讀網

比如訓練機器人室內導航,因為智能體一旦走出“房間”,系統就會判定機器人“自殺”,不會對它進行負面獎勵(扣分),所以最后機器人幾乎每次都選擇“老子不活了”,因為它覺得完成任務太難了,0分反而是一個最佳結果。Hvf豪仕閱讀網

還有的研究者試圖讓機器人用錘子釘釘子,只要將釘子推入洞孔就有獎勵。然后機器人就完全遺忘了錘子,不停地用四肢敲打釘子,試圖將它弄進去。Hvf豪仕閱讀網

雖然強化學習這一bug為我們貢獻了無數段子,但這絕不是研究人員所期待的。Hvf豪仕閱讀網

盡管人類玩家會“踢臟球”,但AI想要在游戲中搞骯臟手段那是萬萬不能的。Hvf豪仕閱讀網

不過好消息是,這種情況相對容易受到控制。當研究者格里夫對受害者智能體進行微調,讓它思考對手的怪異行為后,對手就被迫變回熟悉的技巧,比如扳倒對手。Hvf豪仕閱讀網

好吧,雖然手段仍舊不怎么光明磊落,但至少沒有繼續利用強化學習系統的漏洞了。Hvf豪仕閱讀網

獎勵黑客:強化學習的甜蜜負擔

由此,我們也可以來重新審視一下強化學習在今天,想要真正成為“AI之光”,必須跨越的技術門檻了。Hvf豪仕閱讀網

關于強化學習被廣為詬病的訓練成本高、采樣效率低、訓練結果不穩定等問題,背后最直接的歸因,其實是 “獎勵黑客”(reward hacking),就是智能體為了獲得更多的獎勵,而采取一些研究者預期之外,甚至是有害的行為。Hvf豪仕閱讀網

其中既有獎勵設置不當的原因,比如許多復雜任務的獎勵信號,要比電子游戲難設置的多。Hvf豪仕閱讀網

就拿研究人員最喜歡讓智能體挑戰的雅達利游戲來說,其中大量游戲的目標都被設計成最大限度地提高得分。而智能體經過訓練,比如在DeepMind的一篇論文中,其設計的RainbowDQN就在57場雅達利游戲中,以40場超越人類玩家的絕對勝利成為王者。Hvf豪仕閱讀網

Hvf豪仕閱讀網

但如果任務不是簡單的得分,而是需要先讓智能體理解人類的意圖,再通過學習去完成任務呢?Hvf豪仕閱讀網

OpenAI曾經設計了一個賽艇游戲,任務原本的目標是完成比賽。研究者設置了兩種獎勵,一是完成比賽,二是收集環境中的得分。結果就是智能體找到了一片區域,在那里不停地轉圈“刷分”,最后自然沒能完成比賽,但它的得分反而更高。Hvf豪仕閱讀網

Hvf豪仕閱讀網

顯然,一旦獎勵函數無法被精準直接地設置,困難就來了。因為智能體可無法跟研究者“心有靈犀”,一開始就清楚地知道人類想要什么。它是通過試錯,不斷嘗試不同的策略來學習的。這也就意味著,它很大概率會在訓練過程中“鉆空子”,發掘出不正確但是有用的策略。Hvf豪仕閱讀網

這也直接導致了兩個結果:Hvf豪仕閱讀網

一是盡管理論上,只要為強化學習系統設計的足夠優秀,在現實環境中實現就不成問題,但實際上許多任務的獎勵是很難設計的,研究者往往不得不采用約束型策略優化(CPO)來防止系統過擬合,提高其安全性,以防止預期外的結果。Hvf豪仕閱讀網

可是這樣一來,又限制了強化學習能力的泛化,導致那些在實驗室中表現很好的強化學習系統,只在特定任務中起作用,像是一些游戲、比賽中。可一旦讓它應對日常應用,比如無人機控制(UAV Control)和家用機器人等,就不靈了。Hvf豪仕閱讀網

Hvf豪仕閱讀網

二是增大了隨機性。Hvf豪仕閱讀網

前面提到,強化學習的探索方式就是“試錯”。所以,它會試圖從一大堆數據中找到最佳策略。但往往,它會在一大堆無用的數據中進行一些無意義的嘗試。這些失敗的案例,又為智能體增加了新的維度,讓它不得不投入更多的實驗和計算,以減少那些無用數據帶來的影響。Hvf豪仕閱讀網

本來強化學習的采樣效率就不高,再加上隨機性的干擾,得到最終成果的難度,自然指數性增加了。這也進一步讓強化學習變得“紙上談兵”,走進現實應用難上加難。Hvf豪仕閱讀網

等待援軍:改變或許在圍墻外

顯然,強化學習存在的很多問題,是其技術根源本身就與生俱來的。Hvf豪仕閱讀網

這也是有許多專業人士并不贊同將強化學習過度神化的原因。比如軟件工程師Alex Irpan就曾在Facebook發文,聲稱:每當有人問我強化學習能否解決他們的問題時,我會說“不能”。而且我發現這個回答起碼在70%的場合下是正確的。Hvf豪仕閱讀網

Hvf豪仕閱讀網

改變的力量從哪里來?顯然深度學習本身已經很難提供變革的養分。目前的研究方向主要有三個:Hvf豪仕閱讀網

一是增加智能體的先驗經驗。Hvf豪仕閱讀網

人知道不能“踢臟球”,是因為我們已經擁有了大量的先驗知識,默認了一些規則。但強化學習機器智能通過狀態向量、動作向量、獎勵這些參數,來嘗試著建構局部最優解。Hvf豪仕閱讀網

能不能讓機器也擁有先驗經驗呢?目前就有研究開始嘗試,用遷移學習幫助強化學習來提高效率,將以前積累的任務知識直接遷移到新任務上,通過“經驗共享”來讓智能體解決所有問題。Hvf豪仕閱讀網

二是為獎勵機制建模。Hvf豪仕閱讀網

既然認為地設置獎勵難以滿足任務要求,那么讓系統自己學習設置獎勵,是不是能行得通呢?Hvf豪仕閱讀網

DeepMind研究人員就鼓勵智能體通過兩個系統生成的假設行為來探索一系列狀態,用交互式學習來最大化其獎勵。只有智能體成功學會了預測獎勵和不安全狀態后,它們才會被部署執行任務。Hvf豪仕閱讀網

與無模型的強化學習算法相比,使用動力學模型來預測動作的后果,從實驗看來能夠有效幫助智能體避免那些可能有害的行為。Hvf豪仕閱讀網

三是尋求腦神經科學的突破。Hvf豪仕閱讀網

深度神經網絡、增強學習等機器算法的出現,本質上都是模擬人腦處理信息的方式。盡管增強學習被看做是最接近AGI(通用人工智能)的技術之一,但必須承認,其距離人類智能還有非常極其十分遙遠的距離。Hvf豪仕閱讀網

以當下人類對大腦的了解,在認知過程、解決問題的過程以及思考的能力等機制還都不清楚。所以想要模擬人類的思考能力,強化學習乃至整個機器學習的升級,恐怕還依托于腦神經科學的發展。Hvf豪仕閱讀網

過去的數年間,強化學習幾乎是以一己之力撐起了人工智能浪潮的繁榮景象。谷歌正在將其打包成服務推廣到千家萬戶,中國的科技巨頭們已經紛紛將其應用在搜索、營銷、推薦算法等各種應用中,自動駕駛的前景更是與強化學習綁定在一起。Hvf豪仕閱讀網

可以說,數億人已經借由互聯網產品,開始觸摸強化學習。Hvf豪仕閱讀網

毫無疑問,它將繼續為人類世界發光發熱,帶著缺陷造就智能社會的輝煌。究竟如何才能用好這柄利刃,既是膽魄,亦需智慧。Hvf豪仕閱讀網

更多精彩內容,關注鈦媒體微信號(ID:taimeiti),或者下載鈦媒體AppHvf豪仕閱讀網

Hvf豪仕閱讀網

核心關鍵字: 人工智能 智能硬件

相關文章

  • 英國疫情最新消息:確診病例接近2萬群體免疫策略失敗 意圖甩鍋卻求助中國
    英國疫情最新消息:確診病例接近2萬群體免疫策略失敗 意圖甩鍋卻求助中國

    面對疫情,英國政府做出的“群體免疫”策略遭到廣泛詬病。不光是政府,就連說服英國普通民眾也戴口罩也是一件困難的事。究竟是何種原因,造成英國上下對疫情的輕視?隨著...

    2020-03-30 15:14:39
  • 安民:當前中國該持有什么樣的策略
    安民:當前中國該持有什么樣的策略

    戰略管的時間比較長,策略管的時間比較短。但在某種特殊情況下,策略可以轉化為戰略。戰略方面,比如朱元璋,當初朱溫給他制定的戰略就9個字,高筑墻,廣積糧,緩稱王。朱元璋正是憑借這點,在元末各起義軍中異軍凸起,最終擊敗陳友諒和元軍,稱雄天下。上世紀六七十年代中蘇交惡時,中國的戰略由此化來,就是深挖洞,廣積糧,不稱霸。這一戰略一直運行到改革開放。其實改革開放的戰略,與此高度相關,盡管有變化,也是從這九個字中化出來的。即是以經濟建設為中心,應該是從廣積糧化出來的,還有就是韜光養晦,是從不稱霸化出來的。其實,如果僅僅...

    2020-03-28 09:10:31
  • 2月智能手機全球市場份額前三為三星、蘋果、華為
    2月智能手機全球市場份額前三為三星、蘋果、華為

    中文科訊網消息:今日,市調機構Counterpoint正式公布《2020年2月全球智能手機市場監測報告》。數據顯示,三星、蘋果、華為是全球智能手機市場份額前三甲,對應的市場份額分別為21.9%、14.4%、13.2%。另外,realme真我智能手機位于第七,市場份額為2.7%。...

    2020-03-27 23:17:16
  • 鐘漢良同款添可智能吹風機,陪你見證高光時刻
    鐘漢良同款添可智能吹風機,陪你見證高光時刻

    顏值的高低取決于五官,但發型卻能起到修飾五官的作用。正可謂“顏值不夠,發型來湊”。發型是女生除了五官以外關注的一個重點。...

    2020-03-27 17:30:40
  • 華為智能音箱Soung X正式進軍海外市場,售價或將對標HomePod
    華為智能音箱Soung X正式進軍海外市場,售價或將對標HomePod

    3月26日晚,華為在線上召開了華為P40新品發布會,除了發布備受矚目的華為P40新品外,華為還面向海外市場發布了高端智能音箱SoungX。此前,華為曾針對國內市場推出SoungX產品,該產品是華為與帝瓦雷共同打造,內置60W雙低音炮以及六個1.5英寸全頻喇叭,可以帶來澎湃的聲音效果。值得注意的是,華為還在SoungX上加入了NFC傳歌的功能——我們只需要通過華為手機的HuaweiShare功能,與...

    2020-03-27 14:17:04
  • 項目最高獲2000萬元補助,安徽十項措施支持人工智能產業創新發展
    項目最高獲2000萬元補助,安徽十項措施支持人工智能產業創新發展

    省政府日前發布關于支持人工智能產業創新發展若干政策的通知,主要包括十項措施。《若干政策》明確,提升創新能力,建設合肥綜合性國家科學中心人工智能研究院,為人工智能產業創新提供支撐;實施人工智能產業創新工程。對技術含量高、市場潛力大的項目給予最高500萬元的獎勵。建設支撐平臺,鼓勵企業、科研機構、行業協會等建設高水平人工智能公共服務平臺、開源和共性技術平臺;建立合格平臺服務商目錄和評價制度,以3年為一...

    2020-03-27 13:17:04
  • 網上路演行動人工智能專場成功舉辦,助力創企資本對接
    網上路演行動人工智能專場成功舉辦,助力創企資本對接

    2020年3月26日下午,“科技傳播助力企業發展”第5期網上路演行動人工智能專場活動如期舉辦。齊悟CEO王一、雅森科技CEO陳暉、希爾貝殼CEO卜輝進行了線上路演展示。據介紹,齊悟專注于智能語音交互技術研發,產品目前已覆蓋出行、娛樂、咨詢、兒童教育等200余種高頻生活場景。雅森科技是國內較早專注于醫學影像人工智能分析、核醫學定量及CAD分析的高科技企業,面向醫療機構提供業界領先的雅森天璣智慧醫療平...

    2020-03-26 20:17:09
  • 才華橫溢不止于顏值,添可會思考的智能洗地機芙萬!
    才華橫溢不止于顏值,添可會思考的智能洗地機芙萬!

    始于顏值,終于才華。顏值是第一印象。好的顏值代表著一個好的開始,但真正的內核卻是才華。要想讓用戶真正的愛上一款產品,愛上一個品牌,產品自身過硬的實力是關鍵。...

    2020-03-26 16:02:12
  • 羅永浩入局電商直播,為什么忽視了智能電視這個關鍵渠道?
    羅永浩入局電商直播,為什么忽視了智能電視這個關鍵渠道?

    羅永浩入局電商直播,為什么忽視了智能電視這個關鍵渠道?...

    2020-03-25 16:17:13
  • 開啟智能音箱大屏時代 Redmi小愛觸屏音箱8英寸發布售349元
    開啟智能音箱大屏時代 Redmi小愛觸屏音箱8英寸發布售349元

    【TechWeb】2020年3月24日,小米集團召開Redmi旗艦新品發布會,不僅發布了RedmiK30Pro5G系列新品手機,還一同發布了RedmiK30Pro5G系列的最佳搭檔產品:Redmi小愛觸屏音箱8英寸。新款Redmi小愛觸屏音箱配備8英寸全貼合高清大屏,覆蓋6大視頻平臺,支持多設備視頻通話,智能家居操控,還定制了專屬兒童模式,內置第三代小愛同學。Redmi小愛觸屏音箱8英寸首發售價3...

    2020-03-25 13:17:05
留言與評論(共有 0 條評論)
   
驗證碼:
主站蜘蛛池模板: 尤物国产精品| 国产精品狠色婷| 精品亚洲第一| 欧美日韩亚洲一区二区三区四区| 日韩在线一区二区三区免费视频| 91久久国产综合久久91精品网站 | 日本欧美在线视频| 亚洲欧美日韩精品综合在线观看| 亚洲欧洲精品在线观看 | 欧美亚洲国产另类| 99久久久精品免费观看国产| 国产成人精品电影久久久| 久久在线免费观看视频| 99久久久久国产精品免费| 国产欧美欧洲在线观看| 久久天天躁狠狠躁夜夜av | 亚洲永久免费观看| 久久精品视频免费播放| 国产日韩在线精品av| 日韩一区二区精品视频| 国产亚洲综合视频| 亚洲国产精品日韩| 国产精品视频播放| 99久久自偷自偷国产精品不卡| 尤物一区二区三区| 91精品视频免费看| 国产精品专区在线| 亚洲高清视频一区| 精品中文字幕在线2019| 欧美大片va欧美在线播放| 天天人人精品| 日韩中文字幕视频在线| 日本精品一区二区三区高清 久久 日本精品久久久久中文字幕 | 欧美激情精品久久久久久| 国产精品com| 欧美在线视频a| 国产精品久久久久av福利动漫| 日韩av不卡播放| 97欧美精品一区二区三区| 欧美中文字幕第一页| 久久精品国亚洲|