人工智能,也應該學會遺忘

圖片來源@視覺中國
文 | 每日科技前瞻
我們的故事還是從AlphaGo這里說起,無他,我實在是太喜歡這個小家伙了。
在AlphaGo的棋盤招式中,偶有出現之前出現在棋譜里的招式。他通過強化學習,“記住”(至少是我們認為那個意義上的記住)了圍棋的局面較優解。這樣超凡的學習能力和“記憶力”(雖然運行方式和人類的記憶不同)是AI在這些方面超越人類,出類拔萃的保障之一。
如果把我們代入人工智能的視角,有了這樣的記憶力,我們將看到一個學習成本空前降低,創造力勃發的世界。但是當我們有限的記憶芯片被填滿之后呢?我們不得不撞上一個名為“遺忘”的問題。
人們有在互聯網上提出“被遺忘”的權利,那在人工智能眼前呢?
人工智能,也應該學會“遺忘”。
遺忘,不止應該是對人類
人們似乎永遠無法完全控制自己的記憶,我們都知道忘記一些事情是什么感覺。即使是那些擁有非凡記憶力的人,也無法確保自己的記憶能夠保持多長的時間。

也正是因為此,我們發明了紙筆,發明了硬盤,發明了各種各樣能夠把我們的記憶以物質記錄的方式存留下來的方式。人工智能,也是我們“記住自己”的一種方式。
但是我們的記錄與記憶是有選擇的:誰都不想把那些不好的回憶在自己的腦海里留存太久,誰都不會去刻意記住生活中繁雜的細枝末節。我們保留了有用的、有價值的記憶,而忘記了價值較低的信息。我們對于這些記憶的物質承載工具大多也是這個態度。
同樣,對于AI也應該是這樣的,我們應該有能力讓一個人工智能忘記它所見證的一切。
“遺忘”對人工智能機器人來說勢在必行
計算機中的存儲器通常用來描述其存儲需要回憶的信息的能力,以及存儲這些信息的計算機的物理部件。例如,當計算機的工作存儲器不再需要某個任務時,在人類的干預下,它會“忘記”數據,從而釋放出計算資源用于其他任務。
這也同樣適用于人工智能。不過,機器學習算法并不善于知道什么時候保留舊信息,什么時候丟棄過時的信息。比如,非常科幻的“連接主義人工智能”,就面臨著幾個與“遺忘”有關的問題。比如過度擬合,即學習機器從過去的經驗中儲存過于詳細的信息,從而妨礙了它概括和預測未來事件的能力。
關于這樣的“過度擬合”問題,在國外的TowardsDataScience 論壇上,有一位極客為我們分享了他用程序跑出來的例子。
他首先使用sklearn 的“ make _ classification”函數生成一個數據集。并將這些數據集生成的點分成兩種顏色,并且放置在同一個平面直角坐標系內,如圖所示。
注意紅點和藍點的顏色有所區別
在這項實驗中,過度擬合的定義是:反映該模型學習輸入的示例,但不能推廣到其它示例。比如,在這個系統中,他通過過度擬合要求電腦繪制紅色點的存在邊界,在編寫完相應的程序并且運行之后,電腦給出了這樣子的回答。
結果
他確實“忠實”地幫我們把紅色點與藍色點區分開了,但是其發現的模式毫無意義,因為生成這些點的規律和自己擬合出來的結果根本就不是一個東西。這樣擬合出來的模型,根本沒法用。
沒有經過“遺忘”提純,過度擬合的出來的數據,就像人類的“經驗主義與教條主義”,比如炒股找類似圖形判斷未來走勢,比如不結合實際情況去找別人的解決方案……不懂得隨機應變與因勢利導,只會死套公式找公式化的解決方案,但是這樣的方案很多時候并不存在。
要解決這樣的過度擬合難題,“遺忘”就勢在必行。
目前有一項技術叫做長短期記憶網絡(LSTM)算法,它使用特定的學習機制來決定在任意一個節點哪些信息需要記住,哪些需要更新,哪些需要關注。用香港科技大學相關領域的專家Edwin Chen的話來說,LSTM應該達到這樣的狀態:
“當場景結束,模型應該忘記當前場景的位置,所處時間,并重置任何特定場景的信息;然而,如果場景中的一個角色死亡了,機器則應該繼續記住他不再活著的事實。因此,我們希望機器能學習掌握一個相互獨立的遺忘/記憶機制,這樣當新信息進來時,它知道什么觀念該保留什么該丟棄。”這些遺忘的過程,應該在沒有人工干預的前提下獨立完成。
對于人類來說,遺忘不僅僅是一次失敗的記憶,還是一個積極的過程,可以幫助大腦獲取新信息并更有效地做出決策。
對于人工智能來說也是如此。
遺忘或許是AI進步的關鍵
我們先做一個看起來不是那么恰當的比喻,所有“記憶”的物質承載都是有承載上限的,日記本寫滿了就沒法再記,硬盤的容量塞滿了也放不下更多的東西。如果放任所有你看到的信息都記在你的電腦硬盤里,它可能很快就會被塞滿,然后“寫入”這個類似于“記憶”的東西就會罷工不干。
如果教一個說中文的孩子學習英語,孩子會很容易把學習中文的方法應用到英語的學習中(雖然這兩者不屬于同一語系,但是中間還是有相通的部分,同一語系中的相通部分更多,所能“借鑒”的經驗也就更多),比如名詞,句子構建,語序區別,同時忘記那些不相關的東西,比如口音,語調,沒必要的俚語,我們人類可以同時進行遺忘和學習,并且總結他們之中的共同經驗,放棄實際應用中毫無必要的細枝末節。
但是機器人的處境可不一樣,如果訓練神經網絡學習英語,則他會通過“深度學習”整出一個適用于英語的學習方式。這讓他在學英文的時候有了無可比擬的優勢,但如果還想同時教它中文,對中文內容的學習將覆蓋神經網絡以前為學習英語所獲得的知識,因為這與之前的學習方式矛盾,如果存儲內存一定,那么只好刪除所有內容并重新開始。
其實這也很好理解,現在的神經網絡不允許AlphaGo在一個深度學習過程中同時學會圍棋和五子棋,盡管他們棋具都很相似,但是規則大不同。如果用圍棋的下法去下五子棋會速敗,用五子棋的下法去下圍棋會給自己挖出一個大坑。這被稱為“?災難性遺忘?”,也是神經網絡的一個局限。
算法不能選擇忘記什么,目前只能依靠人來對信息進行篩選,這是人相比機器的思維優勢之一。通過選擇性遺忘的提純,AI可以更好地去理解人類的命令,解決更多的實際問題。比如在語音識別中摒棄各種干擾的聲音,抓住最核心的內容,并且通過最正確的方式將其實現。
如果只是進行大量數據持續的收集,而沒有簡單的方法通過“遺忘”提純數據,那人工智能也僅僅是在有限的容量上,在一個狹隘的角度里堆砌和發展我們的智慧成果而已。
因此,學會遺忘是人工智能面臨的重大挑戰之一,可能也是這個行業破局的關鍵所在。人類大腦和遺忘的過程中,有可能藏著顛覆現有AI技術的秘密。
忘記該忘記的,改變能改變的
醫療機器人進行醫療診斷,智能家居設備監控我們的行動,安全機器人通過視頻攝像機和熱成像進行巡邏。面對這些海量存儲的數據,決定一個機器人什么時候應該忘記,是一個深刻的人類挑戰。
但是如果成功了呢?
前面我們提到了,因為過度擬合的存在,讓AI在對未來做出邏輯判斷時可能會出現失真的問題。如果我們把“遺忘”這把鑰匙交給了人工智能,讓他們通過合理的選擇性遺忘,走出了過度擬合可能存在的問題。那么,我們擁有一個“百科全書”式的AI時,它(或者應該是他)能通過各種被記憶與遺忘提純的數據,對未來進行精準的預測嗎?
這是人們一直在期待的圖景,也是我們隱隱害怕的圖景。
阿西莫夫有一篇短篇科幻小說,叫做《最后的問題》。書中的“超腦”在一代一代的開發之后,就有了這樣解答問題的能力。如果能夠將這樣的人工智能制造出來,并且處于完全的控制之下,對于人類社會來說可能都是一場意義非凡的飛躍。
忘記該忘記的,改變能改變的,刈除雜草,才有新生,此之謂也。
更多精彩內容,關注鈦媒體微信號(ID:taimeiti),或者下載鈦媒體App
核心關鍵字: 人工智能| 留言與評論(共有 0 條評論) |
|



