這裏有一篇深度強化學習勸退文 2018-02-25 本文作者 Frankenstein,首發於 作者的知乎主頁 。 今天在學校又雙叒叕提到了 Deep Reinforcement Learning That Matters 這篇打響 DRL(Deep Reinforcement Learning, 深度強化學習)勸退第一槍的文章後,回來以後久違刷了一下推特,看到了這篇爆文 Deep Reinforcement Learning Doesn't Work Yet ,或可直譯爲深度強化學習還玩不轉或意譯爲深度強化學習遠不能即插即玩。 看完以後很多從自己去年七月入坑以來隱隱約約的困惑都得到了解答。讀完大有如不見此文,萬古如長夜之感。心裏激動,一時難以自抑。知乎上深度強化學習的內容比較少,最好的私以爲是 智能單元 ,此外還有許多零散的論文介紹、課程筆記、問答等等,但好像沒人提過這篇文章。這篇文章是我入坑以來看到的深度強化學習方面最好的階段性總結,強烈建議應該作爲深度強化學習的第一課,看完以後大家再慎重考慮到底要不要入坑。 先看一下作者的背景。作者叫 Alex Irpan,現爲谷歌大腦機器人團隊的軟件工程師。他從伯克利拿到的計算機科學本科學位,本科的時候曾經在伯克利人工智能實驗室(Berkeley AI Research (BAIR) Lab)進行本科科研,導師是 DRL 大牛 Pieter Abbeel,他還和 John Schulman 工作過。 這篇文章一上來就指出深度強化學習是個大坑。它的成功案例其實很少,但每個都太有名了,例如用 Deep Q Network(DQN)在 Atari games 上用原始像素圖片作爲狀態達到甚至超越人類專家的表現、通過左右互搏(self-play)等方式在圍棋上碾壓人類、大大降低了谷歌能源中心的能耗等等。造成的結果就是沒有從事過深度強化學習的研究人員對它產生了很大的錯覺,高估了它的能力,低估了它的難度。 強化學習本身是一個非常通用的人工智能範式,在直覺上讓人覺得非常適合用來模擬各種時序決策任務,如語音、文本類任務。當它和深度神經網絡這種只要給我足夠層和足夠多的神經元,可以逼近任何函數的非線性函數近似模型結合在一起感覺要上天啊,無怪乎 DeepMind 經常號...
20年後, 精華區還是很重要, 有FB, Google Talk, FB Bot, Line再加上重要的東西放在Google Blogger, 應該可以整理一些有記憶的東西在這裡