跳到主要內容

發表文章

目前顯示的是有「AI」標籤的文章

這裏有一篇深度強化學習勸退文

這裏有一篇深度強化學習勸退文  2018-02-25 本文作者 Frankenstein,首發於 作者的知乎主頁 。 今天在學校又雙叒叕提到了 Deep Reinforcement Learning That Matters 這篇打響 DRL(Deep Reinforcement Learning, 深度強化學習)勸退第一槍的文章後,回來以後久違刷了一下推特,看到了這篇爆文   Deep Reinforcement Learning Doesn't Work Yet ,或可直譯爲深度強化學習還玩不轉或意譯爲深度強化學習遠不能即插即玩。 看完以後很多從自己去年七月入坑以來隱隱約約的困惑都得到了解答。讀完大有如不見此文,萬古如長夜之感。心裏激動,一時難以自抑。知乎上深度強化學習的內容比較少,最好的私以爲是 智能單元 ,此外還有許多零散的論文介紹、課程筆記、問答等等,但好像沒人提過這篇文章。這篇文章是我入坑以來看到的深度強化學習方面最好的階段性總結,強烈建議應該作爲深度強化學習的第一課,看完以後大家再慎重考慮到底要不要入坑。 先看一下作者的背景。作者叫 Alex Irpan,現爲谷歌大腦機器人團隊的軟件工程師。他從伯克利拿到的計算機科學本科學位,本科的時候曾經在伯克利人工智能實驗室(Berkeley AI Research (BAIR) Lab)進行本科科研,導師是 DRL 大牛 Pieter Abbeel,他還和 John Schulman 工作過。 這篇文章一上來就指出深度強化學習是個大坑。它的成功案例其實很少,但每個都太有名了,例如用 Deep Q Network(DQN)在 Atari games 上用原始像素圖片作爲狀態達到甚至超越人類專家的表現、通過左右互搏(self-play)等方式在圍棋上碾壓人類、大大降低了谷歌能源中心的能耗等等。造成的結果就是沒有從事過深度強化學習的研究人員對它產生了很大的錯覺,高估了它的能力,低估了它的難度。 強化學習本身是一個非常通用的人工智能範式,在直覺上讓人覺得非常適合用來模擬各種時序決策任務,如語音、文本類任務。當它和深度神經網絡這種只要給我足夠層和足夠多的神經元,可以逼近任何函數的非線性函數近似模型結合在一起感覺要上天啊,無怪乎 DeepMind 經常號...

完整盤點 201 年 AI 圈大小事,從語音辨識到深度學習全都包啦

假設你在 2017 年昏睡了一年,忽然驚醒的時候,想要了解這個世界在今年有哪些最值得驕傲的成就,這篇文章值得你花幾十分鐘讀一讀。 這一年,Google 發布了 Google Translate 的新模型,並詳細描述了網路結構——循環神經網路。Facebook 的聊天機器人,因為失控創造了自己的語言被關閉。DeepMind  的研究員在他們的文章中展示了如何生成語音。一個已經成功超越人類的深度學習成就叫做唇語識別。 本文將帶你瀏覽 2017 年幾乎所有最有意義的 AI 研究,從文本、語音、計算機視覺到強化學習和最重要的新聞。其中的大部分事件,文摘菌都在其發生之時做過相關報導,回憶起來,感慨萬分,我們也在相應部分附上了報導連結,方便查看細節。 1:文本 1.1 Google 神經機器翻譯 大約一年前,Google 發布了 Google Translate 的新模型,並詳細描述了網路結構——循環神經網路。連結: https://blog.statsbot.co/machine-learning-translation-96f0ed8f19e4 關鍵成果:與人類翻譯的準確率之差縮小了 55%-85%(研究者使用 6 分制打分標準評估得到)。如果不依賴 Google 龐大的數據庫進行訓練,這一結果很難復現。 1.2: 談判 你可能聽過這個謠言:Facebook 的聊天機器人,因失控創造自己的語言而被關閉。 點擊查看大數據文摘相關報導《 Facebook 謀殺“失控”機器人?一個常見 bug 引發的恐慌鬧劇 》 該聊天機器人原本被設計用來談判,其目的是與其他機器人(代理)進行文本談判並達成協議:  如何在兩個人之間分配物品(書籍和帽子等) 。每一個機器人(代理)有對方不掌握的交易信息。同時,談判的設定是不達成交易就不終止。 他們收集了一個人類談判的數據庫,並訓練出了一個監督式的循環網路。隨後,他們讓強化訓練後的機器人,通過自我對話的方式繼續訓練,直到與人類語言近似到一定程度為止。 該機器人已經學會了一種真正的談判技巧——對交易中的某些因素假裝表現出興趣,隨後僅僅通過犧牲它們來達成真正目的。 新聞裡聲稱機器人發明了一種新語言,這種說法有點過於誇張。當用同一個機器人來訓練的時候,它沒有被限制必須用...