當(dāng)前位置：首頁 > 智能硬件 > 人工智能AI

人工智能之深度強(qiáng)化學(xué)習(xí)DRL的解析

時(shí)間：2020-05-12 08:27:01

關(guān)鍵字：人工智能神經(jīng)網(wǎng)絡(luò) 智能體函數(shù)

手機(jī)看文章

掃描二維碼
隨時(shí)隨地手機(jī)看文章

[導(dǎo)讀] （文章來源：人工智能網(wǎng)）深度學(xué)習(xí)DL是機(jī)器學(xué)習(xí)中一種基于對(duì)數(shù)據(jù)進(jìn)行表征學(xué)習(xí)的方法。深度學(xué)習(xí)DL有監(jiān)督和非監(jiān)督之分，都已經(jīng)得到廣泛的研究和應(yīng)用。強(qiáng)化學(xué)習(xí)RL是通過對(duì)未知環(huán)境一邊探索一邊建

（文章來源：人工智能網(wǎng)）

深度學(xué)習(xí)DL是機(jī)器學(xué)習(xí)中一種基于對(duì)數(shù)據(jù)進(jìn)行表征學(xué)習(xí)的方法。深度學(xué)習(xí)DL有監(jiān)督和非監(jiān)督之分，都已經(jīng)得到廣泛的研究和應(yīng)用。強(qiáng)化學(xué)習(xí)RL是通過對(duì)未知環(huán)境一邊探索一邊建立環(huán)境模型以及學(xué)習(xí)得到一個(gè)最優(yōu)策略。強(qiáng)化學(xué)習(xí)是機(jī)器學(xué)習(xí)中一種快速、高效且不可替代的學(xué)習(xí)算法。

深度強(qiáng)化學(xué)習(xí)DRL自提出以來，已在理論和應(yīng)用方面均取得了顯著的成果。尤其是谷歌DeepMind團(tuán)隊(duì)基于深度強(qiáng)化學(xué)習(xí)DRL研發(fā)的AlphaGo，將深度強(qiáng)化學(xué)習(xí)DRL成推上新的熱點(diǎn)和高度，成為人工智能歷史上一個(gè)新的里程碑。因此，深度強(qiáng)化學(xué)習(xí)DRL非常值得研究。

深度強(qiáng)化學(xué)習(xí)DRL將深度學(xué)習(xí)DL的感知能力和強(qiáng)化學(xué)習(xí)RL的決策能力相結(jié)合，可以直接根據(jù)輸入的信息進(jìn)行控制，是一種更接近人類思維方式的人工智能方法。在與世界的正?；?dòng)過程中，強(qiáng)化學(xué)習(xí)會(huì)通過試錯(cuò)法利用獎(jiǎng)勵(lì)來學(xué)習(xí)。它跟自然學(xué)習(xí)過程非常相似，而與深度學(xué)習(xí)不同。在強(qiáng)化學(xué)習(xí)中，可以用較少的訓(xùn)練信息，這樣做的優(yōu)勢是信息更充足，而且不受監(jiān)督者技能限制。

深度強(qiáng)化學(xué)習(xí)DRL是深度學(xué)習(xí)和強(qiáng)化學(xué)習(xí)的結(jié)合。這兩種學(xué)習(xí)方式在很大程度上是正交問題，二者結(jié)合得很好。強(qiáng)化學(xué)習(xí)定義了優(yōu)化的目標(biāo)，深度學(xué)習(xí)給出了運(yùn)行機(jī)制——表征問題的方式以及解決問題的方式。將強(qiáng)化學(xué)習(xí)和深度學(xué)習(xí)結(jié)合在一起，尋求一個(gè)能夠解決任何人類級(jí)別任務(wù)的代理，得到了能夠解決很多復(fù)雜問題的一種能力——通用智能。深度強(qiáng)化學(xué)習(xí)DRL將有助于革新AI領(lǐng)域，它是朝向構(gòu)建對(duì)視覺世界擁有更高級(jí)理解的自主系統(tǒng)邁出的一步。從某種意義上講，深度強(qiáng)化學(xué)習(xí)DRL是人工智能的未來。

深度強(qiáng)化學(xué)習(xí)DRL的Autonomous Agent使用強(qiáng)化學(xué)習(xí)的試錯(cuò)算法和累計(jì)獎(jiǎng)勵(lì)函數(shù)來加速神經(jīng)網(wǎng)絡(luò)設(shè)計(jì)。這些設(shè)計(jì)為很多依靠監(jiān)督／無監(jiān)督學(xué)習(xí)的人工智能應(yīng)用提供支持。它涉及對(duì)強(qiáng)化學(xué)習(xí)驅(qū)動(dòng)Autonomous Agent的使用，以快速探索與無數(shù)體系結(jié)構(gòu)、節(jié)點(diǎn)類型、連接、超參數(shù)設(shè)置相關(guān)的性能權(quán)衡，以及對(duì)深度學(xué)習(xí)、機(jī)器學(xué)習(xí)和其他人工智能模型設(shè)計(jì)人員可用的其它選擇。

深度Q網(wǎng)絡(luò)通過使用深度學(xué)習(xí)DL和強(qiáng)化學(xué)習(xí)RL兩種技術(shù)，來解決在強(qiáng)化學(xué)習(xí)RL中使用函數(shù)逼近的基本不穩(wěn)定性問題：經(jīng)驗(yàn)重放和目標(biāo)網(wǎng)絡(luò)。經(jīng)驗(yàn)重放使得強(qiáng)化學(xué)習(xí)RL智能體能夠從先前觀察到的數(shù)據(jù)離線進(jìn)行抽樣和訓(xùn)練。這不僅大大減少了環(huán)境所需的交互量，而且可以對(duì)一批經(jīng)驗(yàn)進(jìn)行抽樣，減少學(xué)習(xí)更新的差異。此外，通過從大存儲(chǔ)器均勻采樣，可能對(duì)強(qiáng)化學(xué)習(xí)RL算法產(chǎn)生不利影響的時(shí)間相關(guān)性被打破了。最后，從實(shí)際的角度看，可以通過現(xiàn)代硬件并行地高效地處理批量的數(shù)據(jù)，從而提高吞吐量。

Q學(xué)習(xí)的核心思想就是通過Bellman方程來迭代求解Q函數(shù)。Q值更新：1）使用當(dāng)前的狀態(tài)s通過神經(jīng)網(wǎng)絡(luò)計(jì)算出所有動(dòng)作的Q值；2）使用下一個(gè)狀態(tài)s’通過神經(jīng)網(wǎng)絡(luò)計(jì)算出 Q（s’， a’），并獲取最大值max a’ Q（s’， a’）；3）將該動(dòng)作a的目標(biāo)Q值設(shè)為 r ＋ γmax a’ Q（s’， a’），對(duì)于其他動(dòng)作，把目標(biāo)Q值設(shè)為第1步返回的Q值，使誤差為0；4）使用反向傳播來更新Q網(wǎng)絡(luò)權(quán)重。

策略搜索方法通過無梯度或梯度方法直接查找策略。無梯度的策略搜索算法可以選擇遺傳算法。遺傳方法依賴于評(píng)估一組智能體的表現(xiàn)。因此，對(duì)于具有許多參數(shù)的一大群智能體來說遺傳算法的使用成本很高。然而，作為黑盒優(yōu)化方法，它們可以用于優(yōu)化任意的不可微分的模型，并且天然能夠在參數(shù)空間中進(jìn)行更多的探索。結(jié)合神經(jīng)網(wǎng)絡(luò)權(quán)重的壓縮表示，遺傳算法甚至可以用于訓(xùn)練大型網(wǎng)絡(luò)；這種技術(shù)也帶來了第一個(gè)直接從高維視覺輸入學(xué)習(xí)RL任務(wù)的深度神經(jīng)網(wǎng)絡(luò)。

Actor－Critic算法將策略搜索方法的優(yōu)點(diǎn)與學(xué)習(xí)到的價(jià)值函數(shù)結(jié)合起來，從而能夠從TD錯(cuò)誤中學(xué)習(xí)，近來很受歡迎。深度強(qiáng)化學(xué)習(xí)挑戰(zhàn)：目前深度強(qiáng)化學(xué)習(xí)研究領(lǐng)域仍然存在著挑戰(zhàn)。1）提高數(shù)據(jù)有效性方面；2）算法探索性和開發(fā)性平衡方面；3）處理層次化強(qiáng)化學(xué)習(xí)方面；4）利用其它系統(tǒng)控制器的學(xué)習(xí)軌跡來引導(dǎo)學(xué)習(xí)過程；5）評(píng)估深度強(qiáng)化學(xué)習(xí)效果；6）多主體強(qiáng)化學(xué)習(xí)；7）遷移學(xué)習(xí)；8）深度強(qiáng)化學(xué)習(xí)基準(zhǔn)測試。

深度強(qiáng)化學(xué)習(xí)DRL應(yīng)用范圍較廣，靈活性很大，擴(kuò)展性很強(qiáng)。它在圖像處理、游戲、機(jī)器人、無人駕駛及系統(tǒng)控制等領(lǐng)域得到越來越廣泛的應(yīng)用。深度強(qiáng)化學(xué)習(xí)DRL算法已被應(yīng)用于各種各樣的問題，例如機(jī)器人技術(shù)，創(chuàng)建能夠進(jìn)行元學(xué)習(xí)（“學(xué)會(huì)學(xué)習(xí)”learning to learn）的智能體，這種智能體能泛化處理以前從未見過的復(fù)雜視覺環(huán)境。

強(qiáng)化學(xué)習(xí)和深度學(xué)習(xí)是兩種技術(shù)，但是深度學(xué)習(xí)可以用到強(qiáng)化學(xué)習(xí)上，叫做深度強(qiáng)化學(xué)習(xí)DRL。深度學(xué)習(xí)不僅能夠?yàn)閺?qiáng)化學(xué)習(xí)帶來端到端優(yōu)化的便利，而且使得強(qiáng)化學(xué)習(xí)不再受限于低維的空間中，極大地拓展了強(qiáng)化學(xué)習(xí)的使用范圍。深度強(qiáng)化學(xué)習(xí)DRL自提出以來，已在理論和應(yīng)用方面均取得了顯著的成果。

尤其是谷歌DeepMind團(tuán)隊(duì)基于深度強(qiáng)化學(xué)習(xí)DRL研發(fā)的AlphaGo，將深度強(qiáng)化學(xué)習(xí)DRL成推上新的熱點(diǎn)和高度，成為人工智能歷史上一個(gè)新的里程碑。因此，深度強(qiáng)化學(xué)習(xí)DRL很值得大家研究。深度強(qiáng)化學(xué)習(xí)將有助于革新AI領(lǐng)域，它是朝向構(gòu)建對(duì)視覺世界擁有更高級(jí)理解的自主系統(tǒng)邁出的一步。難怪谷歌DeepMind中深度強(qiáng)化學(xué)習(xí)領(lǐng)頭人David Silver曾經(jīng)說過，深度學(xué)習(xí)＋強(qiáng)化學(xué)習(xí)＝深度強(qiáng)化學(xué)習(xí)DRL＝人工智能。深度強(qiáng)化學(xué)習(xí)應(yīng)用范圍較廣，靈活性很大，擴(kuò)展性很強(qiáng)。它在圖像處理、游戲、機(jī)器人、無人駕駛及系統(tǒng)控制等領(lǐng)域得到越來越廣泛的應(yīng)用。
? ? ? ?

本站聲明：本文章由作者或相關(guān)機(jī)構(gòu)授權(quán)發(fā)布，目的在于傳遞更多信息，并不代表本站贊同其觀點(diǎn)，本站亦不保證或承諾內(nèi)容真實(shí)性等。需要轉(zhuǎn)載請聯(lián)系該專欄作者，如若文章內(nèi)容侵犯您的權(quán)益，請及時(shí)聯(lián)系本站刪除。

換一批

阿維塔、賽力斯已入股！華為引望可能成“中國博世”

9月2日消息，不造車的華為或?qū)⒋呱龈蟮莫?dú)角獸公司，隨著阿維塔和賽力斯的入局，華為引望愈發(fā)顯得引人矚目。

關(guān)鍵字：阿維塔塞力斯華為

[美通社全球TMT]

Trianz與AWS達(dá)成戰(zhàn)略合作協(xié)議，徹底改變云采用和管理方式

加利福尼亞州圣克拉拉縣2024年8月30日 /美通社/ -- 數(shù)字化轉(zhuǎn)型技術(shù)解決方案公司Trianz今天宣布，該公司與Amazon Web Services （AWS）簽訂了...

關(guān)鍵字： AWS AN BSP 數(shù)字化

[美通社全球TMT]

人工智能驅(qū)動(dòng)工具SODA V將顛覆汽車市場，使汽車開發(fā)時(shí)間和成本降低90%

倫敦2024年8月29日 /美通社/ -- 英國汽車技術(shù)公司SODA.Auto推出其旗艦產(chǎn)品SODA V，這是全球首款涵蓋汽車工程師從創(chuàng)意到認(rèn)證的所有需求的工具，可用于創(chuàng)建軟件定義汽車。 SODA V工具的開發(fā)耗時(shí)1.5...

關(guān)鍵字：汽車人工智能智能驅(qū)動(dòng) BSP

[美通社全球TMT]

從容應(yīng)對(duì)未知風(fēng)險(xiǎn)----解密亞馬遜云科技的韌性之道

北京2024年8月28日 /美通社/ -- 越來越多用戶希望企業(yè)業(yè)務(wù)能7×24不間斷運(yùn)行，同時(shí)企業(yè)卻面臨越來越多業(yè)務(wù)中斷的風(fēng)險(xiǎn)，如企業(yè)系統(tǒng)復(fù)雜性的增加，頻繁的功能更新和發(fā)布等。如何確保業(yè)務(wù)連續(xù)性，提升韌性，成...

關(guān)鍵字：亞馬遜解密控制平面 BSP

[通信先鋒]

中國游戲市場開始復(fù)蘇！騰訊、網(wǎng)易等巨頭縮減在日本投資

8月30日消息，據(jù)媒體報(bào)道，騰訊和網(wǎng)易近期正在縮減他們對(duì)日本游戲市場的投資。

關(guān)鍵字：騰訊編碼器 CPU

[通信先鋒]

獨(dú)立自主！華為董事：致力打造不依賴西方的技術(shù)

8月28日消息，今天上午，2024中國國際大數(shù)據(jù)產(chǎn)業(yè)博覽會(huì)開幕式在貴陽舉行，華為董事、質(zhì)量流程IT總裁陶景文發(fā)表了演講。

關(guān)鍵字：華為 12nm EDA 半導(dǎo)體

[通信先鋒]

華為張平安：數(shù)字世界話語權(quán)最終由生態(tài)繁榮決定！

8月28日消息，在2024中國國際大數(shù)據(jù)產(chǎn)業(yè)博覽會(huì)上，華為常務(wù)董事、華為云CEO張平安發(fā)表演講稱，數(shù)字世界的話語權(quán)最終是由生態(tài)的繁榮決定的。

關(guān)鍵字：華為 12nm 手機(jī) 衛(wèi)星通信

[美通社全球TMT]

中國通信服務(wù)公布2024年中期業(yè)績

要點(diǎn)：有效應(yīng)對(duì)環(huán)境變化，經(jīng)營業(yè)績穩(wěn)中有升落實(shí)提質(zhì)增效舉措，毛利潤率延續(xù)升勢戰(zhàn)略布局成效顯著，戰(zhàn)新業(yè)務(wù)引領(lǐng)增長以科技創(chuàng)新為引領(lǐng)，提升企業(yè)核心競爭力堅(jiān)持高質(zhì)量發(fā)展策略，塑強(qiáng)核心競爭優(yōu)勢...

關(guān)鍵字：通信 BSP 電信運(yùn)營商數(shù)字經(jīng)濟(jì)

[美通社全球TMT]

NVI技術(shù)創(chuàng)新聯(lián)盟成立！自主生態(tài)將帶動(dòng)產(chǎn)業(yè)鏈高速發(fā)展

北京2024年8月27日 /美通社/ -- 8月21日，由中央廣播電視總臺(tái)與中國電影電視技術(shù)學(xué)會(huì)聯(lián)合牽頭組建的NVI技術(shù)創(chuàng)新聯(lián)盟在BIRTV2024超高清全產(chǎn)業(yè)鏈發(fā)展研討會(huì)上宣布正式成立。活動(dòng)現(xiàn)場 NVI技術(shù)創(chuàng)新聯(lián)...

關(guān)鍵字： VI 傳輸協(xié)議音頻 BSP

[美通社全球TMT]

軟通動(dòng)力與長三角投資達(dá)成戰(zhàn)略合作共謀數(shù)字生態(tài)新發(fā)展

北京2024年8月27日 /美通社/ -- 在8月23日舉辦的2024年長三角生態(tài)綠色一體化發(fā)展示范區(qū)聯(lián)合招商會(huì)上，軟通動(dòng)力信息技術(shù)（集團(tuán)）股份有限公司（以下簡稱"軟通動(dòng)力"）與長三角投資（上海）有限...

關(guān)鍵字： BSP 信息技術(shù)