谷歌DADS算法助力智能體實(shí)現(xiàn)多樣化行為發(fā)現(xiàn)
近年來(lái)強(qiáng)化學(xué)習(xí)的高速發(fā)展已經(jīng)證明監(jiān)督強(qiáng)化學(xué)習(xí)可以在真實(shí)世界中處理包括任意物體的抓取、靈巧的運(yùn)動(dòng)等復(fù)雜的任務(wù)。然而利用精心設(shè)計(jì)的獎(jiǎng)勵(lì)函數(shù)來(lái)教會(huì)智能體進(jìn)行復(fù)雜的行為卻面臨著顯著的局限性。一方面在設(shè)計(jì)損失函數(shù)上需要大量的工程性工作,對(duì)于大量任務(wù)來(lái)說(shuō)幾乎是不可能的。另一方面針對(duì)真實(shí)環(huán)境設(shè)計(jì)獎(jiǎng)勵(lì),其復(fù)雜性不僅來(lái)自于獎(jiǎng)勵(lì)函數(shù)本身,同時(shí)還需要一系列的環(huán)境基礎(chǔ)設(shè)施(額外的傳感器)或手工標(biāo)注的目標(biāo)狀態(tài)來(lái)進(jìn)行輔助。這種獎(jiǎng)勵(lì)函數(shù)工程方式顯示了智能體學(xué)習(xí)復(fù)雜行為的過(guò)程,而無(wú)監(jiān)督學(xué)習(xí)的出現(xiàn)為這一問(wèn)題提供了潛在的解決思路。
在監(jiān)督強(qiáng)化學(xué)習(xí)中,來(lái)自環(huán)境的外部獎(jiǎng)勵(lì)將引導(dǎo)智能體學(xué)習(xí)期待的行為,強(qiáng)化對(duì)環(huán)境進(jìn)行期待的行為改造。而在非監(jiān)督強(qiáng)化學(xué)習(xí)中,整體則利用內(nèi)在的獎(jiǎng)勵(lì)函數(shù)(例如嘗試環(huán)境中不同事物的好奇心)來(lái)生成訓(xùn)練信號(hào),從而可以獲得更為廣泛的任務(wù)無(wú)關(guān)的技能行為。內(nèi)部獎(jiǎng)勵(lì)函數(shù)可以繞過(guò)外部獎(jiǎng)勵(lì)函數(shù)特有的工程問(wèn)題,在無(wú)需額外設(shè)計(jì)的情況下適用于更廣泛更通用的任務(wù)上去。雖然已經(jīng)有很多研究人員聚焦于實(shí)現(xiàn)非監(jiān)督強(qiáng)化學(xué)習(xí)的不同手段,但這是一個(gè)嚴(yán)重欠約束的問(wèn)題,沒(méi)有環(huán)境獎(jiǎng)勵(lì)函數(shù)的引導(dǎo)是很難學(xué)習(xí)到有用的行為的。那么主體和環(huán)境間交互的有效特性是否可以幫助發(fā)現(xiàn)更好的行為(技能)呢?
這篇文章中將介紹關(guān)于非監(jiān)督強(qiáng)化學(xué)習(xí)的最新研究。在DADS(Dynamics-Aware Unsupervised Discovery of Skills)方法中為非監(jiān)督學(xué)習(xí)引入了可預(yù)測(cè)的優(yōu)化目標(biāo),將技能的基礎(chǔ)特性視為可以對(duì)環(huán)境帶來(lái)可預(yù)測(cè)的改變,基于這一觀點(diǎn)開(kāi)發(fā)出了非監(jiān)督強(qiáng)化學(xué)習(xí)技能發(fā)現(xiàn)算法,并在模擬實(shí)驗(yàn)中展示了其廣泛適應(yīng)性。隨后研究人員還改進(jìn)了樣本效率,展示了非監(jiān)督技能發(fā)現(xiàn)對(duì)于真實(shí)世界的可行性。
左圖表示隨機(jī)不可預(yù)測(cè)的行為,右圖描述了在可預(yù)測(cè)環(huán)境中的系統(tǒng)性運(yùn)動(dòng)。本研究的目標(biāo)在于學(xué)習(xí)像右圖一樣潛在的有用行為而無(wú)需獎(jiǎng)勵(lì)函數(shù)工程。
DADS概覽
DADS設(shè)計(jì)了一個(gè)內(nèi)部獎(jiǎng)勵(lì)函數(shù)來(lái)鼓勵(lì)主體發(fā)現(xiàn)可預(yù)測(cè)、多樣性的技能。在以下兩種情況下內(nèi)部獎(jiǎng)勵(lì)函數(shù)值很高:
(a).不同技能對(duì)于環(huán)境的改變不同(鼓勵(lì)多樣性);
(b).給定技能在環(huán)境的造成的改變是可預(yù)測(cè)的(可預(yù)測(cè)性)。由于DADS無(wú)法從環(huán)境中獲取任何獎(jiǎng)勵(lì),技能優(yōu)化的多樣性可以使得智能體抓住盡可能多的潛在有效行為。
為了判斷技能是否具有可預(yù)測(cè)性,文章中又訓(xùn)練技能動(dòng)力學(xué)網(wǎng)絡(luò),在給定當(dāng)前狀態(tài)和執(zhí)行技能后來(lái)預(yù)測(cè)環(huán)境狀態(tài)的改變。技能動(dòng)力學(xué)網(wǎng)絡(luò)對(duì)于環(huán)境狀態(tài)的預(yù)測(cè)越好,對(duì)于技能就越是可預(yù)測(cè)的。DADS定義的內(nèi)部獎(jiǎng)勵(lì)可以利用任何傳統(tǒng)的強(qiáng)化學(xué)習(xí)算法來(lái)最大化。
DADS的概覽圖
這套算法使得多個(gè)不同的主體可以通過(guò)與環(huán)境純粹的無(wú)獎(jiǎng)勵(lì)交互來(lái)發(fā)現(xiàn)可預(yù)測(cè)的技能。DADS與先前的算法不同,可以拓展到高維度的連續(xù)控制環(huán)境中,例如人形機(jī)器人、模擬雙足機(jī)器人等。由于DADS可適應(yīng)多種環(huán)境,可用于在方向性的環(huán)境中定位、操控和運(yùn)動(dòng)。下圖展示了一些實(shí)驗(yàn)中的例子。
旋轉(zhuǎn)跳躍、人形仿真的不同步態(tài)、旋轉(zhuǎn)目標(biāo)的不同方法。
發(fā)表評(píng)論
請(qǐng)輸入評(píng)論內(nèi)容...
請(qǐng)輸入評(píng)論/評(píng)論長(zhǎng)度6~500個(gè)字
最新活動(dòng)更多
-
即日-11.13立即報(bào)名>>> 【在線會(huì)議】多物理場(chǎng)仿真助跑新能源汽車(chē)
-
11月28日立即報(bào)名>>> 2024工程師系列—工業(yè)電子技術(shù)在線會(huì)議
-
12月19日立即報(bào)名>> 【線下會(huì)議】OFweek 2024(第九屆)物聯(lián)網(wǎng)產(chǎn)業(yè)大會(huì)
-
即日-12.26火熱報(bào)名中>> OFweek2024中國(guó)智造CIO在線峰會(huì)
-
即日-2025.8.1立即下載>> 《2024智能制造產(chǎn)業(yè)高端化、智能化、綠色化發(fā)展藍(lán)皮書(shū)》
-
精彩回顧立即查看>> 【限時(shí)免費(fèi)下載】TE暖通空調(diào)系統(tǒng)高效可靠的組件解決方案
推薦專(zhuān)題
- 1 【一周車(chē)話(huà)】沒(méi)有方向盤(pán)和踏板的車(chē),你敢坐嗎?
- 2 特斯拉發(fā)布無(wú)人駕駛車(chē),還未迎來(lái)“Chatgpt時(shí)刻”
- 3 特斯拉股價(jià)大跌15%:Robotaxi離落地還差一個(gè)蘿卜快跑
- 4 馬斯克給的“驚喜”夠嗎?
- 5 打完“價(jià)格戰(zhàn)”,大模型還要比什么?
- 6 馬斯克致敬“國(guó)產(chǎn)蘿卜”?
- 7 神經(jīng)網(wǎng)絡(luò),誰(shuí)是盈利最強(qiáng)企業(yè)?
- 8 比蘋(píng)果偉大100倍!真正改寫(xiě)人類(lèi)歷史的智能產(chǎn)品降臨
- 9 諾獎(jiǎng)進(jìn)入“AI時(shí)代”,人類(lèi)何去何從?
- 10 Open AI融資后成萬(wàn)億獨(dú)角獸,AI人才之爭(zhēng)開(kāi)啟
- 高級(jí)軟件工程師 廣東省/深圳市
- 自動(dòng)化高級(jí)工程師 廣東省/深圳市
- 光器件研發(fā)工程師 福建省/福州市
- 銷(xiāo)售總監(jiān)(光器件) 北京市/海淀區(qū)
- 激光器高級(jí)銷(xiāo)售經(jīng)理 上海市/虹口區(qū)
- 光器件物理工程師 北京市/海淀區(qū)
- 激光研發(fā)工程師 北京市/昌平區(qū)
- 技術(shù)專(zhuān)家 廣東省/江門(mén)市
- 封裝工程師 北京市/海淀區(qū)
- 結(jié)構(gòu)工程師 廣東省/深圳市