WorryFree Computers »
Address
:
[go:
up one dir
,
main page
]
Include Form
Remove Scripts
Accept Cookies
Show Images
Show Referer
Rotate13
Base64
Strip Meta
Strip Title
Session Cookies
Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[論文紹介] 状態遷移差分の学習による耐故障ロボットのための強化学習
Search
tt1717
January 26, 2024
Research
0
23
[論文紹介] 状態遷移差分の学習による耐故障ロボットのための強化学習
PDFファイルをダウンロードすると,スライド内のリンクを見ることができます.
tt1717
January 26, 2024
Tweet
Share
More Decks by tt1717
See All by tt1717
[論文紹介] RT-1: Robotics Transformer for Real-World Control at Scale
tt1717
0
18
[論文紹介] Chip Placement with Deep Reinforcement Learning
tt1717
0
9
[論文紹介] Human-level control through deep reinforcement learning
tt1717
0
21
[論文紹介] Transformer-based World Models Are Happy With 100k Interactions
tt1717
0
37
[論文紹介] Deep Learning for Video Game Playing
tt1717
0
24
[論文紹介] Playing Atari with Deep Reinforcement Learning
tt1717
0
20
[論文紹介] 物理パラメータのランダム化による耐故障ロボットのための強化学習
tt1717
0
21
[論文サーベイ] Survey on Minecraft AI
tt1717
0
39
[論文サーベイ] Survey on Sim-to-Real
tt1717
0
15
Other Decks in Research
See All in Research
ニューラルネットワークを用いた床面圧力センサによる靴の種類の識別 / shoes-i2024
yumulab
0
110
サステナビリティと価格の壁 / Price Challenges to Sustainability
dmattsun
0
160
Engineering LaCAM∗: Towards Real-Time, Large-Scale, and Near-Optimal Multi-Agent Pathfinding
kei18
0
220
大規模言語モデルを用いた その場での要約に基づく レビュー探索インタフェース
yamamotolab
0
120
第12回全日本コンピュータビジョン勉強会:画像の自己教師あり学習における大規模データセット
naok615
0
560
MLtraq: Track your AI experiments at hyperspeed
micheda
1
130
LLMとの共同執筆は文章の多様性を減らすか?
kuri8ive
3
530
東工大Swallowプロジェクトにおける大規模日本語Webコーパスの構築
aya_se
13
7.8k
CARA MEMBUKA VIDEO DEWASA DI INDONESIA
bloglangit
0
170
LiDARセキュリティ最前線
kentaroy47
0
320
Ground Metric Learning with applications in genomics
gpeyre
0
420
媒介分析と疫学
kingqwert
0
170
Featured
See All Featured
Save Time (by Creating Custom Rails Generators)
garrettdimon
PRO
5
220
Keith and Marios Guide to Fast Websites
keithpitt
408
22k
Optimising Largest Contentful Paint
csswizardry
14
2.5k
Adopting Sorbet at Scale
ufuk
69
8.7k
Designing on Purpose - Digital PM Summit 2013
jponch
112
6.5k
Building Effective Engineering Teams - LeadDev
addyosmani
38
2k
Music & Morning Musume
bryan
42
5.7k
Cheating the UX When There Is Nothing More to Optimize - PixelPioneers
stephaniewalter
275
13k
Design and Strategy: How to Deal with People Who Don’t "Get" Design
morganepeng
117
18k
Thoughts on Productivity
jonyablonski
61
4k
Fight the Zombie Pattern Library - RWD Summit 2016
marcelosomers
228
16k
Sharpening the Axe: The Primacy of Toolmaking
bcantrill
23
1.5k
Transcript
・walker2Dを使用 ・3通りの訓練で検証 1.正常なロボットのみで訓練 (normal policy) 2.ロボットをランダムに故障させながら訓練 (robust policy) 3.状態遷移の差分を用いて故障させながら訓練 (our
policy) どんなもの? 先行研究と比べて何がすごい? 技術の手法や肝は? どうやって有効だと検証した? ・故障度合いが大きいとき,our policyとrubust policyで高い収益を 得られた ・故障度合いが小さいとき,our policyで高い収益を得られた 故障の表現 ・故障する関節をランダムに選択し,関節アクチュエータのトルク に対して,故障係数kをかける ・故障係数kは一様分布U(0.0,2.0)からサンプリングする ・MDPにおける遷移関数に対して,正常時の遷移関数と故障時の遷 移関数の差分を利用して故障度合いを表現する手法を提案 状態遷移差分の学習による耐故障ロボットのための強化学習 (JSAI 2020)大里 虹平, 川本 一彦 https://www.jstage.jst.go.jp/article/pjsai/JSAI2020/0/JSAI2020_4Rin134/_pdf 2024/01/26 論文を表す画像 被引用数:- 1/4
故障の表現 ❏ 正常時の遷移関数Tnormalと故障時の遷移関数Tbrokenが異なることを 利用 ❏ Tnormalと遷移関数Tが等しければ正常,そうでなければ故障とみなす ❏ Stdiff:ロボットの故障度合いを反映したパラメータ ❏ St:t時刻の状態
❏ Stnormal:正常時ロボットを仮定してt時刻の状態 ❏ Tnormalは未知関数なのでニューラルネットワークで表現する ❏ 定常環境でStnormalを収集し,これを教師データとして遷移予測ネッ トワークを訓練する ❏ St^normalとSt^diffは予測値を意味する 2/4
実験結果 ❏ 結果 ❏ 故障度合いが大きいとき,our policyとrobust policyで高い収益 ❏ 故障度合いが小さいとき,our policyで高い収益
3/4 ❏ 実験設定 ❏ 正常なロボットのみで訓練 (normal policy) ❏ ロボットをランダムに故障させな がら訓練 (robust policy) ❏ 状態遷移の差分を用いて故障させ ながら訓練 (our policy) ❏ hip,knee,ankleに対してkを0.25刻 みで故障させて評価する ❏ 各手法に対して3つのシード値で 3200万ステップ訓練する
❏ まとめ ❏ 正常時の遷移関数を学習する ❏ 予測される状態遷移と実際の状態遷移の差分を方策ネットワークに加える ❏ これにより,故障度合いを識別しながら学習する手法を提案 ❏ 提案手法では,正常時および故障時に遷移関数を利用しない方策より高い
収益を獲得した ❏ 感想 ❏ 提案手法の概要とイメージを掴むことができたが,方策ネットワークに入 力される「StとSt^diff」の2つを入力するのをどのように実装しているの か気になる (通常,t時刻に対する状態は1つだけいれる) ❏ 他のロボット (hopper,halfcheetah,ant)による実験でも,同様の結果が得 られるのか気になる ❏ この研究では,オンライン強化学習の設定で行っているが,オフライン強 化学習の設定で行った場合,結果に変化があるのか見てみたい まとめと感想 4/4