マサチューセッツ工科大学(MIT)のエンジニアは、構築環境のシミュレーションと強化学習を使用してロボットに学習させました
表面の特性を変えるとダイナミクスが変わるボールの動き。コントロールとドリブル (ボールの駆動) のために、ロボットは 4 本の脚を使って動き、内蔵センサー、コンピューター ビジョン、および外部条件を評価してロボットとボールの軌道を決定するコンピューティング システムを使用します。
加速学習研究者向け自然のデジタルツインである人工シミュレーションを使用しました。環境に必要な物理パラメータをダウンロードし、そのような条件でのオブジェクトのダイナミクスをシミュレートできます。このアプローチを使用して、エンジニアは同時に 4,000 バージョンのロボットをシミュレートし、それに応じて動きの開発をスピードアップしました。このようなシミュレーションの後、実際の条件での練習が始まります。
ロボットはドリブルの仕方を知らずに学習を始める -彼はそれをしたときに報酬を得るか、間違いを犯したときに負の強化を得るだけだと開発者は説明しています.したがって、基本的には、どのような順序で脚に力を加える必要があるかを理解しようとしています。
ロボットにボールをドリブルさせる。ビデオ: MIT CSAIL
研究者は、ほとんどのこれまでの開発では、ロボットが走るか、ボールをパスするかという 1 つのタスクのみに焦点を当てていました。ドリブルを学ぶには、より複雑さが必要であり、環境への依存度が高くなります。ロボットは、その動きをボールに作用するように適応させる必要があります。この場合、ボールと環境の間の相互作用は、ロボットと風景の間の相互作用とは異なる場合があります。たとえば、サッカー ボールが芝生と舗道で経験する摩擦は異なりますが、傾斜によって加速が発生し、ボールの通常の軌道が変化します。
より安定したローバーとは異なり(車輪付きロボット)、4 脚ロボットは理論的にはより機敏であり、洪水や地震の後などの自然災害時に困難な状況で移動できます。しかし、これらの機会を実現するためには、変化する外部条件に迅速に適応できるシステムを構築する必要があります。
歩行ロボットのアルゴリズム開発における私たちの目標は、ロボット システムでは現在利用できない困難な環境で自律性を提供することです。
マサチューセッツ工科大学の教授兼研究所長である Pulkit Agrawal 氏は、次のように述べています。
続きを読む:
光合成は科学者が考えていたようには機能しないことが判明しました。今、彼らはそれをハッキングしたい
遠方の電波銀河は、地球に直接向けられたブラックホールであることが判明しました
専門家は、2100年までに地球上に何人の人々が住むかを予測しています