# 連続行動空間

Ppo LunarLander V2
これはPPOアルゴリズムに基づく強化学習モデルで、LunarLander-v2環境向けに特別に訓練され、月着陸船を安全に着陸させることができます。
物理学モデル
P
sofiascat
14
1
Ppo LunarLander V2
これはPPOアルゴリズムに基づく強化学習モデルで、LunarLander-v2環境における着陸タスクを解決するために特別に設計されています。
物理学モデル
P
tooalvin
13
1
Ppo LunarLander V2
これはPPOアルゴリズムに基づく強化学習モデルで、月面着陸機-v2環境における制御タスクを解決するためのものです。
物理学モデル
P
sigalaz
20
0
Ppo LunarLander V2
これはPPOアルゴリズムに基づく強化学習モデルで、LunarLander-v2環境向けに訓練され、月面着陸船の安全な着陸を制御するために使用されます。
物理学モデル
P
andri
16
0
Assignment2 Omar
これはPPOアルゴリズムに基づく強化学習モデルで、LunarLander-v2環境における着陸タスクを解決するために特別に設計されています。
物理学モデル
A
Classroom-workshop
135
3
Ppo Hopper V3
これはstable-baselines3ライブラリで訓練されたPPO強化学習モデルで、Hopper-v3環境における連続制御タスク専用です。
物理学モデル
P
sb3
19
0
Ppo HalfCheetah V3
これはPPOアルゴリズムに基づく強化学習モデルで、HalfCheetah-v3環境向けに設計されており、stable-baselines3ライブラリでトレーニングされています。
物理学モデル
P
sb3
51
1
Sealswalker2d V0
これはPPOアルゴリズムに基づく強化学習エージェントで、seals/Walker2d-v0環境向けに訓練され、Walker2dロボットの歩行制御タスクに使用されます。
物理学モデル
S
ernestumorga
0
0
Ppo MountainCar V0
これはPPOアルゴリズムに基づく深層強化学習モデルで、MountainCar-v0環境における制御問題を解決するために特別に設計されています。
物理学モデル
P
sb3
21
1
PPO LunarLander V2
これはPPOアルゴリズムに基づく強化学習モデルで、LunarLander-v2環境向けに訓練され、月面着陸機を安全に着陸させることができます。
物理学モデル
P
BioGeek
102
0
Dqn MountainCar V0
これはstable-baselines3で訓練されたDQNエージェントモデルで、MountainCar-v0環境における強化学習タスクを解決するために特別に設計されています。
分子モデル
D
sb3
578
1
Ball
これはPPOアルゴリズムで訓練された強化学習エージェントで、Unity 3DBallゲームにおけるバランスボールタスクを制御するために使用されます。
3Dビジョン TensorBoard
B
ThomasSimonini
23
0
Decision Transformer Gym Hopper Medium
これはGym Hopper環境で中程度のパフォーマンス軌跡を使用して訓練された意思決定トランスフォーマーモデルで、連続制御タスクに適しています。
物理学モデル Transformers
D
edbeeching
6,518
6
AIbase
未来を切り開く、あなたのAIソリューション知識ベース
© 2025AIbase