モデル選定

強化学習制御

# 強化学習制御

Tldr Content Gen

Mistral-7B-v0.1をファインチューニングしたニュースコンテンツ生成モデルで、タイトルから自動的にニュースコンテンツを生成可能

テキスト生成

Dqn CartPole V1

これは深層Qネットワーク(DQN)に基づく強化学習モデルで、CartPole-v1環境における棒のバランス問題を解決するために特別に設計されています。

分子モデル

これはstable-baselines3ライブラリで訓練されたTD3エージェントモデルで、Hopper-v3環境における強化学習タスク専用です。

物理学モデル

これはstable-baselines3ライブラリで訓練されたPPO強化学習モデルで、Hopper-v3環境における連続制御タスク専用です。

物理学モデル

Ppo HalfCheetah V3

これはPPOアルゴリズムに基づく強化学習モデルで、HalfCheetah-v3環境向けに設計されており、stable-baselines3ライブラリでトレーニングされています。

物理学モデル

Ppo MountainCar V0

これはPPOアルゴリズムに基づく深層強化学習モデルで、MountainCar-v0環境における制御問題を解決するために特別に設計されています。

物理学モデル

Dqn MountainCar V0

これはstable-baselines3で訓練されたDQNエージェントモデルで、MountainCar-v0環境における強化学習タスクを解決するために特別に設計されています。

分子モデル

Ppo CartPole V1

これはPPOアルゴリズムに基づく強化学習モデルで、CartPole-v1環境におけるバランス問題を解決するために特別に設計されています。

分子モデル

Decision Transformer Gym Walker2d Expert

このモデルはGym Walker2d環境からサンプリングされた専門家軌跡に基づいて訓練された意思決定トランスフォーマーモデルです。

物理学モデル

Decision Transformer Gym Hopper Medium

これはGym Hopper環境で中程度のパフォーマンス軌跡を使用して訓練された意思決定トランスフォーマーモデルで、連続制御タスクに適しています。

物理学モデル

Decision Transformer Gym Hopper Expert

これはGym Hopper環境のエキスパート軌跡データで訓練された意思決定トランスフォーマーモデルです。

物理学モデル

Decision Transformer Gym Halfcheetah Medium

これは意思決定トランスフォーマーアーキテクチャに基づく強化学習モデルで、Gym HalfCheetah連続制御環境向けに特別に訓練され、中程度の品質の軌跡データを使用しています。

物理学モデル

Decision Transformer Gym Halfcheetah Expert

これはGym HalfCheetah環境からサンプリングされた専門家軌跡で訓練された意思決定トランスフォーマーモデルです。

物理学モデル

おすすめAIモデル

Llama 3 Typhoon V1.5x 8b Instruct

タイ語専用に設計された80億パラメータの命令モデルで、GPT-3.5-turboに匹敵する性能を持ち、アプリケーションシナリオ、検索拡張生成、制限付き生成、推論タスクを最適化

大規模言語モデル

Transformers 複数言語対応

Cadet-TinyはSODAデータセットでトレーニングされた超小型対話モデルで、エッジデバイス推論向けに設計されており、体積はCosmo-3Bモデルの約2％です。

対話システム

Transformers 英語

Roberta Base Chinese Extractive Qa

RoBERTaアーキテクチャに基づく中国語抽出型QAモデルで、与えられたテキストから回答を抽出するタスクに適しています。

質問応答システム中国語

AIbase

未来を切り開く、あなたのAIソリューション知識ベース

English 简体中文繁體中文にほんご

© 2025AIbase