Enhancing PPO With Trajectory-Aware Hybrid Policies
Explore this paper's citation graph
- Type
- preprint
- Published
- 2025-02-21
- Cited by
- 3
- References
- 67
- Access
- Open access
- OpenAlex
- https://openalex.org/W4414836561
- Semantic Scholar
- https://api.semanticscholar.org/CorpusID:276575293
Keywords
Reinforcement learning, Baseline (sea), Trajectory, Construct (python library), Variance (accounting)
References
- Approximately Optimal Approximate Reinforcement Learning
- Playing Atari with Deep Reinforcement Learning
- Accelerating Stochastic Gradient Descent using Predictive Variance Reduction
- Variance Reduction for Stochastic Gradient Optimization
- Explained Variance Measures for Multilevel Models
- Survey of Model-Based Reinforcement Learning: Applications on Robotics
- Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning
- Proximal Policy Optimization Algorithms
- Adversarial Advantage Actor-Critic Model for Task-Completion Dialogue Policy Learning
- A novel DDPG method with prioritized experience replay
- Deep Q-learning From Demonstrations
- Stochastic Variance-Reduced Policy Gradient
- Towards Combining On-Off-Policy Methods for Real-World Applications
- P3O: Policy-on Policy-off Policy Optimization
- An Improved Convergence Analysis of Stochastic Variance-Reduced Policy Gradient
- Driving in Dense Traffic with Model-Free Reinforcement Learning
- End-to-End Model-Free Reinforcement Learning for Urban Driving Using Implicit Affordances
- Sample Efficient Policy Gradient Methods with Recursive Variance Reduction
- Power Control Based on Deep Reinforcement Learning for Spectrum Sharing
- Twin-Delayed DDPG: A Deep Reinforcement Learning Technique to Model a Continuous Movement of an Intelligent Robot Agent
Cited by
Related papers
No related papers recorded.