Batch Reinforcement Learning With a Nonparametric Off-Policy Policy Gradient
Explore this paper's citation graph
- Type
- preprint
- Published
- 2020-10-27
- Cited by
- 8
- References
- 66
- Access
- Open access
- OpenAlex
- https://openalex.org/W3095986187
- Semantic Scholar
- https://api.semanticscholar.org/CorpusID:225094174
Keywords
Reinforcement learning, Inefficiency, Variance (accounting), Computer science, Nonparametric statistics
References
- Relative Entropy Policy Search
- Exploration in Gradient-Based Reinforcement Learning
- On Estimating Regression
- All of Nonparametric Statistics
- Kernelized value function approximation for reinforcement learning
- Design-adaptive Nonparametric Regression
- Kernel-Based Least Squares Policy Iteration for Reinforcement Learning
- Tree-Based Batch Mode Reinforcement Learning
- A Natural Policy Gradient
- PILCO: A Model-Based and Data-Efficient Approach to Policy Search
- A Non-Parametric Approach to Dynamic Programming
- Infinite-Horizon Policy-Gradient Estimation
- Human-level control through deep reinforcement learning
- Simulation and the Monte Carlo method
- Fitted Q-iteration in continuous action-space MDPs
- Bias in Natural Actor-Critic Algorithms
- Policy Gradient Methods for Reinforcement Learning with Function Approximation
- Reinforcement learning with Gaussian processes
- MuJoCo: A physics engine for model-based control
- On a Connection between Importance Sampling and the Likelihood Ratio Policy Gradient
Cited by
- UMIM: Utility-Maximization Incentive Mechanism for Mobile Crowd Sensing
- Robust Offline Actor-Critic with On-Policy Regularized Policy Evaluation
- Reducing the estimation bias and variance in reinforcement learning via Maxmean and Aitken value iteration
- Enhancing PPO With Trajectory-Aware Hybrid Policies
- Model-free Policy Learning with Reward Gradients
- Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality
- A Temporal-Difference Approach to Policy Gradient Estimation
- Balloon Estimators for Improving and Scaling the Nonparametric Off-Policy Policy Gradient
Related papers
- Variance-Reduced Off-Policy Memory-Efficient Policy Search
- Off-Policy Policy Gradient Algorithms by Constraining the State Distribution Shift
- R2PG: Risk-Sensitive and Reliable Policy Gradient
- Adaptive Batch Size for Safe Policy Gradients
- Generalized Proximal Policy Optimization with Sample Reuse
- Divergence-Augmented Policy Optimization
- Policy Optimization Through Approximated Importance Sampling
- On- and Off-Policy Monotonic Policy Improvement
- Stable Policy Optimization via Off-Policy Divergence Regularization