Research questionHow can we learn near-optimal policies from transition samples in large or infinite-state-action MDPs using function approximation?Tabular policy representations become infeasible when an MDP has a large or infinite state-action space. The challenge is to use function approximation to learn reliable policies from transition samples without requiring an impractical number of queries.