Piyush Bhardwaj
  • about
  • blog (current)
  • publications
  • Advanced Policy Gradients: TRPO

    20 min read   ·   July 06, 2026

    2026   ·   rl   policy-gradients   trpo   trust-region   fisher-information   kl-divergence   total-variations   ·   reinforcement-learning

  • RL Basics: Policy Gradients and A2C

    17 min read   ·   July 02, 2026

    2026   ·   rl   policy-gradients   a2c   actor-critic   advantage-function   value-function   ·   reinforcement-learning

  • Reinforcement Learning vs Machine Learning

    10 min read   ·   June 29, 2026

    2026   ·   rl   ml   policy   delayed-reward   super-mario   ·   reinforcement-learning   machine-learning

  • Martingale Pricing Basics for Traders

    14 min read   ·   December 22, 2025

    2025   ·   martingale   risk-neutral   replication   no-arbitrage   gbm   measure-change   ·   quantitative-finance   martingale-pricing

  • Stochastic Calculus Basics for Traders

    12 min read   ·   December 07, 2025

    2025   ·   ito   brownian-motion   gbm   derivatives   ·   quantitative-finance   stochastic-calculus

  • <
  • 1
  • 2
  • >