20 min read · July 06, 2026
2026 · rl policy-gradients trpo trust-region fisher-information kl-divergence total-variations · reinforcement-learning
17 min read · July 02, 2026
2026 · rl policy-gradients a2c actor-critic advantage-function value-function · reinforcement-learning
10 min read · June 29, 2026
2026 · rl ml policy delayed-reward super-mario · reinforcement-learning machine-learning
14 min read · December 22, 2025
2025 · martingale risk-neutral replication no-arbitrage gbm measure-change · quantitative-finance martingale-pricing
12 min read · December 07, 2025
2025 · ito brownian-motion gbm derivatives · quantitative-finance stochastic-calculus