Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training Paper • 2609.37119 • Published 12 days ago • 1
Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models Paper • 2609.26637 • Published 19 days ago • 26
Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training Paper • 2609.37119 • Published 12 days ago • 1