Large Language Model Policy Optimization

Latest papers 67

All topics
CardsList
  1. PA3: Policy-Aware Agent Alignment through Chain-of-Thought

    Mar 15, 2026Shubhashis Roy Dipta, Daniel Bis, Kun Zhou +4Large Language Model Policy OptimizationChain-of-Thought Reasoning

  2. Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

    Jan 28, 2026Zhengbo Jiao, Hongyu Xian, Qinglong Wang +5LLM Reasoning StrategiesLarge Language Model Policy Optimization

  3. Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

    Jan 6, 2026Harshvardhan Saini, Yiming Tang, Dianbo LiuArtificial Intelligence PersonasLarge Language Model Policy Optimization

  4. Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs

    Dec 3, 2025Oren Rachmil, Avishag Shapira, Roy Betser +5Large Language Model Policy OptimizationLarge Language Model Safety