Large Language Model Policy Optimization

Latest papers 67

All topics
CardsList
  1. LLM Persona Unlearning

    Sep 30, 2026Kemou Li, Zhuan Shi, Qizhou Wang +4Artificial Intelligence PersonasLarge Language Model Unlearning

  2. BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning

    Sep 29, 2026Quan Xiao, Mingda Liu, Gaowen Liu +2Agentic Reinforcement LearningLarge Language Model Policy Optimization

  3. When Words Fall Short: Iterative Synergy Between Verbalized Reasoning and Hidden Features for LLM Confidence Estimation

    Sep 28, 2026Yekun Xu, Ante Wang, Jingyi Ren +3Confidence EstimationLarge Language Model Policy Optimization

  4. NLPG: Natural-Language Policy Gradients for Self-Evolving Language Agents

    Sep 27, 2026Xu Liu, WenZhang Wei, Jun Cao +4Large Language Model Policy OptimizationImprovement

  5. From Policy Documents to Structured Survey Responses: Evaluating Large Language Models for Policy Monitoring

    Sep 24, 2026Carolyn Cole, Matthias Deschryvere, Toqeer Ehsan +1Large Language Model Policy OptimizationSurvey

  6. Information-Time Proximal Policy Optimization

    Sep 21, 2026Yongcheng Zeng, Xinyu Cui, Yan Song +9Frictive Policy OptimizationLarge Language Model Policy Optimization

  7. Smarter by the Moment: Environment-Driven Dynamic Policies for Continual LLM Improvement

    Sep 15, 2026Ting-Wei Chang, Po-Chun Chen, Hen-Hsen Huang +1Large Language Model Policy OptimizationReplay-Based Continual Learning

  8. Automated Design of Inventory Policy with Large Language Models: An Exploratory Study

    Sep 8, 2026Fenghua Yang, Preet Baxi, Yi Zhang +4Inventory ControlLarge Language Model Policy Optimization

  9. SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents

    Sep 7, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1AdmissibilityLarge Language Model Policy Optimization

  10. Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers

    Sep 4, 2026Yumiao Li, Peixin Liu, Donglin Di +2Large Language Model Policy OptimizationAgent Behavior Modeling

  11. GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis

    Sep 3, 2026Linh Le, Melanie Bui, My Chiffon Nguyen +2Policy EvaluationMulti-Agent Simulations

  12. PersuaRL: Reinforcement Learning-Driven Multi-Expert Selection for Persuasive Dialogue Generation in Insurance

    Sep 1, 2026Rohan Kirti, Akash Ghosh, Aryan Vats +5PersuasionLarge Language Model Policy Optimization

  13. An Agentic Retrobiosynthesis Framework with Learned Frontier Selection

    Aug 31, 2026Philippe Meyer, Guillaume Gricourt, Thomas Duigou +2Large Language Model Policy OptimizationSearch-Augmented Reasoning

  14. From Answers to Policies: Efficient In-Context Learning System through Emulating Expert Investigation

    Aug 17, 2026Minh-Ha Nguyen, Ngoc-Ngo Quang Tran, Thuy Dung Nguyen +1Large Language Model Policy OptimizationIn-Context Learning

  15. JustLLMGRPO: Radiographic Control for Chest X-Ray Generation

    Aug 8, 2026Pengxiang Cai, Xiaohan Li, Anglin Liu +3Chest X-RayMedical Image Generation

  16. AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents

    Aug 1, 2026Alina Kapanova, Arun Kanhai, Natan Vidra +1Adversarial EvaluationMulti-Agent Planning

  17. Learning an Interior Layout Policy in a Domain Specific Language Action Space

    Jul 31, 2026Yuhao Lu, Weichen Zhang, Wenyi Xiao +23D Layout GenerationLayouts

  18. An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

    Jul 30, 2026Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler +1Artificial Intelligence GovernanceEu Artificial Intelligence Act

  19. Simulating Tenant Responses to Energy Policy Interventions with Transaction-Cost-Aware LLM Agent

    Jul 27, 2026Weijie Xia, Stefanie Horian, Hanyue Huang +3User SimulationLarge Language Model Policy Optimization

  20. ToolGuardian: Declarative Security for AI Agent-Tool Interactions

    Jul 23, 2026Arun Ravindran, Saurabh DeochakeAuthorizationAgentic Deployments

  21. Co-Evolving LLM Evaluators and Policies via DynamicRubric

    Jul 22, 2026Beining Wang, Weihang Su, Hongtao Tian +8Large Language Model Policy OptimizationLarge Language Model Evaluation

  22. A Formally Grounded ODRL Evaluator: Implementation and Comparison

    Jul 17, 2026Jaime Osvaldo Salas, Paolo Pareti, Adeel Aslam +2Policy EvaluationMulti-Dimensional Evaluation

  23. Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

    Jul 15, 2026Shunbao Li, Zhipeng Yuan, Amoako Ofori +5Large Language Model Policy OptimizationPrecision Agriculture

  24. Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks

    Jul 5, 2026Gerasimos Papanikolaou-Ntais, Alexandros Kaloxylos, Athanasios KanavosSchedulersLarge Language Model Policy Optimization

  25. When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions

    Jul 3, 2026Peiying Zhu, Sidi ChangLarge Language Model Policy OptimizationRepair

  26. DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents

    Jul 2, 2026Tianyi Zhang, Mousumi Das, Abrar Anwar +2PersuasionLarge Language Model Policy Optimization

  27. AlgoEvolve: LLM-driven Meta-evolution of Algorithmic Trading Programs

    Jun 24, 2026Dhruv Sharma, Gautam ShroffAlgorithmic TradingEvolutionary Search

  28. PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

    Jun 24, 2026Chang Wu, Junfeng Fang, Houcheng Jiang +5Safety AlignmentLarge Language Model Safety

  29. A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions

    Jun 15, 2026Jianghan Shen, Siqi Luo, Yue Li +9Large Language Model Policy OptimizationTrajectory Generation

  30. REFLEX: Reflective Evolution from LLM Experience

    Jun 15, 2026Pan WangLarge Language Model Policy OptimizationOn-Policy Self-Evolution

  31. Carolina Guide: A Multi-Agent RAG System with Institutional Guardrails for Academic Policy Assistance

    Jun 11, 2026Ben Torsion, Jun ZhouAcademic IntegrityAgentic Retrieval-Augmented Generation Systems

  32. Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents

    Jun 11, 2026Saehun Chun, Wonje Choi, Sera Choi +2Large Language Model Policy OptimizationLarge Language Model Agents

  33. EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

    Jun 2, 2026Guhong Chen, Yingcheng Shi, Yongbin Li +6On-Policy Self-EvolutionAgentic Reinforcement Learning

  34. When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

    May 29, 2026Stephane Hatgis-Kessell, Emma BrunskillLarge Language Model Policy OptimizationFrictive Policy Optimization

  35. UniMaia: Steering Chess Policies with Language for Human-like Play

    May 26, 2026Sherman Siu, Lesley IsteadChessLarge Language Model Policy Optimization

  36. Reducing Political Manipulation with Consistency Training

    May 21, 2026Long Phan, Devin Kim, Alexander Pan +3Large Language Model BiasBiases

  37. Modeling Pathology-Like Behavioral Patterns in Language Models Through Behavioral Fine-Tuning

    May 21, 2026Nicola Milano, Davide MaroccoLarge Language Model Fine-TuningLarge Language Model Policy Optimization

  38. LLM4Branch: Large Language Model for Discovering Efficient Branching Policies of Integer Programs

    May 11, 2026Zhinan Hou, Xingchen Li, Yankai Zhang +2Mixed-Integer ProgrammingLarge Language Model Policy Optimization

  39. DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

    May 8, 2026Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang +2Large Language Model Policy OptimizationAgentic Benchmarks

  40. Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

    May 8, 2026Xiaoze Liu, Dhananjay Ram, Yuting Zhang +3Reinforcement Learning Post-TrainingBetter Call Group Relative Policy Optimization

  41. SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents

    May 7, 2026Xiwen Chen, Wenhui Zhu, Songzhu Zheng +3Large Language Model Policy OptimizationCredit Assignment

  42. InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees

    May 1, 2026Chenyu Huang, Jianghao Lin, Zhengyang Tang +4Inventory ControlLarge Language Model Policy Optimization

  43. Hybrid Policy Distillation for LLMs

    Apr 22, 2026Wenhong Zhu, Ruobing Xie, Rui Wang +1Knowledge DistillationLarge Language Model Policy Optimization

  44. Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation

    Apr 19, 2026Lin Zhong, Renjin Zhu, Shujuan Ma +4Emotional Support Conversation TaskCognitive Diagnosis