Answer

Momentum

24 papers in the last four weeks, up 50% on the four weeks before. 0.3% of all new papers.

Jul 6Week of Sep 21

Latest papers 181

All topics
CardsList
  1. Right Answers, Wrong States: Hidden Information Failures in Multi-Agent Collaboration

    Oct 1, 2026Herun Wan, Jiaying Wu, Minnan Luo +4CollaborationMulti-Agent Reasoning

  2. Beyond Final Accuracy: Auditing Communication in LLM Multi-Agent Systems

    Oct 1, 2026Shixuan Li, Wei Yang, Peiyu Zhang +3Multi-Agent CommunicationModel Auditing

  3. Two Clocks in Diffusion MLLMs: When Answers Stabilize Before Rationales Unfold

    Oct 1, 2026Keuntae Kim, Yong Suk ChoiVisual Question Answering BenchmarksAnswer

  4. LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian

    Sep 30, 2026Claudiu Creanga, Liviu P. DinuLow-Resource LanguagesRanking

  5. When the Right Answer Is Missing: An Arithmetic-Dependent Rejection Bottleneck in Jev

    Sep 30, 2026Jike Zhong, Ming Li, Yuxiang LaiRejectionAnswer

  6. Right Answer, Wrong Mechanism: Detecting Pernicious Divergence in Causal Interventions

    Sep 30, 2026Beiming Liu, Minjie ChenCausal InterventionDivergence

  7. Aligning Thoughts with Answers: Probability Rewards to Tame Thinking Drift

    Sep 30, 2026Pengzhan Sun, Shiu-hong Kao, Shijie Li +4Weak Visual GroundingOffline Reinforcement Learning

  8. Right Answers, Costly Models: The Efficiency Gap in LLM-based Optimization Modeling

    Sep 30, 2026Zhong Li, Xin Huang, Jinhui Wan +6Optimization ModelingLarge Language Model Benchmarks

  9. Budget Boundary Effects in Test-Time Mathematical Reasoning

    Sep 30, 2026Guilin Zhang, Ziqi Tan, Wulan Guo +5Mathematical ReasoningTest Time

  10. Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

    Sep 29, 2026Jaewoo Jung, Hyeonseo Yu, Honggyu An +10Spatial ReasoningMultimodal Large Language Models

  11. Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces

    Sep 29, 2026Ratish Puduppully, Pranabendu Misra, Paarth Iyer +3Reasoning TracesChain-of-Thought Reasoning

  12. Locating Answer-Correctness Signals in Frozen Large Language Models

    Sep 29, 2026Yuansen Liu, Yixuan Tang, Anthony Kum Hoe TungFrozen Language ModelCorrectness

  13. TAEC: Trajectory-Aware Evidence Coordination for Multi-Step Visual RAG

    Sep 29, 2026Yalun Wu, Bingzhou Wang, Boyang Wang +5Visual EvidenceMultimodal Retrieval Augmented Generation

  14. When Upstream Messages Override Correct Answers: A Controlled Study of Multi-Agent LLM Collaboration

    Sep 29, 2026Yaxin Gong, Gangyi Zhang, Chongming Gao +7Multi-Agent Large Language Model SystemsDownstream Reasoning

  15. Towards Mitigating Deceptive Safety Alignment in Large Reasoning Models

    Sep 28, 2026Xiangyu Zhou, Saleh Zare Zade, Rafi Ibn Sultan +2Safety AlignmentLarge Reasoning Models

  16. AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors

    Sep 28, 2026Mohamed Eltahir, Fardows Adam, Duaa M. Tahir +6AnswerPosterior

  17. When Confidence Rises Too Early: Detecting Shortcut Reasoning via Premature Answer Commitment

    Sep 28, 2026Zhaohan Zhang, Junjie Liu, Chengzhengxu Li +6Reasoning SkillsOverconfidence

  18. From Perception to Integration: Revisiting the Internal Dynamics of Reasoning in Vision-Language Models

    Sep 28, 2026Rong Yu Xu, Prayag Tiwari, Shaolei ZhangRecent Vision-Language ModelsVisual Reasoning

  19. When Does an Image Determine the Answer? Benchmarking Visual Answerability across Charts and Scenes

    Sep 28, 2026Sungguk Cha, Mintae Kim, Youngsub Han +2AnswerChart

  20. Calibration, Not Answer Selection: Distilling Internal Confidence in Reasoning Models

    Sep 27, 2026Yadong Xi, Rongsheng Zhang, Tangjie Lv +2Confidence CalibrationLarge Reasoning Models

  21. Instruct, Not Answer: Using Instruction Privileges in On-Policy Context Distillation

    Sep 26, 2026Hantao Yu, Xiaoxue Han, Udaya Ghai +4Online-Policy DistillationInstruction

  22. Reasoning Instructions Can Break Answer Decoding in Vision--Language Models

    Sep 24, 2026Zeyan Li, Siyuan Qiu, Jianfeng XuQwen3Answer

  23. Looks the Same, Answers Differently: Flip-Direction Steering for Robust Vision-Language Reasoning

    Sep 23, 2026Yeonsung Jung, Joonhyun Jeong, Hoang Pham +4Visual ReasoningSteering

  24. Order-Invariant Answers, Order-Sensitive Representations in Mathematical Reasoning

    Sep 23, 2026Zhixu Silvia TaoMathematical ReasoningOrder Matters

  25. DocAttriBench: Benchmarking Answer Grounding in Document Visual Question Answering

    Sep 17, 2026Luca De Grandis, Silvia Cappelletti, William Raccagni +3Human-Annotated BenchmarkDocument

  26. AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment

    Sep 16, 2026Sai Sri Pushpa Jampani, Kshitij Mishra, Asif EkbalSafety AlignmentModel Auditing

  27. Rewarding Reasoning, Not Answers: Fixing and Bounding Test-Time Reinforcement Learning on Medical QA

    Sep 15, 2026Kailong Fan, Anqi Pu, Yichen Wu +7Process Reward ModelAnswer

  28. Vision And Text Transformer For Predicting Answerability On Visual Question Answering

    Sep 15, 2026Tung Le, Huy Tien Nguyen, Le Minh NguyenSelf-Supervised Vision TransformersTransformer Architectures

  29. Beyond Safe Answers: Segment-Aware Listwise Alignment for Reasoning Safety in Large Reasoning Models

    Sep 14, 2026JungMin Yun, Junehyoung Kwon, Hayeong Ryu +3Large Reasoning ModelsReasoning Skills

  30. When Successful Knowledge Graph Edits Displace Correct Answers: Rank-Level Locality beyond Parameter Support

    Sep 14, 2026Yi-Cheng Lai, Jerry Wang, Hsin-Ling Hsu +3Multimodal Knowledge EditingKnowledge Graph Embeddings

  31. From Parameters to Answers: How LLMs Retrieve and Use Their Internal Knowledge

    Sep 12, 2026Wenkang Wei, Yuan Fang, Renhe Jiang +2Qwen3Answer

  32. SearchAtlas: Analyzing Agentic Search Strategies via Evidential Query Graphs

    Sep 11, 2026Jiacheng Sang, Mengyuan Li, Sanxing Chen +3Agentic SearchQueries

  33. GANDR: Claim Auditing for Verifiable Legal Answer Generation

    Sep 9, 2026Chen Qian, Yimeng Wang, Yu Chen +2Legal Reasoning TasksCategory-Aware Atomic Claims

  34. FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect

    Sep 7, 2026Hazel H. Kim, Andrew M. Bean, Guilherme Affonso Ferreira de Camargo +10Task FramingQuestion

  35. How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation

    Sep 1, 2026Elitsa Yotkova, Violeta Kastreva, Petar Velkov +4Open-Ended ResponsesAnswer

  36. The Answer Is Not the Argument

    Aug 31, 2026Will Yeadon, Sergio Juárez, Paul Mackay +5AnswerReasoning Traces

  37. Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

    Aug 31, 2026Yi Fang, Que Shen, Chengpeng Li +6LLM Reasoning StrategiesReasoning Paths

  38. Candidate supply and answer selection shape the value of LLM judging in multi-agent systems

    Aug 26, 2026Jia-Hao Ji, Sijie Li, Jiabei Cheng +3Multi-Agent Large Language Model SystemsMulti-Agent Reasoning

  39. Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

    Aug 10, 2026Siyang Wu, Yibo Jiang, Bryon AragamLarge Language Model ReliabilityAnswer

  40. Muscle Memory for Agents: Compile not Merely Retrieve

    Aug 10, 2026Pouya Ghiasnezhad Omran, Soujanya Lanka, Qin Zhang +1AnswerMusculoskeletal

  41. How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

    Aug 8, 2026Henri Vanhuynegem, Weitao Xu, Yiran Shen +1Recent Vision-Language ModelsQwen3

  42. DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding

    Aug 7, 2026Tianjian He, Yujie Liu, Zhiping Huang +1Video Temporal GroundingTemporal Grounding

  43. Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination

    Aug 5, 2026Ruitong Li, Binjie Guo, Aisheng Mo +3DiversityAgreement

  44. When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs

    Aug 4, 2026Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague +2Causal ReasoningReasoning Traces

  45. Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces

    Aug 4, 2026Francesca Carlon, Vincent Ginis, Andres AlgabaReasoning TracesMmlu-Pro

  46. Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains

    Aug 4, 2026Yanchao Li, Wanhao Liu, Jiaqing Xie +4Reasoning BenchmarkPossibilities