Real-World Tasks

Momentum

1 paper in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 27

All topics
CardsList
  1. Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks

    Oct 1, 2026Hao Wang, Ting HuangAgent HarnessReal-World Tasks

  2. GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks

    Aug 4, 2026Leijun Zhou, Zhihao Liu, Xiang Qu +9Self-Evolving AgentsSelf-Evolution

  3. An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

    Aug 4, 2026Vikas Pahuja, Jonathan Brokman, Omer Hofman +6Multilingual AgentsLarge Language Model Planning

  4. Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity

    Jul 15, 2026Xiaotian Luo, Fengxingyu Wang, Chuanrui Hu +2Self-Evolving AgentsAgent Harness

  5. Metacognition in LLMs: Foundations, Progress, and Opportunities

    Jul 13, 2026Gabrielle Kaili-May Liu, Areeb Gani, Jacqueline Lu +3MetacognitionArtificial Intelligence Systems

  6. Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation

    Jul 3, 2026Jin Yang, Ping Wei, Nanning ZhengRobotic ManipulationReal-World Tasks

  7. MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

    Jun 30, 2026Qingyun Liu, Jiwen Zhang, Jingyi Hu +2Multimodal AgentsEmbodied Agents

  8. SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

    Jun 8, 2026Hongcheng Gao, Hailong Qu, Jingyi Tang +18Spatial ReasoningMultimodal Agents

  9. ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

    Jun 7, 2026Lu Jia, Haibo Tong, Feifei Zhao +5Large Language Model SafetyLarge Language Model Agents

  10. Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning

    Jun 2, 2026Eric Cho, Shawn Huang, Alice Lu +1Finance BenchmarksAgentic Benchmarks

  11. GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

    May 27, 2026Zheng Wu, Chengcheng Han, Zhengxi Lu +5Graphical User Interface AgentsMultimodal Agents

  12. TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

    May 21, 2026Zhaoyang Chu, Jiarui Hu, Xingyu Jiang +8Real-World TasksAgentic Benchmarks

  13. Do Coding Agents Understand Least-Privilege Authorization?

    May 14, 2026Zheng Yan, Jingxiang Weng, Charles Chen +9AuthorizationAccess Control

  14. Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare

    May 8, 2026Prasanna Desikan, Harshit Rajgarhia, Shivali Dalmia +1Clinical Decision SupportReal-World Tasks

  15. DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

    Apr 28, 2026Jinxiang Meng, Shaoping Huang, Fangyu Lei +17Visual AnalyticsReal-World Tasks

  16. EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks

    Apr 26, 2026Yihang Li, Xuelong Wei, Jingzhou Luo +26Egocentric DatasetEgocentric Video

  17. CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks

    Apr 20, 2026Yijia Shao, Zora Zhiruo Wang, Neel Ahuja +3Human-Ai CollaborationCollaboration

  18. Artificial Effort

    Apr 17, 2026Federico Belotti, Stefano Coniglio, Antonio Cosma +1Real-World Tasks

  19. Abstract Sim2Real through Approximate Information States

    Apr 16, 2026Yunfu Deng, Yuhao Li, Josiah P. HannaSim-To-Real Reinforcement LearningSim-To-Real Gap

  20. Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

    Dec 2, 2025Songwen Zhao, Danqing Wang, Kexun Zhang +3Vibe CodingVulnerable Code