Large Language Model Responses

Latest papers 56

All topics
CardsList
  1. A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses

    Sep 29, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoRubricsTask-Specific Rubrics

  2. Simulating Respondents, Not Single Questions: Coherent Survey Generation with Large Language Models

    Sep 28, 2026Ji Huang, Mengfei Li, Shuai ShaoSurveyLarge Language Model Responses

  3. Test-Time Scaling via Budgeted Multi-Attribute Verification

    Sep 28, 2026Bo Xue, Ji Cheng, Shen-Huan Lyu +2Token Budget AllocationLarge Language Model Responses

  4. Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference

    Sep 27, 2026Yilong Li, Chengpo Yan, Aayan Arish +1Large Language Model ResponsesFactual Recall

  5. Not All AI Agents Are Equal: Characterizing Resource and Performance Dynamics

    Sep 17, 2026Wonmi Choi, Minuk Park, Zhixiong Niu +3Artificial Intelligence AgentsBottlenecks

  6. Route, Don't Fix: Regime-Dependent Decoding Correction and a Trajectory-Gated Router for Reliable Clinical LLM Answer Selection

    Sep 13, 2026Zeyu Dong, Benjamin Wang, Joyee W. JinLarge Language Model ResponsesCorrection

  7. Measuring Brand and Source Discovery under Repeated LLM Queries: A Finite-Sample Audit

    Sep 4, 2026Dmitrij ŻatuchinModel AuditingLarge Language Model Responses

  8. The Language of the Question Selects the Market: Query Language and Exit IP as Separable Factors in Commercial Recommendations from a Generative Search Interface

    Aug 30, 2026Dmitrij ŻatuchinBrand-As-MemoryLanguage Pairs

  9. Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions

    Aug 13, 2026Qingfang Liu, Qiao Jin, Joe D. Menke +2ChatbotsLarge Language Model Responses

  10. It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief

    Jul 20, 2026Kevin Du, Clara Kümpel, Michelle Wastl +1Large Language Model ResponsesLinguistics

  11. When LLMs Over-Answer: Measuring and Mitigating Quality Issues in LLM-Based Hardware Description Language Question Answering

    Jul 19, 2026Ziteng Hu, Jiachi Chen, Wenhao Lv +2Large Language Model ResponsesHigh-Level Synthesis

  12. How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

    Jul 13, 2026Elmira Salari, Hazem Amamou, José Victor de Souza +3Large Language Model BiasLarge Language Model Responses

  13. Comprehensive Evaluation of Large Language Model Responses: A Multi-Factor Scoring System

    Jul 8, 2026Yiming Gai, Junde Lu, Xuefei HuangLarge Language Model EvaluationLarge Language Model Responses

  14. ChatImage: Navigating Long-Form LLM Answers through Interactive Images

    Jul 6, 2026Wencan Jiang, Jiangning Zhang, Yong LiuLarge Language Model ResponsesAnswer

  15. Detecting Answer-Driven Reasoning in LLM-Based Educational Tutors via Truncated Chain-of-Thought Auditing

    Jul 6, 2026Bonan Shen, Dingyan Shang, Youting Wang +1TutorsLLM Reasoning Strategies

  16. Prompting GPT-5 on Scrum Certification Questions: An Empirical Accuracy Study

    Jun 29, 2026Mirko Perkusich, Danyllo Albuquerque, João Paiva +6Large Language Model ResponsesQuestion

  17. Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

    Jun 23, 2026Tian Zheng, Kai-Tai HsuGradingData Science Agents

  18. LLMs Infer Cultural Context but Fail to Apply It When Responding

    Jun 16, 2026Yisong Miao, Jian Zhu, Vered ShwartzLarge Language Model ResponsesLarge Language Model Adaptation

  19. Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning

    Jun 11, 2026Zach Studdiford, Gary LupyanLLM Reasoning StrategiesReasoning Errors

  20. More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs

    Jun 7, 2026Marina Igitkhanian, Erik ArakelyanSmall Large Language ModelsLLM Reasoning Strategies

  21. Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

    Jun 5, 2026Indu Panigrahi, Tal AugustLarge Language Model ResponsesLarge Language Model Evaluation

  22. On Wednesdays, We Ask Questions: Optimizing "Active Listening" in Automated Legal Triage and Referral

    May 29, 2026Quinten Steenhuis, Jacqueline HarveyLegal Reasoning TasksLegal Domain

  23. JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

    May 26, 2026Jiho Jin, Junho Myung, Juhyun Oh +5Cultural AwarenessLlm-As-A-Judge

  24. APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings

    May 20, 2026Philipp Spohn, Leander Girrbach, Zeynep AkataLarge Language Model PersonalizationPersonalization

  25. Less Back-and-Forth: A Comparative Study of Structured Prompting

    May 19, 2026Saurav Ghosh, Gabriella Polach, Abdou SowAutomatic Prompt OptimizationLarge Language Model Responses

  26. Occupational Prompting Reveals Cultural Bias in Large Language Models

    May 19, 2026Maksim E. Eren, Andrea Brennen, Ryan C. Barron +1Large Language Model BiasLarge Language Model Responses

  27. Improving Cross-Cultural Survey Simulation with Calibrated Value Personas

    May 15, 2026Axel Abels, Elias Fernandez Domingos, Apurva Shah +1Cultural EvolutionUser Simulation

  28. When Can Digital Personas Reliably Approximate Human Survey Findings?

    May 11, 2026Mumin Jia, Yilin Chen, Divya Sharma +1Artificial Intelligence PersonasSurvey

  29. CLaC at SemEval-2026 Task 6: Response Clarity Detection in Political Discourse

    May 4, 2026Nawar Turk, Lucas Miquet-Westphal, Leila KosseimLarge Language Model ResponsesInterviews

  30. Revisiting Non-Verbatim Memorization in Large Language Models: The Role of Entity Surface Forms

    Apr 23, 2026Yuto Nishida, Naoki Shikoda, Yosuke Kishinami +4MemorizationImplicit Association Test

  31. From If-Statements to ML Pipelines: Revisiting Bias in Code-Generation

    Apr 23, 2026Minh Duc Bui, Xenia Heilmann, Mattia Cerrato +2Large Language Model BiasCode Generation

  32. Generative Discovery of Magnetic Insulators under Competing Physical Constraints

    Apr 22, 2026Qiulin Zeng, Tahiya Chowdhury, Md Shafayat HossainData-Driven Materials DiscoveryMagnetic Tunnel Junction

  33. Continuous Semantic Caching for Low-Cost LLM Serving

    Apr 21, 2026Baran Atalar, Xutong Liu, Jinhang Zuo +3Large Language Model ServingLarge Language Model Responses

  34. Expressing Social Emotions: Misalignment Between LLMs and Human Cultural Emotion Norms

    Apr 18, 2026Sree Bhattacharyya, Manas Mehta, Leona Chen +4Large Language Model BiasEmotion

  35. Stochastic Parrots or Singing in Harmony? Testing Five Leading LLMs for their Ability to Replicate a Human Survey with Synthetic Data

    Feb 10, 2026Jason Miklian, Kristian Hoelscher, John E. KatsosSurveySynthetic Data

  36. User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

    Oct 23, 2025Xiaoyuan Wu, Roshni Kaushik, Wenkai Li +2PrivacyLarge Language Model Responses

  37. Human Psychometric Questionnaires Mischaracterize LLM Behavior

    Sep 12, 2025Woojung Song, Dongmin Choi, Yoonah Park +3Psychometric PropertiesPersona Consistency

  38. HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs

    Mar 3, 2025Tin Nguyen, Logan Bolton, Mohammad Reza Taesiri +2Large Language Model HallucinationLarge Language Model Responses

  39. PACIFIC: Can LLMs Discern the Psychometric Traits Influencing Your Preferences? Personality-Driven Preference Alignment in LLMs

    Date pendingTianyu Zhao, Siqi Li, Yasser Shoukry +1Preference AlignmentPreference Alignment Learning