Human Annotators

Momentum

8 papers in the last four weeks, up 14% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 71

All topics
CardsList
  1. Two Emojis of Difference: What Multilingual Affective Generation Benchmarks Actually Measure

    Sep 24, 2026Fardeen Sadab, Adib SakhawatMultilingual BenchmarkHuman Annotators

  2. Vroom-Vroom at SHROOM-Visions: A Multi-Judge Committee for Detecting Hallucinated Spans in Vision-Language Outputs

    Sep 15, 2026Toqeer Ehsan, Nico Penttilä, Richard Schmidt +2Vision-Language Foundation ModelsHallucination Detection

  3. Through the Eyes of the Beholder: Biometric and Demographic Conditioning for Multimodal Sexism Detection

    Sep 14, 2026Ana-Maria Luisa Mocanu, Sebastian Mocanu, Ciprian-Octavian Truică +1Multimodal Deep LearningHuman Annotators

  4. Option-Aware Retrieval and Task-Specific VLM Adaptation for Medical VQA

    Sep 14, 2026Tristan Kirscher, Niklas C. Koser, Soren PirkMedical Visual Question AnsweringMultiple-Choice Questions

  5. How broad is that claim? Mapping Generalisation in NLP Research

    Sep 13, 2026Chenxin Diao, Nataliya Stepanova, Emily AllawayScientific DiscoveryGeneralisation

  6. Human Agreement and Return Association Are Not Interchangeable Criteria

    Sep 10, 2026AS Aravinthakshan, Laven Srivastava, Harsh NandwaniFinancial Sentiment AnalysisSentiment

  7. Social Intuition vs. Machine Reasoning: Anticipating Human-Robot Interaction from multiple modalities

    Sep 7, 2026Raphael Lorenzo-Louis, Bertrand Luvison, Serena IvaldiHuman-Robot InteractionIntuition

  8. Beyond Majority Vote: Multi-Perspective Adjudication for Medical Hallucination Detection

    Sep 3, 2026Joe Cecil, Marjorie FreedmanCitation Hallucination DetectionHuman Annotators

  9. Does task decomposition improve automatic NLG evaluation?

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1Llm-As-A-JudgeNatural Language Datasets

  10. Human-Anchored Factuality Evaluation with Strategic Annotation

    Aug 31, 2026Yu Wang, Craig Erickson, Kevin SmallHuman AnnotatorsFacts

  11. LLM-as-a-Demographic: Whom Sociodemographic Prompting Helps, and Whom It Hurts

    Aug 31, 2026Daniela Occhipinti, Andrea Piergentili, Marco GueriniDemographicsLarge Language Model Bias

  12. Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment

    Aug 30, 2026Zhiyu Chen, Keyu Zhao, Jigao Fu +8Scientific IdeationAssessment

  13. Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

    Aug 21, 2026Emma Granqvist, Rocío Mercado, Samuel GenhedenLlm-As-A-JudgeDrug Discovery

  14. Toward a Theory of Value in AI Alignment

    Aug 10, 2026Andrew Smart, Shazeda Ahmed, Jackie Kay +3Artificial Intelligence AlignmentHuman Values

  15. Conformal Coverage Guarantees for Any Video Temporal Grounder

    Aug 7, 2026Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin +1Temporal GroundingSpatial Coherence

  16. ArtAnno: Annotating Implicit Semantics in Artworks through LLM Agent-Driven Bidirectional Human-AI Augmentation

    Aug 5, 2026Xiaoyan Gu, Yifang Wang, Wenqing Zheng +6Artistic OwnershipArt

  17. Oh Deer, How Should I Handle This? Seasonal Priors for Selective Wildlife Annotation and Classification

    Aug 3, 2026Hugo Markoff, Christoph Praschl, Anton Hjalte Jørgensen +5Animal Re-IdentificationSpecies

  18. SERUM: State Extraction and Refinement for User Modeling

    Jul 31, 2026Andy J. Phu, James Mooney, Karin de Langis +2User ModelingEgocentric Video

  19. DODA: A Database of Datasets for Aesthetics Research

    Jul 30, 2026Lisa Koßmann, Ralf Bartho, Christoph Redies +1AestheticsImage Quality Assessment

  20. A Model for Imbalanced Label Aggregation: A Focus on Minority-Class Detection

    Jul 27, 2026Gabriel Singer, Samuel Gruffaz, Olivier Vo Van +2Imbalanced ClassificationMinority

  21. The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

    Jul 20, 2026Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann +4Similarity and MetricsRecent Vision-Language Models

  22. Validity of LLMs as data annotators: AMALIA on authority

    Jul 9, 2026Manuel PitaHuman AnnotatorsValidation

  23. Who's Behind It? Annotating and Extracting Conspiratorial Actors from German Telegram Posts

    Jul 6, 2026Helena Mihaljević, Jolanda Beer, Mareike Lisker +1Human AnnotatorsArtificial Intelligence Detection

  24. Multi-Agentic System Leveraging Open-Source LLMs to Mitigate Disinformation Threats

    Jun 29, 2026Sebastian Kula, Martin TamajkaMisinformation DetectionMulti-Agent Large Language Model Systems

  25. Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs

    Jun 26, 2026Manuel PitaCorrectnessInter-Annotator Agreement

  26. Interpretable Probabilistic Medical Image Segmentation via Gaussian Process with Explicit Modelling of Annotation Bias and Variability

    Jun 22, 2026Qi Li, Yuliang Huang, Shaheer U. Saeed +7Semi-Supervised Medical Image SegmentationInter-Annotator Agreement

  27. Counsel: A Meta-Evaluation Dataset for Agentic Tasks

    Jun 19, 2026Sashank Pisupati, Henry Broomfield, Eujeong Choi +5Agentic BenchmarksLlm-As-A-Judge

  28. Findings of the MAGMaR 2026 Shared Task

    Jun 10, 2026Alexander Martin, Dengjia Zhang, Joel Brogan +7Multimodal Retrieval Augmented GenerationMultimodal Retrieval

  29. Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails

    Jun 4, 2026Marco Antonio Stranisci, A Pranav, Rossana Damiano +2Large Language Model BiasGuardrail

  30. SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

    Jun 3, 2026Jingyao Wu, Ashley Wang, Keane Ong +2Automatic LabellingLarge Language Model Alignment

  31. SynCred-Bench: Benchmarking Synthetic Credibility in AI-Generated Visual Misinformation

    Jun 2, 2026Junxiao Yang, Minghao Zhang, Xiaoce Wang +4CredibilityHuman Annotators

  32. The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction

    Jun 1, 2026Mirko Lai, Alessandra Urbinati, Simona Frenda +2Large Language Model AnnotationsHuman Annotators

  33. EvoPool: Evolutionary Programmatic Annotation for Label-Efficient Specialized Supervision

    Jun 1, 2026Tianyi Xu, Yaolun Zhang, Xuan Ouyang +1Human AnnotatorsMulti-Agent Evolution

  34. Digging Up Citations: FOSSIL, a Dataset and Workflow for Reference Extraction in Law and the Humanities

    May 31, 2026Luca Foppiano, Christian BoulangerCitationsHuman Annotators

  35. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartReinforcement Learning From Human FeedbackReward Functions

  36. Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization

    May 27, 2026Beiduo Chen, Pingjun Hong, Ziyun Zhang +3Human AnnotatorsProcess-Level Supervision

  37. Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

    May 27, 2026Niantong Li, Guangzheng Hu, Weixu Qiao +35CreativityFidelity

  38. AraHopeCorpus: Annotation Guidelines and Dataset for Hope Speech in Arabic Social Media Crisis Discourse

    May 22, 2026Esra'a Sharqawi, Wajdi ZaghouaniArabicHate Speech Detection

  39. Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech

    May 17, 2026Kaavya Chaparala, Thomas Thebaud, Jesús Villalba López +3TranscriptSummarization

  40. Voice "Cloning" is Style Transfer

    May 15, 2026Kaitlyn Zhou, Federico Bianchi, Martijn Bartelds +3Cross-Lingual Voice CloningVoice Conversion

  41. Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models

    May 15, 2026Cheng Zhang, Yuer Liu, Zhiyu Zhou +2Emotion RecognitionEmotion

  42. Beyond Majority Voting: Agreement-Based Clustering to Model Annotator Perspectives in Subjective NLP Tasks

    May 11, 2026Tadesse Destaw Belay, Ibrahim Said Ahmad, Idris Abdulmumin +6Human AnnotatorsDisagreement

  43. Who and What? Using Linguistic Features and Annotator Characteristics to Analyze Annotation Variation

    May 7, 2026Maximilian Maurer, Maximilian Linde, Gabriella LapesaHuman AnnotatorsLinguistics

  44. Understanding Annotator Safety Policy with Interpretability

    May 6, 2026Alex Oesterling, Donghao Ren, Yannick Assogba +4Human AnnotatorsArtificial Intelligence Safety

  45. Leveraging Vision-Language Models as Weak Annotators in Active Learning

    May 1, 2026Phuong Ngoc Nguyen, Kaito Shiku, Ryoma Bise +2Pool-Based Active LearningActive Learning

  46. Three Models of RLHF Annotation: Extension, Evidence, and Authority

    Apr 28, 2026Steve CoyneReinforcement Learning From Human FeedbackHuman Annotators

  47. Progressing beyond Art Masterpieces or Touristic Clichés: how to assess your LLMs for cultural alignment?

    Apr 28, 2026António Branco, João Silva, Nuno Marques +10Cultural AwarenessLarge Language Model Alignment

  48. SemEval-2026 Task 4: Narrative Story Similarity and Narrative Representation Learning

    Apr 23, 2026Hans Ole Hatzel, Ekaterina Artemova, Haimo Paul Stiemer +2NarrativesSimilarity and Metrics

  49. Fine-Grained Perspectives: Modeling Explanations with Annotator-Specific Rationales

    Apr 23, 2026Olufunke O. Sarumi, Charles Welch, Daniel BraunHuman AnnotatorsExplainable AI Methods

  50. Modeling Human Perspectives with Socio-Demographic Representations

    Apr 20, 2026Leixin Zhang, Cagri ColtekinHuman AnnotatorsDemographics

  51. From Fallback to Frontline: When Can LLMs be Superior Annotators of Human Perspectives?

    Apr 20, 2026Hasan Amin, Harry Yizhou Tian, Xiaoni Duan +3Human AnnotatorsBiases

  52. REALM: Reliable Expertise-Aware Language Model Fine-Tuning from Noisy Annotations

    Apr 19, 2026Sajjad Ghiasvand, Mark Beliaev, Mahnoosh Alizadeh +1Large Language Model AnnotationsLarge Language Model Fine-Tuning