Human Annotations

Momentum

15 papers in the last four weeks, up 25% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. Optimal Design for Active Preference Learning with Biased LLM Judges

    Sep 30, 2026Zhongman Du, Huiming Zhang, Haodong Zhu +1Preference LearningPreference Alignment Learning

  2. Curating Synthetic Data for Task-Specific Visual Perception

    Sep 29, 2026Saptarshi Neil Sinha, Paul Julius Kühn, Michael WeinmannSynthetic DataIndoor Scene Generation

  3. Does Model Uncertainty Track Human Ambiguity? Evidence from Multi-Annotator Vision Benchmarks

    Sep 28, 2026Manya Singh, Arjun PakrashiAmbiguityMulti-Label Classification

  4. Can Vision-Language Models Analyze Human-Centered Video? Mapping Model Capabilities and Human-AI Collaborative Workflows

    Sep 23, 2026Xiyuan Shen, Jiuyang Lyu, Seokhyun Hwang +4Human AnnotationsAgentic Workflow Design

  5. Learning to Defer with Guidance on Real World Medical Data

    Sep 22, 2026Emma Sun, Joshua Strong, Alison NobleHuman AnnotationsMulti-Stage Training

  6. Canonical Procedural Actions: An Auditable Annotation Protocol for Tool-Use Agent Traces

    Sep 21, 2026Songqi Li, Dongqing Li, Zheqiao ChengTracesTool Invocation

  7. Measuring Annotation Efficiency for Handwritten Devanagari Recognition: Sample-Complexity Curves for Four Pretraining Regimes

    Sep 15, 2026Manglesh Kumar Pandey, Sumit Kumar BanshalHandwritten Text RecognitionPretraining

  8. OpenEnded: An Open-Response Speech Corpus for Speaking Proficiency Assessment with Human Annotations and ALM Supervision

    Sep 14, 2026Yu-Wen Chen, Eric Zhou, Evelyn Ding +3ProficiencyText Corpora

  9. TEAR: Table Extraction with Attribute Recommendation from Texts via Large Language Models

    Sep 14, 2026Tong Li, Shuye Ding, Jiachuan Wang +4Information ExtractionText Analysis and Detection

  10. What Counts as a Mistake? Annotating Recitation Events in Quran Memorization Transcripts

    Sep 14, 2026Mohamad Al Mdfaa, Nursultan Askarbekuly, Ahmed Helaly +2TranscriptHuman Annotations

  11. A Multi-Vehicle Dataset with Camera, LiDAR, and Radar Sensors and Scanned 3D Models for Custom Auto-Annotation using RTK-GNSS

    Sep 14, 2026Philipp Berthold, Bianca Forkel, Mirko MaehlischAutonomous DrivingRadar

  12. Single-Query Person-Centric Bimanual Hand-Object Interaction Detection

    Sep 14, 2026Jonghyun Kim, Junho Roh, Yubin Yoon +5Hand-Object Interaction DetectionHuman Annotations

  13. OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models

    Sep 11, 2026Jianjiang Yang, Peihang Li, Shanqing Xu +3Multimodal Large Language ModelsCross-Modal

  14. SignMatch: Matching Dictionary Signs to Continuous Sign Language Video

    Sep 1, 2026Ryan Wong, Youngjoon Jang, Liliane Momeni +2Sign Language TranslationSign

  15. On the Human and Computer Alignment of Attribute-Based Music Matches

    Sep 1, 2026Roser Batlle-Roca, Woosung Choi, Joan Serrà +5Music Structure AnalysisGenerative Artificial Intelligence

  16. Human-Anchored Factuality Evaluation with Strategic Annotation

    Aug 31, 2026Yu Wang, Craig Erickson, Kevin SmallHuman AnnotatorsFacts

  17. Expert-like Bone Ultrasound Segmentation through Expert-in-the-loop Mask-conditioned Progressive Learning

    Aug 31, 2026Arash Tavangar, Larissa K. Chiu, Hamidreza Khodashenas +2UltrasoundU-Net

  18. Lot Machine: Multimodal Lot Extraction from Auction Catalogs

    Aug 31, 2026Mathias Zinnen, Alisha Mund, Sabine Lang +3CatalogsExtraction

  19. WildFin: An In-the-Wild Dataset for Fish Behavioral Recognition

    Aug 21, 2026Abigail G. Grassick, Jerome Tze-Hou Hsu, Ethan Lin +10Df-Wild DatasetFish

  20. Attune: A Self-Annotation Tool for Understanding Robot Operator Attention Profiles

    Aug 12, 2026Puqi Zhou, Sungsoo Ray Hong, David PorfirioRobot SystemsMulti-Robot Systems

  21. Learning Under Treatment-Induced Label Indeterminacy with Expert Annotations of Counterfactual Outcomes: A Case Study in Neurological Prognostication

    Aug 12, 2026Xiaobin Shen, Chloe Y. H. Huang, Jonathan Elmer +1Clinical PredictionPredictive Uncertainty

  22. CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

    Aug 10, 2026Bingcan Guo, Eryue Xu, Jijie Zhou +2PrivacyDisclosures

  23. TradeVerse: A Longitudinal Benchmark of Political Negotiation in International Trade

    Aug 6, 2026Debodeep Banerjee, Amitangshu DasguptaDialogue BenchmarksNegotiation

  24. Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

    Aug 3, 2026Han Wang, Alex Whitworth, Pak Ming Cheung +5RelevanceHuman Annotations

  25. Automatic Annotation of Ancient Greek Vowel Length

    Aug 3, 2026Albin Thörn Cleland, Eric CullhedGreekConsonants

  26. Challenges in annotations by humans and LLMs: A case study of evaluative language

    Jul 30, 2026Mirela Imamovic, Aenne Cecilia Kristine Knierim, Khushi Pitroda +1Large Language Model AnnotationsHuman Annotations

  27. Automated Cardiac Adipose Tissue Segmentation in Computed Tomography: A Literature Review

    Jul 18, 2026Andreas W. Aspe, Jonas Jalili Pedersen, Andreas Ohrt Johansen +4EchocardiographyMulti Organ Computed Tomography Segmentation

  28. Demographic Prompting at Scale: When More Attributes Hurt LLM--Human Agreement

    Jul 12, 2026Mahammed Kamruzzaman, Shrabon Kumar Das, Gene Louis KimLarge Language Model AnnotationsDemographics

  29. Why Domain Matters: Domain-Aware Benchmarking of Underwater Object Detection and Annotation Quality

    Jul 12, 2026Melanie Wille, Dimity Miller, Tobias Fischer +1Underwater Object DetectionUnsupervised Detection

  30. VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

    Jul 9, 2026Iulia-Maria Udrea, Alexandra Diaconu, Bogdan AlexeHigh Confidence Pseudo-LabelsVideo Dataset

  31. GKDT: General Keypoint Detection Transformer

    Jul 1, 2026Changsheng Lu, Yuxin Chen, Haokun Gui +5Keypoint DetectionOpen-Vocabulary Object Detection

  32. RareDxR1: Autonomous Medical Reasoning for Rare Disease Diagnosis Beyond Human Annotation

    Jun 30, 2026Deyang Jiang, Haoran Wu, Ziyi Wang +4Rare DiseaseClinical Reasoning Training

  33. A Point Cloud Transformer for Remote Monitoring and Automated Assessment of Physical Rehabilitation Exercises

    Jun 29, 2026Kazi Rafat, Md. Ismail Hossain, M M Lutfe Elahi +4RehabilitationPoint Clouds

  34. HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data

    Jun 29, 2026Xinrui Ruan, Zhenyu Zhao, Waverly Wei +4Model EvaluationHuman Annotations

  35. AutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search

    Jun 24, 2026Md Omar Faruk Rokon, Shasvat Desai, Hong Yao +1RelevanceHuman Annotations

  36. PrivacyAlign: Contextual Privacy Alignment for LLM Agents

    Jun 19, 2026Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet +3Large Language Model AgentsPrivacy

  37. μμMatch: Foundation Models for Semi-supervised Learning and Domain Adaptation in EM

    Jun 19, 2026Marei Freitag, Olesia Korchevaia, Luca Freckmann +2Recent Vision Foundation ModelsWireless Foundation Models

  38. Speeding up the annotation process in semantic segmentation industrial applications

    Jun 18, 2026Marta Fernandez-Moreno, Margarita Guerrero, Rosalia Rementeria +2Semantic SegmentationHuman Annotations

  39. AnnotateAnything: Automatic Annotation of 3D Assets for Robot Manipulation

    Jun 16, 2026Haoran Lu, Mutian Shen, Shuyang Yu +9Robotic Data Acquisition3D Assets

  40. IMPACTeen: Intentions, Manipulation, Persuasion, Annotations, and Consequences in Teen Communication Dataset

    Jun 15, 2026Aleksander Szczęsny, Wiktoria Mieleszczenko-Kowszewicz, Maciej Markiewicz +5Social InfluenceTextual Dataset

  41. LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

    Jun 14, 2026Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi +1Llm-As-A-JudgeLarge Language Model Judges

  42. LLM-Assisted Stance Detection in Scientific Discourse: A Test Case in Bayesian Cognitive Science

    Jun 14, 2026Eyup Engin Kucuk, Tarik Kelestemur, Ömer Dağlar TanrikuluQualitative ResearchDiscourse

  43. Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

    Jun 12, 2026Alyssa Unell, Natalie Dullerud, Naomi Boneh +4Large Language Model JudgesJudges

  44. Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

    Jun 12, 2026Daniel Lee, Harsh Sharma, Eunkyu Park +5Llm-As-A-JudgeLarge Language Model Alignment

  45. Profy: Interpretable Visualization of Expertise-Dependent Motor Skills Toward Supporting Piano Practice

    Jun 9, 2026Kazuki Kawamura, Fujiki Nakamura, Hayato Nishioka +3InstrumentProficiency

  46. Deep Active Re-Labeling: Toward Noise-Resilient Annotation Efficiency

    Jun 7, 2026Md Abdullah Al Forhad, Weishi ShiNoisy LabelsHuman Annotations

  47. Cross-Source Reasoning-based Correction for Author Name Disambiguation

    Jun 7, 2026Fanjin Zhang, Yunhe Pang, Bo Chen +4AuthorshipDisambiguation

  48. Sycophantic Praise: Evaluating Excessive Praise in Language Models

    Jun 5, 2026Daniel Vennemeyer, Phan Anh Duong, Meryl Ye +2SycophancyLarge Language Model Alignment

  49. Towards Characterizing Scientific Image Utility and Upgradability

    Jun 2, 2026WenZhe Li, Qihang Yan, Liang Chen +6Scientific FigureScientific Discovery

  50. Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025

    Jun 1, 2026Maria Kunilovskaya, Gagan Bhatia, Lisa Sophie Albertelli +10Human AnnotationsAnnotations

  51. Knowledge-Intensive Video Generation

    May 31, 2026Chenxu Wang, Mingda ChenInteractive Video GenerationHuman Annotations

  52. Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment

    May 29, 2026Arkadiy Saakyan, Charvi Rastogi, Lora AroyoCultural AwarenessMultilingual Safety