Instruction-Tuned Models

Latest papers 158

All topics
CardsList
  1. Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods

    Oct 6, 2026Haotian Yang, Huikang Jiang, Yucheng Wu +4Linear Activation SteeringLarge Language Model Evaluation

  2. Base Models Can Reason By Taking a Cue From Training Data

    Oct 5, 2026Sophie L. Wang, Amil Dravid, Rulin Shao +3Instruction-Tuned Models

  3. Steering by Influence: Curvature Aware Data Weighting for Activation Steering

    Oct 5, 2026James A. E. Dixon, Stephen J. Roberts, Francesco QuinzanLinear Activation SteeringModel Activations

  4. Lend Me Your Eyes: Instruction-Aware Text Embeddings via Attention Relay

    Oct 4, 2026Yiyuan Luo, Vaggos ChatziafratisInstruction-Tuned Models

  5. Hidden in the Comments: A Context-Injection Attack Surface in Code LLMs

    Oct 4, 2026Noor Munir, Francesco Quinzan, Stephen RobertsInstruction Injection AttacksInstruction-Tuned Models

  6. AnyJev Technical Report

    Sep 30, 2026Jiamu Zhang, Tianze Yang, Yucheng Shi +6Instruction-Tuned ModelsDecisions

  7. Coverage Before Control: Route-Instruction Grounding and Steering for Controllable Retrosynthesis

    Sep 30, 2026Xuemin Chen, Xiaozhuang Song, Xinjian Zhao +2InstructionInstruction-Tuned Models

  8. OPSRD: On-Policy Self-Role Distillation

    Sep 30, 2026Weijie Ren, Yanwen Zhang, Hao Li +3Unsupervised On-Policy Self-DistillationInstruction-Tuned Models

  9. The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization

    Sep 29, 2026Benoit Dherin, Michael Munn, Xavier Gonzalvo +14Safety ClaimsInstruction Tuning

  10. Same Bytes, Different Authority: Reserved-Token Representations in Chat-Template Prompt Injection

    Sep 28, 2026Yan Zhan, Yunze Song, Mengkai Hou +3Instruction-Tuned ModelsPrompt Engineering

  11. Faithful Activation Verbalization: Reducing Hallucinations in LLM Representation Interpretation

    Sep 27, 2026Haiyan Zhao, Zirui Hei, Wei Shi +3VerbalizationLarge Language Model Hallucination

  12. How code helps different tasks? A decompositional lens on LLM post-training

    Sep 27, 2026Zheng Yu, Yiwei Li, Yishen Chen +4Instruction-Tuned ModelsPost-Training

  13. ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation

    Sep 24, 2026Qingyu Wu, Zeyu Feng, Yongda Yu +2Prompt EngineeringInstruction-Tuned Models

  14. Detecting Soft Errors in Parallel Software with LLM-tuned Instruction Duplication

    Sep 17, 2026Yafan Huang, Guanpeng LiReal-Tool BenchmarksInstruction-Tuned Models

  15. Compositional Multilingual and Behavioral Attribute Steering

    Sep 8, 2026Hyun Gu Kang, Daniil Gurgurov, Tanja Baeumel +2Linear Activation SteeringSteering

  16. Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering

    Sep 8, 2026Yizhong Geng, Kecan Mao, Qifei Li +6Instruction TuningInstruction

  17. In-Place Instruction Following in Diffusion Language Models

    Sep 7, 2026Zheng Nie, Zherui Li, Jiaming Zhang +3Diffusion Language ModelsInstruction-Tuned Models

  18. LLMs Learn Better In-Context from Rules than from Examples

    Sep 2, 2026Xiang Fu, Seungmin Cho, Yukyung Lee +1In-Context LearningIn-Context

  19. How Output Format Confounds Data Quality and Capability in Instruction Tuning

    Sep 2, 2026Chengguang Gan, Hanjun Wei, Yunhao Liang +3Instruction TuningData Quality

  20. Prompt-Robust Language Models: Which Training Strategies Work?

    Sep 1, 2026Frederic Sadrieh, Michal ŠtefánikInstruction-Tuned ModelsIn-Context Learning

  21. Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

    Aug 13, 2026Irina Proskurina, Mayank Kumar, Oyindolapo O. KomolafeInstruction TuningInstruction-Tuned Models

  22. When Do Task Vectors Interfere? Mapping the Validity Boundaries of Weight-Space Composition

    Aug 10, 2026Chencheng Zhu, Xiaoyang Li, Taotao CaiWeight-SpaceTask-Level

  23. UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following

    Aug 10, 2026Jeet Sharma, Balpreet Kaur, Jeremiah Hong +2Instruction-Tuned ModelsInstruction

  24. Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment

    Aug 8, 2026Peiyang Liu, Xi Wang, Ziqiang Cui +2Emergent MisalignmentHarmful Content

  25. Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve

    Aug 4, 2026Denys Pushkin, Albert Q. Jiang, Aryo Lotfi +2Chain-of-Thought ReasoningInstruction-Tuned Models

  26. Inverted Detection and Control in Steering Vectors

    Aug 3, 2026Max Torop, Aria Masoomi, Jennifer DyVectorsInstruction-Tuned Models

  27. Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

    Jul 29, 2026Parishruthi Ganesh, Gerry Dozier, Cheryl SealsInstruction-Tuned ModelsNatural Language Datasets

  28. Steering Instruction Hierarchies at Inference Time

    Jul 28, 2026Siqi Zeng, Sewoong Lee, Han Zhao +1Instruction-Tuned ModelsSteering

  29. Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do

    Jul 28, 2026Zandi EberstadtInstruction-Tuned ModelsSyntactic Structure

  30. Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe

    Jul 28, 2026Chaemin Jang, Dongman Lee, Jihee KimInstruction-Tuned ModelsPersona Consistency

  31. Where Steering Signals Come From: Activation Source Selection in Activation Steering

    Jul 28, 2026Jiaran Ye, Lingxu Ran, Zijun Yao +5Linear Activation SteeringSteering

  32. MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents

    Jul 27, 2026Yiwen Ma, Songjun Tu, Qichao Zhang +3Instruction-Tuned ModelsTraces

  33. IKS-Instruct: A 24,000-Example Multilingual Dataset for Teaching Language Models Indian Knowledge Systems

    Jul 25, 2026Shwetha Singaravelu, Gayathri Muruganantham, Lakshmi Rajendran +1Natural Language DatasetsInstruction

  34. A Unified Moral-Value Dataset for Instruction Tuning

    Jul 23, 2026Zhaohui Zeng, Florian MaiInstruction TuningMoral Reasoning

  35. Task Competence Is Not Instruction Following: Evaluating Instruction-Conflicting Behavior in Small Language Models

    Jul 21, 2026Mahdiyeh Farajidizaji, Vatsal RainaInstruction-Tuned ModelsInstruction

  36. CASE: Causal Alignment and Structural Enforcement for Improving Chain-of-Thought Faithfulness

    Jul 21, 2026Ziming Wang, Yinghua Yao, Changwu Huang +2Reasoning ChainInstruction-Tuned Models

  37. Diagnosing Correctness Probes under Self-Judgement Confounding

    Jul 18, 2026Yi-Long LuCorrectnessInstruction-Tuned Models

  38. PANOPTICON: A PII-Based Assemblage of Naturalistic Output Tokens for Investigating Privacy Leakage Within LLM Context Window

    Jul 17, 2026Ryan Thornton, Mir Mehedi Ahsan Pritom, Maanak GuptaPrivacyAttacker Large Language Model

  39. Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

    Jul 16, 2026Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero +1LLM Reasoning StrategiesInstruction Tuning

  40. Extending LLM Context via Associative Recurrent Memory

    Jul 13, 2026Gleb Kuzmin, Ivan Rodkin, Aydar Bulatov +8Efficient Long-Context InferenceInstruction-Tuned Models

  41. Two Axes of LLM Abstention: Answer Correctness and Question Answerability

    Jul 9, 2026Benedikt J. WagnerAnswerInstruction-Tuned Models

  42. Prompt Compression via Activation Aggregation

    Jul 9, 2026Thibaud Ardoin, Semira Einsele, Evis Bregu +1Large Language Model CompressionInstruction-Tuned Models