| 351 |
Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe
Dain Kim, Eungi Cho, ... (+3 more)
|
|
cs.AI
|
0 |
19 days ago |
| 352 |
RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
Zhenxuan Fan, Bo Zhang, ... (+10 more)
|
|
cs.RO
|
0 |
19 days ago |
| 353 |
How to Speculate about Uncertainty in Agentic Coding? A Draft-Model Gate Method
Konstantin Grotov, Valentin Malykh
|
|
cs.LG
|
0 |
19 days ago |
| 354 |
Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory
Peng Cui, Heejin Do, Mrinmaya Sachan
|
|
cs.AI
|
0 |
19 days ago |
| 355 |
First Things First: Teaching LLM-Based Agents to Prioritize Must-Haves before Nice-to-Haves
Tianjie Ju, Xinyue Xu, ... (+5 more)
|
|
cs.CV
|
0 |
19 days ago |
| 356 |
From Vision to Language: Investigating Causal Information Flow in Multimodal Decision-Making
Davide Testa, Hugh Mee Wong, ... (+3 more)
|
|
cs.CL
|
0 |
19 days ago |
| 357 |
Improving Language Identification for Code-Switched Utterances with Integer Linear Programming
Joanna Radoła, Josep Maria Crego, François Yvon
|
|
cs.CL
|
0 |
19 days ago |
| 358 |
Leveraging Low-Level Symbolic Competences for Unsupervised Grounding in Hallucination Detection
Renato Vukovic, Hsien-chin Lin, ... (+6 more)
|
|
cs.CL
|
0 |
19 days ago |
| 359 |
A Tree-based RAG Framework for Evidence-Intensive QA via Adaptive Planning and Topology-Aware Evidence Gathering
Songeun Lee, Kyungjin Min, ... (+4 more)
|
|
cs.AI
|
0 |
19 days ago |
| 360 |
Discourse Dependency: A Continuous Criterion for Translation Difficulty
Ahrii Kim, Chanjun Park, Seong-heum Kim
|
|
cs.CL
|
0 |
19 days ago |
| 361 |
RefactorPlatform: An Open-Source Harness for Controlled Evaluation of Repository-Scale Refactoring Agents
Aziz Ben Amor, Drish Mali, ... (+3 more)
|
|
cs.CL
|
0 |
19 days ago |
| 362 |
ReCAST: Restoration-aware Cascaded Stage-wise Training for Obfuscated SMS Risk Classification
Jieyun Huang, Yi Shen, ... (+8 more)
|
|
cs.CR
|
0 |
19 days ago |
| 363 |
MABPD: Multi-Agent Bias Probing & Detection via Structured Argument Debate
Garvit Joshi, Stavya Dhyani, ... (+2 more)
|
|
cs.CL
|
0 |
19 days ago |
| 364 |
Generating Constructive Feedback on Stories via Reinforcement Learning
Maja Stahl, Timon Ziegenbein, Henning Wachsmuth
|
|
cs.CL
|
0 |
19 days ago |
| 365 |
Inventory-Grounded Policy-Level Optimization for Training-Free AI Search
Wei Zhou, Tiandeng Wu, ... (+3 more)
|
|
cs.IR
|
0 |
19 days ago |
| 366 |
Intrinsic Temporal Adaptation of CLIP for Partially Relevant Video Retrieval
Hyun Seok Seong, Woojin Jun, ... (+2 more)
|
|
cs.CV
|
0 |
19 days ago |
| 367 |
Can Activation Steering Capture Multidimensional Authorship Style?
Hieu Tran, Calvin Bao, Marine Carpuat
|
|
cs.CL
|
0 |
19 days ago |
| 368 |
Persistent Teacher Anchoring for Tool-Using Agents
Hyun Bin Park, Kyungho Song, ... (+2 more)
|
|
cs.LG
|
0 |
19 days ago |
| 369 |
Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs
Seogyeong Jeong, Jaehui Hwang, ... (+4 more)
|
|
cs.CL
|
0 |
19 days ago |
| 370 |
Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models
Minji Kim, Jihyoung Jang, Hyounghun Kim
|
|
cs.CL
|
0 |
19 days ago |
| 371 |
Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models
Minji Kim, Hyounghun Kim
|
|
cs.CL
|
0 |
19 days ago |
| 372 |
How Do Language Models Represent and Use Phonological Information for Allomorph Selection?
Sangwoo Kim, Sangah Lee
|
|
cs.CL
|
0 |
19 days ago |
| 373 |
Controlling and Assessing Appropriate Persona Use in LLM-based Dialogue Generation
Jongkyung Shin, Inkyu Lee, Chiehyeon Lim
|
|
cs.CL
|
0 |
19 days ago |
| 374 |
Choosing the Right Language Mode at Inference Time for Multilingual Reliability
Ekata Mitra, Ameeta Agrawal
|
|
cs.CL
|
0 |
19 days ago |
| 375 |
Continual Graph Memory for Adaptive Recommendation under Intent Drift
Hao Nguyen Ngoc, Tung Nguyen, ... (+3 more)
|
|
cs.AI
|
0 |
19 days ago |
| 376 |
PetQA: Benchmarking Veterinary Knowledge and Clinical Reasoning
Taegyun Kim, Youngwook Ham, ... (+4 more)
|
|
cs.CL
|
0 |
19 days ago |
| 377 |
Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines
Siddharth Vohra, Runmin Jiang, ... (+2 more)
|
|
cs.AI
|
0 |
19 days ago |
| 378 |
Patterns of Priming in Production: Lexical, Semantic and Structural Alignment in Language Model Generation
Giulia Pucci, Ruizhe Li, Arabella Sinclair
|
|
cs.CL
|
0 |
20 days ago |
| 379 |
TRILOGUE: A Trilingual Spoken Dialogue Fact-Checking Benchmark with Evidence and Paired Audio
Chaewan Chun, Meruyert Aristombayeva, ... (+4 more)
|
|
cs.CL
|
0 |
20 days ago |
| 380 |
GRACE: Graph-Grounded Reflective Agent Copilot Engine for Expert-in-the-Loop Knowledge Expansion
John Seon Keun Yi, Joshua R. Minot, Dokyun Lee
|
|
cs.CL
|
0 |
20 days ago |
| 381 |
What Attention Recalls and Recurrence Controls in Hybrid Language Models
Kirill Afendulev, Alexey Dontsov, ... (+2 more)
|
|
cs.CL
|
0 |
20 days ago |
| 382 |
REFINE: LLM Refinement over Budgeted Text-Attributed Graphs for Personalized Medical Concept Representation
Mohsen Nayebi Kerdabadi, Arya Hadizadeh Moghaddam, ... (+2 more)
|
|
cs.LG
|
0 |
20 days ago |
| 383 |
You Really Didn't Get That? Benchmarking Social Pragmatic Inference for Indirect and Playful Chinese Online Comments
Shiwei Hong, Junjie Ma, ... (+6 more)
|
|
cs.CL
|
0 |
20 days ago |
| 384 |
Adapting from Downturns: Prediction of Long-Term Conversational-Skill Development in Mental-Health Crisis Counselors
Vivian Nguyen, Lillian Lee, ... (+2 more)
|
|
cs.CL
|
0 |
20 days ago |
| 385 |
MedProb: Probing Internal Representations of Vision-Language Models for Medical Question Answering
Erfan Nourbakhsh, Ke Yang, Anthony Rios
|
|
cs.CL
|
0 |
20 days ago |
| 386 |
Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
Yuntian Deng, Pengyu Nie, Stuart Shieber
|
|
cs.CL
|
0 |
20 days ago |
| 387 |
ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize
Lihao Liu, Peng Tang, ... (+2 more)
|
|
cs.CL
|
0 |
20 days ago |
| 388 |
Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning
Ye-Chan Kim, Seunghee Choi, ... (+5 more)
|
|
cs.CV
|
0 |
20 days ago |
| 389 |
Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views
Joseph Lee, Yidi Huang, ... (+3 more)
|
|
cs.CL
|
0 |
20 days ago |
| 390 |
The Shape of Time: Video-Token Contrast for Temporal Understanding in VideoLMs
Yumeng Shi, Quanyu Long, ... (+2 more)
|
|
cs.CV
|
0 |
20 days ago |
| 391 |
When Models Edit Too Much: On the Fidelity of Minimal Code Edits
Tongyao Zhu, Wei Hern Lim, Min-Yen Kan
|
|
cs.SE
|
0 |
20 days ago |
| 392 |
Two-Stage Reinforcement Learning for Sound and Adversarial Test Generation in Code LLMs
Jiacheng Xu, Wentao Zhang, ... (+5 more)
|
|
cs.CL
|
0 |
20 days ago |
| 393 |
Beyond Majority Vote: Multi-Perspective Adjudication for Medical Hallucination Detection
Joe Cecil, Marjorie Freedman
|
|
cs.CL
|
0 |
20 days ago |
| 394 |
Speak for Me: Giving LLMs the Situational Awareness to Participate in a Meeting
Muneeb Khan, Frederic Kirstein, ... (+2 more)
|
|
cs.AI
|
0 |
20 days ago |
| 395 |
CROCODIL: Cross-Model Code Editing with LLMs
Linghan Zhong, Aditya Thimmaiah, ... (+3 more)
|
|
cs.CL
|
0 |
20 days ago |
| 396 |
Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering Robustness
Hoang Cuong Nguyen, Mark Dras, Usman Naseem
|
|
cs.CL
|
0 |
20 days ago |
| 397 |
Flip, Don't Shuffle: Watermarking LLMs at the Speed of Inference
Simone Ceppi, Ignacio Sanchez
|
|
cs.CR
|
0 |
20 days ago |
| 398 |
IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks
Saikat Mondal, Mamta, ... (+3 more)
|
|
cs.CL
|
0 |
20 days ago |
| 399 |
Typological Feature Prediction with Large Language Models: An In-Context Learning Approach
Qianwen Wang, York Hay Ng, ... (+2 more)
|
|
cs.CL
|
0 |
20 days ago |
| 400 |
Rent-a-RAG: Embedding-Space Watermarks for Auditing Third-Party RAG
Alexandr Goultiaev Tolstokorov, Kyriakos Mouratidis, ... (+2 more)
|
|
cs.CR
|
0 |
20 days ago |