Compression Remembers the Detour: How Context Compression Amplifies Off-Task Content and Derails LLM Agents

Authors

  • Zhan Zhang Ernst & Young; Nanjing University of Finance and Economics
  • Wenzhi Zhang Nanjing University of Finance and Economics

DOI:

https://doi.org/10.62177/apemr.v3i4.1704

Keywords:

Context Compression, Large Language Model Agents, Goal Drift, Agent Memory, Goal-Anchored Compression

Abstract

Long-horizon LLM agents rely on context compression to keep growing histories within a finite window [1][2]. These mechanisms are goal-agnostic—retention follows volume, recurrence, and generic salience rather than task relevance—and we show they systematically amplify off-task content, inducing Compression-Induced Goal Drift (CIGD). We formalize CIGD via the drift amplification ratio (DAR), evaluate six compression strategies on a controlled injection benchmark ( per cell), and propose Goal-Anchored Compression (GAC): a pinned goal anchor, a negation ledger, status-aware retention scoring, and drift re-anchoring. Volume- and recurrence-based compressors amplify detours monotonically with repetition (attention-scored eviction reaches  at twelve-fold repetition), while query-conditioned compressors de-amplify. Under severe budgets, summarization and scored eviction lose the user’s negated constraint in  and  of episodes where GAC retains it in ; GAC eliminates residual detour content () with  smaller contexts. Prior work asks what compression forgets [3][4]; we ask what it amplifies.

Downloads

Download data is not yet available.

References

Packer, C., et al.(2023).MemGPT: Towards LLMs as operating systems.arXiv. https://arxiv.org/abs/2310.08560

Wu, et al.(2025).ReSum: Unlocking long-horizon search intelligence via context summarization.arXiv. https://arxiv.org/abs/2509.13313

Chen, S.(2026).Governance decay: How context compaction silently erases safety constraints in long-horizon LLM agents.arXiv. https://arxiv.org/abs/2606.22528

Wang, Zhang, Lee, & Yang(2026).Lost in compaction: Evaluating side-constraint loss under context compaction.arXiv. https://arxiv.org/abs/2608.11242

Zhang, Q., et al.(2025).Agentic context engineering: Evolving contexts for self-improving language models (ACE).arXiv. https://arxiv.org/abs/2510.04618

Park, J. S., et al.(2023).Generative agents: Interactive simulacra of human behavior.UIST 2023. https://arxiv.org/abs/2304.03442

Zhang, Z., et al.(2023).H2O: Heavy-hitter oracle for efficient generative inference of large language models.NeurIPS 2023. https://arxiv.org/abs/2306.14048

Chhikara, P., et al.(2025).Mem0: Building production-ready AI agents with scalable long-term memory.arXiv. https://arxiv.org/abs/2504.19413

Chen, Pan, Dai, & Netravali(2026).Slipstream: Trajectory-grounded compaction validation for long-horizon agents.arXiv. https://arxiv.org/abs/2605.08580

Arike, A., Donoway, R., Bartsch, K., & Hobbhahn, M.(2025).Evaluating goal drift in language model agents.arXiv. https://arxiv.org/abs/2505.02709

Xu, J., et al.(2022).Learning to generate and detect repetition (DITTO).NeurIPS 2022. https://arxiv.org/abs/2206.02369

Li, H., et al.(2023).Repetition in repetition out: Understanding the self-reinforcement of repetition in LLMs.NeurIPS 2023. https://arxiv.org/abs/2310.10226

Kolawole, S., & Smith, V.(2026).Epiphany-aware KV cache eviction without the attention matrix (EpiKV).arXiv. https://arxiv.org/abs/2606.26472

Cemri, M., et al.(2025).Why do multi-agent LLM systems fail? (MAST).NeurIPS 2025 D&B. https://arxiv.org/abs/2503.13657

Backlund, A., & Petersson, L.(2025).Vending-bench: A benchmark for long-term coherence of autonomous agents.arXiv. https://arxiv.org/abs/2502.15840

Li, Y., et al.(2023).Selective context: Compressing context to enhance inference efficiency.EMNLP 2023. https://arxiv.org/abs/2304.12102

Jiang, H., et al.(2023).LLMLingua: Compressing prompts for accelerated inference of large language models.EMNLP 2023. https://arxiv.org/abs/2310.05736

Jiang, H., et al.(2024).LongLLMLingua: Accelerating and enhancing LLMs in long context scenarios via prompt compression.ACL 2024. https://arxiv.org/abs/2310.06839

Pan, Z., et al.(2024).LLMLingua-2: Data distillation for efficient and faithful task-agnostic prompt compression.ACL 2024. https://arxiv.org/abs/2403.12968

Xu, F., Shi, W., & Choi, E.(2024).RECOMP: Improving retrieval-augmented LMs with compression and selective augmentation.ICLR 2024. https://arxiv.org/abs/2310.04408

Yoon, J., et al.(2024).CompAct: Compacting retrieved documents with active context compression.EMNLP 2024. https://arxiv.org/abs/2407.09014

Litschko, R., et al.(2024).Context-aware sentence encoding for prompt compression (CPC).arXiv. https://arxiv.org/abs/2409.01227

Ge, T., et al.(2024).In-context autoencoder for context compression (ICAE).ICLR 2024. https://arxiv.org/abs/2307.06945

Chevalier, A., et al.(2023).Adapting language models to compress contexts (AutoCompressor).EMNLP 2023. https://arxiv.org/abs/2305.14788

Xiao, G., et al.(2024).Efficient streaming language models with attention sinks (StreamingLLM).ICLR 2024. https://arxiv.org/abs/2309.17453

Li, Y., et al.(2024).SnapKV: LLM knows what you are looking for before generation.NeurIPS 2024. https://arxiv.org/abs/2404.14469

Cai, Z., et al.(2024).PyramidKV: Dynamic KV cache compression based on pyramidal information funneling.arXiv. https://arxiv.org/abs/2406.02069

Wu, J., Ouyang, L., et al.(2021).Recursively summarizing books with human feedback.arXiv. https://arxiv.org/abs/2109.10862

Chen, X., et al.(2024).Compress to impress with compressive memory (COMEDY).arXiv. https://arxiv.org/abs/2402.11975

Ye, et al.(2025).AgentFold: Long-horizon web agents with proactive context management.arXiv. https://arxiv.org/abs/2510.24699

Wan, et al.(2025).COMPASS: Enhancing agent long-horizon reasoning with evolving context.arXiv. https://arxiv.org/abs/2510.08790

Li, et al.(2026).ACM: Agentic context management for long horizon tasks.arXiv. https://arxiv.org/abs/2607.23809

Microsoft(2025).ACON: Optimizing context compression for long-horizon agents.arXiv. https://arxiv.org/abs/2510.00615

Zhong, W., et al.(2024).MemoryBank: Enhancing large language models with long-term memory.AAAI 2024. https://arxiv.org/abs/2305.10250

Xu, W., et al.(2025).A-MEM: Agentic memory for LLM agents.NeurIPS 2025. https://arxiv.org/abs/2502.12110

Zhou, et al.(2025).MEM1: Learning to synergize memory and reasoning.arXiv. https://arxiv.org/abs/2506.15841

Zhang, et al.(2026).SWE-Pruner: Task-aware adaptive pruning for coding agents.arXiv. https://arxiv.org/abs/2601.16746

Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., & Liang, P.(2024).Lost in the middle: How language models use long contexts.Transactions of the Association for Computational Linguistics,12. https://arxiv.org/abs/2307.03172

Hong, K., Troynikov, A., Huber, J., et al.(2025).Context rot: How increasing input tokens impacts LLM performance.Chroma Research Technical Report. https://research.trychroma.com/context-rot

Modarressi, A., et al.(2025).NoLiMa: Long-context evaluation beyond literal matching.ICML 2025. https://arxiv.org/abs/2502.05167

Hsieh, C. P., et al.(2024).RULER: What's the real context size of your long-context language models?.arXiv. https://arxiv.org/abs/2404.06654

Zhu, K., et al.(2025).AgentErrorBench: Diagnosing failure modes of LLM agents.arXiv. https://arxiv.org/abs/2509.25370

Wang, et al.(2026).HORIZON: A benchmark for long-horizon agent evaluation.arXiv. https://arxiv.org/abs/2604.11978

Shi, F., et al.(2023).Large language models can be easily distracted by irrelevant context (GSM-IC).ICML 2023. https://arxiv.org/abs/2302.00093

Chen, Wang, & Qu(2026).The horizon gap: A survey of long-horizon LLM agents.arXiv. https://arxiv.org/abs/2608.06663

Du, H.(2026).Memory for autonomous LLM agents: Mechanisms, systems, and open challenges.arXiv. https://arxiv.org/abs/2603.07670

Chen, Z., et al.(2024).MemWalker: Learning to walk in memory for long-context LLMs.ICLR 2024. https://arxiv.org/abs/2310.05029

Yao, S., et al.(2024).τ-bench: A benchmark for tool-agent-user interaction in real-world domains.arXiv. https://arxiv.org/abs/2406.12045

Wu, D., et al.(2024).LongMemEval: Benchmarking chat assistants on long-term interactive memory.arXiv. https://arxiv.org/abs/2410.10813

Maharana, A., et al.(2024).Evaluating very long-term conversational memory of LLM agents (LoCoMo).arXiv. https://arxiv.org/abs/2402.17753

Downloads

How to Cite

Zhang, Z., & Zhang, W. (2026). Compression Remembers the Detour: How Context Compression Amplifies Off-Task Content and Derails LLM Agents. Asia Pacific Economic and Management Review, 3(4). https://doi.org/10.62177/apemr.v3i4.1704

Issue

Section

Articles