How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior
- Authors: Zidi Xiong, Yuping Lin, Wenya Xie, Pengfei He, Zirui Liu, Jiliang Tang, Himabindu Lakkaraju, Zhen Xiang
- Affiliation: Harvard University; University of Georgia; Michigan State University; University of Minnesota-Twin Cities
- Paper: https://aclanthology.org/2026.acl-long.27/
- Code: https://github.com/yuplin2333/agent_memory_manage
- Published: May 21, 2025 (arXiv preprint); ACL 2026 Main (Long Papers)
TL; DR
agent memory์ add/delete๋ง ๋ถ๋ฆฌํ์ฌ ์ธก์ ํ๋ฉด long-term ์ฑ๋ฅ์ evaluator ํ์ง์ ์์กด, ์ฝํ LLM judge๋ memory๋ฅผ ๊ฐฑ์ ํ์ง ์๋ ๊ฒ๋ณด๋ค๋ ์
ํ.
- ์: ๊ธฐ์กด memory ์ฐ๊ตฌ๋ ์ ๋ถ โ์ด๋ค memory ์์คํ ์ ์ค๊ณํ ๊นโ์ ์ง์ค, ๋ฉ๋ชจ๋ฆฌ์์ ๊ฐ์ฅ ๊ธฐ์ด์ ์ธ ๋ ์ฐ์ฐ(add, delete)์ด ์๊ฐ์ ๋ฐ๋ผ agent ํ๋์ ์ด๋ป๊ฒ ๋ฐ๊พธ๋์ง๋ ์๋ฌด๋ ๊ท๋ช ํ์ง ์์.
- ์ ์: ์ ๋ฐฉ๋ฒ๋ก ์ ์์ด ์ฃผ๋ชฉ์ ์ด ์๋ empirical study. ๋ค๋ง ๋ถ์์ ์ผ๋ก history-based deletion์ด๋ผ๋ ์ ์ญ์ ์ ๋ต ์ ์.
- ๋ฐ๊ฒฌ: (1) experience-following property, (2) error propagation, (3) misaligned experience replay. ๋ฏธ๋ task์ ์คํ ๊ฒฐ๊ณผ๊ฐ ์ ์ฅ๋ memory์ label์ด ๋๋ค๋ ์ค์ฉ์ ๊ฒฐ๋ก


1) ์ข์๋จ query๊ฐ ์
๋ ฅ๋๊ณ ,
2) memory์์ ๊ฒ์ํด์ planning โ execution
3) ์ฐ์ธก Memory Management ๋ธ๋ก์์ ๊ทธ ๊ฒฐ๊ณผ๋ฅผ addํ ์ง/deleteํ ์ง ํ๋จ
4) ๊ทธ ๊ฒฐ๊ณผ๊ฐ ๋ค์ timestep์ memory bank. loop ๋ฐ๋ณต
Background
agent memory์ ๊ธฐ๋ณธ ๊ตฌ์กฐ
- LLM agent์ 3๊ฐ์ง long-term memory (Sumers et al., 2023)
- semantic memory: ์ธ๊ณ ์ง์, ํ๊ฒฝ์ ๋ํ ์ดํด
- procedural memory: ๊ท์น๊ณผ ์ ์ฐจ. LLM weight ์์ ์๋ฌต์ ์ผ๋ก ์๊ฑฐ๋ guideline์ผ๋ก ๋ช ์๋จ
- episodic memory: task๋ณ ๊ฒฝํ ๊ธฐ๋ก. ์ด ๋ ผ๋ฌธ์ ๋์
Figure 1episodic memory์ ๋์ ๋ฐฉ์- memory bank $D = \lbrace (q_1, e_1), \dots, (q_N, e_N) \rbrace$
- $q$: task query (agent input)
- $e$: execution trajectory (agent output)
- Memory Reading:
- ์ query $q$๊ฐ ์ค๋ฉด ๊ฐ์ฅ ๊ด๋ จ ์๋ $K$๊ฐ ๋ถ๋ถ์งํฉ $\xi_K \subset D$ ๊ฒ์.
- ๋ณดํต text encoder๋ก embedding ์ป๊ณ cosine similarity ๊ณ ๋ฅด๊ธฐ
- in-context demonstration์ผ๋ก ์จ์ ์ execution $e$ ์์ฑ
- Memory Management: ๋๋ $(q, e)$๋ฅผ ์ ์ฅํ ์ง
addition, ์ค๋๋๊ฑฐ๋ ์ค๋ณต๋ ๊ฑธ ์ง์ธ์งdeletion๊ฒฐ์
- memory bank $D = \lbrace (q_1, e_1), \dots, (q_N, e_N) \rbrace$
Related Work
memory ์์คํ ์ ๋ง์๋ฐ, ๊ทธ ์์คํ ์ด ์๊ฐ์ ๋ฐ๋ผ ์ค์ค๋ก๋ฅผ ์ค์ผ์ํค๋ ๊ณผ์ ์ ์ฐ ์ฐ๊ตฌ๋ ์์.
- ๊ธฐ์กด memory management ์ ๋ต: ์ ๋ถ ํน์ agent ํ์
(e.g. chatbot)์ ๋ง์ถฐ, ์๋ก ๋ค๋ฅธ agentic system์ ๊ดํตํ๋ ํตํฉ ์ค๊ณ ๋ถ์ฌ
- structural transformation (ArIGraph, Zeng et al.)
- merging (Think-in-Memory, HiAgent)
- summarization (MemoryBank, Pan et al.)
- reflection (Reflexion, ExpeL)
- memory bank ์ต์ ํ ์ฐ๊ตฌ: add/delete๊ฐ ๋ณธ์ง์ ์ผ๋ก noisyํ ๋ memory bank์ dynamics๊ฐ long-term ์ฑ๋ฅ์ ์ด๋ค ์ํฅ์ ์ฃผ๋์ง์ ๋ํ ์ดํด ๋ถ์ฌ
- EM ๊ธฐ๋ฐ (Yin et al., 2024)
- MDP formulation (Zhou et al., 2025 / AgentFly)
- static KB๋ฅผ ์ฐ๋ ICL ์ฐ๊ตฌ (Luo et al., 2024)์ ์ฐจ์ด
- agentic memory๋ (a) retrieval pool ์์ฒด๊ฐ ์๊ฐ์ ๋ฐ๋ผ ๋ณํ๊ณ (b) ์ ์ฅ๋๋ ๋ด์ฉ์ด agent ์์ ์ด ๋ง๋ noisy output
Problem States
memory bank๊ฐ ์ฐ์์ ์ธ memory ์ฐ์ฐ์ ์ํด ์งํํ ๋, ๊ทธ dynamics๊ฐ ์ฅ๊ธฐ agent ์คํ์ ์ด๋ป๊ฒ ์ํฅ์ ์ฃผ๋๊ฐ?
- ๊ฐ์ฅ ๊ธฐ๋ณธ์ ์ธ ์ฐ์ฐ๋ง ๋ถ๋ฆฌํด์ ์ธก์ ํ๋ ์ค์ฆ ์ฐ๊ตฌ ํ์
- add์ delete๋ memory management์ ์ต์ ๋จ์
- ๊ทธ๋ผ์๋ ๋ถ๊ตฌํ๊ณ ๊ทธ ํจ๊ณผ๊ฐ ์ ๋๋ก ์ธก์ ๋ ์ ์์
- ํ๋ฆฐ/์๋ชป๋ ๊ฒฝํ์ด ์ฌ๊ฒ์ โ ๋ค์ ์คํ์ ์ค์ผ์ํค๋ ๊ฒฝ๋ก ์ถ์ ํ์
- agent๊ฐ ์ ์ฅํ๋ ๊ฑด ์๊ธฐ๊ฐ ๋ง๋ output
- ๊ทธ output์ ์ค๋ฅ ๊ฐ๋ฅ์ฑ ๋ดํฌ, ์ฆ ํ๋ฆด ์ ์์
- evaluator(trajectory evaluator)๊ฐ add/delete๋ฅผ ๊ฒฐ์ ํ๋๋ฐ, ๊ทธ evaluator์ ํ์ง์ด ์ด๋๊น์ง ์ค์ํ์ง ์๋ฌด๋ ์ ์ผ โ evaluator ํ์ง ๋๋น ์ฅ๊ธฐ ์ฑ๋ฅ ๊ณก์ ์ด ํ์
- ์ค์ ๋ฐฐํฌ ํ๊ฒฝ์ task ๋ถํฌ๊ฐ ๋ฐ๋๊ณ ์ ์ฅ ๊ณต๊ฐ์ด ์ ํํจ โ distribution shift์ memory ์ฉ๋ ์ ์ฝ ํ์์๋ ์ฑ๋ฆฝํ๋์ง ํ์ธ์ด ํ์
- ๊ณผ๊ฑฐ ์คํ ๊ฒฐ๊ณผ๊ฐ ๋ฏธ๋์๋ ์ ํจํ ์ง๋ ๋ณด์ฅ ๋ถ๊ฐํจ์๋, ๊ณผ๊ฑฐ ํ๊ฐ ๊ธฐ๋ก์ ๊ทธ๋๋ก ์ฌ์ฉํ๋ ๊ฒ์ ๊ฒฝ๊ณ
Suggestions
- addition ๊ฒฐ์ : evaluator $\pi$์ ์ด์ง ํ์
- $\pi(q, e) = 1$์ด๋ฉด ์ ์ฅ
- $\pi(q, e) = 0$์ด๋ฉด ํ๊ธฐ
- deletion ๊ฒฐ์ : ๊ธฐ์ค $\phi$
- $\phi = 1$์ด๋ฉด memory bank์์ ์ ๊ฑฐ
4๊ฐ์ง Memory Addition
task๊ฐ ํ๋ ์ข ๋ฃ๋๋ฉด ๋ง๋ค์ด์ง๋ $q$์ $e$ pair์ ๋ํด memory์ ๋ฃ์์ง ๋ง์ง ๊ฒฐ์ ํ๋ ํ์ ์ $\pi$๋ฅผ ๋ฌด์์ผ๋ก ๋๋๋๋ง ๋ฐ๊ฟ๊ฐ๋ฉฐ ๋น๊ต.
- Fixed-memory baseline $\pi_{\text{fixed}} = 0$ : training set์์ ์ ๋ต ์คํ๋ง ๊ณจ๋ผ ๋ง๋ ๊ณ ์ memory. ์๋ฌด๊ฒ๋ ์ถ๊ฐํ์ง ์์.
- Add-all $\pi_{\text{all}} = 1$ : ๋ง์ฃผ์น ๋ชจ๋ task์ ์คํ์ ๋ฌด์กฐ๊ฑด ์ ์ฅ
- Selective addition, coarse $\pi_{\text{automatic}}$ : LLM์ด ๋ง์ ๊ฑฐ ๊ฐ์์ง๋ฅผ ํ์
- C1(GPT-4o-mini) < C2(GPT-4.1-mini) < C3(GPT-4.1-mini๋ฅผ ์ ๋ต ํ์ 300๊ฐ๋ก fine-tune ํ ์ง์) ์์ผ๋ก ์ ํ
- (RegAgent) ์์ธก๊ฐ๊ณผ ์ ๋ต์ ์ ๋ ์ค์ฐจ threshold๋ก ์ ์: C1=1.6, C2=1.4, C3=1.2 (threshold๊ฐ ์์์๋ก ์๊ฒฉ = ์ ํํ evaluator)
- C1(GPT-4o-mini) < C2(GPT-4.1-mini) < C3(GPT-4.1-mini๋ฅผ ์ ๋ต ํ์ 300๊ฐ๋ก fine-tune ํ ์ง์) ์์ผ๋ก ์ ํ
- Selective addition, strict $\pi_{\text{human}}$ : ์ฌ๋(oracle) ํ์ .
- ์ค์ ๋ก๋ ์์ฑ ๊ฒฐ๊ณผ๋ฅผ gt์ ์ง์ ๋น๊ตํด์ ์๋ฎฌ๋ ์ด์ (upper-bound)
Findings 1 Experience-Following Property
- ํ์ฌ query์ ๊ฒ์๋ ๊ธฐ๋ก์ query ์ฌ์ด input similarity๊ฐ ๋์ผ๋ฉด, ๋ ์คํ ๊ฒฐ๊ณผ ์ฌ์ด์ output similarity๋ ๋์
- ์ง๊ด์ ์ผ๋ก๋ โ๋น์ทํ ์ง๋ฌธ์ ๋ง๋๋ฉด agent๊ฐ ๊ณผ๊ฑฐ ๋ต์ ์ถ๋ก ํ๋ ๋์ ๋ฒ ๋๋คโ
- ์ ์ฌ๋ ์ ์๋ agent๋ง๋ค ๋ค๋ฆ: RegAgent์ AgentDriver๋ RBF kernel์ ์ฌ์ฉ
- EHRAgent๋ ์ฝ๋๊ฐ ์ถ๋ ฅ์ด๋ผ
pycode_similar์ ์ฝ๋ ํ์ ์ ์๋ฅผ output similarity๋ก ์
- EHRAgent๋ ์ฝ๋๊ฐ ์ถ๋ ฅ์ด๋ผ
- ๋ ์ถ๋ ฅ ๋ฒกํฐ๊ฐ ๊ฐ๊น์ธ์๋ก 1์ ๊ฐ๊น๊ณ ๋ฉ์๋ก 0์ผ๋ก ๋จ์ด์ง๋ ์ง์ ๊ฐ์ ํจ์
Findings 2 Error Propagation
- ํ๋ฆฐ ๊ธฐ๋ก์ด demonstration์ผ๋ก ๊ฒ์ โ ํ์ฌ ์คํ๋ ์คํจ โ ๊ทธ ๊ฒฐ๊ณผ๊ฐ ๋ค์ ์ ์ฅ โ ๋ฏธ๋ task๋ก ์ค๋ฅ ์ ํ
- experience-following์ด ๊ฐํ ์๋ก ์ด ์ ํ๋ ๊ฐํ
- ์ฑ์ง ์์ฒด๋ ์ค๋ฆฝ์ด๋๋ผ๋ ์ ์ฅ๋ด์ฉ์ด ์ค์ผ๋๋ฉด ์ฆํญ
3๊ฐ์ง Memory Deletion: ์ธ ๊ฐ์ง ์ ๋ต
- Periodical-based Deletion: ์ธ๊ฐ ์ธ์ง์ forgetting rate์์ ์ฐฉ์, โ์ง๋ ๊ตฌ๊ฐ ๋์ $\alpha$๋ฒ ์ดํ๋ก๋ง ๋ถ๋ ค๋์จ ๊ธฐ๋ก์ ์ธ๋ชจ์์ผ๋ ์ง์ด๋คโ
- memory ํฌ๊ธฐ์ ์ํ: $M \leq \alpha(t - tโ)K$ ($K$๋ ์คํ๋น ๊ฒ์ ๊ฐ์)
- ํ์ง์ ์ ํ ๊ณ ๋ คํ์ง ์๊ณ ์ค์ง ์ธ๊ธฐ๋๋ง ํ์ธ
- $fr_t$: ์๊ฐ $t$๊น์ง ์ด ๊ธฐ๋ก์ด ๊ฒ์๋ ๋์ ํ์
- $\alpha$: ๊ตฌ๊ฐ $[tโ, t]$ ์์์ ์๊ตฌ๋๋ ์ต์ ๊ฒ์ ํ์
- History-Based Deletion (๋ณธ ์ฐ๊ตฌ ์ ์!): ๊ธฐ๋ก ์์ฒด๋ฅผ ์ฑ์ ํ๋ ๊ฒ ์๋๋ผ, ๊ทธ ๊ธฐ๋ก์ ์ฐธ์กฐํ ๋ฏธ๋ ์คํ๋ค์ ์ฑ์ ํ๋ก ์๊ธ ์ฑ์ .
- ๋ฏธ๋ task ํ๊ฐ๊ฐ ์ ์ฅ๋ memory์ free quality label์ด ๋๋ ๊ฒ
- โ์ ์ฅ๋ ๊ฒฝํ์ ํ์ง๊ณผ, ๊ทธ ๊ฒฝํ์ด ๊ฒ์๋์ ๋ ๋์จ ๋ฏธ๋ ์คํ์ ํ์ง ์ฌ์ด์ ์๊ด์ด ์์ ๊ฒโ
- ๊ธฐ๋ก์ด ๋ถ๋ ค๋๊ฐ๋ ๊ณผ๊ฑฐ ์คํ๋ค์ ํ๊ท ์ ์๋ฅผ ๋ณด๊ณ ํ๋จ
- $\Phi$: utility evaluator (addition์ ์ด ๊ฒ๊ณผ ๊ฐ์ ๊ฑธ ์ฌ์ฌ์ฉ ๊ฐ๋ฅ)
- $\Phi(q_m, e_m)$: ์ด memory ๊ธฐ๋ก์ด $m$๋ฒ์งธ๋ก ๊ฒ์๋์ ๋ ๋์จ ๊ฒฐ๊ณผ ์คํ์ ํ์ง ์ ์
- ์กฐ๊ฑด:
- (a) ์ต์ $n$๋ฒ์ ๊ฒ์๋ ์ ์์ด์ผ ํ๊ณ (ํ๊ท ์ถ์ ํธํฅ์ ์ค์ด๊ณ ์),
- (b) ๊ทธ ํ๊ท utility๊ฐ threshold $\beta$ ์ดํ์ฌ์ผ ํจ
-
Note.
addition๊ณผ deletion์ ๊ฐ์ ์ธต์์ ๋์นญ ์ฐ์ฐ์ด ์๋. (ํ์ ์์ ๊ณผ ๊ทผ๊ฑฐ๊ฐ ๋ค๋ฅด๊ณ ๊ฐ๊ฐ ๋ค๋ฅธ ์คํจ๋ฅผ ๋์)
- addition: ์คํ ์งํ 1ํ, ๊ทธ ์คํ ์์ฒด๊ฐ ๋ง์๋์ง(intrinsic)๋ฅผ ํ์ธ โ error propagation์ ๋ง๋ ๊ฒ์ดํธ
- deletion(history-based): ์ฌ๋ฌ ๋ฒ ๊ฒ์๋ ๋ค ๋์ , ๊ทธ๊ฒ์ ์ฐธ์กฐํ ํ์ ์คํ์ด ์ ๋๋์ง(downstream)๋ฅผ ํ์ธ โ misaligned experience replay๋ฅผ ๊ฑท์ด๋ด๋ gate
- ์ฆ ํ์ ๊ทผ๊ฑฐ๋ฅผ intrinsic์์ downstream์ผ๋ก ์ฎ๊ธฐ๋ ๊ฒ ๋ ผ๋ฌธ ์ ์์ ์ค์ง
- Combined Deletion : ์ธ๊ธฐ ์๊ฑฐ๋ ์ฑ์ ๋์๊ฑฐ๋ ๋ ์ค ํ๋๋ฉด ์ญ์
Findings 3 Misaligned Experience Replay
- evaluator judge๋ ํต๊ณผํด๋, ํ์ฌ task ๋ถํฌ์ ๋ถ์ผ์น๋ก demonstration์ผ๋ก์ ๊ณ์ ๋์ ๊ฒฐ๊ณผ๋ฅผ ๋ด๋ ๊ธฐ๋ก์ด ์๋ค๊ณ
- ์์ธ:
-
(a) ์ ์ฅ๋ trajectory์ ํ์ฌ ์คํ ๋งฅ๋ฝ ์ฌ์ด์ ๋ถ์ผ์น
e.g. ์ ์ฅ ์์ ์๋ ์ ๋ต์ผ๋ก ํ์ ๋์ง๋ง, ํ์ฌ task์ ๋งฅ๋ฝ์ด ์ด๊ธ๋ demonstration์ผ๋ก ์ฐ์ผ ๋๋ง๋ค ๋์ ์คํ์ ์ ๋ํ๋ ๊ธฐ๋ก
-
(b) evaluator ์์ฒด์ ํ๊ณ๋ก ๋ค์ด๊ฐ ์ค๋ฅ
-
- ์์ธ:
- ์ฆ โ์ ๋ต์ด๋คโ์ โ์์๋ก ์ ์ฉํ๋คโ๊ฐ ๋ค๋ฅธ ์ถ์ด๋ผ๋ ์ฃผ์ฅ.
- history-based deletion์ด ์ด ๋ถ๋ฅ๋ฅผ ์ก๋๋ค๊ณ ์ฃผ์ฅ.
Effects
- Experimental setup
- agent: ํต์ ๊ฐ๋ฅ์ฑ ์คํํธ๋ผ๊ณผ ํ์ ๋ค์์ฑ์ ๋์์ ํ๋ณดํ๋๋ก ๊ตฌ์ฑ
Tab 3- RegAgent (ํฉ์ฑ, ํต์ ์ฉ): demonstration์๋ง ์์กดํ๊ณ , memory noise๋ฅผ ์ง์ ์กฐ์ ํ๋ฉฐ, error๋ฅผ ์ง์ ์ธก์ ํ ์ ์์ด ์ค์ผ๊ณผ ์ฑ๋ฅ์ ์ธ๊ณผ๋ฅผ ๊ฒฉ๋ฆฌ ๊ฐ๋ฅ
- ์จ์ ๊ฐ์ค์น $w \in \mathbb{R}^6$์ ๋ํด $y = w^\top x$๋ฅผ demonstration 6๊ฐ๋ก ์์ธก
- ์ด๊ธฐ memory 100๊ฑด: $\mu \in \lbrace -0.5, 0, 0.5 \rbrace$์ธ ์ธ ๊ฐ์ฐ์์์์ $x$๋ฅผ ๋ฝ๊ณ $y = w^\top x + \epsilon$, $\epsilon \in [-1, 1]$๋ก ์์ฑ
- ์คํ ์คํธ๋ฆผ 4,000๊ฑด: $\lvert \hat{y} - y \rvert \leq 1$์ด๋ฉด ์ฑ๊ณต(SR)
- EHRAgent (Shi et al., 2024): MIMIC-III์ ์์ฐ์ด๋ก ์ง์ํ๋ฉด ์ฝ๋๋ฅผ ์์ฑํด ๋ตํ๋ agent
- ์ค๋ณต ๋ฐ ์๋ต๋ถ๊ฐ ์ ๊ฑฐ ํ 2,392 task, ์ด๊ธฐ memory 100๊ฑด
- ๊ฒ์ 4๊ฑด,
text-embedding-3-large, ์งํ ACC
- ๊ฒ์ 4๊ฑด,
- strict evaluator๋ exact match, coarse๋ LLM์ด ์์ฑํ ์ข ๋ฃ ์ ํธ
- ์ค๋ณต ๋ฐ ์๋ต๋ถ๊ฐ ์ ๊ฑฐ ํ 2,392 task, ์ด๊ธฐ memory 100๊ฑด
- AgentDriver (Mao et al., 2024): nuScenes ๊ธฐ๋ฐ ์์จ์ฃผํ agent
- ํ
์คํธ 2,000๊ฑด, ์ด๊ธฐ memory 180๊ฑด
- ์ ๋ ผ๋ฌธ์ top-3 ๊ฒ์ ํ LLM ์ ํ์ ์ฌํ์ฑ ๋ชฉ์ ์ผ๋ก top-1 ๋จ์ผ ๊ฒ์์ผ๋ก ๋จ์ํ
- strict evaluator๋ UniAD 3์ด ํ๊ท L2 ๊ฑฐ๋ฆฌ๊ฐ 2.5 ๋ฏธ๋ง์ด๋ฉด ์ ์ฅ
- ํ
์คํธ 2,000๊ฑด, ์ด๊ธฐ memory 180๊ฑด
- CIC-IoT Agent (Neto et al., 2023): IoT ํจํท feature๋ก ํธ๋ํฝ ์ ํ ๋ถ๋ฅ
- ์๋ 34๊ฐ class ์ค single-flow feature๋ก ๊ตฌ๋ถ ๊ฐ๋ฅํ 8๊ฐ๋ง ๋จ๊น
- ํ ์คํธ 1,000๊ฑด, ๊ฒ์ 3๊ฑด, ์งํ ACC
- input similarity๋ ์ฐ์ํ feature์ ์๋ ๋ณํ๋๊ณผ ์ด์ฐํ feature์ ์ผ์น ์ฌ๋ถ๋ฅผ ํ๊ท ํ feature ๊ธฐ๋ฐ ๋ฐฉ์
- ์๋ 34๊ฐ class ์ค single-flow feature๋ก ๊ตฌ๋ถ ๊ฐ๋ฅํ 8๊ฐ๋ง ๋จ๊น
- RegAgent (ํฉ์ฑ, ํต์ ์ฉ): demonstration์๋ง ์์กดํ๊ณ , memory noise๋ฅผ ์ง์ ์กฐ์ ํ๋ฉฐ, error๋ฅผ ์ง์ ์ธก์ ํ ์ ์์ด ์ค์ผ๊ณผ ์ฑ๋ฅ์ ์ธ๊ณผ๋ฅผ ๊ฒฉ๋ฆฌ ๊ฐ๋ฅ
- backbone: ์ฃผ ์คํ์ GPT-4o-mini, ์ฌํ ํ์ธ์ GPT-4o์ DeepSeek-V3
- evaluator: Fixed, Add-all, Coarse C1/C2/C3, Strict๋ฅผ ํ์ง ์์ผ๋ก ๋ฐฐ์นํด ์ฐ์ ๋ณ์์ฒ๋ผ ์ทจ๊ธ
- ๋์ ์กฐ๊ฑด
- task distribution shift: ํ ์คํธ query ์๋ฒ ๋ฉ์ GMM์ผ๋ก 3๊ฐ ๊ตฐ์งํ, ๊ตฐ์ง ์์๋๋ก ์ฌ์ ๋ ฌํด ์ธ์์ ๋ถํฌ ์ด๋ ์์ฑ
- memory constraint: EHRAgent 100๊ฑด, AgentDriver 180๊ฑด์ผ๋ก ์ฉ๋ ๊ณ ์
- ์ด๊ณผ ์ ์ต์ utility ๊ธฐ๋ก ํ๋๋ง ์ ๊ฑฐํ๋๋ก combined deletion ์์
-
hyperparameter๋ agent๋ง๋ค ๊ฐ๋ณ ์ค์ (Appendix A.1)

ย RegAgent EHRAgent AgentDriver CIC-IoT strict $\pi_{\text{human}}$ ์ค์ฐจ $\leq$ 1.0 exact match UniAD 3์ด L2 $<$ 2.5 string match coarse $\pi_{\text{automatic}}$ ์ค์ฐจ $\leq$ 1.6 / 1.4 / 1.2 LLM ์ข ๋ฃ ์ ํธ LLM yes/no LLM judge periodic ์ฃผ๊ธฐ, $\alpha$ 500, 0 200, 0 500, 0 500, 1 history $n$, $\beta$ 5, 0.5 5, 0.3(coarse) / 0.7(strictยทFT) 3, L2 $>$ 5.0 3, 0.7
- agent: ํต์ ๊ฐ๋ฅ์ฑ ์คํํธ๋ผ๊ณผ ํ์ ๋ค์์ฑ์ ๋์์ ํ๋ณดํ๋๋ก ๊ตฌ์ฑ
- Results
- Addition of Memory
- ์คํ ํ์ง๊ณผ memory ํฌ๊ธฐ๊ฐ ํจ๊ป long-term ์ฑ๋ฅ ๊ฒฐ์
Tab 1- $\pi_{\text{fixed}}$๊ฐ RegAgent, AgentDriver, CIC-IoT์์ ์ค์
- ๋๋ก๋ coarse evaluator๋ฅผ ์์๊ธฐ๋
- noisyํ๊ฑฐ๋ ์ ํ์ง์ธ addition์ด memory ํจ์ฉ์ ํด์น ์ ์์
- $\pi_{\text{human}}$์ ๊ณ ํ์ง ๊ธฐ๋ก๋ง์ผ๋ก memory๋ฅผ ๋ํ ์ผ๊ด๋๊ฒ ์ฐ์
- memory์ ํ์ง๊ณผ ์ฉ๋์ด ๋ ๋ค ํจ๊ณผ์ ์ธ long-term ํ์ต์ ์กฐ๊ฑด
- coarse์์๋ ์ฑ๋ฅ์ด judge ๋ฅ๋ ฅ์ ์์กด
- 300๊ฑด fine-tuneํ C3๊ฐ ๋ค๋ฅธ coarse์ ๋ฌดํํฐ addition์ ๋ชจ๋ ์ํ
- ์ฑ๋ฅ trend
Fig 2- $\pi_{\text{all}}$๊ณผ ์ผ๋ถ coarse๋ ํํํ๊ฑฐ๋ ํ๋ฝ == ๊ฒฐํจ ๊ธฐ๋ก์ ๋์
- $\pi_{\text{fixed}}$๋ ๋ ๋ซ๊ธด ํด๋ memory๊ฐ ๋ณํ์ง ์์ ์ ์ฒด
- $\pi_{\text{human}}$๊ณผ C3๋ง ๊ณ์ ๊ฐ์ ๋๋ฉฐ backbone์ ๋ฐ๊ฟ๋ ๋์ผ
- vanilla LLM์ trajectory evaluator๋ก ๊ทธ๋๋ก ์ฐ๋ ๊ฒ์ ์์ง๋ง ํ์ง ์ข์ ๋ฐ์ดํฐ์ ์ ์ง์ ๋ง๋๋ ๊ฒ๋ณด๋ค ๋ ์ฌํ ์ ์ํฅ์ ์ค ์ ์๋ค
- $\pi_{\text{fixed}}$๊ฐ RegAgent, AgentDriver, CIC-IoT์์ ์ค์
- input similarity์ output similarity์ ์๊ด์ฑ
Fig 3- $\pi_{\text{fixed}}$: ๋ ์ ์ฌ๋๊ฐ ๋ชจ๋ ๋ฎ๊ฒ ์ ์ง vs. addition ๊ณ์ด($\pi_{\text{fixed}}$ ์ ์ธ): input์ด ์ค๋ฅผ์๋ก output๋ ์์น
- $\pi_{\text{fixed}}$๋ RegAgent์ AgentDriver ๋ชจ๋ 0.52 vs. addition ๊ณ์ด์ Pearson $r$์ด 0.9 ๋ด์ธ
- RegAgent์์ memory๊ฐ ์ปค์ง๊ณ demonstration์ด query์ ๋น์ทํด์ง์๋ก $r \approx 1$์ ๊ทผ์
- $\pi_{\text{fixed}}$๋ ์์ ๋ชจ๋ฐฉ์ด ์๋๋ผ ์ถ๋ก ์ ์์กด โ noisy memory๋ฅผ ์ฐ๋ coarse๋ณด๋ค ์คํ๋ ค ๋์ ์ฑ๋ฅ
- ๋ชจ๋ฐฉํ๋ ๊ฐ๋๋ backbone์ ์์กด์
Fig 12- GPT-4o-mini 0.85 > GPT-4o 0.71 > DeepSeek-V3 0.60
- ๊ฐํ evaluator๋ฅผ ์ฐ๋ฉด ๋ง๋ ์คํ์ ๋ณต์ ๋ก self-improvement๋ฐ์ ๋ฌด๋ถ๋ณํ addition์ self-degradation์ ๋ฐ์
- $\pi_{\text{fixed}}$: ๋ ์ ์ฌ๋๊ฐ ๋ชจ๋ ๋ฎ๊ฒ ์ ์ง vs. addition ๊ณ์ด($\pi_{\text{fixed}}$ ์ ์ธ): input์ด ์ค๋ฅผ์๋ก output๋ ์์น
- error-free variants์ ์ฑ๋ฅ ์ฐจ
Fig 4: ๊ฒ์๋๋ ์์๋ ๋์ผํ๊ฒ ๋๊ณ execution๋ง ground truth๋ก ๊ต์ฒด ๊ตฌ์ฑ- ๋ agent ๋ชจ๋ ์ฆ๊ฐ์ ์ธ ๊ฒฉ์ฐจ ๋ฐ์, $\pi_{\text{all}}$๊ณผ coarse๋ ์คํ์ด ์ด์ด์ง์๋ก ๊ฒฉ์ฐจ ํ๋
- AgentDriver์ $\pi_{\text{human}}$์ ์ด๋ฐ์ ๋ค์ฒ์ง๋ ์ฝ 2,000 ์คํ ํ ์คํ๋ ค ์ถ์
- memory์ ์๊ณผ ์ง์ด ๋ชจ๋ ์ค์, evaluator๋ฅผ ์ ์คํ ์ ํํ๊ณ ํ์ต ์๋ง
- ๋ agent ๋ชจ๋ ์ฆ๊ฐ์ ์ธ ๊ฒฉ์ฐจ ๋ฐ์, $\pi_{\text{all}}$๊ณผ coarse๋ ์คํ์ด ์ด์ด์ง์๋ก ๊ฒฉ์ฐจ ํ๋
- ์คํ ํ์ง๊ณผ memory ํฌ๊ธฐ๊ฐ ํจ๊ป long-term ์ฑ๋ฅ ๊ฒฐ์
- Deletion of Memory
- ์ ๋ต์ memory deletion์ด agent ์ฑ๋ฅ ๊ฐ์
Tab 2: ์ ๋ขฐํ ๋งํ utility evaluator๊ฐ ์์ผ๋ฉด history deletion์ด ์ฑ๋ฅ ๊ฐ์ , combined๋ ์ฑ๋ฅ ์ ์ง์ memory ์ถ์ ์ฌ์ด ๊ท ํ ์ ๊ณต- periodical-based deletion: ํฐ memory ๊ฐ์๋ฅผ ์์ ์ฑ๋ฅ ์ ํ๋ก ๋ฌ์ฑ
- addition๋ง ํ๋ ์ค๊ณ๊ฐ ์์ฌ ํญ๋ชฉ์ ์์ฃผ ์ถ์
- history-based & combined: utility evaluator ์ ๋ขฐ๋์ ๋ฐ๋ผ ํธ์ฐจ๊ฐ ํผ
- $\pi_{\text{human}}$์ ์ฐ๋ฉด ๋นํฉ์ฑ agent์์ ๋๋ ทํ ์ฑ๋ฅ ํฅ์
- RegAgent๋ ์๋ฐฑ ๊ฑด์ ๋น์ถ ์คํ์ ์ ๊ฑฐํด๋ ์ฑ๋ฅ ํ๋ฝ์ด ์์
- error-free memory baseline๊ณผ ๋น๊ต
Fig 13- AgentDriver์์ $\pi_{\text{human}}$ + history deletion์ด error-free ๋์์ ๋ฅ๊ฐ, ํญ๋ deletion ์๋ ๊ฒฝ์ฐ๋ณด๋ค ํผ
- downstream utility๊ฐ ๋์ ๊ฒฝํ์ ์ ํ์ ์ผ๋ก ๋จ๊ธฐ๋ ๊ฒ์ด ์ฅ๊ธฐ ์ฑ๋ฅ์ ๊ฐ์ ํ ์ ์๋ค
- AgentDriver์์ $\pi_{\text{human}}$ + history deletion์ด error-free ๋์์ ๋ฅ๊ฐ, ํญ๋ deletion ์๋ ๊ฒฝ์ฐ๋ณด๋ค ํผ
- evaluator๊ฐ coarseํ๊ฑฐ๋ noisyํ ๋ ๋ฐฉํฅ์ฑ
Fig 5- GPT-4o-mini judge๋ EHRAgent์์ ์ด๋, AgentDriver์์ ์ ํ
- fine-tuned evaluator๋ ๋ ์์ ์ ์ด๋ฉฐ ๋ ์์ memory๋ก ๋น์ทํ ์ฑ๋ฅ ๋ฌ์ฑ
- periodical-based deletion: ํฐ memory ๊ฐ์๋ฅผ ์์ ์ฑ๋ฅ ์ ํ๋ก ๋ฌ์ฑ
- ์ญ์ ๊ธฐ๋ก๊ณผ ๋จ์ ๊ธฐ๋ก์ ํ์ง ์ฐจ์ด
Fig 6- ๋งฅ๋ฝ๊ณผ task ๋ถํฌ์ ๋ถ์ผ์น๋ ์ฌ๋ก๋ณ์ด๋ผ ํฌ์ฐฉ์ด ์ด๋ ค์, evaluator ํ๊ณ์์ ์ค๋ error๋ฅผ ๋๋ฆฌ ์งํ๋ก ์ฌ์ฉ
- RegAgent์ KDE ๋น๊ต์์ ์์กด demonstration์ error๊ฐ ์ญ์ ๋ ๊ฒ๋ณด๋ค ๋ฎ์
- $\pi_{\text{human}}$ ์กฐ๊ฑด์์ error 1.0 ์ดํ๋ง ์ ์ฅํ๋๋ฐ๋ 0.5 ์ด๊ณผ ํญ๋ชฉ์ ์ค๋ฅ๋ฅผ ์ ํํด ์ ๊ฑฐ๋จ
- ๊ฒฝํ์ ๋ด์ฌ์ ํ์ง์ด downstream ์คํ ํ์ง๊ณผ ์ฐ๊ฒฐ๋๋ฉฐ, ๋ฏธ๋ ์คํ ํ์ง์ด ๋ฎ์ demonstration์ ์ ๊ฑฐํ๋ฉด misaligned experience replay๋ฅผ ์ํ
- ์ ๋ต์ memory deletion์ด agent ์ฑ๋ฅ ๊ฐ์
- Memory Management under Challenging Scenarios
- task distribution shift
Fig 7- ๋ถํฌ ์ ํ ์ดํ์๋ no-shift๋ค ๋๋น ๊ฒฉ์ฐจ๋ ์ ๋ฐ์ ์ผ๋ก ์๋ค๊ณ
- AgentDriver: $\pi_{\text{human}}$ addition๋ง์ผ๋ก no-shift๋ค์ ์ํ
- EHRAgent: history-based deletion์ด combined๋ณด๋ค ์ ์กฐ
- ๋ถํฌ ์ด๋์ด ์๋ ์ค์ ์ํฉ์์๋ periodic deletion์ด ๋จ์ํจ์๋ ์์ ํ์ ๊ธฐ์ฌ ๊ฐ๋ฅ
- memory resource constraint
- ์ฉ๋์ ์ด๊ธฐ ํฌ๊ธฐ๋ก ๊ณ ์ ํ ์กฐ๊ฑด์์๋ memory management ์ ์ฑ
์ด ๋์ ์ฑ๋ฅ ์ ์ง
- ๊ฐ์ฅ ๊ด๋ จ์ฑ ๋๊ณ ํ์ง ์ข์ ๊ธฐ๋ก๋ง ๋จ๊ฒจ ์ ํ๋ ์ ์ฅ ๊ณต๊ฐ์ ํจ์จ์ ์ผ๋ก ํ์ฉ
- AgentDriver์์ ์ ์ฝ ํฌ๊ธฐ๋ฅผ ๋๋ฆฌ๋ฉด ์ฑ๋ฅ์ด ์ ์ง์ ์ผ๋ก ์๋ ด
- ์์ ์ ํ ํ๊ฒฝ์์๋ memory management๊ฐ ์ฅ๊ธฐ ์ฑ๋ฅ์ ๊ฐ์ ํ๋ฉฐ, ๋ฌดํ์ ํ memory ์ฑ์ฅ์ ๋ถ์
- ์ฉ๋์ ์ด๊ธฐ ํฌ๊ธฐ๋ก ๊ณ ์ ํ ์กฐ๊ฑด์์๋ memory management ์ ์ฑ
์ด ๋์ ์ฑ๋ฅ ์ ์ง
- task distribution shift
- Addition of Memory
- Limitation
- ๋ค๋ฃฌ ์ฐ์ฐ์ด add/delete ๋๊ฐ ๋ฟ: structural transformation, merging, summarization, reflection์ ์ ์ธ๋จ
- ์ด๋ก ์ ๋ณด์ฆ ์์ด ๊ฒฝํ์ ๋ถ์์๋ง ์์กดํ๋ฉฐ RegAgent ํ๊ฒฝ์ด ํฅํ ์ด๋ก ์ฐ๊ตฌ์ ๋ฐํ์ด ๋ ์ ์๋ค๊ณ ๋ง ์ธ๊ธ
Personal note. ์ค๊ณ๊ฐ ๊น๋ํด์ ๋ฐฐ์ธ ๊ฒ ์์๋ค๊ณ ์๊ฐํฉ๋๋ค. ๊ณ ๋ฏผ ๋ง์ด ํ์ ๊ฒ ๊ฐ์์. ์ด ๋ ผ๋ฌธ์ add/delete๋ ์ ๋ถ framework๊ฐ ๊ท์น์ผ๋ก ์ํํ๋ ๊ฒ์ด๊ณ , agent๊ฐ ์ธ์ง ๋ง์ง๋ฅผ ํ๋จํ์ง๋ ์์ต๋๋ค. proactivity ์ธก๋ฉด์ ๊ณ ๋ คํด์ผํ๋์ง ๊ณ ๋ฏผ์ค์ธ๋ฐ, ์ฌ์ค์ ๊ทธ์ ๋๋ฅผ ๊ณ ๋ คํ์ง ์๋๋ผ๋, ๊ท์น์ผ๋ก ์์ผ๋ ๋ฌธ์ ๊ฐ ์๋ค๋ ๋ป์ผ ์๋ ์๊ณ ์. ๋ค๋ง error-free baseline๊ณผ ๋น๊ต์์ AgentDriver์์ ์ค์ ์คํ์ด ground-truth ์คํ์ ์ถ์ํ๋๋ฐ, ์ ๋ต trajectory๊ฐ ๋ฐ๋์ ์ต์ ์ demonstration์ ์๋๋ผ๋ ๋ป์ผ๋ก ์ดํด๋ฉ๋๋ค. ์คํ ์ค๊ณ์ ์๋ฒฝํ ๋ฉ๋ชจ๋ฆฌ(gt)๋ฅผ ์คฌ์ ๋๋ฅผ ์ํ์ผ๋ก ์์ ํ๊ณ ๋ ํ๋๋ฐ, ์ค์ ๋ก๋ ๊ทธ gt๊ฐ ์ต์ ์ ์๋๋ผ๋ ์๋ฆฌ๋๊น์. ๊ฒ์ ๊ฒฐ๊ณผ๋ ๊ณ ์ ํ๊ณ ์ ์ฅ๋ ์คํ ๋ด์ฉ๋ง gt๋ก ๊ต์ฒดํจ์ผ๋ก์จ retrieval ํ์ง๊ณผ ์ ์ฅ๋ฌผ ํ์ง์ ๋ถ๋ฆฌํด๋ธ ๋์กฐ๊ตฐ ์ค๊ณ๋ ๋์ฌ๊ฒจ๋ณผ ๋งํฉ๋๋ค.