10 minute read

Meta info.

TL; DR

agent memory์˜ add/delete๋งŒ ๋ถ„๋ฆฌํ•˜์—ฌ ์ธก์ •ํ•˜๋ฉด long-term ์„ฑ๋Šฅ์€ evaluator ํ’ˆ์งˆ์— ์˜์กด, ์•ฝํ•œ LLM judge๋Š” memory๋ฅผ ๊ฐฑ์‹ ํ•˜์ง€ ์•Š๋Š” ๊ฒƒ๋ณด๋‹ค๋„ ์•…ํ™”.
  • ์™œ: ๊ธฐ์กด memory ์—ฐ๊ตฌ๋Š” ์ „๋ถ€ โ€œ์–ด๋–ค memory ์‹œ์Šคํ…œ์„ ์„ค๊ณ„ํ• ๊นŒโ€์— ์ง‘์ค‘, ๋ฉ”๋ชจ๋ฆฌ์—์„œ ๊ฐ€์žฅ ๊ธฐ์ดˆ์ ์ธ ๋‘ ์—ฐ์‚ฐ(add, delete)์ด ์‹œ๊ฐ„์— ๋”ฐ๋ผ agent ํ–‰๋™์„ ์–ด๋–ป๊ฒŒ ๋ฐ”๊พธ๋Š”์ง€๋Š” ์•„๋ฌด๋„ ๊ทœ๋ช…ํ•˜์ง€ ์•Š์Œ.
  • ์ œ์•ˆ: ์ƒˆ ๋ฐฉ๋ฒ•๋ก  ์ œ์•ˆ์ด ์ฃผ๋ชฉ์ ์ด ์•„๋‹Œ empirical study. ๋‹ค๋งŒ ๋ถ€์ˆ˜์ ์œผ๋กœ history-based deletion์ด๋ผ๋Š” ์ƒˆ ์‚ญ์ œ ์ „๋žต ์ œ์•ˆ.
  • ๋ฐœ๊ฒฌ: (1) experience-following property, (2) error propagation, (3) misaligned experience replay. ๋ฏธ๋ž˜ task์˜ ์‹คํ–‰ ๊ฒฐ๊ณผ๊ฐ€ ์ €์žฅ๋œ memory์˜ label์ด ๋œ๋‹ค๋Š” ์‹ค์šฉ์  ๊ฒฐ๋ก 

Slide Agent memory figure 1 Agent memory figure 2 Agent memory figure 3 Agent memory figure 4 Agent memory figure 5 Agent memory figure 6 Agent memory figure 7 Agent memory figure 8 Agent memory figure 9 Agent memory figure 10


Figure 1

1) ์ขŒ์ƒ๋‹จ query๊ฐ€ ์ž…๋ ฅ๋˜๊ณ ,
2) memory์—์„œ ๊ฒ€์ƒ‰ํ•ด์„œ planning โ†’ execution
3) ์šฐ์ธก Memory Management ๋ธ”๋ก์—์„œ ๊ทธ ๊ฒฐ๊ณผ๋ฅผ addํ• ์ง€/deleteํ• ์ง€ ํŒ๋‹จ
4) ๊ทธ ๊ฒฐ๊ณผ๊ฐ€ ๋‹ค์Œ timestep์˜ memory bank. loop ๋ฐ˜๋ณต

Background

agent memory์˜ ๊ธฐ๋ณธ ๊ตฌ์กฐ

  • LLM agent์˜ 3๊ฐ€์ง€ long-term memory (Sumers et al., 2023)
    • semantic memory: ์„ธ๊ณ„ ์ง€์‹, ํ™˜๊ฒฝ์— ๋Œ€ํ•œ ์ดํ•ด
    • procedural memory: ๊ทœ์น™๊ณผ ์ ˆ์ฐจ. LLM weight ์•ˆ์— ์•”๋ฌต์ ์œผ๋กœ ์žˆ๊ฑฐ๋‚˜ guideline์œผ๋กœ ๋ช…์‹œ๋จ
    • episodic memory: task๋ณ„ ๊ฒฝํ—˜ ๊ธฐ๋ก. ์ด ๋…ผ๋ฌธ์˜ ๋Œ€์ƒ
  • Figure 1 episodic memory์˜ ๋™์ž‘ ๋ฐฉ์‹
    • memory bank $D = \lbrace (q_1, e_1), \dots, (q_N, e_N) \rbrace$
      • $q$: task query (agent input)
      • $e$: execution trajectory (agent output)
    • Memory Reading:
      • ์ƒˆ query $q$๊ฐ€ ์˜ค๋ฉด ๊ฐ€์žฅ ๊ด€๋ จ ์žˆ๋Š” $K$๊ฐœ ๋ถ€๋ถ„์ง‘ํ•ฉ $\xi_K \subset D$ ๊ฒ€์ƒ‰.
      • ๋ณดํ†ต text encoder๋กœ embedding ์–ป๊ณ  cosine similarity ๊ณ ๋ฅด๊ธฐ
      • in-context demonstration์œผ๋กœ ์จ์„œ ์ƒˆ execution $e$ ์ƒ์„ฑ
    • Memory Management: ๋๋‚œ $(q, e)$๋ฅผ ์ €์žฅํ• ์ง€ addition, ์˜ค๋ž˜๋˜๊ฑฐ๋‚˜ ์ค‘๋ณต๋œ ๊ฑธ ์ง€์šธ์ง€ deletion ๊ฒฐ์ •

memory ์‹œ์Šคํ…œ์€ ๋งŽ์€๋ฐ, ๊ทธ ์‹œ์Šคํ…œ์ด ์‹œ๊ฐ„์— ๋”ฐ๋ผ ์Šค์Šค๋กœ๋ฅผ ์˜ค์—ผ์‹œํ‚ค๋Š” ๊ณผ์ •์„ ์žฐ ์—ฐ๊ตฌ๋Š” ์—†์Œ.

  • ๊ธฐ์กด memory management ์ „๋žต: ์ „๋ถ€ ํŠน์ • agent ํƒ€์ž…(e.g. chatbot)์— ๋งž์ถฐ, ์„œ๋กœ ๋‹ค๋ฅธ agentic system์„ ๊ด€ํ†ตํ•˜๋Š” ํ†ตํ•ฉ ์„ค๊ณ„ ๋ถ€์žฌ
    • structural transformation (ArIGraph, Zeng et al.)
    • merging (Think-in-Memory, HiAgent)
    • summarization (MemoryBank, Pan et al.)
    • reflection (Reflexion, ExpeL)
  • memory bank ์ตœ์ ํ™” ์—ฐ๊ตฌ: add/delete๊ฐ€ ๋ณธ์งˆ์ ์œผ๋กœ noisyํ•  ๋•Œ memory bank์˜ dynamics๊ฐ€ long-term ์„ฑ๋Šฅ์— ์–ด๋–ค ์˜ํ–ฅ์„ ์ฃผ๋Š”์ง€์— ๋Œ€ํ•œ ์ดํ•ด ๋ถ€์žฌ
    • EM ๊ธฐ๋ฐ˜ (Yin et al., 2024)
    • MDP formulation (Zhou et al., 2025 / AgentFly)
  • static KB๋ฅผ ์“ฐ๋Š” ICL ์—ฐ๊ตฌ (Luo et al., 2024)์™€ ์ฐจ์ด
    • agentic memory๋Š” (a) retrieval pool ์ž์ฒด๊ฐ€ ์‹œ๊ฐ„์— ๋”ฐ๋ผ ๋ณ€ํ•˜๊ณ  (b) ์ €์žฅ๋˜๋Š” ๋‚ด์šฉ์ด agent ์ž์‹ ์ด ๋งŒ๋“  noisy output

Problem States

memory bank๊ฐ€ ์—ฐ์†์ ์ธ memory ์—ฐ์‚ฐ์— ์˜ํ•ด ์ง„ํ™”ํ•  ๋•Œ, ๊ทธ dynamics๊ฐ€ ์žฅ๊ธฐ agent ์‹คํ–‰์— ์–ด๋–ป๊ฒŒ ์˜ํ–ฅ์„ ์ฃผ๋Š”๊ฐ€?

  • ๊ฐ€์žฅ ๊ธฐ๋ณธ์ ์ธ ์—ฐ์‚ฐ๋งŒ ๋ถ„๋ฆฌํ•ด์„œ ์ธก์ •ํ•˜๋Š” ์‹ค์ฆ ์—ฐ๊ตฌ ํ•„์š”
    • add์™€ delete๋Š” memory management์˜ ์ตœ์†Œ ๋‹จ์œ„
    • ๊ทธ๋Ÿผ์—๋„ ๋ถˆ๊ตฌํ•˜๊ณ  ๊ทธ ํšจ๊ณผ๊ฐ€ ์ œ๋Œ€๋กœ ์ธก์ •๋œ ์  ์—†์Œ
  • ํ‹€๋ฆฐ/์ž˜๋ชป๋œ ๊ฒฝํ—˜์ด ์žฌ๊ฒ€์ƒ‰ โ†’ ๋‹ค์Œ ์‹คํ–‰์„ ์˜ค์—ผ์‹œํ‚ค๋Š” ๊ฒฝ๋กœ ์ถ”์  ํ•„์š”
    • agent๊ฐ€ ์ €์žฅํ•˜๋Š” ๊ฑด ์ž๊ธฐ๊ฐ€ ๋งŒ๋“  output
    • ๊ทธ output์€ ์˜ค๋ฅ˜ ๊ฐ€๋Šฅ์„ฑ ๋‚ดํฌ, ์ฆ‰ ํ‹€๋ฆด ์ˆ˜ ์žˆ์Œ
  • evaluator(trajectory evaluator)๊ฐ€ add/delete๋ฅผ ๊ฒฐ์ •ํ•˜๋Š”๋ฐ, ๊ทธ evaluator์˜ ํ’ˆ์งˆ์ด ์–ด๋””๊นŒ์ง€ ์ค‘์š”ํ•œ์ง€ ์•„๋ฌด๋„ ์•ˆ ์žผ โ†’ evaluator ํ’ˆ์งˆ ๋Œ€๋น„ ์žฅ๊ธฐ ์„ฑ๋Šฅ ๊ณก์„ ์ด ํ•„์š”
  • ์‹ค์ œ ๋ฐฐํฌ ํ™˜๊ฒฝ์€ task ๋ถ„ํฌ๊ฐ€ ๋ฐ”๋€Œ๊ณ  ์ €์žฅ ๊ณต๊ฐ„์ด ์œ ํ•œํ•จ โ†’ distribution shift์™€ memory ์šฉ๋Ÿ‰ ์ œ์•ฝ ํ•˜์—์„œ๋„ ์„ฑ๋ฆฝํ•˜๋Š”์ง€ ํ™•์ธ์ด ํ•„์š”
    • ๊ณผ๊ฑฐ ์‹คํ–‰ ๊ฒฐ๊ณผ๊ฐ€ ๋ฏธ๋ž˜์—๋„ ์œ ํšจํ• ์ง€๋Š” ๋ณด์žฅ ๋ถˆ๊ฐ€ํ•จ์—๋„, ๊ณผ๊ฑฐ ํ‰๊ฐ€ ๊ธฐ๋ก์„ ๊ทธ๋Œ€๋กœ ์‚ฌ์šฉํ•˜๋Š” ๊ฒƒ์„ ๊ฒฝ๊ณ„

Suggestions

๐Ÿ“Œ ๊ณตํ†ต ํ‘œ๊ธฐ
  • addition ๊ฒฐ์ •: evaluator $\pi$์˜ ์ด์ง„ ํŒ์ •
    • $\pi(q, e) = 1$์ด๋ฉด ์ €์žฅ
    • $\pi(q, e) = 0$์ด๋ฉด ํ๊ธฐ
  • deletion ๊ฒฐ์ •: ๊ธฐ์ค€ $\phi$
    • $\phi = 1$์ด๋ฉด memory bank์—์„œ ์ œ๊ฑฐ

4๊ฐ€์ง€ Memory Addition

task๊ฐ€ ํ•˜๋‚˜ ์ข…๋ฃŒ๋˜๋ฉด ๋งŒ๋“ค์–ด์ง€๋Š” $q$์™€ $e$ pair์— ๋Œ€ํ•ด memory์— ๋„ฃ์„์ง€ ๋ง์ง€ ๊ฒฐ์ •ํ•˜๋Š” ํŒ์ •์ž $\pi$๋ฅผ ๋ฌด์—‡์œผ๋กœ ๋‘๋А๋ƒ๋งŒ ๋ฐ”๊ฟ”๊ฐ€๋ฉฐ ๋น„๊ต.

  • Fixed-memory baseline $\pi_{\text{fixed}} = 0$ : training set์—์„œ ์ •๋‹ต ์‹คํ–‰๋งŒ ๊ณจ๋ผ ๋งŒ๋“  ๊ณ ์ • memory. ์•„๋ฌด๊ฒƒ๋„ ์ถ”๊ฐ€ํ•˜์ง€ ์•Š์Œ.
  • Add-all $\pi_{\text{all}} = 1$ : ๋งˆ์ฃผ์นœ ๋ชจ๋“  task์™€ ์‹คํ–‰์„ ๋ฌด์กฐ๊ฑด ์ €์žฅ
  • Selective addition, coarse $\pi_{\text{automatic}}$ : LLM์ด ๋งž์€ ๊ฑฐ ๊ฐ™์€์ง€๋ฅผ ํŒ์ •
    • C1(GPT-4o-mini) < C2(GPT-4.1-mini) < C3(GPT-4.1-mini๋ฅผ ์ •๋‹ต ํŒ์ • 300๊ฐœ๋กœ fine-tune ํ›„ ์งˆ์˜) ์ˆœ์œผ๋กœ ์ •ํ™•
      • (RegAgent) ์˜ˆ์ธก๊ฐ’๊ณผ ์ •๋‹ต์˜ ์ ˆ๋Œ€ ์˜ค์ฐจ threshold๋กœ ์ •์˜: C1=1.6, C2=1.4, C3=1.2 (threshold๊ฐ€ ์ž‘์„์ˆ˜๋ก ์—„๊ฒฉ = ์ •ํ™•ํ•œ evaluator)
  • Selective addition, strict $\pi_{\text{human}}$ : ์‚ฌ๋žŒ(oracle) ํŒ์ •.
    • ์‹ค์ œ๋กœ๋Š” ์ƒ์„ฑ ๊ฒฐ๊ณผ๋ฅผ gt์™€ ์ง์ ‘ ๋น„๊ตํ•ด์„œ ์‹œ๋ฎฌ๋ ˆ์ด์…˜ (upper-bound)

Findings 1 Experience-Following Property

  • ํ˜„์žฌ query์™€ ๊ฒ€์ƒ‰๋œ ๊ธฐ๋ก์˜ query ์‚ฌ์ด input similarity๊ฐ€ ๋†’์œผ๋ฉด, ๋‘ ์‹คํ–‰ ๊ฒฐ๊ณผ ์‚ฌ์ด์˜ output similarity๋„ ๋†’์Œ
    • ์ง๊ด€์ ์œผ๋กœ๋Š” โ€œ๋น„์Šทํ•œ ์งˆ๋ฌธ์„ ๋งŒ๋‚˜๋ฉด agent๊ฐ€ ๊ณผ๊ฑฐ ๋‹ต์„ ์ถ”๋ก ํ•˜๋Š” ๋Œ€์‹  ๋ฒ ๋‚€๋‹คโ€
\[\text{output\_similarity} = \exp\left(-\gamma \lVert v_1 - v_2 \rVert^2\right), \quad \gamma = 1.0\]
  • ์œ ์‚ฌ๋„ ์ •์˜๋Š” agent๋งˆ๋‹ค ๋‹ค๋ฆ„: RegAgent์™€ AgentDriver๋Š” RBF kernel์„ ์‚ฌ์šฉ
    • EHRAgent๋Š” ์ฝ”๋“œ๊ฐ€ ์ถœ๋ ฅ์ด๋ผ pycode_similar์˜ ์ฝ”๋“œ ํ‘œ์ ˆ ์ ์ˆ˜๋ฅผ output similarity๋กœ ์”€
  • ๋‘ ์ถœ๋ ฅ ๋ฒกํ„ฐ๊ฐ€ ๊ฐ€๊นŒ์šธ์ˆ˜๋ก 1์— ๊ฐ€๊น๊ณ  ๋ฉ€์ˆ˜๋ก 0์œผ๋กœ ๋–จ์–ด์ง€๋Š” ์ง€์ˆ˜ ๊ฐ์‡  ํ•จ์ˆ˜

Findings 2 Error Propagation

  • ํ‹€๋ฆฐ ๊ธฐ๋ก์ด demonstration์œผ๋กœ ๊ฒ€์ƒ‰ โ†’ ํ˜„์žฌ ์‹คํ–‰๋„ ์‹คํŒจ โ†’ ๊ทธ ๊ฒฐ๊ณผ๊ฐ€ ๋‹ค์‹œ ์ €์žฅ โ†’ ๋ฏธ๋ž˜ task๋กœ ์˜ค๋ฅ˜ ์ „ํŒŒ
    • experience-following์ด ๊ฐ•ํ• ์ˆ˜๋ก ์ด ์ „ํŒŒ๋„ ๊ฐ•ํ™”
    • ์„ฑ์งˆ ์ž์ฒด๋Š” ์ค‘๋ฆฝ์ด๋”๋ผ๋„ ์ €์žฅ๋‚ด์šฉ์ด ์˜ค์—ผ๋˜๋ฉด ์ฆํญ

3๊ฐ€์ง€ Memory Deletion: ์„ธ ๊ฐ€์ง€ ์ „๋žต

  • Periodical-based Deletion: ์ธ๊ฐ„ ์ธ์ง€์˜ forgetting rate์—์„œ ์ฐฉ์•ˆ, โ€œ์ง€๋‚œ ๊ตฌ๊ฐ„ ๋™์•ˆ $\alpha$๋ฒˆ ์ดํ•˜๋กœ๋งŒ ๋ถˆ๋ ค๋‚˜์˜จ ๊ธฐ๋ก์€ ์“ธ๋ชจ์—†์œผ๋‹ˆ ์ง€์šด๋‹คโ€
    • memory ํฌ๊ธฐ์— ์ƒํ•œ: $M \leq \alpha(t - tโ€™)K$ ($K$๋Š” ์‹คํ–‰๋‹น ๊ฒ€์ƒ‰ ๊ฐœ์ˆ˜)
    • ํ’ˆ์งˆ์€ ์ „ํ˜€ ๊ณ ๋ คํ•˜์ง€ ์•Š๊ณ  ์˜ค์ง ์ธ๊ธฐ๋„๋งŒ ํ™•์ธ
\[\phi_{\text{per}}(q_i, e_i, t, t') = \mathbb{1}\left[ fr_t(q_i, e_i) - fr_{t'}(q_i, e_i) \leq \alpha \right]\]
  • $fr_t$: ์‹œ๊ฐ $t$๊นŒ์ง€ ์ด ๊ธฐ๋ก์ด ๊ฒ€์ƒ‰๋œ ๋ˆ„์  ํšŸ์ˆ˜
  • $\alpha$: ๊ตฌ๊ฐ„ $[tโ€™, t]$ ์•ˆ์—์„œ ์š”๊ตฌ๋˜๋Š” ์ตœ์†Œ ๊ฒ€์ƒ‰ ํšŸ์ˆ˜
  • History-Based Deletion (๋ณธ ์—ฐ๊ตฌ ์ œ์•ˆ!): ๊ธฐ๋ก ์ž์ฒด๋ฅผ ์ฑ„์ ํ•˜๋Š” ๊ฒŒ ์•„๋‹ˆ๋ผ, ๊ทธ ๊ธฐ๋ก์„ ์ฐธ์กฐํ•œ ๋ฏธ๋ž˜ ์‹คํ–‰๋“ค์˜ ์„ฑ์ ํ‘œ๋กœ ์†Œ๊ธ‰ ์ฑ„์ .
    • ๋ฏธ๋ž˜ task ํ‰๊ฐ€๊ฐ€ ์ €์žฅ๋œ memory์˜ free quality label์ด ๋˜๋Š” ๊ฒƒ
    • โ€œ์ €์žฅ๋œ ๊ฒฝํ—˜์˜ ํ’ˆ์งˆ๊ณผ, ๊ทธ ๊ฒฝํ—˜์ด ๊ฒ€์ƒ‰๋์„ ๋•Œ ๋‚˜์˜จ ๋ฏธ๋ž˜ ์‹คํ–‰์˜ ํ’ˆ์งˆ ์‚ฌ์ด์— ์ƒ๊ด€์ด ์žˆ์„ ๊ฒƒโ€
      • ๊ธฐ๋ก์ด ๋ถˆ๋ ค๋‚˜๊ฐ”๋˜ ๊ณผ๊ฑฐ ์‹คํ–‰๋“ค์˜ ํ‰๊ท  ์ ์ˆ˜๋ฅผ ๋ณด๊ณ  ํŒ๋‹จ
\[\phi_{\text{hist}}(q_i, e_i, t) = \begin{cases} \delta(q_i, e_i, t), & \text{if } fr_t(q_i, e_i) > n \\ 0, & \text{otherwise} \end{cases}\] \[\delta(q_i, e_i, t) = \mathbb{1}\left[ \frac{1}{fr_t(q_i,e_i)} \sum_{m=1}^{fr_t(q_i,e_i)} \Phi(q_m, e_m) \leq \beta \right]\]
  • $\Phi$: utility evaluator (addition์— ์“ด ๊ฒƒ๊ณผ ๊ฐ™์€ ๊ฑธ ์žฌ์‚ฌ์šฉ ๊ฐ€๋Šฅ)
  • $\Phi(q_m, e_m)$: ์ด memory ๊ธฐ๋ก์ด $m$๋ฒˆ์งธ๋กœ ๊ฒ€์ƒ‰๋์„ ๋•Œ ๋‚˜์˜จ ๊ฒฐ๊ณผ ์‹คํ–‰์˜ ํ’ˆ์งˆ ์ ์ˆ˜
  • ์กฐ๊ฑด:
    • (a) ์ตœ์†Œ $n$๋ฒˆ์€ ๊ฒ€์ƒ‰๋œ ์  ์žˆ์–ด์•ผ ํ•˜๊ณ  (ํ‰๊ท  ์ถ”์ • ํŽธํ–ฅ์„ ์ค„์ด๊ณ ์ž),
    • (b) ๊ทธ ํ‰๊ท  utility๊ฐ€ threshold $\beta$ ์ดํ•˜์—ฌ์•ผ ํ•จ
  • Note.

    addition๊ณผ deletion์€ ๊ฐ™์€ ์ธต์œ„์˜ ๋Œ€์นญ ์—ฐ์‚ฐ์ด ์•„๋‹˜. (ํŒ์ • ์‹œ์ ๊ณผ ๊ทผ๊ฑฐ๊ฐ€ ๋‹ค๋ฅด๊ณ  ๊ฐ๊ฐ ๋‹ค๋ฅธ ์‹คํŒจ๋ฅผ ๋Œ€์‘)

    • addition: ์‹คํ–‰ ์งํ›„ 1ํšŒ, ๊ทธ ์‹คํ–‰ ์ž์ฒด๊ฐ€ ๋งž์•˜๋Š”์ง€(intrinsic)๋ฅผ ํ™•์ธ โ†’ error propagation์„ ๋ง‰๋Š” ๊ฒŒ์ดํŠธ
    • deletion(history-based): ์—ฌ๋Ÿฌ ๋ฒˆ ๊ฒ€์ƒ‰๋œ ๋’ค ๋ˆ„์ , ๊ทธ๊ฒƒ์„ ์ฐธ์กฐํ•œ ํ›„์† ์‹คํ–‰์ด ์ž˜ ๋๋Š”์ง€(downstream)๋ฅผ ํ™•์ธ โ†’ misaligned experience replay๋ฅผ ๊ฑท์–ด๋‚ด๋Š” gate
    • ์ฆ‰ ํŒ์ • ๊ทผ๊ฑฐ๋ฅผ intrinsic์—์„œ downstream์œผ๋กœ ์˜ฎ๊ธฐ๋Š” ๊ฒƒ ๋…ผ๋ฌธ ์ œ์•ˆ์˜ ์‹ค์งˆ
  • Combined Deletion : ์ธ๊ธฐ ์—†๊ฑฐ๋‚˜ ์„ฑ์  ๋‚˜์˜๊ฑฐ๋‚˜ ๋‘˜ ์ค‘ ํ•˜๋‚˜๋ฉด ์‚ญ์ œ
\[\phi_{\text{comb}} = \phi_{\text{per}} \vee \phi_{\text{hist}}\]

Findings 3 Misaligned Experience Replay

  • evaluator judge๋Š” ํ†ต๊ณผํ•ด๋„, ํ˜„์žฌ task ๋ถ„ํฌ์™€ ๋ถˆ์ผ์น˜๋กœ demonstration์œผ๋กœ์„œ ๊ณ„์† ๋‚˜์œ ๊ฒฐ๊ณผ๋ฅผ ๋‚ด๋Š” ๊ธฐ๋ก์ด ์žˆ๋‹ค๊ณ 
    • ์›์ธ:
      • (a) ์ €์žฅ๋œ trajectory์™€ ํ˜„์žฌ ์‹คํ–‰ ๋งฅ๋ฝ ์‚ฌ์ด์˜ ๋ถˆ์ผ์น˜

        e.g. ์ €์žฅ ์‹œ์ ์—๋Š” ์ •๋‹ต์œผ๋กœ ํŒ์ •๋์ง€๋งŒ, ํ˜„์žฌ task์™€ ๋งฅ๋ฝ์ด ์–ด๊ธ‹๋‚˜ demonstration์œผ๋กœ ์“ฐ์ผ ๋•Œ๋งˆ๋‹ค ๋‚˜์œ ์‹คํ–‰์„ ์œ ๋„ํ•˜๋Š” ๊ธฐ๋ก

      • (b) evaluator ์ž์ฒด์˜ ํ•œ๊ณ„๋กœ ๋“ค์–ด๊ฐ„ ์˜ค๋ฅ˜

  • ์ฆ‰ โ€œ์ •๋‹ต์ด๋‹คโ€์™€ โ€œ์˜ˆ์‹œ๋กœ ์œ ์šฉํ•˜๋‹คโ€๊ฐ€ ๋‹ค๋ฅธ ์ถ•์ด๋ผ๋Š” ์ฃผ์žฅ.
    • history-based deletion์ด ์ด ๋ถ€๋ฅ˜๋ฅผ ์žก๋Š”๋‹ค๊ณ  ์ฃผ์žฅ.

Effects

  • Experimental setup
    • agent: ํ†ต์ œ ๊ฐ€๋Šฅ์„ฑ ์ŠคํŽ™ํŠธ๋Ÿผ๊ณผ ํ˜•์‹ ๋‹ค์–‘์„ฑ์„ ๋™์‹œ์— ํ™•๋ณดํ•˜๋„๋ก ๊ตฌ์„ฑ Tab 3
      • RegAgent (ํ•ฉ์„ฑ, ํ†ต์ œ์šฉ): demonstration์—๋งŒ ์˜์กดํ•˜๊ณ , memory noise๋ฅผ ์ง์ ‘ ์กฐ์ ˆํ•˜๋ฉฐ, error๋ฅผ ์ง์ ‘ ์ธก์ •ํ•  ์ˆ˜ ์žˆ์–ด ์˜ค์—ผ๊ณผ ์„ฑ๋Šฅ์˜ ์ธ๊ณผ๋ฅผ ๊ฒฉ๋ฆฌ ๊ฐ€๋Šฅ
        • ์ˆจ์€ ๊ฐ€์ค‘์น˜ $w \in \mathbb{R}^6$์— ๋Œ€ํ•ด $y = w^\top x$๋ฅผ demonstration 6๊ฐœ๋กœ ์˜ˆ์ธก
        • ์ดˆ๊ธฐ memory 100๊ฑด: $\mu \in \lbrace -0.5, 0, 0.5 \rbrace$์ธ ์„ธ ๊ฐ€์šฐ์‹œ์•ˆ์—์„œ $x$๋ฅผ ๋ฝ‘๊ณ  $y = w^\top x + \epsilon$, $\epsilon \in [-1, 1]$๋กœ ์ƒ์„ฑ
        • ์‹คํ–‰ ์ŠคํŠธ๋ฆผ 4,000๊ฑด: $\lvert \hat{y} - y \rvert \leq 1$์ด๋ฉด ์„ฑ๊ณต(SR)
      • EHRAgent (Shi et al., 2024): MIMIC-III์— ์ž์—ฐ์–ด๋กœ ์งˆ์˜ํ•˜๋ฉด ์ฝ”๋“œ๋ฅผ ์ƒ์„ฑํ•ด ๋‹ตํ•˜๋Š” agent
        • ์ค‘๋ณต ๋ฐ ์‘๋‹ต๋ถˆ๊ฐ€ ์ œ๊ฑฐ ํ›„ 2,392 task, ์ดˆ๊ธฐ memory 100๊ฑด
          • ๊ฒ€์ƒ‰ 4๊ฑด, text-embedding-3-large, ์ง€ํ‘œ ACC
        • strict evaluator๋Š” exact match, coarse๋Š” LLM์ด ์ƒ์„ฑํ•œ ์ข…๋ฃŒ ์‹ ํ˜ธ
      • AgentDriver (Mao et al., 2024): nuScenes ๊ธฐ๋ฐ˜ ์ž์œจ์ฃผํ–‰ agent
        • ํ…Œ์ŠคํŠธ 2,000๊ฑด, ์ดˆ๊ธฐ memory 180๊ฑด
          • ์› ๋…ผ๋ฌธ์˜ top-3 ๊ฒ€์ƒ‰ ํ›„ LLM ์„ ํƒ์„ ์žฌํ˜„์„ฑ ๋ชฉ์ ์œผ๋กœ top-1 ๋‹จ์ผ ๊ฒ€์ƒ‰์œผ๋กœ ๋‹จ์ˆœํ™”
        • strict evaluator๋Š” UniAD 3์ดˆ ํ‰๊ท  L2 ๊ฑฐ๋ฆฌ๊ฐ€ 2.5 ๋ฏธ๋งŒ์ด๋ฉด ์ €์žฅ
      • CIC-IoT Agent (Neto et al., 2023): IoT ํŒจํ‚ท feature๋กœ ํŠธ๋ž˜ํ”ฝ ์œ ํ˜• ๋ถ„๋ฅ˜
        • ์›๋ž˜ 34๊ฐœ class ์ค‘ single-flow feature๋กœ ๊ตฌ๋ถ„ ๊ฐ€๋Šฅํ•œ 8๊ฐœ๋งŒ ๋‚จ๊น€
          • ํ…Œ์ŠคํŠธ 1,000๊ฑด, ๊ฒ€์ƒ‰ 3๊ฑด, ์ง€ํ‘œ ACC
        • input similarity๋Š” ์—ฐ์†ํ˜• feature์˜ ์ƒ๋Œ€ ๋ณ€ํ™”๋Ÿ‰๊ณผ ์ด์‚ฐํ˜• feature์˜ ์ผ์น˜ ์—ฌ๋ถ€๋ฅผ ํ‰๊ท ํ•œ feature ๊ธฐ๋ฐ˜ ๋ฐฉ์‹
    • backbone: ์ฃผ ์‹คํ—˜์€ GPT-4o-mini, ์žฌํ˜„ ํ™•์ธ์€ GPT-4o์™€ DeepSeek-V3
    • evaluator: Fixed, Add-all, Coarse C1/C2/C3, Strict๋ฅผ ํ’ˆ์งˆ ์ˆœ์œผ๋กœ ๋ฐฐ์น˜ํ•ด ์—ฐ์† ๋ณ€์ˆ˜์ฒ˜๋Ÿผ ์ทจ๊ธ‰
    • ๋„์ „ ์กฐ๊ฑด
      • task distribution shift: ํ…Œ์ŠคํŠธ query ์ž„๋ฒ ๋”ฉ์„ GMM์œผ๋กœ 3๊ฐœ ๊ตฐ์ง‘ํ™”, ๊ตฐ์ง‘ ์ˆœ์„œ๋Œ€๋กœ ์žฌ์ •๋ ฌํ•ด ์ธ์œ„์  ๋ถ„ํฌ ์ด๋™ ์ƒ์„ฑ
      • memory constraint: EHRAgent 100๊ฑด, AgentDriver 180๊ฑด์œผ๋กœ ์šฉ๋Ÿ‰ ๊ณ ์ •
        • ์ดˆ๊ณผ ์‹œ ์ตœ์ € utility ๊ธฐ๋ก ํ•˜๋‚˜๋งŒ ์ œ๊ฑฐํ•˜๋„๋ก combined deletion ์ˆ˜์ •
    • hyperparameter๋Š” agent๋งˆ๋‹ค ๊ฐœ๋ณ„ ์„ค์ • (Appendix A.1)

      Agent memory figure 11

      ย  RegAgent EHRAgent AgentDriver CIC-IoT
      strict $\pi_{\text{human}}$ ์˜ค์ฐจ $\leq$ 1.0 exact match UniAD 3์ดˆ L2 $<$ 2.5 string match
      coarse $\pi_{\text{automatic}}$ ์˜ค์ฐจ $\leq$ 1.6 / 1.4 / 1.2 LLM ์ข…๋ฃŒ ์‹ ํ˜ธ LLM yes/no LLM judge
      periodic ์ฃผ๊ธฐ, $\alpha$ 500, 0 200, 0 500, 0 500, 1
      history $n$, $\beta$ 5, 0.5 5, 0.3(coarse) / 0.7(strictยทFT) 3, L2 $>$ 5.0 3, 0.7
  • Results
    • Addition of Memory
      • ์‹คํ–‰ ํ’ˆ์งˆ๊ณผ memory ํฌ๊ธฐ๊ฐ€ ํ•จ๊ป˜ long-term ์„ฑ๋Šฅ ๊ฒฐ์ • Tab 1
        • $\pi_{\text{fixed}}$๊ฐ€ RegAgent, AgentDriver, CIC-IoT์—์„œ ์ค€์ˆ˜
          • ๋•Œ๋กœ๋Š” coarse evaluator๋ฅผ ์•ž์„œ๊ธฐ๋„
          • noisyํ•˜๊ฑฐ๋‚˜ ์ €ํ’ˆ์งˆ์ธ addition์ด memory ํšจ์šฉ์„ ํ•ด์น  ์ˆ˜ ์žˆ์Œ
        • $\pi_{\text{human}}$์€ ๊ณ ํ’ˆ์งˆ ๊ธฐ๋ก๋งŒ์œผ๋กœ memory๋ฅผ ๋„“ํ˜€ ์ผ๊ด€๋˜๊ฒŒ ์šฐ์ˆ˜
          • memory์˜ ํ’ˆ์งˆ๊ณผ ์šฉ๋Ÿ‰์ด ๋‘˜ ๋‹ค ํšจ๊ณผ์ ์ธ long-term ํ•™์Šต์˜ ์กฐ๊ฑด
        • coarse์—์„œ๋Š” ์„ฑ๋Šฅ์ด judge ๋Šฅ๋ ฅ์— ์˜์กด
          • 300๊ฑด fine-tuneํ•œ C3๊ฐ€ ๋‹ค๋ฅธ coarse์™€ ๋ฌดํ•„ํ„ฐ addition์„ ๋ชจ๋‘ ์ƒํšŒ
        • ์„ฑ๋Šฅ trend Fig 2
          • $\pi_{\text{all}}$๊ณผ ์ผ๋ถ€ coarse๋Š” ํ‰ํ‰ํ•˜๊ฑฐ๋‚˜ ํ•˜๋ฝ == ๊ฒฐํ•จ ๊ธฐ๋ก์˜ ๋ˆ„์ 
          • $\pi_{\text{fixed}}$๋Š” ๋” ๋‚ซ๊ธด ํ•ด๋„ memory๊ฐ€ ๋ณ€ํ•˜์ง€ ์•Š์•„ ์ •์ฒด
          • $\pi_{\text{human}}$๊ณผ C3๋งŒ ๊ณ„์† ๊ฐœ์„ ๋˜๋ฉฐ backbone์„ ๋ฐ”๊ฟ”๋„ ๋™์ผ
        • vanilla LLM์„ trajectory evaluator๋กœ ๊ทธ๋Œ€๋กœ ์“ฐ๋Š” ๊ฒƒ์€ ์ž‘์ง€๋งŒ ํ’ˆ์งˆ ์ข‹์€ ๋ฐ์ดํ„ฐ์…‹์„ ์ง์ ‘ ๋งŒ๋“œ๋Š” ๊ฒƒ๋ณด๋‹ค ๋” ์‹ฌํ•œ ์•…์˜ํ–ฅ์„ ์ค„ ์ˆ˜ ์žˆ๋‹ค
      • input similarity์™€ output similarity์˜ ์ƒ๊ด€์„ฑ Fig 3
        • $\pi_{\text{fixed}}$: ๋‘ ์œ ์‚ฌ๋„๊ฐ€ ๋ชจ๋‘ ๋‚ฎ๊ฒŒ ์œ ์ง€ vs. addition ๊ณ„์—ด($\pi_{\text{fixed}}$ ์ œ์™ธ): input์ด ์˜ค๋ฅผ์ˆ˜๋ก output๋„ ์ƒ์Šน
          • $\pi_{\text{fixed}}$๋Š” RegAgent์™€ AgentDriver ๋ชจ๋‘ 0.52 vs. addition ๊ณ„์—ด์€ Pearson $r$์ด 0.9 ๋‚ด์™ธ
        • RegAgent์—์„œ memory๊ฐ€ ์ปค์ง€๊ณ  demonstration์ด query์™€ ๋น„์Šทํ•ด์งˆ์ˆ˜๋ก $r \approx 1$์— ๊ทผ์ ‘
        • $\pi_{\text{fixed}}$๋Š” ์ˆœ์ˆ˜ ๋ชจ๋ฐฉ์ด ์•„๋‹ˆ๋ผ ์ถ”๋ก ์— ์˜์กด โ†’ noisy memory๋ฅผ ์“ฐ๋Š” coarse๋ณด๋‹ค ์˜คํžˆ๋ ค ๋†’์€ ์„ฑ๋Šฅ
        • ๋ชจ๋ฐฉํ•˜๋Š” ๊ฐ•๋„๋Š” backbone์— ์˜์กด์  Fig 12
          • GPT-4o-mini 0.85 > GPT-4o 0.71 > DeepSeek-V3 0.60
        • ๊ฐ•ํ•œ evaluator๋ฅผ ์“ฐ๋ฉด ๋งž๋Š” ์‹คํ–‰์˜ ๋ณต์ œ๋กœ self-improvement๋ฐœ์ƒ ๋ฌด๋ถ„๋ณ„ํ•œ addition์€ self-degradation์„ ๋ฐœ์ƒ
      • error-free variants์˜ ์„ฑ๋Šฅ ์ฐจ Fig 4 : ๊ฒ€์ƒ‰๋˜๋Š” ์˜ˆ์‹œ๋Š” ๋™์ผํ•˜๊ฒŒ ๋‘๊ณ  execution๋งŒ ground truth๋กœ ๊ต์ฒด ๊ตฌ์„ฑ
        • ๋‘ agent ๋ชจ๋‘ ์ฆ‰๊ฐ์ ์ธ ๊ฒฉ์ฐจ ๋ฐœ์ƒ, $\pi_{\text{all}}$๊ณผ coarse๋Š” ์‹คํ–‰์ด ์ด์–ด์งˆ์ˆ˜๋ก ๊ฒฉ์ฐจ ํ™•๋Œ€
          • AgentDriver์˜ $\pi_{\text{human}}$์€ ์ดˆ๋ฐ˜์— ๋’ค์ฒ˜์ง€๋‚˜ ์•ฝ 2,000 ์‹คํ–‰ ํ›„ ์˜คํžˆ๋ ค ์ถ”์›”
        • memory์˜ ์–‘๊ณผ ์งˆ์ด ๋ชจ๋‘ ์ค‘์š”, evaluator๋ฅผ ์‹ ์ค‘ํžˆ ์„ ํƒํ•˜๊ณ  ํ•™์Šต ์š”๋ง
    • Deletion of Memory
      • ์ „๋žต์  memory deletion์ด agent ์„ฑ๋Šฅ ๊ฐœ์„  Tab 2 : ์‹ ๋ขฐํ•  ๋งŒํ•œ utility evaluator๊ฐ€ ์žˆ์œผ๋ฉด history deletion์ด ์„ฑ๋Šฅ ๊ฐœ์„ , combined๋Š” ์„ฑ๋Šฅ ์œ ์ง€์™€ memory ์ถ•์†Œ ์‚ฌ์ด ๊ท ํ˜• ์ œ๊ณต
        • periodical-based deletion: ํฐ memory ๊ฐ์†Œ๋ฅผ ์ž‘์€ ์„ฑ๋Šฅ ์ €ํ•˜๋กœ ๋‹ฌ์„ฑ
          • addition๋งŒ ํ•˜๋Š” ์„ค๊ณ„๊ฐ€ ์ž‰์—ฌ ํ•ญ๋ชฉ์„ ์ž์ฃผ ์ถ•์ 
        • history-based & combined: utility evaluator ์‹ ๋ขฐ๋„์— ๋”ฐ๋ผ ํŽธ์ฐจ๊ฐ€ ํผ
          • $\pi_{\text{human}}$์„ ์“ฐ๋ฉด ๋น„ํ•ฉ์„ฑ agent์—์„œ ๋šœ๋ ทํ•œ ์„ฑ๋Šฅ ํ–ฅ์ƒ
          • RegAgent๋Š” ์ˆ˜๋ฐฑ ๊ฑด์˜ ๋นˆ์ถœ ์‹คํ–‰์„ ์ œ๊ฑฐํ•ด๋„ ์„ฑ๋Šฅ ํ•˜๋ฝ์ด ์ž‘์Œ
        • error-free memory baseline๊ณผ ๋น„๊ต Fig 13
          • AgentDriver์—์„œ $\pi_{\text{human}}$ + history deletion์ด error-free ๋Œ€์‘์„ ๋Šฅ๊ฐ€, ํญ๋„ deletion ์—†๋Š” ๊ฒฝ์šฐ๋ณด๋‹ค ํผ
            • downstream utility๊ฐ€ ๋†’์€ ๊ฒฝํ—˜์„ ์„ ํƒ์ ์œผ๋กœ ๋‚จ๊ธฐ๋Š” ๊ฒƒ์ด ์žฅ๊ธฐ ์„ฑ๋Šฅ์„ ๊ฐœ์„ ํ•  ์ˆ˜ ์žˆ๋‹ค
        • evaluator๊ฐ€ coarseํ•˜๊ฑฐ๋‚˜ noisyํ•  ๋•Œ ๋ฐฉํ–ฅ์„ฑ Fig 5
          • GPT-4o-mini judge๋Š” EHRAgent์—์„œ ์ด๋“, AgentDriver์—์„œ ์ €ํ•˜
          • fine-tuned evaluator๋Š” ๋” ์•ˆ์ •์ ์ด๋ฉฐ ๋” ์ž‘์€ memory๋กœ ๋น„์Šทํ•œ ์„ฑ๋Šฅ ๋‹ฌ์„ฑ
      • ์‚ญ์ œ ๊ธฐ๋ก๊ณผ ๋‚จ์€ ๊ธฐ๋ก์˜ ํ’ˆ์งˆ ์ฐจ์ด Fig 6
        • ๋งฅ๋ฝ๊ณผ task ๋ถ„ํฌ์˜ ๋ถˆ์ผ์น˜๋Š” ์‚ฌ๋ก€๋ณ„์ด๋ผ ํฌ์ฐฉ์ด ์–ด๋ ค์›Œ, evaluator ํ•œ๊ณ„์—์„œ ์˜ค๋Š” error๋ฅผ ๋Œ€๋ฆฌ ์ง€ํ‘œ๋กœ ์‚ฌ์šฉ
        • RegAgent์˜ KDE ๋น„๊ต์—์„œ ์ž”์กด demonstration์˜ error๊ฐ€ ์‚ญ์ œ๋œ ๊ฒƒ๋ณด๋‹ค ๋‚ฎ์Œ
          • $\pi_{\text{human}}$ ์กฐ๊ฑด์—์„œ error 1.0 ์ดํ•˜๋งŒ ์ €์žฅํ–ˆ๋Š”๋ฐ๋„ 0.5 ์ดˆ๊ณผ ํ•ญ๋ชฉ์€ ์˜ค๋ฅ˜๋ฅผ ์ „ํŒŒํ•ด ์ œ๊ฑฐ๋จ
        • ๊ฒฝํ—˜์˜ ๋‚ด์žฌ์  ํ’ˆ์งˆ์ด downstream ์‹คํ–‰ ํ’ˆ์งˆ๊ณผ ์—ฐ๊ฒฐ๋˜๋ฉฐ, ๋ฏธ๋ž˜ ์‹คํ–‰ ํ’ˆ์งˆ์ด ๋‚ฎ์€ demonstration์„ ์ œ๊ฑฐํ•˜๋ฉด misaligned experience replay๋ฅผ ์™„ํ™”
    • Memory Management under Challenging Scenarios
      • task distribution shift Fig 7
        • ๋ถ„ํฌ ์ „ํ™˜ ์ดํ›„์—๋„ no-shift๋“ค ๋Œ€๋น„ ๊ฒฉ์ฐจ๋Š” ์ „๋ฐ˜์ ์œผ๋กœ ์ž‘๋‹ค๊ณ 
        • AgentDriver: $\pi_{\text{human}}$ addition๋งŒ์œผ๋กœ no-shift๋“ค์„ ์ƒํšŒ
        • EHRAgent: history-based deletion์ด combined๋ณด๋‹ค ์ €์กฐ
        • ๋ถ„ํฌ ์ด๋™์ด ์žˆ๋Š” ์‹ค์ œ ์ƒํ™ฉ์—์„œ๋Š” periodic deletion์ด ๋‹จ์ˆœํ•จ์—๋„ ์•ˆ์ •ํ™”์— ๊ธฐ์—ฌ ๊ฐ€๋Šฅ
      • memory resource constraint
        • ์šฉ๋Ÿ‰์„ ์ดˆ๊ธฐ ํฌ๊ธฐ๋กœ ๊ณ ์ •ํ•œ ์กฐ๊ฑด์—์„œ๋„ memory management ์ •์ฑ…์ด ๋†’์€ ์„ฑ๋Šฅ ์œ ์ง€
          • ๊ฐ€์žฅ ๊ด€๋ จ์„ฑ ๋†’๊ณ  ํ’ˆ์งˆ ์ข‹์€ ๊ธฐ๋ก๋งŒ ๋‚จ๊ฒจ ์ œํ•œ๋œ ์ €์žฅ ๊ณต๊ฐ„์„ ํšจ์œจ์ ์œผ๋กœ ํ™œ์šฉ
        • AgentDriver์—์„œ ์ œ์•ฝ ํฌ๊ธฐ๋ฅผ ๋Š˜๋ฆฌ๋ฉด ์„ฑ๋Šฅ์ด ์ ์ง„์ ์œผ๋กœ ์ˆ˜๋ ด
        • ์ž์› ์ œํ•œ ํ™˜๊ฒฝ์—์„œ๋„ memory management๊ฐ€ ์žฅ๊ธฐ ์„ฑ๋Šฅ์„ ๊ฐœ์„ ํ•˜๋ฉฐ, ๋ฌดํ•œ์ •ํ•œ memory ์„ฑ์žฅ์€ ๋ถˆ์š”
  • Limitation
    • ๋‹ค๋ฃฌ ์—ฐ์‚ฐ์ด add/delete ๋‘๊ฐœ ๋ฟ: structural transformation, merging, summarization, reflection์€ ์ œ์™ธ๋จ
    • ์ด๋ก ์  ๋ณด์ฆ ์—†์ด ๊ฒฝํ—˜์  ๋ถ„์„์—๋งŒ ์˜์กดํ•˜๋ฉฐ RegAgent ํ™˜๊ฒฝ์ด ํ–ฅํ›„ ์ด๋ก  ์—ฐ๊ตฌ์˜ ๋ฐœํŒ์ด ๋  ์ˆ˜ ์žˆ๋‹ค๊ณ ๋งŒ ์–ธ๊ธ‰

Personal note. ์„ค๊ณ„๊ฐ€ ๊น”๋”ํ•ด์„œ ๋ฐฐ์šธ ๊ฒŒ ์žˆ์—ˆ๋‹ค๊ณ  ์ƒ๊ฐํ•ฉ๋‹ˆ๋‹ค. ๊ณ ๋ฏผ ๋งŽ์ด ํ–ˆ์„ ๊ฒƒ ๊ฐ™์•„์š”. ์ด ๋…ผ๋ฌธ์˜ add/delete๋Š” ์ „๋ถ€ framework๊ฐ€ ๊ทœ์น™์œผ๋กœ ์ˆ˜ํ–‰ํ•˜๋Š” ๊ฒƒ์ด๊ณ , agent๊ฐ€ ์“ธ์ง€ ๋ง์ง€๋ฅผ ํŒ๋‹จํ•˜์ง€๋Š” ์•Š์Šต๋‹ˆ๋‹ค. proactivity ์ธก๋ฉด์„ ๊ณ ๋ คํ•ด์•ผํ•˜๋Š”์ง€ ๊ณ ๋ฏผ์ค‘์ธ๋ฐ, ์‚ฌ์‹ค์€ ๊ทธ์ •๋„๋ฅผ ๊ณ ๋ คํ•˜์ง€ ์•Š๋”๋ผ๋„, ๊ทœ์น™์œผ๋กœ ์‹œ์ผœ๋„ ๋ฌธ์ œ๊ฐ€ ์—†๋‹ค๋Š” ๋œป์ผ ์ˆ˜๋„ ์žˆ๊ณ ์š”. ๋‹ค๋งŒ error-free baseline๊ณผ ๋น„๊ต์—์„œ AgentDriver์—์„œ ์‹ค์ œ ์‹คํ–‰์ด ground-truth ์‹คํ–‰์„ ์ถ”์›”ํ•˜๋Š”๋ฐ, ์ •๋‹ต trajectory๊ฐ€ ๋ฐ˜๋“œ์‹œ ์ตœ์„ ์˜ demonstration์€ ์•„๋‹ˆ๋ผ๋Š” ๋œป์œผ๋กœ ์ดํ•ด๋ฉ๋‹ˆ๋‹ค. ์‹คํ—˜ ์„ค๊ณ„์ƒ ์™„๋ฒฝํ•œ ๋ฉ”๋ชจ๋ฆฌ(gt)๋ฅผ ์คฌ์„ ๋•Œ๋ฅผ ์ƒํ•œ์œผ๋กœ ์ƒ์ •ํ•˜๊ณ ๋Š” ํ•˜๋Š”๋ฐ, ์‹ค์ œ๋กœ๋Š” ๊ทธ gt๊ฐ€ ์ตœ์ ์€ ์•„๋‹ˆ๋ผ๋Š” ์†Œ๋ฆฌ๋‹ˆ๊นŒ์š”. ๊ฒ€์ƒ‰ ๊ฒฐ๊ณผ๋Š” ๊ณ ์ •ํ•˜๊ณ  ์ €์žฅ๋œ ์‹คํ–‰ ๋‚ด์šฉ๋งŒ gt๋กœ ๊ต์ฒดํ•จ์œผ๋กœ์จ retrieval ํ’ˆ์งˆ๊ณผ ์ €์žฅ๋ฌผ ํ’ˆ์งˆ์„ ๋ถ„๋ฆฌํ•ด๋‚ธ ๋Œ€์กฐ๊ตฐ ์„ค๊ณ„๋„ ๋ˆˆ์—ฌ๊ฒจ๋ณผ ๋งŒํ•ฉ๋‹ˆ๋‹ค.