8 minute read

Meta info.
Slide 1 Slide 2
Slide 3 Slide 4

Slide 5

TL; DR

Multi-turn ๋Œ€ํ™”์—์„œ ๋ชจ๋ธ์ด ์Šค์Šค๋กœ ์จ๋‘” assistant history๊ฐ€ ์ดํ›„ ์„ฑ๋Šฅ์„ ์ธ๊ณผ์ ์œผ๋กœ ๋ฐ”๊พธ๋Š”์ง€๋ฅผ, ์™„๋ฃŒ๋œ SHARDED ๋Œ€ํ™”๋ฅผ user ๋ฉ”์‹œ์ง€๋Š” ๊ทธ๋Œ€๋กœ ๋‘๊ณ  assistant ์‘๋‹ต๋งŒ ์ค‘๋ฆฝํ™”ํ•ด replayํ•˜๋Š” ๋ฐฉ์‹(neutralization, Turn Surgery)์œผ๋กœ ๊ฒ€์ฆ
  • ์™œ: multi-turn degradation(FULL โ†’ SHARDED ์„ฑ๋Šฅ ํ•˜๋ฝ)์€ ์ž˜ ์•Œ๋ ค์กŒ์ง€๋งŒ, ๋ชจ๋ธ์ด ์•ž์„œ ์“ด ์ž๊ธฐ ์‘๋‹ต์ด ๊ทธ ์›์ธ ์ค‘ ํ•˜๋‚˜์ธ์ง€, ์–ด๋А turn์ด ๋ฌธ์ œ์ธ์ง€๋Š” ๋ถ„๋ฆฌ๋˜์ง€ ์•Š์Œ
  • ์ œ์•ˆ: ์™„๋ฃŒ๋œ ๋Œ€ํ™”์—์„œ user ๋ฉ”์‹œ์ง€๋ฅผ ๊ณ ์ •ํ•˜๊ณ  assistant ์‘๋‹ต๋งŒ Acknowledged๋กœ ์น˜ํ™˜ํ•ด ์žฌ์ƒ์„ฑ replay
    • ์ „์ฒด ์น˜ํ™˜(neutralization)๊ณผ ํ•œ turn์”ฉ ์น˜ํ™˜(Turn Surgery)์— ๋Œ€ํ•ด ์‹คํ—˜
  • ๋ฐœ๊ฒฌ: ์ž๊ธฐ history๋ฅผ ์ง€์šฐ๋ฉด ์ ์ˆ˜๊ฐ€ ์•ฝ 7%p ์˜ค๋ฅด๊ณ  ๊ธธ์ด๋ฅผ ๋งž์ถฐ๋„ ๋™์ผ โ†’ ๊ธธ์ด๊ฐ€ ์•„๋‹ˆ๋ผ ๋‚ด์šฉ์ด ์›์ธ
    • ๋ฌด๋„ˆ์ง„ ๋Œ€ํ™”์˜ 63.7%์—๋Š” โ€œ์ง€์šฐ๋ฉด ์ข‹์•„์ง€๋Š” turnโ€์ด ์ตœ์†Œ ํ•˜๋‚˜ ์žˆ๋”๋ผ
      • ํ•˜์ง€๋งŒ turn ํ•˜๋‚˜ํ•˜๋‚˜๋กœ ๋ณด๋ฉด ์ ˆ๋ฐ˜ ์ด์ƒ์€ ์ง€์›Œ๋„ ์•ˆ์ง€์›Œ๋„ ๊ฒฐ๊ณผ๊ฐ€ ๊ทธ๋Œ€๋กœ โ†’ ๋ฌธ์ œ turn์€ ๋Œ€ํ™”๋งˆ๋‹ค ์ผ๋ถ€์—๋งŒ ์„ž์—ฌ ์žˆ์Œ
      • ๋ฌธ์ œ turn์ด ์ตœ๊ทผ turn์— ๋ชฐ๋ ค ์žˆ์ง€๋„ ์•Š์•„์„œ, โ€œ์ตœ๊ทผ ๋ช‡ turn๋งŒ ๋‚จ๊ธฐ๊ธฐโ€ ๊ฐ™์€ ๋‹จ์ˆœ ๊ทœ์น™์œผ๋กœ๋Š” ๊ณ ๋ฅผ ์ˆ˜ ์—†์Œ.
Turn Surgery figure 1 Turn Surgery figure 2 Turn Surgery figure 3

Turn Surgery figure 4 Turn Surgery figure 5 Turn Surgery figure 6

Background

  • multi-turn ํ‰๊ฐ€์˜ ํ™•์žฅ: single-turn prompt์—์„œ interactive setting์œผ๋กœ ์ด๋™
    • MT-Bench (Zheng et al., 2023), MINT (Wang et al., 2024), MT-Eval, MT-Bench-101, MultiChallenge
    • underspecified interaction ์—ฐ๊ตฌ: user ์˜๋„๊ฐ€ ๋ถˆ์™„์ „ํ•˜๋ฉด ๋ชจ๋ธ์ด ๋„ˆ๋ฌด ์ผ์ฐ ๋‹ตํ•˜๊ฑฐ๋‚˜ ๊ทผ๊ฑฐ ์—†๋Š” ๊ฐ€์ •์„ ํ•จ
  • sharded simulation (Laban et al., 2026) ๊ธฐ๋ฐ˜ ๋…ผ์˜
    • ๊ฐ™์€ task๋ฅผ ํ•œ ๋ฒˆ์— ๋‹ค ์ฃผ๋Š” FULL vs ์กฐ๊ฐ(shard)์œผ๋กœ ๋‚˜๋ˆ  ์—ฌ๋Ÿฌ turn์— ๊ฑธ์ณ ์ฃผ๋Š” SHARDED๋ฅผ ๋น„๊ต
    • SHARDED์—์„œ ํฐ ์„ฑ๋Šฅ ํ•˜๋ฝ๊ณผ ํ•จ๊ป˜ premature answer, unsupported assumption, reliance on previous responses ๊ฐ™์€ ํ–‰๋™ ์‹คํŒจ๊ฐ€ ๊ด€์ฐฐ๋จ
    • ํ•œ๊ณ„: ์ด ์‹คํŒจ์— ๋ชจ๋ธ ์ž์‹ ์˜ ์ด์ „ ์‘๋‹ต์ด ๊ธฐ์—ฌํ•˜๋Š”์ง€๋Š” ๋ถ„๋ฆฌํ•˜์ง€ ๋ชปํ•จ
  • ์™„ํ™” ์—ฐ๊ตฌ: curriculum RL, entropy-guided context resetting (ERGO), explicit intent mediation (Liu et al., 2026)
    • history-cleaned self-distillation (MAIGO, Zheng et al., 2026), canonical-context distillation (Lin et al., 2026), conversational inertia ์™„ํ™” (Wan et al., 2026)
    • ํ•œ๊ณ„: ๋Œ€๋ถ€๋ถ„ history ์ „์ฒด๋ฅผ omit/transformํ•˜๊ฑฐ๋‚˜ training policy ์ˆ˜์ค€์—์„œ ์ž‘๋™, turn ๋‹จ์œ„ ์ง„๋‹จ์ด ์—†์Œ
  • assistant history ์ž์ฒด๋ฅผ ๋‹ค๋ฃฌ ์—ฐ๊ตฌ: Do LLMs Benefit From Their Own Words? (Huang et al., 2026)
    • ์ด์ „ assistant ์‘๋‹ต์„ ์ƒ๋žต/์š”์•ฝํ•˜๋Š” ์„ค์ •๊ณผ ๋น„๊ตํ•ด assistant history๊ฐ€ ๋ถˆํ•„์š”ํ•˜๊ฑฐ๋‚˜ ํ•ด๋กœ์šธ ์ˆ˜ ์žˆ๋”๋ผ
      • sharded GSM8K์—์„œ length control๊นŒ์ง€ ์ˆ˜ํ–‰
    • ํ•œ๊ณ„: ์—ญ์‹œ whole-history ๋‹จ์œ„, task์™€ model์— ๋”ฐ๋ฅธ ์ฐจ์ด์™€ ๊ฐœ๋ณ„ turn์˜ ์˜ํ–ฅ์€ ํ™•์ธ ํ•„์š”ํ•  ๊ฒƒ
  • context/memory ์—ฐ๊ตฌ: ๋” ๋งŽ์ด ๋ณด์กดํ•œ๋‹ค๊ณ  ๋” ์ž˜ ์“ฐ๋Š” ๊ฒŒ ์•„๋‹˜
  • trajectory ๋‹จ์œ„ ์‹คํŒจ ์ง„๋‹จ๊ณผ intervention ๊ธฐ๋ฐ˜ attribution
    • ๊ด€์ฐฐ ๊ธฐ๋ฐ˜: MAST (Cemri et al., 2025), TRAIL (Deshpande et al., 2025), AgentDebug (Zhu et al., 2025)
    • intervention ๊ธฐ๋ฐ˜: DoVer, CausalFlow (Bonagiri et al., 2026), Causal Agent Replay (Shah, 2026)
    • ํ•œ๊ณ„: ์ด์งˆ์ ์ธ agent execution trace๊ฐ€ ๋Œ€์ƒ์œผ๋กœ ํ•˜์—ฌ ์ผ๋ฐ˜ multi-turn ๋Œ€ํ™”์˜ assistant turn์€ ๋‹ค๋ฃจ์ง€๋Š” ์•Š์Œ.
  • TL; DR: degradation ํ˜„์ƒ์€ ์กด์žฌํ•˜๋Š” ์‚ฌ์‹ค์ด๊ณ , history๋ฅผ ์ค„์ด๋ฉด ๋‚˜์•„์ง„๋‹ค๋Š” ์ฆ๊ฑฐ๋„ ์žˆ์ง€๋งŒ, ๋ชจ๋ธ์ด ์“ด ์–ด๋–ค turn์ด ์–ผ๋งˆ๋‚˜, ์–ด๋А ๋ฐฉํ–ฅ์œผ๋กœ ์ดํ›„๋ฅผ ๋ฐ”๊พธ๋Š”์ง€๋Š” turn ๋‹จ์œ„๋กœ ์ธก์ •๋œ ์ ์ด ์—†์Œ

Problem States

multi-turn degradation์„ ๋ชจ๋ธ ์ž์‹ ์ด ์“ด history์˜ ์ธ๊ณผ ํšจ๊ณผ๋กœ ๋ถ„ํ•ดํ•˜๋ ค๋ฉด ํ•„์š”ํ•œ ์กฐ๊ฑด

  1. degradation์ด ๋ชจ๋ธ ๊ณ ์œ ํ•œ ๋ฌธ์ œ์ผ์ง€, task์™€ model ์กฐํ•ฉ์— ๋”ฐ๋ผ ๊ตฌ์กฐ์ ์œผ๋กœ ๋‹ฌ๋ผ์ง€๋Š”์ง€? ๋จผ์ € ํ™•์ธ โ†’ RQ1: degradation landscape
  2. ์ž๊ธฐ history๋ฅผ ๋ฐ”๊พธ๋ฉด ๊ฒฐ๊ณผ๊ฐ€ ๋ฐ”๋€Œ๋Š”์ง€, ๊ทธ๋ฆฌ๊ณ  ๊ทธ๊ฒŒ ๋‹จ์ˆœํžˆ context๊ฐ€ ์งง์•„์ง„ ํšจ๊ณผ๋Š” ์•„๋‹์ง€? โ†’ RQ2: neutralization + length control
  3. ์–ด๋А turn์ด ๊ฒฐ๊ณผ๋ฅผ ๋ฐ”๊พธ๋Š”์ง€๋ฅผ ํ•œ turn์”ฉ ๋ถ„๋ฆฌํ•ด์„œ ํ™•์ธ โ†’ RQ3: Turn Surgery
  4. ๊ฒฐ๊ณผ๋ฅผ ๋ฐ”๊พผ ๊ฐœ์ž…์ด ๋ชจ๋ธ ๋‚ด๋ถ€ ์ƒํƒœ์—์„œ๋„ ๊ตฌ๋ถ„๋  ์ˆ˜ ์žˆ์„์ง€ โ†’ RQ4: open-weight internal analysis

Suggestions

Definition

  • SHARDED trajectory๋ฅผ user ๋ฉ”์‹œ์ง€ $U_t$์™€ assistant ๋ฉ”์‹œ์ง€ $A_t$์˜ ๊ต๋Œ€ sequence๋กœ ์ •์˜
\[\tau = (U_1, A_1, \dots, U_T, A_T)\]
  • self-generated assistant history: ๋ชจ๋ธ์ด ์ƒ์„ฑํ•ด์„œ ์ดํ›„ turn์˜ ์ž…๋ ฅ์œผ๋กœ ๋ˆ„์ ๋˜๋Š” $A_1, \dots, A_{T-1}$
    • $A_t$๊ฐ€ ๋‹จ์ˆœ ๊ธฐ๋ก(transcript)์ธ์ง€, ์ดํ›„ ๊ณ„์‚ฐ์— ์‹ค์ œ๋กœ ๊ด€์—ฌํ•˜๋Š” ์ž…๋ ฅ์ธ์ง€
  • ํ‰๊ฐ€ ์ ์ˆ˜ $S^c_i$: ์‚ฌ๋ก€ $i$๋ฅผ ์กฐ๊ฑด $c$์—์„œ ๋Œ๋ ธ์„ ๋•Œ ์ตœ์ข… assistant ์ถœ๋ ฅ์— ๋Œ€ํ•œ task๋ณ„ ์ •๊ทœํ™” ์ ์ˆ˜
    • degradation = $S^{\text{FULL}} - S^{\text{SHARDED}}$
  • retrospective replay: ์ด๋ฏธ ๋๋‚œ ๋Œ€ํ™”์—์„œ user ๋ฉ”์‹œ์ง€๋ฅผ ๊ธฐ๋ก๋œ ๊ทธ๋Œ€๋กœ ๋‹ค์‹œ ๋„ฃ๊ณ , assistant history๋งŒ ๋ฐ”๊ฟ” ๋ชจ๋ธ์ด ์ด์–ด์„œ ์ƒ์„ฑํ•˜๊ฒŒ ํ•จ
    • user simulator๋ฅผ ๋‹ค์‹œ ๋Œ๋ฆฌ์ง€ ์•Š์œผ๋ฏ€๋กœ, assistant ์‘๋‹ต์ด ๋ฐ”๋€Œ์—ˆ์„ ๋•Œ user๊ฐ€ ๋‹ค๋ฅด๊ฒŒ ๋ฐ˜์‘ํ–ˆ์„ ๊ฐ€๋Šฅ์„ฑ์€ ๋ฐฐ์ œ๋จ
    • ๋”ฐ๋ผ์„œ ์—ฌ๊ธฐ์„œ ๋งํ•˜๋Š” causal effect๋Š” โ€œ๊ธฐ๋ก๋œ user ๋ฉ”์‹œ์ง€๋ฅผ ์กฐ๊ฑด์œผ๋กœ ํ•œโ€ intervention ํšจ๊ณผ

Neutralization (RQ2)

  • short neutralization: ๋งˆ์ง€๋ง‰์„ ์ œ์™ธํ•œ ๋ชจ๋“  assistant ์‘๋‹ต์„ ๊ณ ์ • placeholder $N$ = Acknowledged๋กœ ์น˜ํ™˜
    • turn ๊ตฌ์กฐ(๋ˆ„๊ฐ€ ์–ธ์ œ ๋งํ–ˆ๋Š”์ง€)๋Š” ์œ ์ง€ํ•˜๋˜ task ๋‚ด์šฉ์€ ์ œ๊ฑฐ
    • ๊ฐ™์€ ๋ชจ๋ธ์ด ๋งˆ์ง€๋ง‰ ์‘๋‹ต๋งŒ ๋‹ค์‹œ ์ƒ์„ฑํ•˜๊ณ , ์›๋ž˜ evaluator๋กœ ์ฑ„์ 
    • history-intervention effect: $S^{\text{SHORT}}_i - S^{\text{SHARDED}}_i$
  • length-matched neutralization: ์งง์•„์ ธ์„œ ์ข‹์•„์ง„ ๊ฒƒ๋ฟ์ผ ์ˆ˜ ์žˆ๋‹ค๋Š” ๋Œ€์•ˆ ์„ค๋ช…์„ ๋ฐฐ์ œํ•˜๊ธฐ ์œ„ํ•œ ํ†ต์ œ
    • ์›๋ž˜ ์‘๋‹ต์˜ ๊ธธ์ด๋งŒํผ $N$์„ ๋ฐ˜๋ณตํ•ด์„œ filling
    • ๊ธธ์ด๋Š” ์ •๊ทœ์‹ \S+๋กœ ์žกํžˆ๋Š” ๋น„๊ณต๋ฐฑ span ์ˆ˜๋กœ ์ธก์ • (๋ชจ๋ธ๋ณ„ tokenizer๊ฐ€ ์•„๋‹Œ ๊ณตํ†ต estimator)
    • ๊ฒฐ๊ณผ ๋ณด๊ธฐ ์ „์— model ร— task cell๋‹น 10๊ฐœ์”ฉ, ์ด 300๊ฐœ ํ›„๋ณด๋ฅผ ๋ฏธ๋ฆฌ ์ง€์ •(prespecified)

Turn Surgery (RQ3)

  • ๋ชฉํ‘œ turn $A_{i,t}$ ํ•˜๋‚˜๋งŒ $N$์œผ๋กœ ์น˜ํ™˜, ๊ทธ ์ด์ „ history๋Š” ๊ทธ๋Œ€๋กœ ๋‘ 
    • ์ดํ›„ ๊ธฐ๋ก๋œ user ๋ฉ”์‹œ์ง€๋ฅผ replayํ•˜๊ณ , ๊ทธ ์‚ฌ์ด assistant ์‘๋‹ต์€ ๊ฐ™์€ ๋ชจ๋ธ์ด autoregressiveํ•˜๊ฒŒ ๋‹ค์‹œ ์ƒ์„ฑ
    • ์ฆ‰ ์น˜ํ™˜ ์ง€์  ์ดํ›„์˜ assistant turn์€ ์›๋ณธ์ด ์•„๋‹Œ ์ƒˆ๋กœ ์ƒ์„ฑ๋œ ์‘๋‹ต์œผ๋กœ ์ด์–ด์ง
  • branch ๋‹จ์œ„ ํšจ๊ณผ: trajectory $i$์˜ $j$๋ฒˆ์งธ branch(= $j$๋ฒˆ์งธ turn์„ ์ˆ˜์ˆ ํ•œ ๋ฒ„์ „)์˜ ์ ์ˆ˜ ์ฐจ
\[\Delta_{ij} = S^{\text{surgery}}_{ij} - S^{\text{SHARDED}}_i\]
  • positive($\Delta_{ij} > 0$): ๊ทธ turn์„ ์ง€์šฐ๋‹ˆ ์ข‹์•„์ง, ์ฆ‰ ์›๋ž˜ turn์ด ํ•ด๋กœ์› ์Œ
  • negative($\Delta_{ij} < 0$): ์ง€์šฐ๋‹ˆ ๋‚˜๋น ์ง, ์ฆ‰ ์›๋ž˜ turn์ด ๋„์›€์ด ๋์Œ
  • no-change($\Delta_{ij} = 0$); ์—ฐ์† ์ ์ˆ˜ task์—๋Š” $\epsilon = .01$ ํ—ˆ์šฉ ์˜ค์ฐจ๋กœ robustness ํ™•์ธ
  • trajectory-equal estimand: trajectory๋งˆ๋‹ค ์ˆ˜์ˆ  ๊ฐ€๋Šฅํ•œ turn ์ˆ˜ $k_i$๊ฐ€ ๋‹ฌ๋ผ์„œ, ๊ธด ๋Œ€ํ™”๊ฐ€ ํ‰๊ท ์„ ์ง€๋ฐฐํ•˜์ง€ ์•Š๋„๋ก ๋จผ์ € trajectory ๋‚ด๋ถ€ ํ‰๊ท ์„ ๋‚ธ ๋’ค trajectory๋ผ๋ฆฌ ๋™์ผ ๊ฐ€์ค‘์œผ๋กœ ํ‰๊ท 
\[\Delta_{\text{traj}} = \frac{1}{n_{\text{traj}}} \sum_{i=1}^{n_{\text{traj}}} \left( \frac{1}{k_i} \sum_{j=1}^{k_i} \Delta_{ij} \right)\]
  • robustness check๋กœ ๋ชจ๋“  branch๋ฅผ ๋™์ผ ๊ฐ€์ค‘ํ•˜๋Š” branch-weighted mean๋„ ๋ณด๊ณ 
  • ์ถ”๊ฐ€ ์ง€ํ‘œ
    • trajectory reach: positive branch๊ฐ€ ํ•˜๋‚˜๋ผ๋„ ์žˆ๋Š” trajectory ๋น„์œจ
    • fail-to-success reversal: binary task์—์„œ SHARDED 0์ ์ด ์ˆ˜์ˆ  ํ›„ 1์ ์ด ๋œ branch๊ฐ€ ์žˆ๋Š” trajectory ๋น„์œจ
    • relative position: ์ˆ˜์ˆ ํ•œ turn์˜ ์ •๊ทœํ™” ์œ„์น˜ (0 = ๊ฐ€์žฅ ์ด๋ฅธ ์ค‘๊ฐ„ turn, 1 = ๊ฐ€์žฅ ๋Šฆ์€ ์ค‘๊ฐ„ turn)
    • distance-to-final: ์ˆ˜์ˆ ํ•œ turn๊ณผ ๋งˆ์ง€๋ง‰ user ์š”์ฒญ ์‚ฌ์ด์˜ user turn ์ˆ˜
  • ๋ถ„์„ ๋Œ€์ƒ์€ degradation์ด ๋šœ๋ ทํ•œ trajectory๋กœ ํ•œ์ •
    • binary task(Actions, Code, Database, Math): $S^{\text{FULL}} = 1$์ด๊ณ  $S^{\text{SHARDED}} = 0$
    • ์—ฐ์† ์ ์ˆ˜ task(Data-to-Text, Summary): $S^{\text{FULL}} - S^{\text{SHARDED}} \ge 0.10$
  • repeatability: ์„ ํƒ๋œ ๊ณ ํšจ๊ณผ ๊ฐœ์ž…์„ temperature 0์œผ๋กœ ๋‘ ๋ฒˆ ๋” ๋Œ๋ ค ๊ฒฐ๊ณผ class๊ฐ€ ์œ ์ง€๋˜๋Š”์ง€ ํ™•์ธ
    • 60๊ฐœ trajectory์—์„œ ์ฒซ run ํšจ๊ณผ๊ฐ€ ๊ฐ€์žฅ ํฐ ๊ฐœ์ž… ํ•˜๋‚˜์”ฉ๋งŒ ๋Œ€์ƒ

Open-weight internal analysis (RQ4)

  • Qwen3-14B, ๋กœ์ปฌ์—์„œ exact evaluation์ด ๊ฐ€๋Šฅํ•œ Actions, Code, Data-to-Text(D2T)๋งŒ ๋Œ€์ƒ
    • probe ์ •์˜๋Š” 24๊ฐœ trajectory์˜ discovery set์—์„œ ๊ณ ์ •
    • ๋ณธ ์ถ”์ •์€ ๊ฒน์น˜์ง€ ์•Š๋Š” held-out 118 trajectory, 603 branch (positive์™€ no-change branch๋ฅผ ๋ชจ๋‘ ๊ฐ€์ง„ mixed trajectory 46๊ฐœ ํฌํ•จ)
    • D2T๋Š” ๋ณ„๋„ prospective ์ง‘๋‹จ์œผ๋กœ ์žฌํ˜„๋งŒ ํ™•์ธ (held-out๊ณผ ํ•ฉ์น˜์ง€ ์•Š์Œ)
  • state propagation: turn surgery๊ฐ€ ๋ชจ๋ธ ๋‚ด๋ถ€ ์ƒํƒœ๋ฅผ ์–ผ๋งˆ๋‚˜ ๋ฐ”๊พธ๋Š”๊ฐ€
    • downstream user anchor: ์ˆ˜์ˆ  ์ดํ›„ replay๋˜๋Š” ๊ฐ user ๋ฉ”์‹œ์ง€์˜ ๋งˆ์ง€๋ง‰ content token ์œ„์น˜
    • ๊ฐ decoder layer์˜ residual stream(transformer block ์‚ฌ์ด๋ฅผ ํ๋ฅด๋Š” ํ‘œํ˜„)์„ anchor์—์„œ ์ถ”์ถœ
    • divergence๋Š” ์›๋ณธ context์™€ ์ˆ˜์ˆ  context์˜ ํ‘œํ˜„ ์‚ฌ์ด 1 โˆ’ cosine similarity
    • ๋งˆ์ง€๋ง‰ anchor์—์„œ์˜ ๊ฐ’(final)๊ณผ, ๋ชจ๋“  downstream anchor์— ๊ฑธ์นœ ์ •๊ทœํ™” ์‚ฌ๋‹ค๋ฆฌ๊ผด ๋ฉด์ (propagation AUC)์œผ๋กœ ์š”์•ฝ
  • state restoration: ๋งˆ์ง€๋ง‰ anchor์—์„œ ์ˆ˜์ˆ ๋œ residual vector๋ฅผ ์›๋ณธ history์˜ vector๋กœ ํ•œ ๋ฒˆ ๋ฎ์–ด์“ฐ๊ณ (prefill ์‹œ) greedy decoding
    • ์ˆ˜์ˆ ๋กœ ์–ป์€ ์ด๋“์ด ์–ผ๋งˆ๋‚˜ ๋˜๋Œ์•„๊ฐ€๋Š”์ง€๋กœ, ๋‚ด๋ถ€ ์ƒํƒœ์™€ ํ–‰๋™ ์‚ฌ์ด ๋ฐฉํ–ฅ์„ฑ์„ ํ™•์ธ
    • mediation ๊ฒ€์ฆ์ด ์•„๋‹ˆ๋ผ ๋ฒ”์œ„๊ฐ€ ์ œํ•œ๋œ causal intervention์œผ๋กœ ์ทจ๊ธ‰
  • ๋ณด์กฐ probe
    • static target-turn attention: ์ˆ˜์ˆ  ๋Œ€์ƒ turn์— ๊ฐ€๋Š” attention ์–‘
    • history attention redistribution: ์ด์ „ assistant history ์ „์ฒด์— ๊ฐ€๋Š” attention์ด ์›๋ณธ ๋Œ€๋น„ ์–ผ๋งˆ๋‚˜ ์žฌ๋ถ„๋ฐฐ๋˜๋Š”์ง€
    • attention knockout: ๋Œ€์ƒ turn์„ ์ตœ์ข… ์ƒ์„ฑ token์—์„œ๋งŒ ๊ฐ€๋ฆผ(direct-only) vs ๋ชจ๋“  downstream ์œ„์น˜์—์„œ ๊ฐ€๋ฆผ(full-downstream); ๋‘ ํšจ๊ณผ ์ฐจ์ด๊ฐ€ propagation advantage
    • continuation margin: ์„ฑ๊ณต continuation๊ณผ ์‹คํŒจ continuation์˜ ๊ธธ์ด ์ •๊ทœํ™” teacher-forced log-likelihood ์ฐจ์ด, ์›๋ณธ vs ์ˆ˜์ˆ  context์—์„œ์˜ ๋ณ€ํ™”

Effects

  • Experimental setup
    • benchmark: sharded simulation (Laban et al., 2026)์˜ 627๊ฐœ fully specified instruction, 6๊ฐœ task family
      • Actions (105, BFCL-V3 Parallel): function-call correctness
      • Code (100, HumanEval): test ๊ธฐ๋ฐ˜ pass@1
      • Data-to-Text (120, ToTTo): SacreBLEU/100
      • Database (107, Spider): SQL execution match
      • Math (103, GSM8K): normalized exact match
      • Summary (92, Summary of a Haystack): coverage + citation score
    • user: ์›๋ž˜ SHARDED ์ƒ์„ฑ ๋•Œ๋Š” user simulator๊ฐ€ ๋‹ค์Œ shard๋ฅผ ๊ณจ๋ผ rephrase; replay ์‹คํ—˜์—์„œ๋Š” ๊ธฐ๋ก๋œ user ๋ฉ”์‹œ์ง€๋ฅผ ๊ทธ๋Œ€๋กœ ์žฌ์‚ฌ์šฉ
    • assistant: GPT-5.6 Luna, Grok 4.5, GPT-4o, DeepSeek V3.2, Qwen3-14B
      • temperature 0, max output 1,000 token
      • Qwen3-14B๋Š” RQ4 ๋‚ด๋ถ€ ๋ถ„์„ ๋ชจ๋ธ์„ ๊ฒธํ•จ
    • evaluation
      • 3,135 instructionโ€“model pair ์ค‘ FULL๊ณผ SHARDED ์ ์ˆ˜๊ฐ€ ๋ชจ๋‘ ์œ ํšจํ•œ 2,989์Œ์ด RQ1 ๋Œ€์ƒ
      • ๋ถˆ์™„์ „ํ•œ ์š”์ฒญ์€ ์‹คํŒจ๋กœ ๋ฐ”๊พธ์ง€ ์•Š๊ณ  missing์œผ๋กœ ์œ ์ง€
      • model ์ˆ˜์ค€ ์š”์•ฝ์€ task ํ‰๊ท ์„ ๋™์ผ ๊ฐ€์ค‘ macro-average; 10,000ํšŒ paired percentile bootstrap์œผ๋กœ 95% CI
  • Results
    • Fig 3 RQ1: ๋ชจ๋“  ๋ชจ๋ธ์ด 14~22%p ๋ฌด๋„ˆ์ง€์ง€๋งŒ, ์–ผ๋งˆ๋‚˜ ๋ฌด๋„ˆ์ง€๋Š”์ง€๋Š” task์™€ model์— ๋”ฐ๋ผ ๋‹ค ๋‹ค๋ฅด๋”๋ผ
      • ํ•œ ๋ฒˆ์— ์คฌ์„ ๋•Œ ์ž˜ํ•˜๋Š” ๋ชจ๋ธ์ด ๋‚˜๋ˆ  ์คฌ์„ ๋•Œ ๋œ ๋ฌด๋„ˆ์ง€๋Š” ๊ฑด ์•„๋‹ˆ๊ณ (FULL 1์œ„ Grok โ‰  ํ•˜๋ฝ ์ตœ์†Œ Luna)
      • ์„ฃ๋ถ€๋ฅธ ๊ฐ€์ •์ด ๋ฐ”๋กœ ์˜ค๋‹ต์ด ๋˜๋Š” Actions, Database ๋„๋ฉ”์ธ์—์„œ๋Š” 20~44%p๋กœ ํฌ๊ฒŒ ํ•˜๋ฝ
      • Summary๋Š” 10%p ๋‚ด์™ธ๋กœ ๊ฑฐ์˜ ๊ทธ๋Œ€๋กœ
    • RQ2: ์ž๊ธฐresponse๋ฅผ ์ง€์šฐ๋ฉด ๊ฒฐ๊ณผ๊ฐ€ ๋ฐ”๋€œ
      • ์ „์ฒด ํ‰๊ท ์œผ๋กœ๋Š” +2.7%p๋กœ ์กฐ๊ธˆ ์˜ค๋ฅด์ง€๋งŒ, ์‚ฌ์‹ค์€ ์˜ค๋ฅด๋Š” ์ชฝ๊ณผ ๋–จ์–ด์ง€๋Š” ์ชฝ์ด ์ƒ์‡„๋œ ๊ฒฐ๊ณผ
        • Actions๋Š” +22%p๋กœ ํฌ๊ฒŒ ์˜ค๋ฅด๊ณ  Code๋Š” โˆ’13%p๋กœ ํฌ๊ฒŒ ๋–จ์–ด์ง
        • ๋ชจ๋ธ ์ค‘์—์„œ๋Š” DeepSeek๋งŒ ๋ฐ˜๋Œ€๋กœ โˆ’15%p
    • Fig 4A ๊ธธ์ด๋ฅผ ๋งž์ถฐ ์ง€์›Œ๋„ ํšจ๊ณผ๊ฐ€ ๊ฐ™์Œ(+6.9%p vs +6.8%p) โ†’ ์งง์•„์ ธ์„œ๊ฐ€ ์•„๋‹ˆ๋ผ response์˜ ๋‚ด์šฉ ๋•Œ๋ฌธ
    • Fig 4B ๋˜‘๊ฐ™์ด ๋Œ€์น˜ํ–ˆ๋”๋ผ๋„, ์–ด๋–ค ๋Œ€ํ™”๋Š” ๊ฐœ์„ ๋˜๊ณ  ์–ด๋–ค ๋Œ€ํ™”๋Š” ํ•˜๋ฝํ•˜๋”๋ผ
      • ์›๋ž˜ ํ‹€๋ฆฐ ๋Œ€ํ™”๋Š” ์ ˆ๋ฐ˜(51%)์ด ์‚ด์•„๋‚˜์ง€๋งŒ,
      • ์›๋ž˜ ๋งž๋˜ ๋Œ€ํ™”์˜ 15%๋Š” ์˜คํžˆ๋ ค ํ‹€๋ฆผ
      • โ†’ history๋ฅผ ํ†ต์งธ๋กœ ์ง€์šฐ๋Š” ๊ฑด ๋‹ต์ด ์•„๋‹˜, RQ3๋กœ ์—ฐ๊ฒฐ
    • Fig 5 RQ3: ๋ฌธ์ œ turn์€ ๋„“๊ฒŒ ํผ์ ธ ์žˆ์ง€๋งŒ ๊ณจ๋ผ์•ผ ๋จ
      • ๋ฌด๋„ˆ์ง„ ๋Œ€ํ™”์˜ 64%์— โ€œ์ง€์šฐ๋ฉด ์ข‹์•„์ง€๋Š” turnโ€์ด ์žˆ๊ณ ,
        • ๊ทธ๋Ÿฐ turn์ด ์—ฌ๋Ÿฌ ๊ฐœ์ธ ๊ฒฝ์šฐ๊ฐ€ ๋” ๋งŽ์Œ
        • 48%๋Š” turn ํ•˜๋‚˜๋งŒ ์ง€์›Œ๋„ ์˜ค๋‹ต์ด ์ •๋‹ต์œผ๋กœ ๋ฐ”๋€œ
      • ํ•˜์ง€๋งŒ turn ํ•˜๋‚˜ํ•˜๋‚˜๋กœ ๋ณด๋ฉด 58%๋Š” ๋„ฃ๋“  ๋นผ๋“  ์˜ํ–ฅ์ด ์—†์œผ๋ฉฐ,
        • 32%๋Š” ํ•ด๋กญ๊ณ ,
        • 11%๋Š” ์˜คํžˆ๋ ค ๋„์›€
      • ์ตœ๊ทผ turn์ด๋ผ์„œ ํ•ด๋กœ์šด ๊ฒƒ๋„ ์•„๋‹ˆ๋”๋ผ
      • ๊ฐ™์€ ์‹คํ—˜์„ ๋‹ค์‹œ ๋Œ๋ฆฌ๋ฉด ์•ฝ 30%๋Š” ๊ฒฐ๊ณผ๊ฐ€ ๋ฐ”๋€œ
        • temperature 0์ธ๋ฐ๋„!
    • Fig 6 RQ4: ๋ชจ๋ธ ๋‚ด๋ถ€์—๋„ ํ”์ ์€ ์žˆ์ง€๋งŒ ์•ฝํ•˜๊ณ  task๋งˆ๋‹ค๋„ ๋‹ค๋ฆ„
      • ๊ฒฐ๊ณผ๋ฅผ ๋ฐ”๊พผ turn์ด ๋‚ด๋ถ€ ์ƒํƒœ๋„ ๋” ํ”๋“ค์ง€๋งŒ, ์ฐจ์ด๋Š” ์•„์ฃผ ์ž‘์Œ
      • ๋‚ด๋ถ€ ์ƒํƒœ๋ฅผ ๋˜๋Œ๋ฆฌ๋ฉด ํšจ๊ณผ๋„ ์‚ฌ๋ผ์ง€๋Š”์ง€๋Š” D2T์—์„œ๋งŒ ์•ฝํ•˜๊ฒŒ ํ™•์ธ
      • ๋ชจ๋“  task์—์„œ ํ†ตํ•˜๋Š” ๋‚ด๋ถ€ ์‹ ํ˜ธ๋Š” ์—†๋‹ค๋Š” ๊ฒฐ๋ก  (probe๋งˆ๋‹ค ๊ฒฐ๊ณผ๊ฐ€ ์ œ๊ฐ๊ฐ)

Personal note. ํ‘œ๋ฉด์ ์œผ๋กœ๋Š” Acknowledged๋ผ๋Š” placeholder๊ฐ€ ์ •๋ง โ€œ์ค‘๋ฆฝโ€์ธ์ง€๋Š” ๊ฑธ๋ฆฌ๊ธด ํ•˜๋Š”๋ฐ ์•„๋ฌดํŠผ ์‰ฌ์šด ๋ฐฉ์‹์œผ๋กœ model response๋ฅผ ๊ฐ€๋ฆด ์ˆ˜๋Š” ์žˆ์—ˆ์–ด์„œ ํฌ๊ฒŒ ๋งˆ์Œ์— ๊ฑธ๋ฆฌ์ง€๋Š” ์•Š์Šต๋‹ˆ๋‹ค. ์•„๋ฌด๋ž˜๋„ ์ง์—ญํ•˜๋ฉด โ€œ์•Œ๊ฒ ๋‹ค, ๊ณ„์† ์ง„ํ–‰ํ•œ๋‹คโ€๋Š” ์ˆ˜๋ฝ ์‹ ํ˜ธ๋กœ๋„ ์ฝํžˆ๊ธด ํ•˜๋‹ˆ๊นŒ..

neutralization ํšจ๊ณผ์˜ ์ƒ๋‹น ๋ถ€๋ถ„์€ ๋ชจ๋ธ์ด ๋„ˆ๋ฌด ์ผ์ฐ ๋‚ด๋†“์€ ๋‹ต(premature answer)์— anchoring๋˜๋˜ ๊ฑธ ๋Š์–ด์ค€ ํšจ๊ณผ๊ฐ€ ์•„๋‹๊นŒ ์‹ถ๊ธฐ๋„ ํ•ฉ๋‹ˆ๋‹ค. Actions๊ฐ€ ํฌ๊ฒŒ ์˜ค๋ฅด๊ณ  Code๊ฐ€ ๋–จ์–ด์ง€๋Š” ๊ฒƒ๋„, ๋ˆ„์ ๋˜๋Š” ์‚ฐ์ถœ๋ฌผ(code)๊ณผ ์„ฃ๋ถ€๋ฅธ ๊ฐ€์ •(function call)์ด history ์•ˆ์—์„œ ๋‹ค๋ฅด๊ฒŒ ์ž‘๋™ํ•œ๋‹ค๊ณ  ๋ณด๋ฉด ์„ค๋ช…์€ ๋œ๋‹ค๊ณ  ๋А๋ผ๊ณ 

์›๋ณธ ๊ทธ๋Œ€๋กœ replayํ–ˆ์„ ๋•Œ ๊ฒฐ๊ณผ๊ฐ€ ์–ผ๋งˆ๋‚˜ ๋’ค์ง‘ํžˆ๋Š”์ง€(null surgery)๋Š” ๋ณด๊ณ ๋˜์ง€ ์•Š์•„์„œ branch๊ฐ€ ์—ฌ๋Ÿฌ ๊ฐœ์ธ trajectory์˜ โ€œํ•˜๋‚˜๋ผ๋„ positiveโ€ ๋น„์œจ์€ temperature 0์—์„œ์˜ run ๋ณ€๋™(71.7% ์ผ๊ด€์„ฑ)๋งŒ์œผ๋กœ๋„ ์–ด๋А ์ •๋„ ๋ถ€ํ’€๋ ค์กŒ์„ ๊ฐ€๋Šฅ์„ฑ๋„ ๋ฐฐ์ œํ•˜๊ธด ์–ด๋ ต๊ฒ ์Šต๋‹ˆ๋‹ค.

๊ทธ๋ž˜๋„ ๊ฐœ์ธํ™” ์ชฝ์—์„œ ๋ณด๋ฉด, agent๊ฐ€ ์ง€๋‚œ ์„ธ์…˜์— ์Šค์Šค๋กœ ์ฑ„์›Œ ๋„ฃ์€ argument๊ฐ€ ๋‹ค์Œ ์„ธ์…˜์—์„œ user ์„ ํ˜ธ์˜ โ€œ์ฆ๊ฑฐโ€๋กœ ๋˜๋จน์ž„๋˜๋Š” ๊ตฌ์กฐ์™€ ์ •ํ™•ํžˆ ๊ฐ™์€ ์งˆ๋ฌธ์ด๋ผ (๋น„๋ก ์ œ๊ฐ€ ํ•˜๊ณ ์ž ํ–ˆ๋˜ ์—ฐ๊ตฌ์™€ ์œ ์‚ฌํ•ด์„œ ๋ฐฉํ–ฅ์„ ์ ‘์—ˆ์–ด์•ผ ํ–ˆ์„์ง€๋ผ๋„) ๊ฝค ํฅ๋ฏธ๋กญ๊ฒŒ ์ฝ์—ˆ์Šต๋‹ˆ๋‹ค.