What if LLMs Ate Their Words: Causal History Effects in Multi-Turn Interaction
- Authors: Jinnan Li, Zheren Fu, Yue Wang, Jinzhe Li, Yuan Wu, Yi Chang
- Affiliation: Jilin University; USTC; UNC-Chapel Hill
- Paper: https://arxiv.org/abs/2609.05882
- Code: https://github.com/jinnanli/llms-ate-their-words
- Published: September 5, 2026 (arXiv preprint)

TL; DR
Multi-turn ๋ํ์์ ๋ชจ๋ธ์ด ์ค์ค๋ก ์จ๋ assistant history๊ฐ ์ดํ ์ฑ๋ฅ์ ์ธ๊ณผ์ ์ผ๋ก ๋ฐ๊พธ๋์ง๋ฅผ, ์๋ฃ๋ SHARDED ๋ํ๋ฅผ user ๋ฉ์์ง๋ ๊ทธ๋๋ก ๋๊ณ assistant ์๋ต๋ง ์ค๋ฆฝํํด replayํ๋ ๋ฐฉ์(neutralization, Turn Surgery)์ผ๋ก ๊ฒ์ฆ
- ์: multi-turn degradation(FULL โ SHARDED ์ฑ๋ฅ ํ๋ฝ)์ ์ ์๋ ค์ก์ง๋ง, ๋ชจ๋ธ์ด ์์ ์ด ์๊ธฐ ์๋ต์ด ๊ทธ ์์ธ ์ค ํ๋์ธ์ง, ์ด๋ turn์ด ๋ฌธ์ ์ธ์ง๋ ๋ถ๋ฆฌ๋์ง ์์
- ์ ์: ์๋ฃ๋ ๋ํ์์ user ๋ฉ์์ง๋ฅผ ๊ณ ์ ํ๊ณ assistant ์๋ต๋ง
Acknowledged๋ก ์นํํด ์ฌ์์ฑ replay- ์ ์ฒด ์นํ(neutralization)๊ณผ ํ turn์ฉ ์นํ(Turn Surgery)์ ๋ํด ์คํ
- ๋ฐ๊ฒฌ: ์๊ธฐ history๋ฅผ ์ง์ฐ๋ฉด ์ ์๊ฐ ์ฝ 7%p ์ค๋ฅด๊ณ ๊ธธ์ด๋ฅผ ๋ง์ถฐ๋ ๋์ผ โ ๊ธธ์ด๊ฐ ์๋๋ผ ๋ด์ฉ์ด ์์ธ
- ๋ฌด๋์ง ๋ํ์ 63.7%์๋ โ์ง์ฐ๋ฉด ์ข์์ง๋ turnโ์ด ์ต์ ํ๋ ์๋๋ผ
- ํ์ง๋ง turn ํ๋ํ๋๋ก ๋ณด๋ฉด ์ ๋ฐ ์ด์์ ์ง์๋ ์์ง์๋ ๊ฒฐ๊ณผ๊ฐ ๊ทธ๋๋ก โ ๋ฌธ์ turn์ ๋ํ๋ง๋ค ์ผ๋ถ์๋ง ์์ฌ ์์
- ๋ฌธ์ turn์ด ์ต๊ทผ turn์ ๋ชฐ๋ ค ์์ง๋ ์์์, โ์ต๊ทผ ๋ช turn๋ง ๋จ๊ธฐ๊ธฐโ ๊ฐ์ ๋จ์ ๊ท์น์ผ๋ก๋ ๊ณ ๋ฅผ ์ ์์.
- ๋ฌด๋์ง ๋ํ์ 63.7%์๋ โ์ง์ฐ๋ฉด ์ข์์ง๋ turnโ์ด ์ต์ ํ๋ ์๋๋ผ

Background
- multi-turn ํ๊ฐ์ ํ์ฅ: single-turn prompt์์ interactive setting์ผ๋ก ์ด๋
- MT-Bench (Zheng et al., 2023), MINT (Wang et al., 2024), MT-Eval, MT-Bench-101, MultiChallenge
- underspecified interaction ์ฐ๊ตฌ: user ์๋๊ฐ ๋ถ์์ ํ๋ฉด ๋ชจ๋ธ์ด ๋๋ฌด ์ผ์ฐ ๋ตํ๊ฑฐ๋ ๊ทผ๊ฑฐ ์๋ ๊ฐ์ ์ ํจ
- sharded simulation (Laban et al., 2026) ๊ธฐ๋ฐ ๋
ผ์
- ๊ฐ์ task๋ฅผ ํ ๋ฒ์ ๋ค ์ฃผ๋ FULL vs ์กฐ๊ฐ(shard)์ผ๋ก ๋๋ ์ฌ๋ฌ turn์ ๊ฑธ์ณ ์ฃผ๋ SHARDED๋ฅผ ๋น๊ต
- SHARDED์์ ํฐ ์ฑ๋ฅ ํ๋ฝ๊ณผ ํจ๊ป premature answer, unsupported assumption, reliance on previous responses ๊ฐ์ ํ๋ ์คํจ๊ฐ ๊ด์ฐฐ๋จ
- ํ๊ณ: ์ด ์คํจ์ ๋ชจ๋ธ ์์ ์ ์ด์ ์๋ต์ด ๊ธฐ์ฌํ๋์ง๋ ๋ถ๋ฆฌํ์ง ๋ชปํจ
- ์ํ ์ฐ๊ตฌ: curriculum RL, entropy-guided context resetting (ERGO), explicit intent mediation (Liu et al., 2026)
- history-cleaned self-distillation (MAIGO, Zheng et al., 2026), canonical-context distillation (Lin et al., 2026), conversational inertia ์ํ (Wan et al., 2026)
- ํ๊ณ: ๋๋ถ๋ถ history ์ ์ฒด๋ฅผ omit/transformํ๊ฑฐ๋ training policy ์์ค์์ ์๋, turn ๋จ์ ์ง๋จ์ด ์์
- assistant history ์์ฒด๋ฅผ ๋ค๋ฃฌ ์ฐ๊ตฌ: Do LLMs Benefit From Their Own Words? (Huang et al., 2026)
- ์ด์ assistant ์๋ต์ ์๋ต/์์ฝํ๋ ์ค์ ๊ณผ ๋น๊ตํด assistant history๊ฐ ๋ถํ์ํ๊ฑฐ๋ ํด๋ก์ธ ์ ์๋๋ผ
- sharded GSM8K์์ length control๊น์ง ์ํ
- ํ๊ณ: ์ญ์ whole-history ๋จ์, task์ model์ ๋ฐ๋ฅธ ์ฐจ์ด์ ๊ฐ๋ณ turn์ ์ํฅ์ ํ์ธ ํ์ํ ๊ฒ
- ์ด์ assistant ์๋ต์ ์๋ต/์์ฝํ๋ ์ค์ ๊ณผ ๋น๊ตํด assistant history๊ฐ ๋ถํ์ํ๊ฑฐ๋ ํด๋ก์ธ ์ ์๋๋ผ
- context/memory ์ฐ๊ตฌ: ๋ ๋ง์ด ๋ณด์กดํ๋ค๊ณ ๋ ์ ์ฐ๋ ๊ฒ ์๋
- Lost in the Middle (Liu et al., 2024), MemGPT (Packer et al., 2023), LongMemEval (Wu et al., 2024), LoCoMo (Maharana et al., 2024)
- agentic system์์๋ plan, reflection, tool ํด์ ๋ฑ model-generated ๋ด์ฉ์ด context์ ์๋น ๋ถ๋ถ์ ์ฐจ์ง
- trajectory ๋จ์ ์คํจ ์ง๋จ๊ณผ intervention ๊ธฐ๋ฐ attribution
- ๊ด์ฐฐ ๊ธฐ๋ฐ: MAST (Cemri et al., 2025), TRAIL (Deshpande et al., 2025), AgentDebug (Zhu et al., 2025)
- intervention ๊ธฐ๋ฐ: DoVer, CausalFlow (Bonagiri et al., 2026), Causal Agent Replay (Shah, 2026)
- ํ๊ณ: ์ด์ง์ ์ธ agent execution trace๊ฐ ๋์์ผ๋ก ํ์ฌ ์ผ๋ฐ multi-turn ๋ํ์ assistant turn์ ๋ค๋ฃจ์ง๋ ์์.
- TL; DR: degradation ํ์์ ์กด์ฌํ๋ ์ฌ์ค์ด๊ณ , history๋ฅผ ์ค์ด๋ฉด ๋์์ง๋ค๋ ์ฆ๊ฑฐ๋ ์์ง๋ง, ๋ชจ๋ธ์ด ์ด ์ด๋ค turn์ด ์ผ๋ง๋, ์ด๋ ๋ฐฉํฅ์ผ๋ก ์ดํ๋ฅผ ๋ฐ๊พธ๋์ง๋ turn ๋จ์๋ก ์ธก์ ๋ ์ ์ด ์์
Problem States
multi-turn degradation์ ๋ชจ๋ธ ์์ ์ด ์ด history์ ์ธ๊ณผ ํจ๊ณผ๋ก ๋ถํดํ๋ ค๋ฉด ํ์ํ ์กฐ๊ฑด
- degradation์ด ๋ชจ๋ธ ๊ณ ์ ํ ๋ฌธ์ ์ผ์ง, task์ model ์กฐํฉ์ ๋ฐ๋ผ ๊ตฌ์กฐ์ ์ผ๋ก ๋ฌ๋ผ์ง๋์ง? ๋จผ์ ํ์ธ โ RQ1: degradation landscape
- ์๊ธฐ history๋ฅผ ๋ฐ๊พธ๋ฉด ๊ฒฐ๊ณผ๊ฐ ๋ฐ๋๋์ง, ๊ทธ๋ฆฌ๊ณ ๊ทธ๊ฒ ๋จ์ํ context๊ฐ ์งง์์ง ํจ๊ณผ๋ ์๋์ง? โ RQ2: neutralization + length control
- ์ด๋ turn์ด ๊ฒฐ๊ณผ๋ฅผ ๋ฐ๊พธ๋์ง๋ฅผ ํ turn์ฉ ๋ถ๋ฆฌํด์ ํ์ธ โ RQ3: Turn Surgery
- ๊ฒฐ๊ณผ๋ฅผ ๋ฐ๊พผ ๊ฐ์ ์ด ๋ชจ๋ธ ๋ด๋ถ ์ํ์์๋ ๊ตฌ๋ถ๋ ์ ์์์ง โ RQ4: open-weight internal analysis
Suggestions
Definition
- SHARDED trajectory๋ฅผ user ๋ฉ์์ง $U_t$์ assistant ๋ฉ์์ง $A_t$์ ๊ต๋ sequence๋ก ์ ์
- self-generated assistant history: ๋ชจ๋ธ์ด ์์ฑํด์ ์ดํ turn์ ์
๋ ฅ์ผ๋ก ๋์ ๋๋ $A_1, \dots, A_{T-1}$
- $A_t$๊ฐ ๋จ์ ๊ธฐ๋ก(transcript)์ธ์ง, ์ดํ ๊ณ์ฐ์ ์ค์ ๋ก ๊ด์ฌํ๋ ์ ๋ ฅ์ธ์ง
- ํ๊ฐ ์ ์ $S^c_i$: ์ฌ๋ก $i$๋ฅผ ์กฐ๊ฑด $c$์์ ๋๋ ธ์ ๋ ์ต์ข
assistant ์ถ๋ ฅ์ ๋ํ task๋ณ ์ ๊ทํ ์ ์
- degradation = $S^{\text{FULL}} - S^{\text{SHARDED}}$
- retrospective replay: ์ด๋ฏธ ๋๋ ๋ํ์์ user ๋ฉ์์ง๋ฅผ ๊ธฐ๋ก๋ ๊ทธ๋๋ก ๋ค์ ๋ฃ๊ณ , assistant history๋ง ๋ฐ๊ฟ ๋ชจ๋ธ์ด ์ด์ด์ ์์ฑํ๊ฒ ํจ
- user simulator๋ฅผ ๋ค์ ๋๋ฆฌ์ง ์์ผ๋ฏ๋ก, assistant ์๋ต์ด ๋ฐ๋์์ ๋ user๊ฐ ๋ค๋ฅด๊ฒ ๋ฐ์ํ์ ๊ฐ๋ฅ์ฑ์ ๋ฐฐ์ ๋จ
- ๋ฐ๋ผ์ ์ฌ๊ธฐ์ ๋งํ๋ causal effect๋ โ๊ธฐ๋ก๋ user ๋ฉ์์ง๋ฅผ ์กฐ๊ฑด์ผ๋ก ํโ intervention ํจ๊ณผ
Neutralization (RQ2)
- short neutralization: ๋ง์ง๋ง์ ์ ์ธํ ๋ชจ๋ assistant ์๋ต์ ๊ณ ์ placeholder $N$ =
Acknowledged๋ก ์นํ- turn ๊ตฌ์กฐ(๋๊ฐ ์ธ์ ๋งํ๋์ง)๋ ์ ์งํ๋ task ๋ด์ฉ์ ์ ๊ฑฐ
- ๊ฐ์ ๋ชจ๋ธ์ด ๋ง์ง๋ง ์๋ต๋ง ๋ค์ ์์ฑํ๊ณ , ์๋ evaluator๋ก ์ฑ์
- history-intervention effect: $S^{\text{SHORT}}_i - S^{\text{SHARDED}}_i$
- length-matched neutralization: ์งง์์ ธ์ ์ข์์ง ๊ฒ๋ฟ์ผ ์ ์๋ค๋ ๋์ ์ค๋ช
์ ๋ฐฐ์ ํ๊ธฐ ์ํ ํต์
- ์๋ ์๋ต์ ๊ธธ์ด๋งํผ $N$์ ๋ฐ๋ณตํด์ filling
- ๊ธธ์ด๋ ์ ๊ท์
\S+๋ก ์กํ๋ ๋น๊ณต๋ฐฑ span ์๋ก ์ธก์ (๋ชจ๋ธ๋ณ tokenizer๊ฐ ์๋ ๊ณตํต estimator) - ๊ฒฐ๊ณผ ๋ณด๊ธฐ ์ ์ model ร task cell๋น 10๊ฐ์ฉ, ์ด 300๊ฐ ํ๋ณด๋ฅผ ๋ฏธ๋ฆฌ ์ง์ (prespecified)
Turn Surgery (RQ3)
- ๋ชฉํ turn $A_{i,t}$ ํ๋๋ง $N$์ผ๋ก ์นํ, ๊ทธ ์ด์ history๋ ๊ทธ๋๋ก ๋
- ์ดํ ๊ธฐ๋ก๋ user ๋ฉ์์ง๋ฅผ replayํ๊ณ , ๊ทธ ์ฌ์ด assistant ์๋ต์ ๊ฐ์ ๋ชจ๋ธ์ด autoregressiveํ๊ฒ ๋ค์ ์์ฑ
- ์ฆ ์นํ ์ง์ ์ดํ์ assistant turn์ ์๋ณธ์ด ์๋ ์๋ก ์์ฑ๋ ์๋ต์ผ๋ก ์ด์ด์ง
- branch ๋จ์ ํจ๊ณผ: trajectory $i$์ $j$๋ฒ์งธ branch(= $j$๋ฒ์งธ turn์ ์์ ํ ๋ฒ์ )์ ์ ์ ์ฐจ
- positive($\Delta_{ij} > 0$): ๊ทธ turn์ ์ง์ฐ๋ ์ข์์ง, ์ฆ ์๋ turn์ด ํด๋ก์ ์
- negative($\Delta_{ij} < 0$): ์ง์ฐ๋ ๋๋น ์ง, ์ฆ ์๋ turn์ด ๋์์ด ๋์
- no-change($\Delta_{ij} = 0$); ์ฐ์ ์ ์ task์๋ $\epsilon = .01$ ํ์ฉ ์ค์ฐจ๋ก robustness ํ์ธ
- trajectory-equal estimand: trajectory๋ง๋ค ์์ ๊ฐ๋ฅํ turn ์ $k_i$๊ฐ ๋ฌ๋ผ์, ๊ธด ๋ํ๊ฐ ํ๊ท ์ ์ง๋ฐฐํ์ง ์๋๋ก ๋จผ์ trajectory ๋ด๋ถ ํ๊ท ์ ๋ธ ๋ค trajectory๋ผ๋ฆฌ ๋์ผ ๊ฐ์ค์ผ๋ก ํ๊ท
- robustness check๋ก ๋ชจ๋ branch๋ฅผ ๋์ผ ๊ฐ์คํ๋ branch-weighted mean๋ ๋ณด๊ณ
- ์ถ๊ฐ ์งํ
- trajectory reach: positive branch๊ฐ ํ๋๋ผ๋ ์๋ trajectory ๋น์จ
- fail-to-success reversal: binary task์์ SHARDED 0์ ์ด ์์ ํ 1์ ์ด ๋ branch๊ฐ ์๋ trajectory ๋น์จ
- relative position: ์์ ํ turn์ ์ ๊ทํ ์์น (0 = ๊ฐ์ฅ ์ด๋ฅธ ์ค๊ฐ turn, 1 = ๊ฐ์ฅ ๋ฆ์ ์ค๊ฐ turn)
- distance-to-final: ์์ ํ turn๊ณผ ๋ง์ง๋ง user ์์ฒญ ์ฌ์ด์ user turn ์
- ๋ถ์ ๋์์ degradation์ด ๋๋ ทํ trajectory๋ก ํ์
- binary task(Actions, Code, Database, Math): $S^{\text{FULL}} = 1$์ด๊ณ $S^{\text{SHARDED}} = 0$
- ์ฐ์ ์ ์ task(Data-to-Text, Summary): $S^{\text{FULL}} - S^{\text{SHARDED}} \ge 0.10$
- repeatability: ์ ํ๋ ๊ณ ํจ๊ณผ ๊ฐ์
์ temperature 0์ผ๋ก ๋ ๋ฒ ๋ ๋๋ ค ๊ฒฐ๊ณผ class๊ฐ ์ ์ง๋๋์ง ํ์ธ
- 60๊ฐ trajectory์์ ์ฒซ run ํจ๊ณผ๊ฐ ๊ฐ์ฅ ํฐ ๊ฐ์ ํ๋์ฉ๋ง ๋์
Open-weight internal analysis (RQ4)
- Qwen3-14B, ๋ก์ปฌ์์ exact evaluation์ด ๊ฐ๋ฅํ Actions, Code, Data-to-Text(D2T)๋ง ๋์
- probe ์ ์๋ 24๊ฐ trajectory์ discovery set์์ ๊ณ ์
- ๋ณธ ์ถ์ ์ ๊ฒน์น์ง ์๋ held-out 118 trajectory, 603 branch (positive์ no-change branch๋ฅผ ๋ชจ๋ ๊ฐ์ง mixed trajectory 46๊ฐ ํฌํจ)
- D2T๋ ๋ณ๋ prospective ์ง๋จ์ผ๋ก ์ฌํ๋ง ํ์ธ (held-out๊ณผ ํฉ์น์ง ์์)
- state propagation: turn surgery๊ฐ ๋ชจ๋ธ ๋ด๋ถ ์ํ๋ฅผ ์ผ๋ง๋ ๋ฐ๊พธ๋๊ฐ
- downstream user anchor: ์์ ์ดํ replay๋๋ ๊ฐ user ๋ฉ์์ง์ ๋ง์ง๋ง content token ์์น
- ๊ฐ decoder layer์ residual stream(transformer block ์ฌ์ด๋ฅผ ํ๋ฅด๋ ํํ)์ anchor์์ ์ถ์ถ
- divergence๋ ์๋ณธ context์ ์์ context์ ํํ ์ฌ์ด 1 โ cosine similarity
- ๋ง์ง๋ง anchor์์์ ๊ฐ(final)๊ณผ, ๋ชจ๋ downstream anchor์ ๊ฑธ์น ์ ๊ทํ ์ฌ๋ค๋ฆฌ๊ผด ๋ฉด์ (propagation AUC)์ผ๋ก ์์ฝ
- state restoration: ๋ง์ง๋ง anchor์์ ์์ ๋ residual vector๋ฅผ ์๋ณธ history์ vector๋ก ํ ๋ฒ ๋ฎ์ด์ฐ๊ณ (prefill ์) greedy decoding
- ์์ ๋ก ์ป์ ์ด๋์ด ์ผ๋ง๋ ๋๋์๊ฐ๋์ง๋ก, ๋ด๋ถ ์ํ์ ํ๋ ์ฌ์ด ๋ฐฉํฅ์ฑ์ ํ์ธ
- mediation ๊ฒ์ฆ์ด ์๋๋ผ ๋ฒ์๊ฐ ์ ํ๋ causal intervention์ผ๋ก ์ทจ๊ธ
- ๋ณด์กฐ probe
- static target-turn attention: ์์ ๋์ turn์ ๊ฐ๋ attention ์
- history attention redistribution: ์ด์ assistant history ์ ์ฒด์ ๊ฐ๋ attention์ด ์๋ณธ ๋๋น ์ผ๋ง๋ ์ฌ๋ถ๋ฐฐ๋๋์ง
- attention knockout: ๋์ turn์ ์ต์ข ์์ฑ token์์๋ง ๊ฐ๋ฆผ(direct-only) vs ๋ชจ๋ downstream ์์น์์ ๊ฐ๋ฆผ(full-downstream); ๋ ํจ๊ณผ ์ฐจ์ด๊ฐ propagation advantage
- continuation margin: ์ฑ๊ณต continuation๊ณผ ์คํจ continuation์ ๊ธธ์ด ์ ๊ทํ teacher-forced log-likelihood ์ฐจ์ด, ์๋ณธ vs ์์ context์์์ ๋ณํ
Effects
- Experimental setup
- benchmark: sharded simulation (Laban et al., 2026)์ 627๊ฐ fully specified instruction, 6๊ฐ task family
- Actions (105, BFCL-V3 Parallel): function-call correctness
- Code (100, HumanEval): test ๊ธฐ๋ฐ pass@1
- Data-to-Text (120, ToTTo): SacreBLEU/100
- Database (107, Spider): SQL execution match
- Math (103, GSM8K): normalized exact match
- Summary (92, Summary of a Haystack): coverage + citation score
- user: ์๋ SHARDED ์์ฑ ๋๋ user simulator๊ฐ ๋ค์ shard๋ฅผ ๊ณจ๋ผ rephrase; replay ์คํ์์๋ ๊ธฐ๋ก๋ user ๋ฉ์์ง๋ฅผ ๊ทธ๋๋ก ์ฌ์ฌ์ฉ
- assistant: GPT-5.6 Luna, Grok 4.5, GPT-4o, DeepSeek V3.2, Qwen3-14B
- temperature 0, max output 1,000 token
- Qwen3-14B๋ RQ4 ๋ด๋ถ ๋ถ์ ๋ชจ๋ธ์ ๊ฒธํจ
- evaluation
- 3,135 instructionโmodel pair ์ค FULL๊ณผ SHARDED ์ ์๊ฐ ๋ชจ๋ ์ ํจํ 2,989์์ด RQ1 ๋์
- ๋ถ์์ ํ ์์ฒญ์ ์คํจ๋ก ๋ฐ๊พธ์ง ์๊ณ missing์ผ๋ก ์ ์ง
- model ์์ค ์์ฝ์ task ํ๊ท ์ ๋์ผ ๊ฐ์ค macro-average; 10,000ํ paired percentile bootstrap์ผ๋ก 95% CI
- benchmark: sharded simulation (Laban et al., 2026)์ 627๊ฐ fully specified instruction, 6๊ฐ task family
- Results
Fig 3RQ1: ๋ชจ๋ ๋ชจ๋ธ์ด 14~22%p ๋ฌด๋์ง์ง๋ง, ์ผ๋ง๋ ๋ฌด๋์ง๋์ง๋ task์ model์ ๋ฐ๋ผ ๋ค ๋ค๋ฅด๋๋ผ- ํ ๋ฒ์ ์คฌ์ ๋ ์ํ๋ ๋ชจ๋ธ์ด ๋๋ ์คฌ์ ๋ ๋ ๋ฌด๋์ง๋ ๊ฑด ์๋๊ณ (FULL 1์ Grok โ ํ๋ฝ ์ต์ Luna)
- ์ฃ๋ถ๋ฅธ ๊ฐ์ ์ด ๋ฐ๋ก ์ค๋ต์ด ๋๋ Actions, Database ๋๋ฉ์ธ์์๋ 20~44%p๋ก ํฌ๊ฒ ํ๋ฝ
- Summary๋ 10%p ๋ด์ธ๋ก ๊ฑฐ์ ๊ทธ๋๋ก
- RQ2: ์๊ธฐresponse๋ฅผ ์ง์ฐ๋ฉด ๊ฒฐ๊ณผ๊ฐ ๋ฐ๋
- ์ ์ฒด ํ๊ท ์ผ๋ก๋ +2.7%p๋ก ์กฐ๊ธ ์ค๋ฅด์ง๋ง, ์ฌ์ค์ ์ค๋ฅด๋ ์ชฝ๊ณผ ๋จ์ด์ง๋ ์ชฝ์ด ์์๋ ๊ฒฐ๊ณผ
- Actions๋ +22%p๋ก ํฌ๊ฒ ์ค๋ฅด๊ณ Code๋ โ13%p๋ก ํฌ๊ฒ ๋จ์ด์ง
- ๋ชจ๋ธ ์ค์์๋ DeepSeek๋ง ๋ฐ๋๋ก โ15%p
- ์ ์ฒด ํ๊ท ์ผ๋ก๋ +2.7%p๋ก ์กฐ๊ธ ์ค๋ฅด์ง๋ง, ์ฌ์ค์ ์ค๋ฅด๋ ์ชฝ๊ณผ ๋จ์ด์ง๋ ์ชฝ์ด ์์๋ ๊ฒฐ๊ณผ
Fig 4A๊ธธ์ด๋ฅผ ๋ง์ถฐ ์ง์๋ ํจ๊ณผ๊ฐ ๊ฐ์(+6.9%p vs +6.8%p) โ ์งง์์ ธ์๊ฐ ์๋๋ผ response์ ๋ด์ฉ ๋๋ฌธFig 4B๋๊ฐ์ด ๋์นํ๋๋ผ๋, ์ด๋ค ๋ํ๋ ๊ฐ์ ๋๊ณ ์ด๋ค ๋ํ๋ ํ๋ฝํ๋๋ผ- ์๋ ํ๋ฆฐ ๋ํ๋ ์ ๋ฐ(51%)์ด ์ด์๋์ง๋ง,
- ์๋ ๋ง๋ ๋ํ์ 15%๋ ์คํ๋ ค ํ๋ฆผ
- โ history๋ฅผ ํต์งธ๋ก ์ง์ฐ๋ ๊ฑด ๋ต์ด ์๋, RQ3๋ก ์ฐ๊ฒฐ
Fig 5RQ3: ๋ฌธ์ turn์ ๋๊ฒ ํผ์ ธ ์์ง๋ง ๊ณจ๋ผ์ผ ๋จ- ๋ฌด๋์ง ๋ํ์ 64%์ โ์ง์ฐ๋ฉด ์ข์์ง๋ turnโ์ด ์๊ณ ,
- ๊ทธ๋ฐ turn์ด ์ฌ๋ฌ ๊ฐ์ธ ๊ฒฝ์ฐ๊ฐ ๋ ๋ง์
- 48%๋ turn ํ๋๋ง ์ง์๋ ์ค๋ต์ด ์ ๋ต์ผ๋ก ๋ฐ๋
- ํ์ง๋ง turn ํ๋ํ๋๋ก ๋ณด๋ฉด 58%๋ ๋ฃ๋ ๋นผ๋ ์ํฅ์ด ์์ผ๋ฉฐ,
- 32%๋ ํด๋กญ๊ณ ,
- 11%๋ ์คํ๋ ค ๋์
- ์ต๊ทผ turn์ด๋ผ์ ํด๋ก์ด ๊ฒ๋ ์๋๋๋ผ
- ๊ฐ์ ์คํ์ ๋ค์ ๋๋ฆฌ๋ฉด ์ฝ 30%๋ ๊ฒฐ๊ณผ๊ฐ ๋ฐ๋
- temperature 0์ธ๋ฐ๋!
- ๋ฌด๋์ง ๋ํ์ 64%์ โ์ง์ฐ๋ฉด ์ข์์ง๋ turnโ์ด ์๊ณ ,
Fig 6RQ4: ๋ชจ๋ธ ๋ด๋ถ์๋ ํ์ ์ ์์ง๋ง ์ฝํ๊ณ task๋ง๋ค๋ ๋ค๋ฆ- ๊ฒฐ๊ณผ๋ฅผ ๋ฐ๊พผ turn์ด ๋ด๋ถ ์ํ๋ ๋ ํ๋ค์ง๋ง, ์ฐจ์ด๋ ์์ฃผ ์์
- ๋ด๋ถ ์ํ๋ฅผ ๋๋๋ฆฌ๋ฉด ํจ๊ณผ๋ ์ฌ๋ผ์ง๋์ง๋ D2T์์๋ง ์ฝํ๊ฒ ํ์ธ
- ๋ชจ๋ task์์ ํตํ๋ ๋ด๋ถ ์ ํธ๋ ์๋ค๋ ๊ฒฐ๋ก (probe๋ง๋ค ๊ฒฐ๊ณผ๊ฐ ์ ๊ฐ๊ฐ)
Personal note. ํ๋ฉด์ ์ผ๋ก๋
Acknowledged๋ผ๋ placeholder๊ฐ ์ ๋ง โ์ค๋ฆฝโ์ธ์ง๋ ๊ฑธ๋ฆฌ๊ธด ํ๋๋ฐ ์๋ฌดํผ ์ฌ์ด ๋ฐฉ์์ผ๋ก model response๋ฅผ ๊ฐ๋ฆด ์๋ ์์์ด์ ํฌ๊ฒ ๋ง์์ ๊ฑธ๋ฆฌ์ง๋ ์์ต๋๋ค. ์๋ฌด๋๋ ์ง์ญํ๋ฉด โ์๊ฒ ๋ค, ๊ณ์ ์งํํ๋คโ๋ ์๋ฝ ์ ํธ๋ก๋ ์ฝํ๊ธด ํ๋๊น..neutralization ํจ๊ณผ์ ์๋น ๋ถ๋ถ์ ๋ชจ๋ธ์ด ๋๋ฌด ์ผ์ฐ ๋ด๋์ ๋ต(premature answer)์ anchoring๋๋ ๊ฑธ ๋์ด์ค ํจ๊ณผ๊ฐ ์๋๊น ์ถ๊ธฐ๋ ํฉ๋๋ค. Actions๊ฐ ํฌ๊ฒ ์ค๋ฅด๊ณ Code๊ฐ ๋จ์ด์ง๋ ๊ฒ๋, ๋์ ๋๋ ์ฐ์ถ๋ฌผ(code)๊ณผ ์ฃ๋ถ๋ฅธ ๊ฐ์ (function call)์ด history ์์์ ๋ค๋ฅด๊ฒ ์๋ํ๋ค๊ณ ๋ณด๋ฉด ์ค๋ช ์ ๋๋ค๊ณ ๋๋ผ๊ณ
์๋ณธ ๊ทธ๋๋ก replayํ์ ๋ ๊ฒฐ๊ณผ๊ฐ ์ผ๋ง๋ ๋ค์งํ๋์ง(null surgery)๋ ๋ณด๊ณ ๋์ง ์์์ branch๊ฐ ์ฌ๋ฌ ๊ฐ์ธ trajectory์ โํ๋๋ผ๋ positiveโ ๋น์จ์ temperature 0์์์ run ๋ณ๋(71.7% ์ผ๊ด์ฑ)๋ง์ผ๋ก๋ ์ด๋ ์ ๋ ๋ถํ๋ ค์ก์ ๊ฐ๋ฅ์ฑ๋ ๋ฐฐ์ ํ๊ธด ์ด๋ ต๊ฒ ์ต๋๋ค.
๊ทธ๋๋ ๊ฐ์ธํ ์ชฝ์์ ๋ณด๋ฉด, agent๊ฐ ์ง๋ ์ธ์ ์ ์ค์ค๋ก ์ฑ์ ๋ฃ์ argument๊ฐ ๋ค์ ์ธ์ ์์ user ์ ํธ์ โ์ฆ๊ฑฐโ๋ก ๋๋จน์๋๋ ๊ตฌ์กฐ์ ์ ํํ ๊ฐ์ ์ง๋ฌธ์ด๋ผ
(๋น๋ก ์ ๊ฐ ํ๊ณ ์ ํ๋ ์ฐ๊ตฌ์ ์ ์ฌํด์ ๋ฐฉํฅ์ ์ ์์ด์ผ ํ์์ง๋ผ๋)๊ฝค ํฅ๋ฏธ๋กญ๊ฒ ์ฝ์์ต๋๋ค.