CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty
- Authors: Johannes Kirmayr, Lukas Stappen, Elisabeth Andrรฉ
- Affiliation: BMW Group Research and Technology; Augsburg University
- Paper: https://arxiv.org/abs/2601.22027
- Code: https://github.com/CAR-bench/car-bench
- Published: January 29, 2026 (arXiv preprint); ACL 2026 Main (Long Papers), Outstanding Paper Award
TL; DR
in-car assistant ๋๋ฉ์ธ์ 58๊ฐ tool๊ณผ 19๊ฐ domain policy๋ฅผ ๊ฐ์ถ ์๋ฎฌ๋ ์ด์
ํ๊ฒฝ์ ์ํ ๋ถ๊ฐํ ์์ฒญ(Hallucination)๊ณผ ๋ชจํธํ ์์ฒญ(Disambiguation)์ด๋ผ๋ ๋ task type๊ณผ ์ผ๊ด์ฑ ์งํ Pass^3 ๋์
. frontier LLM๋ user request ์์๋ฅผ ์ํด policy๋ฅผ ์ด๊ธฐ๊ฑฐ๋ ์ ๋ณด๋ฅผ ์ง์ด๋.
Review Video

Background
- LLM agent ๋ฒค์น๋งํฌ๋ idealized setting์์์ task completion์ ์ธก์ ํจ
- tool-use ๋ฒค์น๋งํฌ(MetaTool, StableToolBench)๋ ๋ํ ์์ด API-calling ๋ฅ๋ ฅ๋ง ๋ถ๋ฆฌ ํ๊ฐ
- TravelPlanner, ToolLLM์ ์์ ํ task ์ ๋ณด๊ฐ ์ ํ ์ ๊ณต๋๋ single-turn ํ๊ฐ
- BFCLv3, ToolTalk์ pre-collected off-policy trajectory โ ๋ชจ๋ธ์ด ์ด์์ ์ธ history ์์์๋ง ํ๊ฐ
- ฯ-bench๊ฐ simulated user + API tool + policy ์ ์ฝ์ ๊ฒฐํฉํด ์ฒซ dynamic policy-guided ๋ฒค์น๋งํฌ๋ฅผ ์ ์
- (1) ์ธ๊ฐโAPI์์ ๋์ ์ํธ์์ฉ (2) domain policy ์ค์ (3) ๋ฐ๋ณต ์ํ ๊ฐ ์ผ๊ด์ฑ(Pass^k)์ด๋ผ๋ ์ธ ์๊ตฌ์กฐ๊ฑด ์ ๋ฆฝ
- ToolSandbox๋ ์ด๋ฅผ state-dependent tool interaction์ผ๋ก ํ์ฅ
- tau^2-bench๋ retail/airline/telecom ๋๋ฉ์ธ์ dual-control ํ๊ฒฝ์ผ๋ก ํ์ฅ
- hallucination ์ฐ๊ตฌ๋ LLM์ด ๋ถํ์ค์ฑ์ ์ธ์ ํ๊ธฐ๋ณด๋ค ๊ทธ๋ด๋ฏํ ์์ฑ์ ์์ฑํ๋๋ก ๋ณด์๋ฐ๋ ๊ตฌ์กฐ์ ์์ธ์ ์ง์ (Kalai et al., 2025)
- ToolSandbox์ BFCLv3๊ฐ missing function ์๋๋ฆฌ์ค๋ฅผ ์ผ๋ถ ๋ค๋ฃจ์ง๋ง, missing parameter๋ ๋ถ์์ ํ tool result ๊ฐ์ ๋ ๋์ ์คํจ ๋ชจ๋๋ ๋ณด์ง ์์์.
- ๋ชจํธํ ์ง์์ ํด์๋ ์ด๋ค ํ๋/์ง๋ฌธ์ด information gain์ ์ต๋ํํ๋์ง ํ๋จํ๋ meta-cognitive reasoning์ ์๊ตฌ (Kobalczyk et al., ICLR 2025)
- car domain์ policy ์ค์์ hallucination ํํผ๊ฐ safety-criticalํ ํ๊ฒฝ: ์ด์ ์ ์ฃผ์๋ถ์ฐ ์ ์ฝ(Strayer et al., 2016) ํ์์ ๋น์ ๋ฌธ๊ฐ์ธ user์ ์์ฑ ์์ฒญ ๋ชจํธ์ฑ๊ณผ heterogenous ์ฐจ๋ API๋ฅผ ๋ค๋ค์ผ ํจ
Problem States
๊ธฐ์กด ๋ฒค์น๋งํฌ๋ ์์ฒญ์ด ํญ์ ์ํ ๊ฐ๋ฅํ๊ณ ์ถฉ๋ถํ ๋ช ์ธ๋์ด ์์ผ๋ฉฐ ํ ๋ฒ์ ์ฑ๊ณต์ด ๋ฅ๋ ฅ์ ์ ์ฆํ๋ค๊ณ ๊ฐ์ ; ์ค์ ๋ฐฐํฌ ์กฐ๊ฑด์ ๋ฐ์ํ๋ ค๋ฉด ์ธ ์กฐ๊ฑด์ด ์ถ๊ฐ๋ก ์ถฉ์กฑ๋ผ์ผ ํจ
- ์กฐ๊ฑด 1 ) ์ํ ๋ถ๊ฐ๋ฅํ ์์ฒญ์์์ limit-awareness ํ๊ฐ: ํ์ํ tool์ด ์๊ฑฐ๋, parameter granularity๊ฐ ๋ถ์กฑํ๊ฑฐ๋, ํ๊ฒฝ query๊ฐ ๋ถ์์ ํ ๋ฐ์ดํฐ๋ฅผ ๋ฐํํ๋ ๊ฒฝ์ฐ๊ฐ ์ค์ ๋ก ๋น๋ฒํจ
- agent๊ฐ โํ ์ ์๋คโ๋ฅผ ์ธ์ ํ๋์ง, ์๋๋ฉด ์ง์ด๋ด๋์ง๋ฅผ ์ง์ ์ธก์ ํด์ผ ํจ โ Hallucination task
- ์กฐ๊ฑด 2 ) ๋ชจํธํ ์์ฒญ์์์ uncertainty resolution ํ๊ฐ: underspecified ์์ฒญ๊ณผ ๋ถ์์ ํ ๊ด์ธก์์ (1) ๋ชจํธ์ฑ์ ์กด์ฌ๋ฅผ ๊ฐ์งํ๊ณ (2) ์ด๋ฅผ ํด์ํ ๊ฐ์ฅ ์ ๋ณด๋ ๋์ ํ๋์ ์ ํํ๋ 2๋จ๊ณ meta-reasoning์ด ํ์ํจ
- ์ฑ๊ธํ ์คํ๊ณผ ๋ถํ์ํ ์ฌ์ฉ์ ์ง๋ฌธ ๋ชจ๋ ์คํจ๋ก ์ ์๋ผ์ผ ํจ โ Disambiguation task
- ์กฐ๊ฑด 3 ) ์ผํ์ฑ ์ฑ๊ณต์ด ์๋ ์ผ๊ด๋ ์ฌํ์ ํ๊ฐ: safety-critical ๋๋ฉ์ธ์์๋ ์ ์ฌ ๋ฅ๋ ฅ(ํ ๋ฒ์ด๋ผ๋ ์ฑ๊ณต)๊ณผ ์ ๋ขฐ ๊ฐ๋ฅํ ๋ฐฐํฌ ์ฑ๋ฅ(๋งค๋ฒ ์ฑ๊ณต)์ ๊ตฌ๋ถํด์ผ ํจ โ Pass^k / Pass@k ๋์ ๋ณด๊ณ
Suggestions
Benchmark Components Fig 1
- user์ agent๋ ํ
์คํธ ๋ฉ์์ง๋ก๋ง ์ํธ์์ฉ
- user๋ tool call๊ณผ ํ๊ฒฝ ๋ฐ์ดํฐ๋ฅผ ๋ณผ ์ ์๊ณ agent๋ control word*๋ฅผ ๋ณผ ์ ์์
- control word*๊ฐ ๊ฐ๋ณ ๊ธธ์ด ์ํธ์์ฉ์ ๋์ ์ข ๋ฃ์ ์๋ ์ ๋ต ํ์ ์ ๋์์ ๋ด๋น
-
- control world: โcontinueโ, โstopโ, โout of scopeโ(tau-bench์์ ๊ธฐ์ธ) + โllm acknowledges limitationโ, โhallucination errorโ, โdisambiguation errorโ
- LLM-simulated user
- persona:
- ์ฐ๋ น: 18-65
- ๋ํ ์คํ์ผ: commanding/conversational/questioning
- ๊ธฐ์ ์๋ จ๋
- task instruction: ๋ชฉํ, ์ ๋ณด ๊ณต๊ฐ ์์, ๋ฐ์ ๊ท์น, ์๋ฃ ๊ธฐ์ค
- ๋งค ํด ํ ์คํธ ๋ฉ์์ง์ ํจ๊ป control word*๋ฅผ ์ถ๋ ฅ
- persona:
- LLM agent: native tool-calling ๊ธฐ๋ฐ
- domain policy ์ค์ํด์ผ ํ๋ฉฐ(๊ธ์ง ์ํ, ํ์ ์์ ํ์ธ ๋ฑ ์ผ์ข ์ ์ฐจ๋ manual)
- policy ์ค์ ์ฌ๋ถ์ ๋ํ ๊ฒ์ฆ: code-based(12์ข ) ํน์ LAAJ(7์ข )
- tool schema
Tab 2- ์ฃผ์ ๋ณ 6๊ฐ ๋๋ฉ์ธ(vehicle function, navigation, charging, productivity, weather, cross-domain)์ ๋ํด
- ์กฐํ์ฉ get function 29๊ฐ
- ๋ณ๊ฒฝ์ฉ set 27๊ฐ
- no-op planning tool 2๊ฐ
- ์ฃผ์ ๋ณ 6๊ฐ ๋๋ฉ์ธ(vehicle function, navigation, charging, productivity, weather, cross-domain)์ ๋ํด
- state variables: set tool๋ก ๋ณ๊ฒฝ๊ฐ๋ฅํ 31๊ฐ ๋์ ์ํ(๊ณต์กฐ, ์ฐฝ๋ฌธ, ์กฐ๋ช , navigation ๋ฑ) ์ ์
- context variables: 12๊ฐ fixed ์ค์ (์๊ฐ, ์์น, ์ฐจ๋ ์คํ, user preference), task ๋ด ๋ถ๋ณ์ด๊ณ task ๊ฐ ์์ดํจ.
- DB: ์ ๋ฝ 48๊ฐ ๋์, 130K POI, 1.7M route, 100 contact, 100 calendar ๋ฑ cross-linked ID๋ก ์ฐธ์กฐ ๋ฌด๊ฒฐ์ฑ ์ ์ง
3 Task Types
- Base (100): persona, instruction, ์ด๊ธฐ state/context, ground-truth action sequence ์ ์
- agent๊ฐ ์ ์ผํ end-state์ ๋๋ฌํ๋ฉด ์ฑ๊ณต
Fig 2
- agent๊ฐ ์ ์ผํ end-state์ ๋๋ฌํ๋ฉด ์ฑ๊ณต
- Hallucination (90): Base์์ ํ์ ๊ตฌ์ฑ์์๋ฅผ ์ ๊ฑฐํด ์์ฒญ์ ์ํ ๋ถ๊ฐ๋ฅํ๊ฒ ๋ง๋ฆ
- ์ ๊ฑฐ ๋์: tool ์์ฒด / tool parameter / tool result
- ์ฑ๊ณต ์กฐ๊ฑด: missing capability/information์ ๋ช ์์ ์ธ์ (์ง์ด๋ด๊ฑฐ๋ ๋์ถฉ ์ฑ ๋์ด๊ฐ๋ฉด ์คํจ)
- Disambiguation (50): Base์ ๋ชจํธ์ฑ ์ฃผ์
- ์ฃผ์ ๋ฐฉ์: ์ฌ์ฉ์ clarification ์ด ํ์ํ ๊ฒฝ์ฐ / ๋ด๋ถ ์ ๋ณด ์์ง์ผ๋ก ํด์ ๊ฐ๋ฅํ ๊ฒฝ์ฐ
- system prompt๊ฐ ๋ด๋ถ ํด์ ์ฐ์ ํ๋๋ก ์์ฑ
- ์คํจ: ์๋ชป๋ end-state๋ก ์ด์ด์ง๋ premature action๊ณผ ํ๊ฒฝ์ ํด์ ๊ทผ๊ฑฐ๊ฐ ์๋๋ฐ๋ ์ฌ์ฉ์์๊ฒ ๋ฌป๋ unnecessary clarification ๋ชจ๋ ์คํจ๋ก ๊ฐ์ฃผ
- ์์: ground-truth action์ผ๋ก ์ฑ๊ณต์ ์ ์ํ ์ ์๋ ํ๋์ LLM-as-a-Judge๋ก ํ๊ฐ
- Hallucination๊ณผ ๋ด๋ถ Disambiguation์์๋ user simulator์๊ฒ ์ ๊ฑฐ๋ ์์/ํด์ ๋์์ ์๋ ค์ฃผ๊ณ
- ํ์ฅ control word(โllm acknowledges limitationโ, โhallucination errorโ, โdisambiguation errorโ)๋ก ํ์
Task-level and Aggregated Metrics
- task๋ณ binary reward $r \in \lbrace 0, 1 \rbrace$ ์งํฉ์ผ๋ก ํ๊ฐ, ๋ชจ๋ ํด๋น ์งํ๊ฐ 1์ผ ๋๋ง ํด๊ฒฐ๋ก ๊ฐ์ฃผ
- Base ์งํ: actions final(์ต์ข ์ํ ์ผ์น), actions intermediate(๋งค ํด ์ค๊ฐ ์ํ๊ฐ ground-truth ์งํฉ์ ํฌํจ, ์๋ชป๋ set์ ์ดํ ์ ์ ํด๋ ๊ฐ์ ), tool subset(ํ์ get tool ํธ์ถ), tool execution errors, policy errors, user end conversation
- Hallucination: tool execution / policy / user end conversation๋ง ์ฌ์ฉ
- user end conversation์ด limitation ์ธ์ ์ฌ๋ถ๋ฅผ ์ธก์
- Disambiguation: Base ์ ์ฒด ์งํ + โdisambiguation errorโ ์ ์คํจ
- task $t$๋ฅผ $k$ํ ๋ฐ๋ณตํด ์ผ๊ด์ฑ(^k)๊ณผ ์ ์ฌ๋ ฅ(@k) ๋ถ๋ฆฌ ์ธก์
- ๋ metric ๊ฐ๊ทน์ด ์์์๋ก ์ ์ฌ๋ ฅ๊ณผ ์ผ๊ด์ฑ์ด ์ ์ ๋ ฌ๋ ๊ฒ
- ๊ฐ๊ทน์ด ํฌ๋ฉด parallel inference๋ fine-tuning์ผ๋ก ๋์ด๋ผ ์ ์๋ latent competence๊ฐ ์กด์ฌํจ์ ์๋ฏธ
- $\text{Pass}^k$: $k$ํ ์ ๋ถ ์ฑ๊ณต(consistency), $\text{Pass}@k$: 1ํ ์ด์ ์ฑ๊ณต(potential)
Environment and Dataset Construction
- ํ๊ฒฝ: ๋ชจ๋ tool/state/context๋ฅผ ์ค์ ์ฐจ๋ ์์คํ
์ ์ฌ๋ฌผ๋ก๋ถํฐ ์์์
์ค๊ณ
- DB: ๊ตฌ์กฐ์ ์ผ๊ด์ฑ์ ์ํด code-generated, ์ด๋ฆ, ๋๋ฉ์ธ๋ง LLM ์์ฑ. (tau-bench ๊ธฐ๋ฐ)
- task ์์ฑ: tool์ parameter, ์ ๊ทผ state, state ๋ณ๊ฒฝ์ ์ฐ๊ฒฐํ API graph ์ ์
- parameter chaining๊ณผ policy trigger ์ํธ์์กด์ฑ์ ๋ฐ์ํด multi-step trajectory ์ํ๋ง
- LLM agent๊ฐ trajectory๋ก ์ด์ด์ง๋ ์์ฐ์ค๋ฌ์ด user instruction์ ์์ฑํ๊ณ ํ๊ฒฝ๊ณผ ์ํธ์์ฉํ๋ฉฐ ์คํ ๊ฐ๋ฅ์ฑ์ ์กฐ์
- ๊ฒ์ฆ: ์ task๋ฅผ ์ฌ๋์ด ๊ฒํ
- ๋ฌธ๊ตฌ ๋ช ํ์ฑ, instruction ์์ ์ฑ, action ์ ํ์ฑ, ์คํ ๊ฐ๋ฅ์ฑ, ์ ์ผ end-state๋ฅผ ํ์ธํ๊ณ LLM agent๋ก ๋ฐ๋ณต ํ ์คํธํ๋ฉฐ task instruction ์ค๋ฅ ์์
Effects
- Experimental setup
- agent: proprietary 3๊ณ์ด; non-thinking(GPT-4.1, Gemini-2.5-Flash), thinking (2048 token)(GPT-5/5.2, Claude-Opus-4.5/4.6, Claude-Sonnet-4, Gemini-2.5-Flash), auto-thinking(Gemini-2.5-Pro); open์ GPT-OSS-120B, Qwen3-32B(thinking), ฯ-bench trace๋ก SFT xLAM-2-32B-fc-r
- setup details
- ๊ฐ๋ฅํํ temperature 0 ๊ณ ์ (Claude/GPT-5 thinking์ provider ๊ฐ์ 1.0)
- CoT ๋ฑ ํ๋กฌํํ ๊ธฐ๋ฒ ์์ด baseline ์ฑ๋ฅ ๋ถ๋ฆฌ
- k=3 (์ ์ ํฌํ ์์ด ์ ๋ขฐ๋ ํ๋ณํ๋ ์์ค)
- user simulator: Gemini-2.5-Flash (thinking)
- Base 100 task 1ํ ์ ์ฒด ์คํ ๋น์ฉ์ simulator $0.08 + GPT-5 agent $11
- evaluation: task type๋ณ $\text{Pass}^3$ ํ๊ท
- Results
Tab 4F1: consistency gap; ๋ชจ๋ ๋ชจ๋ธ์์ $\text{Pass}@k$(์ ์ฌ๋ ฅ)์ $\text{Pass}^k$(์ฌํ์ฑ) ๊ฐ ํฐ ๊ฐ๊ทน- ์ต๊ณ ์ฑ๋ฅ์ ๋ชจ๋ธ๋ ํ๊ท ^3 54-58% ์์ค
- Disambiguation์์ GPT-5๊ฐ @3 โ ^3 ์ ๋ฐ์์ค ๊ธ๋ฝ
Fig 3Fig 4F2: model capabilities; thinking ๋ชจ๋ธ์ด ์ task type์์ ์ฐ์, task ๋ณต์ก๋๊ฐ ์ค๋ฅผ์๋ก ๊ฒฉ์ฐจ ํ๋- Claude-Opus-4.5๊ฐ Base์ Disambiguation, GPT-5/5.2๊ฐ Hallucination ์ต๊ณ ์ฑ๋ฅ ํ์ธ
- ground-truth action ์๊ฐ ๋์๋ก non-thinking ๋ชจ๋ธ์ Pass^1์ด ๊ธ๋ฝ
Fig 3 - GPT-4.1์ GPT-5 ๋๋น policy ์๋ฐ, tool ์คํ ์ค๋ฅ, ํ์ get ์๋ต ๋ฑ
Fig 4
- F3: task type difficulty; Base > Hallucination > Disambiguation ์์ผ๋ก ์ฒด๊ณ์ ์ฑ๋ฅ ์ ํ
- user persona / simulation ๋ถ์: persona(๋์ด/์คํ์ผ/์๋ จ๋)๋ณ ์ ์๋ฏธํ ์ฑ๋ฅ ์ฐจ์ด ์์
- GPT-5 k=5 ์ ์ฒด ์คํจ๋ฅผ human ๊ฒ์ฌ, user simulator๊ฐ ์ ์ผํ ์ค๋ฅ ์์ธ์ธ sole-source error ์ ๋ํ
- Base 2.4% ์ค๋ฅ์ Pass^5 -6%, Hallucination 6.1%์ -9%, Disambiguation 2.8%์ -8% ์ํฅ
- GPT-5 k=5 ์ ์ฒด ์คํจ๋ฅผ human ๊ฒ์ฌ, user simulator๊ฐ ์ ์ผํ ์ค๋ฅ ์์ธ์ธ sole-source error ์ ๋ํ
- error taxonomy์ completion-compliance tension; ๋น์ผ๊ด task(5ํ ์ค 0ยท1ยท4ํ ์ฑ๊ณต)์ ์คํจ๋ฅผ 5๋ฒ์ฃผ๋ก ๋ถ๋ฅ
- (E1) premature action, (E2) policy violation, (E3) logical error, (E4) execution error, (E5) fabrication(E5a ์๋ฌต์ ์ํ / E5b ๋ฅ๋์ ๋ ์กฐ)
- ๋ชจ๋ธ์ policy ์ค์๋ณด๋ค ์์ฒญ ์์๋ฅผ ์ผ๊ด๋๊ฒ ์ฐ์ ํจ
- GPT-5 ์ง์๋ ์คํจ์ 8ํ ์ด E1, Hallucination์์ GPT-4.1์ E5b ~40%, GPT-5๋ E5a ~70% ์์ค
- ๊ฐ์ ๋ชจ๋ธ์ด ์ํ์ ๋ฐ๋ผ policy๋ฅผ ์งํค๊ธฐ๋/์ด๊ธฐ๊ธฐ๋ ํ๋ stochastic adherence==๋ฅ๋ ฅ์ ์์ผ๋ ์ ์ฝ์ ์์ ์ ํ์ฑํ ๊ธฐ์ ๊ฐ ์์์ ์ฃผ์ฅ
- plausible completion์ ๋ณด์ํ๋ ํ์ต ์ฒด๊ณ์ ์ฐ๋ฌผ๋ก ํด์ (Kalai et al., 2025, RLHF ๊ฐํ)
- reasoning as partial mitigation; ๋ช
์์ ์ถ๋ก ์ ์ธก์ ๊ฐ๋ฅํ๋ ์ ํ์ ์ธ ๊ฐ์
- Base์์ E2-E4 ๊ฐ์, Hallucination์์ E5b ๊ฐ์ํ๋, Disambiguation ์คํจ์ 9ํ ์ ์ฐจ์งํ๋ E1์ ์ํ ์คํจ
- GPT-5๋ ๋ด๋ถ ํด์ policy์๋ ๋ถ๊ตฌํ๊ณ ํ๊ฒฝ ์ ๋ณด ์์ง ์ ์ ์ง๋ฌธํ๊ฑฐ๋ best-guess๋ก ์คํ
Tab 5practical implications ์ฑ๋ฅโ์ง์ฐโ๋น์ฉ trade-off
Personal note. Pass^k๋ผ๋ metric๊ณผ ์ฝ๋๋ฒ ์ด์ค ๋ชจ๋ ์ ํ์ฐ๊ตฌ(tau-bench) ๊ฒ์ด๊ณ ์๋ก์ด ๋ชจ๋ธ์ด๋ ํ์ต๋ฒ ์์ด โtask completion์ด ์๋๋ผ agent์ ์๊ธฐ ํ๊ณ ์ธ์์ ์ฌ์ผ ํ๋คโ๋ ์ฃผ์ฅ์ ๊ฒ์ฆ ๊ฐ๋ฅํ task ์ค๊ณ(๊ตฌ์ฑ์์ ์ ๊ฑฐ + control word ํ์ )๋ก ํ์ํ ๊ฒ ์ฌ์ค ์ฐ๊ตฌ์ ์ ๋ถ์ธ๋ฐ ๊ทธ๊ฒ ํํํ๊ฒ ์์ฌ์ง ๊ฒ ์์์ ์ด์ ๊ฐ ๋ ๊ฒ ๊ฐ์์. ๊ฐ์ธ์ ์ผ๋ก๋ ๋ณธ์์ ์ธ ํ๊ณ(user simulator ์ค๋ฅ)๋ฅผ ์ ์ ๊ฒ์ฌํด ์๊ธฐ ๋ฒค์น๋งํฌ์ ๋ ธ์ด์ฆ ํํ์ ์ฃผ๋ ๋ํ ์ผ์ด ์ธ์๊น์์ต๋๋ค. ๋ค๋ง instruction-following ๋ฅ๋ ฅ์ ์ฌ๋ ๊ฒ๊ณผ ๋ญ๊ฐ ๋ค๋ฅด๋ค๊ณ ๋ณผ ์ ์๋์ง ์์ฒด๋ ๋ค์ ์๋ฑํ๊ฒ ๋ฐ๋ผ๋ณด๊ฒ ๋๊ธด ํ๋๋ฐ, ์ง๋ ๋ฒ์ ์๊ฐํ ImplicitMemBench๋ ACL2026์์ ์์ํ๋ค๊ณ ํด์ ๋น๊ตํด๋ณด๊ณ ์ถ์ด Seminar ์ค๋นํด๋ณด์์ต๋๋ค.