4 minute read

Kanana-2 SLM 개발기에서 tool call이 post-training의 일급 도메인으로 올라섰다는 점에 주목한 정리. 학습 단계별 성능 표에서 병합 구간에 tool이 가장 크게 하락하는 현상과, 그 성능이 하나의 집계 점수로만 보고된다는 문제를 함께 다룬다. 파이프라인 전반에 대한 정리는 앞선 포스트 참고.


Motivation

7월 28일 공개된 Kanana-2 경량 모델의 개발기에서 이전 세대와 달라진 지점이 하나 분명하게 드러난다.

최근 온디바이스 환경에서도 Tool Call에 대한 필요성이 대두되고 있는 만큼, 지난 SLM 시리즈와 다르게 SFT 단계부터 Tool Call을 위한 다양한 소스의 데이터를 학습에 사용하였습니다.

tool call이 사후학습 파이프라인의 일급 도메인이 됐다는 뜻이다. 3B의 post-training은 instruction following, math, code, tool, chat, knowledge 여섯 개 도메인으로 나뉘어 각각 RL을 돌고, 그 결과를 SCE 방식으로 병합한 뒤 calibration을 거친다. tool이 math나 code와 같은 층위에 놓였다.

작은 모델을 만드는 쪽이 tool call에 이 정도 자원을 쓰는 건 합리적이다. 온디바이스 모델의 존재 이유가 대체로 “기기 안에서 뭔가를 실제로 시키는 것”이기 때문이다. 그런데 이 투자에 대응하는 측정이 따라오지 않았다는 게 이 글의 논지다.

병합 단계에서의 tool 하락

개발기에 실린 3B의 학습 단계별 성능 표는 그 자체로 읽을 거리가 많다.

Stage IF Math Code Tool Chat Knowledge Avg. (Macro)
SFT 44.93 47.64 62.56 71.51 40.73 39.63 46.18
Merge 62.39 56.18 61.61 65.84 46.17 41.46 50.95
Calibration 62.56 57.05 61.31 71.94 47.58 40.74 51.52

병합 단계에서 instruction following은 45에서 62로 크게 오르고 math도 48에서 56으로 오른다. 평균은 46에서 51로 올라간다.

tool은 71.51에서 65.84로 떨어진다. code도 62.56에서 61.61로 소폭 내려가지만, 하락 폭은 tool이 압도적으로 크다. calibration이 71.94로 되돌려놓긴 하지만, 전체 파이프라인에서 tool call은 SFT 직후 값을 겨우 회복하는 데 그친다. 대부분의 도메인이 병합으로 이득을 보는 동안 tool은 잃은 것을 되찾느라 두 단계를 쓴 셈이다.

도메인별 expert를 합칠 때 tool call 능력이 유독 취약하다는 관찰인데, 개발기는 이 현상을 따로 해설하지 않는다. 숫자만 있고 설명이 없다. tool 능력이 다른 능력들과 표현 공간에서 충돌하는 것인지, 아니면 tool 데이터가 출력 형식에 민감해서 가중치 평균에 특히 약한 것인지는 표만으로 판별할 수 없다. (후자라면 형식 준수는 회복이 쉽고 실제 도구 선택 능력은 손실이 남아 있을 가능성도 있어, 집계 점수만으로는 구분이 안 된다.)

측정 축 정의: Live vs Multi-Turn

여기서 문제가 생긴다. 표에서도, 다른 모델과 비교한 막대그래프에서도 tool call은 하나의 값으로 보고된다. Tool 71.94. 그게 전부다.

같은 계열 30B 모델 카드를 열어보면 tool call이 왜 하나의 숫자가 될 수 없는지 바로 보인다. BFCL은 성격이 다른 두 축으로 나뉜다.

  • Live: 한 번의 요청에 대해 적절한 함수와 인자를 골라내는 능력. 6개 live 벤치마크 평균.
  • Multi-Turn: 대화가 이어지는 동안 여러 번 호출하고, 결과를 받아 다음 행동을 정하고, 실패하면 복구하는 능력. 4개 multi-turn 벤치마크 평균.
Model Live Multi-Turn
kanana-2-30b-a3b-instruct-2601 76.66 38.63
Qwen3-30B-A3B-Instruct-2507 73.93 38.77
kanana-2-30b-a3b-thinking-2601 75.9 43.7
Qwen3-30B-A3B-Thinking-2507 82.9 53.6

네 모델 모두 오른쪽에서 크게 꺾인다. instruct 계열은 절반 수준으로 떨어지고 thinking 계열도 35% 이상 낮다. 단일 호출은 사실상 풀렸고 이어지는 도구 사용은 안 풀렸다는 뜻이다.

그러니 “Tool 71.94”는 어느 쪽인지 알 수 없는 숫자다. live 계열 위주라면 30B의 76.66과 비슷한 종류의 성취이고, multi-turn이 상당 비중 섞여 있다면 3B 모델치고 상당히 놀라운 수치가 된다. tool call을 도메인으로 격상시켜 놓고 보고는 도메인 하나당 숫자 하나라는 형식을 유지한 결과다.

참고로 1월 릴리스 당시 보도는 이 모델이 Qwen 대비 멀티턴 도구 호출에서 우위라고 전했는데, 표를 보면 이긴 쪽은 Live(76.66 대 73.93)이고 Multi-Turn은 38.63 대 38.77로 근소하게 진다. 0.14는 노이즈 범위지만, 두 축이 “멀티턴 도구 호출”이라는 한 단어로 합쳐지는 과정에서 정보가 사라진 건 사실이다.

그런데 Multi-Turn도 세션 안의 이야기다

한 겹 더 들어가면 상황이 더 분명해진다.

BFCL의 multi-turn은 하나의 세션 안에서 벌어지는 일이다. 대화가 시작되고, 여러 턴이 오가고, 끝난다. 그 안의 모든 정보는 컨텍스트에 다 들어 있고, 따라서 기억의 문제가 아니라 계획과 복구의 문제다.

온디바이스 개인 비서가 놓인 상황은 그렇지 않다. 사용자는 화요일에 한 번, 금요일에 한 번, 다음 주에 또 한 번 말을 건다. 매번 세션이 끊긴다. 지난주에 “예약은 조용한 데로 해줘”라고 했던 걸 이번 주에 기억해서 도구 인자에 반영하는 능력은 BFCL multi-turn이 재는 대상이 아니다. 그리고 온디바이스야말로 세션이 가장 자주 끊기는 환경이다. 컨텍스트 32K는 한 세션에서는 넉넉하지만 몇 달치 사용 이력을 담는 그릇은 아니다.

정리하면 층위가 세 개로 갈린다.

층위 필요한 능력 측정 상태
단일 도구 호출 함수/인자 선택 BFCL Live, 70~80점대
세션 내 멀티턴 계획, 결과 반영, 복구 BFCL Multi-Turn, 30~50점대
세션 간 개인화 호출 선호 기억, 인자 반영 측정 대상 아님

그리고 제품은 세 번째 층위에서 팔린다.

Wrap-up

Kanana-2 문서에는 짧지만 무게 있는 문장이 하나 있다. 사전학습과 사후학습 어디에도 카카오 사용자 데이터를 쓰지 않았다는 것.

프라이버시 관점에서 옳은 결정이지만, 동시에 이 결정은 개인화의 위치를 강제로 옮긴다. 사용자 데이터가 학습에 안 들어가면 사용자에 대한 지식은 파라미터 안에 없고, 그러면 남는 자리는 추론 시점의 메모리뿐이다. 무엇을 저장하고, 무엇을 꺼내오고, 그걸 어떻게 도구 호출 결정에 반영할 것인가. 개인화가 학습 문제가 아니라 메모리 설계 문제가 된다.

국내에서 가장 큰 대화 데이터를 가진 쪽이 그걸 안 쓰기로 하고 개인 비서를 만들고 있다는 사실은, 이 문제가 이론적 관심사가 아니라 이미 배포된 제품의 제약 조건이라는 뜻이다. 카나나 인 카카오톡은 지난 3월 정식 출시됐고, 이전 포스트에서 다뤘듯 대화를 상시 관측하며 선제적으로 제안하는 방향으로 가고 있다.

Kanana-2 SLM은 tool call을 여섯 도메인 중 하나로 올려놓았고, 병합 과정에서 tool이 가장 크게 떨어진다는 관찰까지 표로 남겼다. 문제를 진지하게 다루고 있다는 증거다. 그런데 그 진지함이 하나의 집계 점수로 압축되는 순간, 안에서 무슨 일이 일어났는지는 밖에서 볼 수 없게 된다.

Future Work

벤치마크에 칸이 없는 능력은 개선되지 않는다. 정확히는, 개선되었는지 알 수 없다.

세션을 넘는 개인화된 도구 호출을 재려면 최소한 세 가지가 필요할 것으로 보인다. 세션 경계가 명시적으로 존재하는 대화 구성, 이전 세션의 선호가 이번 세션의 도구 인자에 반영되어야만 정답이 되는 태스크 설계, 그리고 기억을 명시적으로 되묻지 않는 평가 방식(사용자가 “지난번에 말한 대로”라고 말해주면 그건 그냥 컨텍스트 문제가 된다).

이 방향으로 이미 진행 중인 작업이 있어 별도로 정리할 예정이다.


출처: 더 작고 강해진 Kanana SLM 개발, kakao/kanana-2