분류·판정 업무에 결정 모델을 쓰려면: Liquid d1과 Unsloth 학습 준비
Liquid AI가 10월 7일 공개한 d1과 Unsloth 결정 모델 학습 기능을 바탕으로 판정 업무를 질문으로 바꾸고 학습 데이터를 준비하는 방법을 정리했습니다.
최재현 · 2026.10.09

고객 문의 메일을 읽고 담당 팀을 정하거나, 상담 기록에 품질 점수를 매기는 일은 긴 답변을 쓰지 않아도 끝납니다. 정해 둔 보기 가운데 하나를 고르면 됩니다. Liquid AI는 2026년 10월 7일 이런 판정 용도로 만든 d1 결정 모델(decision model) 가운데 d1-3B와 d1-omni-600M을 오픈 웨이트(가중치를 내려받아 회사 장비에 직접 설치할 수 있는 모델)로 공개했습니다. 같은 날 Unsloth는 GitHub 릴리스 v0.1.904-beta에서 텍스트·비전 LLM을 결정 모델로 학습시키는 기능을 발표했고, 10월 8일 블로그 목록에 학습 문서를 올렸습니다. 판정 업무를 결정 모델에 맡길지 정하는 기준과, 직접 미세 조정(공개된 모델을 우리 데이터로 추가 학습시키는 일)하려면 무엇을 준비해야 하는지 정리했습니다.
1. Liquid AI가 공개한 d1 모델
Liquid AI 공식 블로그는 d1 결정 모델 계열의 오픈 웨이트 모델 2개, d1-3B와 d1-omni-600M을 공개한다고 밝혔습니다. Hugging Face에 올라온 Liquid AI 팀 글에 따르면 d1-3B는 텍스트와 이미지를, d1-omni-600M은 텍스트와 이미지 또는 텍스트와 오디오를 입력으로 받습니다. 모델 크기는 각각 3.1B, 587M 파라미터이고 Hugging Face 모델 카드에는 라이선스가 lfm1.0으로 표시돼 있습니다. 실행 환경으로는 NVIDIA DGX와 Jetson 계열 장비, llama.cpp 지원이 소개됐습니다. 지역 제한에 대한 언급은 없습니다.
성능 수치는 회사 자체 측정입니다. Liquid AI는 d1-3B가 Decision Index v0.2.1 공개 분할(public split)에서 48.57점을 받아 10B 미만 모든 모델보다 앞섰고, 크기가 12배인 결정 모델 Decider 35B-A3B와 비슷한 수준이라고 발표했습니다. 제3자가 같은 결과를 재현했는지는 확인하지 못했습니다. d1-omni-600M은 공식 블로그에 실험용 체크포인트(experimental checkpoint)로 적혀 있어, 업무에 넣기 전에 품질을 어디까지 보증하는지 따로 확인해야 합니다. lfm1.0 라이선스의 상업 이용 조건도 이 글에서는 확인하지 못했습니다.
2. 판정 업무를 질문 형태로 바꾸기
10월 5일 나온 d1 소개 글은 d1이 답하는 질문을 Noul, Choice, Score라는 3가지 유형으로 나눴습니다. 유형 이름으로 보면 Choice는 여러 보기 가운데 하나를 고르는 질문, Score는 점수를 매기는 질문으로 읽을 수 있습니다. Noul 유형의 정확한 정의는 d1 소개 글 원문에서 확인하시기 바랍니다.
작성자는 결정 모델을 검토하기 전에 업무의 답이 어떤 모양인지부터 적어 보기를 권합니다. 답을 보기 목록이나 점수 단계로 미리 정할 수 있으면 결정 모델에 맞습니다. 답변 문안을 새로 써야 하거나 판정 이유를 문장으로 설명해야 하는 일은 지금처럼 생성 모델에 맡기는 편이 맞습니다. 아래 표의 업무는 모두 예시입니다.
| 업무 예시 | 답의 모양 | 결정 모델 검토 |
|---|---|---|
| 문의 메일 담당 팀 지정 | 결제·기술·영업 중 1개 | 검토할 만함 (보기 고정) |
| 상담 기록 품질 평가 | 1점에서 5점 | 검토할 만함 (점수 단계 고정) |
| 불량 사진 합격 판정 | 합격·불합격 | 이미지 입력 모델로 검토 |
| 고객 회신 메일 작성 | 자유 문장 | 맞지 않음 (문장 생성 필요) |
| 판정 근거 보고서 작성 | 설명 문단 | 맞지 않음 (이유 설명 필요) |
3. Unsloth로 직접 학습시키는 방법과 측정 조건
Unsloth 공식 문서는 Jev, Laya, Clef 같은 결정 모델을 Unsloth로 직접 학습시킬 수 있다고 적었습니다. 공식 문서에 따르면 Train 탭에서 unsloth/Qwen3.5-4B 같은 LLM을 고른 뒤 Train as 항목을 Decision model로 지정합니다. 이 절차는 공식 문서의 설명이며 이 글을 쓰면서 직접 실행하지는 않았습니다. 기능은 Unsloth Desktop과 오픈소스 라이브러리에 들어 있어 별도 요금제 구분이 없고, 로컬 GPU가 있어야 합니다. 문서의 예시 환경은 L4 GPU, VRAM 4GB에서 14GB이고, 기능을 담은 릴리스 이름에는 beta가 붙어 있습니다.
정확도 수치도 회사 자체 측정입니다. Unsloth 문서는 학습 전 30%에서 37%였던 정확도가 학습 후 최대 78%까지 올랐다고 밝혔고, 학습 전 수치를 우연히 맞히는 수준에 가깝다고 설명했습니다. 시험 데이터는 typed-decisions, BANKING77, CLINC150을 섞은 3,000행이며, 학습 데이터와 겹치는 항목을 걸러 냈다고 적었습니다. GitHub 릴리스 문구는 같은 변화를 30%에서 80%로 표현해 문서 수치와 조금 다릅니다. 이 글에서 확인한 자료만으로는 78%를 낸 모델과 VRAM 조합을 하나로 특정하지 못했고, 한국어 데이터로 검증한 수치는 원문에 없습니다.
4. 학습 전에 준비할 것
Unsloth 시험셋 3,000행, 학습 전 30%에서 37%와 학습 후 최대 78%, 릴리스 문구의 30%에서 80%, 예시 환경 L4 GPU와 VRAM 4GB에서 14GB, d1 라이선스 lfm1.0은 Unsloth와 Liquid AI가 공개한 내용이며 수치는 회사 자체 측정입니다. 4칸 구성과 Choice·Score 풀이, 칸마다 적은 준비 항목은 작성자가 정리한 것입니다.
Unsloth가 학습 전과 학습 후 정확도를 나란히 공개한 방식은 사내에서 따라 할 만합니다. 학습 전 수치가 없으면 학습 효과를 판단할 수 없습니다. 시험 데이터를 학습 데이터와 겹치지 않게 정리했다는 설명도 같은 이유에서 눈여겨볼 만합니다. 학습에 쓴 사례가 시험에 다시 나오면 정확도가 실제보다 높게 나옵니다.
그래서 작성자는 판정 질문과 보기 목록, 정답이 달린 과거 사례, 학습 전 정확도 기록, 장비와 라이선스 조건을 학습 전에 갖추기를 권합니다. 작성자가 보기에 준비 기간은 정답 데이터를 만드는 데 가장 많이 듭니다. 같은 문의 메일을 두고 담당자마다 다른 팀을 고른다면 모델보다 기준을 먼저 손봐야 합니다. Unsloth 측정에는 한국어 데이터 검증이 없으므로 우리 데이터로 다시 재야 합니다.
5. 이번 주에 해 볼 일
판정 업무 1건을 고르고, 답이 될 보기 목록을 문서 한 장에 적어 보십시오. 그다음 지난 처리 기록에서 사례 50건을 뽑아 담당자 2명이 따로 정답을 붙여 봅니다. 두 사람의 답이 얼마나 일치하는지 세어 보면, 보기 목록이 모호한 곳과 정답 데이터를 만드는 데 드는 시간을 함께 알 수 있습니다. 일치율이 낮으면 학습보다 기준 문서를 먼저 고치고, 일치율이 높으면 그 50건을 학습 전 정확도를 재는 시험 데이터로 따로 보관해 두십시오.
참고한 자료
- Open d1: Edge decision models for text, vision, and audio - Liquid AI, 2026년 10월 7일 발표
- Multimodal open d1 decision models for the edge - Liquid AI 팀(Hugging Face 블로그), 2026년 10월 7일 게시
- Introducing d1: The most capable decision model, now with vision - Liquid AI, 2026년 10월 5일 발표
- Unsloth v0.1.904-beta 릴리스 - Unsloth GitHub, 2026년 10월 7일 게시
- Unsloth 블로그 목록: Decision models - Unsloth, 2026년 10월 8일 표시
- Train your own Decision Model with Unsloth - Unsloth 공식 문서, 페이지 발표일 표시 없음
