한국어 회의록 요약 실험: Qwen3·Gemma3의 누락과 오류
같은 Mac에서 Qwen3 4B와 Gemma3 4B에 가상 회의록을 맡겼다. 16회 응답의 날짜·조건·숫자 오류와 출력 잘림을 원문으로 대조하고, 시간·메모리·재현 자료를 공개한다.
읽는 시간 약 9분
자료 조사와 초안 정리에 AI의 도움을 받았습니다. 내용 검토와 수정에 대한 책임은 코딩하는 상인 운영자에게 있습니다.
한국어 회의록 요약을 로컬 LLM에 맡길 때는 문장이 자연스러운지보다 날짜·조건·담당자·예외가 그대로 남았는지 먼저 확인해야 한다. 2026년 9월 24일 같은 Mac에서 Qwen3 4B와 Gemma3 4B를 실행했지만, 이번 설정에서 검토 없이 전달할 수 있는 답변은 나오지 않았다.
Gemma3는 여덟 항목의 한국어 요약을 완성했으나 공개 조건과 수동 처리 전환을 빠뜨렸다. 부록을 붙인 입력에서는 폐기된 초안 날짜까지 되살렸다. Qwen3는 영문 검토 문장이 본문에 섞인 채 출력 상한에 도달했다. 이를 두 모델의 한국어 전체 능력 순위로 확대하지 않는다.
입력·채점 기준·16회 응답·시간·메모리·재현 스크립트 다운로드에서 잘린 답변까지 모두 확인할 수 있다. 공개용 가상 회의록 한 건으로 실행한 작은 사례다. 실제 회사 문서나 고객 개인정보는 사용하지 않았다.
한국어 회의록 요약에서 실제로 달라진 답
963자 회의록에는 초안과 최종 합의를 함께 넣었다. 공개일은 9월 30일에서 품질 검증을 통과한 경우에만 10월 6일로 바뀐다. 초안의 50곳 모집은 기존 상점 20곳 초대로 줄어든다. 독자가 요약을 보고 결정해야 할 날짜와 조건을 의도적으로 구분했다.
긴 입력은 같은 회의록에 결정 사항이 아닌 설계 참고 부록을 붙인 2,875자다. 요청문에는 부록의 권고를 회의 결정에 추가하지 말라고 썼다. 963자와 2,875자는 문서 본문의 문자 수이며, 요청문과 채팅 템플릿을 포함한 토큰 수와 다르다.
| 실행 조건 | 답변 상태 | 원문 대조에서 확인한 문제 |
|---|---|---|
| Gemma3 4B · 짧은 입력 | 한국어 8항목 완결 | 10월 6일은 남았지만 품질 검증 조건과 수동 처리 전환을 누락 |
| Gemma3 4B · 부록 포함 | 한국어 8항목 완결 | 공개일을 9월 30일로 잘못 요약, 품질 검증 조건과 수동 처리 전환 누락 |
| Qwen3 4B · 짧은 입력 | 영문 검토와 한국어 초안이 섞이다 잘림 | 요청한 최종 요약을 완성하지 못함. 주말 지원 결정자가 운영 책임자라는 점이 불명확 |
| Qwen3 4B · 부록 포함 | 영문 검토와 한국어 초안이 섞이다 잘림 | “3건 이상”과 “정확히 3건은 제외”를 함께 써 중단 기준이 모순됨 |
각 조건은 모델을 내린 상태 한 번과 메모리에 유지한 상태 세 번, 총 네 번 실행했다. 같은 조건의 네 답변은 SHA-256이 모두 같았다. 따라서 표는 16개의 서로 다른 문제를 맞힌 결과가 아니라, 네 조건에서 같은 출력이 반복된 기록이다.
날짜가 맞아도 공개 조건이 빠지면 다른 결정이다
Gemma3의 짧은 입력 답변에는 “공개 예정일은 10월 6일로 확정”이라고 적혀 있다. 날짜 자체는 맞지만, 품질 검증을 통과해야 공개한다는 조건이 없다. 조건 없이 일정을 공유하면 원래 회의에서 정한 결정을 바꾸게 된다.
부록 포함 답변은 “공개 실험은 9월 30일에 진행”이라고 썼다. 회의록에서 폐기했다고 명시한 날짜다. 긴 입력의 결과가 달라졌다는 관찰은 가능하지만, 입력 길이와 컨텍스트 설정을 함께 바꿨으므로 부록의 길이만이 원인이라고 단정할 수는 없다.
“3건 초과”를 “3건 이상”으로 바꾸면 경계가 달라진다
원문은 최근 100건 중 오분류가 3건을 초과하면 자동 분류를 끄고 수동 처리로 되돌리며, 기존 기록은 유지한다고 정했다. 정수 건수로는 4건 이상이 같은 조건이다.
Qwen3의 부록 포함 응답에는 “최근 100건 중 3건 이상 잘못 분류 시”와 “정확히 3건은 중단 조건에 해당하지 않음”이 함께 나온다. 두 문장은 서로 충돌한다. Gemma3는 초과 조건과 기록 유지를 보존했지만 수동 처리로 돌아간다는 행동을 빠뜨렸다.
이런 요약을 운영 규칙으로 옮길 때는 숫자만 추출해서는 부족하다. 3건 → 계속, 4건 → 중지 후 수동 처리처럼 경계의 양쪽을 원문과 대조해야 한다. 이 두 예시는 원문에서 도출한 검토 방법이며, 별도 자동화 시스템을 실행한 결과는 아니다.
출력이 끝났다는 응답과 업무가 끝났다는 판단을 구분한다
Qwen에는 think:false를 요청했다. 그러나 실제 message.content에는 영문 검토 문장이 들어 있었고 1,024토큰 상한에 도달했다. 짧은 입력은 한국어 목록 6번 도중, 부록 포함 입력은 한국어 8항목 초안 뒤 영문 재검토 도중에 잘렸다. 둘 다 요청한 형식의 최종 응답으로 마무리되지 않았다. 런타임·템플릿·모델 중 무엇이 원인인지는 분리 검증하지 않았다.
이번 원본을 잘 보이도록 고치거나 출력 상한을 늘린 결과로 교체하지 않았다. 모델 설정을 바꾼 후속 실험은 별도 조건으로 남겨야 한다. Ollama 채팅 API 문서의 done_reason과 실제 답변을 함께 읽으면 요청 종료와 문서 완결을 구분할 수 있다.
실행 전에 정한 여덟 가지 대조 기준
채점 기준은 모델 답변을 받기 전에 고정했다. 각 항목은 필수 사실을 모두 보존하고 모순이 없어야 통과한다. 표현의 자연스러움에 가중치를 주거나 하나의 종합 점수로 합치지 않았다.
| 항목 | 반드시 남아야 하는 사실 |
|---|---|
| 공개 | 10월 6일, 품질 검증 통과 조건 |
| 참여 | 기존 상점 20곳 초대, 공개 모집 제외 |
| 예산 | 부가세 포함 총 90만 원, 도구 6만 원도 총액에 포함 |
| 제출 | 개발 담당자, 시험 보고서와 되돌리기 코드, 10월 2일 오후 6시 |
| 자료 | 담당자가 작성한 가상 문의만, 실고객 문의와 개인정보 제외 |
| 중단 | 최근 100건 중 오분류 3건 초과, 자동 분류 중지 후 수동 처리, 기존 기록 유지 |
| 범위 | 자동 결제와 자동 환불 제외 |
| 미확정 | 주말 지원 미확정, 운영 책임자가 9월 28일까지 결정 |
두 AI 에이전트가 같은 원문과 기준으로 따로 대조한 뒤 판정과 근거를 맞췄다. 사람의 블라인드 평가가 아니다. 다운로드 자료에는 항목별 누락·오류와 대조 근거를 남겼다. Qwen의 사실 대조에는 영문 검토 문장을 포함한 반환 본문 전체를 사용했지만, 그 안에 정답이 있다는 이유로 완성된 한국어 요약으로 취급하지 않았다.
필수 사실 보존과 근거 없는 추가 내용도 분리했다. 예를 들어 두 Gemma3 답변은 가상 자료 작성자를 “개발 담당자”로 좁혔다. 원문은 담당자가 작성한 자료라고만 정한다. 일부 항목을 보존했더라도 답변 전체가 정확하다는 뜻은 아니다.
같은 Mac에서 측정한 응답 시간
실행 환경은 Apple M4 Pro, CPU 12코어, 통합 메모리 48GiB, macOS와 Ollama 0.34.3이다. qwen3:4b와 gemma3:4b는 모두 Q4_K_M 양자화 모델을 사용했다. 각각 등록된 파라미터 표시는 4.0B와 4.3B이며 구조·토크나이저·템플릿은 다르다. 브라우저와 개발 서버가 켜진 일상 작업 환경에서 실행했다.
| 모델·입력 | 실제 입력 / 출력 토큰 | 미로드 1회 | 유지 3회 중앙값 | 종료 |
|---|---|---|---|---|
| Qwen3 · 짧음 | 909 / 1,024 | 18.03초 | 15.28초 | 4회 모두 길이 상한 |
| Qwen3 · 부록 포함 | 2,096 / 1,024 | 20.68초 | 16.66초 | 4회 모두 길이 상한 |
| Gemma3 · 짧음 | 767 / 420 | 10.12초 | 6.27초 | 4회 모두 정상 종료 |
| Gemma3 · 부록 포함 | 1,708 / 395 | 9.62초 | 5.87초 | 4회 모두 정상 종료 |
시간은 요청 직전부터 응답 수신까지의 경과 시간이다. 미로드는 Ollama에서 모델이 내려간 상태이며 OS 디스크 캐시까지 비운 상태가 아니다. 유지 반복에서는 같은 입력의 프롬프트 캐시가 재사용됐다. 세 번의 중앙값은 많은 다른 회의록을 처리했을 때의 평균이나 서비스 지연 보장이 아니다.
Qwen의 시간은 미완성 응답이 잘릴 때까지의 시간이다. Gemma3와 생성한 토큰 수도 달라 “몇 배 빠른 모델”이라는 결론을 내릴 수 없다. 같은 한국어 입력이어도 토크나이저가 달라 실제 입력 토큰 수가 달랐다.
실험 서버와 자식 프로세스의 RSS 표본 최고치는 Qwen3 짧음 3.30GiB, 부록 포함 3.64GiB였고 Gemma3는 각각 4.24GiB, 4.83GiB였다. 기기 전체 RAM이나 필요한 최소 메모리가 아니다. 0.2초 간격 표본은 순간 최고점을 놓칠 수 있고 공유 메모리가 중복 집계될 수 있다. Ollama 할당 보고치와의 차이는 로컬 LLM 메모리 확인 가이드의 실측 표에서 구분했다.
같은 조건을 재현하는 방법
짧은 입력은 num_ctx:4096, 부록 포함은 num_ctx:8192로 실행했다. 공통 설정은 temperature:0, seed:42, num_predict:1024, stream:false다. Qwen만 think:false를 추가했다. 요청에는 회의록과 여덟 항목의 출력 지시만 넣고 정답표는 보내지 않았다.
실행 전 별도의 네 진단 요청으로 채팅 템플릿을 포함한 입력 토큰 수를 확인했다. 입력 토큰에 출력 상한 1,024를 더해도 할당 컨텍스트 안에 들어갔다. 이 진단은 품질 채점 16회에 포함하지 않는다.
다운로드 자료의 README.md에는 공식 런타임의 다운로드 주소와 SHA-256, 모델을 별도 폴더에 두는 방법, 재현 명령이 있다. protocol/에는 회의록·요청문·채점 기준의 실행 전 고정 시각과 해시를, local/runs/measured/에는 각 요청과 답변 원문을 보존했다. 설치된 Ollama와 모델을 준비한 뒤 패키지의 local 폴더에서 다음 스크립트로 새 결과 폴더를 만든다.
python3 run-experiment.py --output-dir reproduction-run
전체 준비 절차는 패키지 README를 따른다. 모델 가중치 다운로드는 약 5.84GB이며, 실행파일과 가중치는 ZIP에 넣지 않았다. 모델 태그가 나중에 달라질 수 있으므로 execution-plan.json의 전체 digest를 대조한다. 기록된 digest와 다르면 같은 스냅샷의 재현으로 보지 않는다.
이 결과로 결정할 수 있는 범위
이번 두 모델·설정 조합을 회의록 자동 공유에 바로 연결하기는 어렵다. Gemma3는 사람이 원문과 조건을 확인하는 초안 후보로 검토할 수 있고, Qwen3는 이 설정에서 답변 완결과 형식부터 다시 검증해야 한다. 출력 상한이나 생각 모드 설정을 바꾸면 개선될 가능성이 있지만 이번 실행으로 확인한 결과는 아니다.
자기 업무에 적용할 때는 폐기된 초안, 조건부 일정, 금액 포함 관계, 숫자 경계, 미정 사항이 들어 있는 비공개 정보 없는 예제를 먼저 만든다. 정답과 판정 기준을 고정한 뒤 실패한 답변도 보존한다. 이 사례의 입력과 루브릭은 그 출발점으로 재사용할 수 있다.
한 회의록, 두 모델, 한 장비, 두 입력 조건만 확인했다. 번역·창작·이메일·코딩 능력, 다른 양자화, 장시간 동시 처리, 실제 직원의 수정 시간은 측정하지 않았다. 유료 외부 API 호출은 0회지만 전력과 장비 감가상각을 포함한 운영비가 0원이라는 뜻은 아니다. 클라우드 API를 선택할 때의 토큰 비용은 별도의 단계별 API 비용 계산에서 계산한다.
2026년 9월 24일 공개: 합성 입력과 기준을 먼저 고정하고 16회 실행의 원문·실패·시간·메모리 표본을 함께 공개했다. 모델 digest, 런타임, 요청 설정을 바꿔 재검증할 때는 기존 기록을 보존하고 변경 조건을 별도로 기록한다.
참고한 출처
공식 발표·문서·changelog 기반으로 작성했습니다. 전체 4개 중 공식 출처는 4개입니다.
- Ollama — Generate a chat message(새 창)공식Ollama
- Ollama — List running models(새 창)공식Ollama
- Ollama qwen3:4b tag(새 창)공식Ollama
- Ollama gemma3:4b tag(새 창)공식Ollama