Munche-768

최초의 한국어 소설 문체 임베딩 모델

각 작가의 고유한 문체를 768차원 벡터로 표현하다.

EmbeddingGemma 300M 768 dimensions

Test results

작가 탐지 정확도 88.2%

42개 test 작품에서 추출한 348개 질의 중, 동일 장르의 다른 작품을 후보로 두고 같은 작가의 작품을 1순위로 찾은 비율입니다.

동일 작품 검색

동일 장르 후보군에서 같은 작품의 비중첩 장면을 검색한 mAP@R입니다.

동일 작가 검색

동일 장르의 다른 작품 중 같은 작가의 작품을 검색한 mAP@R입니다.

내용 강건성

내용이 가장 유사한 타 작품 4개보다 같은 작품의 다른 장면을 가깝게 배치한 비율입니다.

동일 내용 분리

동일 내용을 유지한 LLM 재작성본보다 같은 작품의 다른 장면을 가깝게 배치한 비율입니다.

최대 2,048토큰(약 3,600자)만으로 소설의 문체를 구분할 수 있습니다.

추가 지표결과평가 조건
동일 작품 Hit@195.6%동일 장르 · 1,089 질의
동일 작가 Hit@188.2%동일 장르 · 다른 작품 · 348 질의
가명 치환 질의 mAP@R81.1%가명 질의 · 원문 후보군
문단·문장부호 정규화 mAP@R68.3%형식 신호 통제

1,113가지 소설의 문체를3D 공간에서 확인해보세요.

AI와 인간, 그리고 장르별 분포를 확인해보세요. 전체 데이터는 6개 장르의 인간 소설 783편과 언어 모델 11종의 생성 소설 330편으로 구성됩니다.

UMAP · 3D1,113개 표본

문체 판별

같은 내용, 다른 문체를 분리합니다.

소설의 내용을 유지하고 AI로 새롭게 작성했을 때, 91.3%의 확률로 AI와 인간을 구분해냅니다.

단 10분의 추가 훈련만으로 같은 내용에서도 AI와 인간을 구분할 수 있습니다.

AUROC 0.967 · 균형 정확도 91.3%

인간 recall95.8%인간 원문 190편
LLM recall86.8%LLM 재작성본 190편
실제 원천인간 예측LLM 예측
인간 원문 190편182정분류8오분류
LLM 재작성본 190편25오분류165정분류

Detailed evaluation

검색·강건성·분리 성능을독립 test split에서 검증했습니다.

작품 및 저자 단위로 train·validation·test를 분리했습니다. 검색 평가는 동일 장르 후보군에서 수행했으며, 아래 수치는 체크포인트 선택에 사용되지 않은 test split 결과입니다.

mAP@R은 정답 수만큼의 상위 결과에서 측정한 평균 정밀도입니다. 반사실 순위 정확도는 동일 내용의 재작성본보다 동일 작품의 다른 장면을 가깝게 배치한 비율입니다.

테스트 조건지표결과표본
동일 작품·동일 장르 검색mAP@R0.8401,089 질의
동일 저자·작품 간 검색mAP@R0.799348 질의
가명 치환 질의에서 원문 검색mAP@R0.8111,089 질의
내용이 유사한 타 작품 4개 분리4개 전부 분리 정확도83.1%1,216 기준점
동일 내용 LLM 재작성본 순위Triplet accuracy79.5%190쌍
문단·문장부호 정규화 후 검색mAP@R0.6831,089 질의

작품과 저자 단위 분할을 사용했으며, test split은 체크포인트 선택에 사용하지 않았습니다.

Training configuration

인간 양성쌍
64,000쌍 · 동일 회차 8K, 근거리 20K, 원거리 24K, 동일 저자·타 작품 12K
내용 유사 음성
24,000 기준점 · Kiwi 형태소 TF-IDF 기반 타 작품 후보
반사실 쌍
1,306쌍 · train 913, validation 203, test 190
기반 모델
google/embeddinggemma-300m
적응 방식
Rank 32 LoRA · q/k/v/o 및 MLP projection
학습 파라미터
8,355,840 · 기반 모델, pooling, dense projection 고정
출력
Mean pooling · Dense projection · 768D · L2 normalization
입력 길이
최대 2,048 tokens

동일 작품 및 동일 저자의 텍스트를 양성 표본으로, 내용 유사 타 작품과 동일 내용 LLM 재작성본을 명시적 음성 표본으로 구성했습니다. 한국어 입력은 원문 25%, 가명 치환 50%, 고유명사 마스킹 25% 비율로 노출했습니다.

검색부터 코퍼스 진단까지,문체를 수치로 비교합니다.

문체 검색, 저자 간 일관성 분석, 코퍼스 분포 진단과 생성 모델 비교에 사용할 수 있습니다.

01

문체 유사도 검색

입력 텍스트와 문체적으로 유사한 텍스트를 검색합니다.

02

작가 간 비교

서로 다른 작품 사이의 문체적 일관성을 분석합니다.

03

장르 조건부 군집 분석

장르를 통제한 상태에서 작품 간 문체 거리와 군집 구조를 분석합니다.

04

코퍼스 분포 진단

인간·생성 코퍼스의 문체 분포, 편중 및 이상치를 점검합니다.

05

생성 모델 비교

언어 모델별 소설 출력의 문체 분포를 비교합니다.

Limitations

01 · 형식 신호 의존

문단 경계와 문장부호를 통일하면 동일 작품 검색 mAP@R이 0.840에서 0.683으로 하락합니다. 줄바꿈과 부호 사용이 문체 임베딩의 일부를 차지합니다.

02 · 한국어 소설 중심 평가

PAN21 저자 검증 AUROC는 0.895이나 PAN 삼중항은 학습 자료에 포함되었습니다. 미학습 영어 문체 속성을 평가한 SynthSTEL 정확도는 1.9%로 일반화 성능이 확인되지 않았습니다.

03 · LLM 원천 판별 범위

AUROC 0.967은 지정된 4종의 생성 모델이 특정 절차로 재작성한 표본에 대한 결과이며, 새로운 모델이나 다른 생성 조건의 AI 텍스트 탐지 성능을 보장하지 않습니다.