교수님 피하기 연구노트 무료로 시작

AI 감지 개선안을 검증하는 기준

감지 점수가 전반적으로 높아졌다고 정확도가 좋아졌다고 말할 수는 없어요. AI 글을 더 잘 찾으면서 사람 글을 잘못 의심하는 경우가 늘지 않는지 함께 확인해야 해요. 2026년 9월 7일 진행한 내부 개발 비교와, 그 결과 두 후보를 공개 점수에 적용하지 않은 이유를 정리했어요.

서로 다른 두 오류를 따로 세어요

사람이 쓴 글에 높은 AI 감지 점수가 나오면 오탐, AI가 쓴 글에 낮은 점수가 나오면 누락으로 살펴볼 수 있어요. 모든 점수에 일정한 값을 더하면 누락이 줄어든 것처럼 보일 수 있지만 사람 글의 오탐도 함께 늘 수 있어요. 그래서 두 결과를 따로 기록해요.

비교 기준점도 먼저 정해요. 이번 개발 비교에서는 50점 이상인 글의 수를 표로 정리했어요. 50점이 작성자를 확정하는 경계라는 뜻은 아니에요. 후보별 결과를 같은 기준으로 비교하기 위한 선이에요.

이번에는 어떤 글을 비교했나요

이미 개발 과정에서 열람한 사람 대조군 70편과 AI 글 41편, 총 111편을 사용했어요. 사람 대조군은 KLUE·NSMC 자료 40편과 공개 연구의 한국어 학생 글 30편이에요. AI 글은 생성한 설명문 20편, 리뷰 20편, AI 작성으로 확인된 탐구 보고서 재현본 1편으로 구성했어요.

학생 글은 연구진이 기록한 참가자 진술을 근거로 분류했으며, 개별 작성 이력을 독립적으로 인증한 자료는 아니에요. 이번 표본에는 자기소개서가 없어요. 무엇보다 이미 확인한 글을 다시 쓴 개발용 비교이므로 새로운 최종 검증 자료로 볼 수 없어요.

두 후보 모두 검출 개선으로 이어지지 않았어요

첫 후보는 숫자·이름·경험·오탈자 등을 사람 글에 유리한 단서로 단정하지 않도록 분석 지시를 다듬었어요. 두 번째 후보는 기존 분석과 통계 분류기의 판단이 크게 다른 글만 상위 모델로 다시 검토했어요. 실제 추가 검사는 33편에 수행하고 나머지는 기존 결과를 재사용했어요.

비교 방식사람 글AI 글
기존 엔진7/70편14/41편
지시 수정7/70편13/41편
선별 재검사7/70편14/41편

각 칸은 50점 이상인 글 수 / 해당 대조군 전체 글 수예요. 사람 글은 70편, AI 글은 41편을 같은 기준으로 비교했어요.

사람 대조군의 높은 점수 사례 수는 같았지만, AI 글을 찾은 수는 늘지 않았어요. 설명문은 20편 중 14편 → 13편 → 14편이었고, 리뷰는 세 방식 모두 20편 중 0편이었어요. 탐구 보고서도 세 방식 모두 50점 미만으로 나왔어요. 따라서 두 후보를 공개 감지 점수에 적용하지 않았어요.

이 표는 2026년 9월 7일, 공개 감지 엔진 v1.29를 기준으로 수행한 내부 개발 비교예요. 제한된 표본의 결과이며 서비스 전체 정확도나 모든 과제·리뷰에 대한 성능을 나타내지 않아요. 외부 기관의 인증 결과도 아니에요.

자료 수보다 작성 경위와 분리가 먼저예요

뉴스·리뷰가 많다고 과제·자기소개서까지 충분히 검증된 것은 아니에요. AI 글과 사람 글의 장르·길이·문항이 크게 다르면 작성 방식보다 자료의 차이를 구별하는 평가가 될 수 있어요. 실제 사용 상황에 맞춰 비교할 필요가 있어요.

또한 같은 원문을 줄이거나 다시 쓴 글을 개발용과 최종 검증용에 나누어 넣으면, 사실상 이미 본 내용으로 성능을 평가하게 돼요. 원본과 파생 글은 한 묶음으로 관리하고 작성자·출처도 함께 확인해야 해요. 최종 검증 자료를 보고 후보를 고쳤다면 그 자료는 다음 후보의 독립 검증에 재사용하지 않아요.

동작 검증과 정확도 검증은 역할이 달라요

이번 운영 반영에서는 내부 비교 기록의 누락을 고치고 모델·정책별 결과를 나누어 집계했어요. 같은 글을 두 번 계산하던 경로도 줄였고, 기존 900편의 후보 점수가 수정 전후에 모두 같다는 것을 확인했어요. 이는 계산을 정리해도 결과가 바뀌지 않았다는 검증이에요.

차감·캐시·결과 이력이 정상인지 확인하는 검사도 따로 진행했어요. 이런 검사를 통과했다는 사실만으로 사람 글과 AI 글을 더 정확히 구별한다고 말하지 않아요. 서비스가 정상 작동하는지와 분석 판단이 맞는지는 각각 확인해야 해요.

다음 공개 적용 전에 확인할 항목

아직 충분히 검증하지 못한 장르는 별도로 남겨 두고, 특정 예시의 점수를 높이는 전용 규칙으로 전체 개선을 대신하지 않으려 해요. 이번 비교는 정확도 문제를 해결했다는 발표가 아니라, 어떤 시도가 효과가 없었고 무엇을 더 확인해야 하는지 기록한 연구노트예요.

내 글의 결과도 근거와 함께 확인하세요

감지 점수를 작성자 판정으로 받아들이기보다, 원문에서 다시 읽을 부분을 찾는 참고 자료로 활용해 보세요.

무료 20크레딧으로 시작하기