- 스탠퍼드 HAI(Stanford HAI)의 2024년 보고서에서 GPT-Zero, Turnitin 등 주요 AI 탐지 도구의 오탐률이 상당하며, 특히 비영어권 언어에서 부정확성이 더 높다는 분석이 제시됐습니다. 탐지 도구는 AI 사용을 증명하거나 반증하는 근거가 될 수 없습니다.
- 검증의 목적이 AI 사용 여부를 잡아내는 것이라면 이미 잘못된 질문입니다. 검증의 목적은 산출물에 담긴 판단이 의뢰한 업무의 맥락을 이해한 사람에게서 나왔는지를 확인하는 것입니다.
- 실질적으로 작동하는 검증 방법은 구체적인 질문입니다. 이 결론에 도달하기까지 어떤 판단을 했는가, 이 방향을 선택하고 버린 대안은 무엇인가, 이 자료에서 확신이 낮은 부분은 어디인가를 물었을 때 설명할 수 있으면 산출물을 이해하고 있는 것입니다.
탐지 도구가 작동하지 않는 이유
채용팀이 마케팅 전략 기획서를 포트폴리오로 제출한 지원자의 자료를 AI 탐지 도구에 넣었습니다. 결과는 AI 생성 가능성 92%였습니다. 지원자는 본인이 직접 작성했다고 했습니다. 반대 상황도 있었습니다. 외주사가 납품한 시장 조사 보고서를 같은 도구에 돌렸더니 AI 생성 가능성 8%가 나왔습니다. 그러나 보고서 안의 시장 규모 수치가 실제 출처와 달랐고, 경쟁사 분석 부분이 공개 데이터 요약에 그쳤습니다. 탐지 도구는 AI를 썼는지를 알려주지 않았습니다.
스탠퍼드 인간중심 AI 연구소(Stanford HAI)의 2024년 AI 지수 보고서에서 현재 AI 탐지 도구들의 신뢰성 한계가 지적됐습니다. 특히 후처리를 거친 AI 생성 텍스트나 비영어권 언어에서 오탐률이 높아지는 문제가 언급됐습니다. AI를 썼더라도 탐지를 피하는 방법은 이미 널리 알려져 있습니다. 탐지 도구에 의존하는 것은 이미 의미 있는 검증 방법이 아닙니다.
더 근본적인 문제가 있습니다. AI를 써서 만든 산출물이라도 제대로 된 판단이 담겨 있다면 가치 있습니다. 반대로 AI를 전혀 쓰지 않았어도 판단이 없는 산출물은 의미가 없습니다. 검증해야 할 것은 AI 사용 여부가 아닙니다.
검증이 찾아야 하는 것
외주사 산출물과 지원자 포트폴리오를 검증하는 목적은 하나입니다. 이 산출물에 담긴 판단이 의뢰한 업무의 맥락을 이해한 사람에게서 나왔는가를 확인하는 것입니다. AI가 초안을 썼더라도 그 초안을 검토하고 맥락에 맞게 조정한 사람이 있다면 그 판단이 산출물에 남아 있습니다. 반대로 AI 출력을 그대로 붙여넣었다면 맥락에 맞지 않는 일반적 내용이 산출물 안에 있습니다.
판단의 흔적을 확인하는 방법은 구체적인 질문입니다. 이 결론에 도달하기까지 검토했던 다른 방향은 무엇이었는가. 이 자료에서 본인이 확신이 낮은 부분이 어디이며 왜인가. 이 분석에서 가장 어려웠던 판단은 무엇이었는가. 이 질문에 설명할 수 있는 사람은 산출물을 이해한 것입니다. 설명하지 못한다면 산출물과 분리되어 있는 것입니다.
Ahn Partners 판단: 외주사에 대한 검증 질문은 납품 후에 하는 것이 아닙니다. 계약 전 제안 단계에서 제안서의 특정 판단에 대해 '이 결론은 어떤 데이터에서 나왔는가', '이 추천과 반대 방향을 선택했을 때의 리스크는 무엇인가'를 물어보면 됩니다. 그 질문에 답하는 방식이 이후 납품물의 질을 예측합니다.
검증 질문을 표준화하는 방법
채용 포트폴리오 검증에서 실무적으로 작동하는 방법이 있습니다. 제출된 포트폴리오에서 가장 핵심적인 판단이 담긴 문장이나 섹션을 하나 골라서 그 내용에 대해 세 가지를 묻는 것입니다. 이 판단의 근거가 된 데이터나 사례가 무엇인가. 이 방향 외에 검토했다가 버린 대안은 무엇인가. 만약 이 제안이 실제로 실행된다면 실패할 가능성이 높은 조건은 무엇인가.
이 세 질문에 답하는 과정에서 해당 산출물을 만든 사람이 그 주제를 실제로 이해했는지가 드러납니다. AI로 만든 산출물을 이해하지 않고 제출한 경우라면 근거가 막히거나 대안을 설명하지 못하거나 실패 조건을 생각해본 적이 없습니다.
이번 주에 확인할 것은 이것입니다. 지금 외주사나 지원자 산출물을 검증할 때 어떤 질문을 하는가입니다. AI 탐지 도구 결과를 확인하거나 결과물 형식만 보고 있다면 실질적인 검증이 이뤄지고 있지 않을 가능성이 높습니다.
한 문장으로 정리하면
AI 산출물 검증의 유일하게 작동하는 방법은 탐지 도구가 아니라 산출물에 담긴 판단의 근거, 버린 대안, 확신이 낮은 부분을 직접 묻는 것입니다.
점검 목록
- 외주사 납품물이나 채용 포트폴리오를 검토할 때 AI 탐지 도구 결과 외에 판단의 근거와 버린 대안을 묻는 질문이 표준 검증 프로세스에 포함되어 있는가
- 외주 제안 단계에서 제안서의 핵심 판단에 대해 반대 방향의 리스크를 질문해서 이후 납품 품질을 사전 검증한 적이 있는가
- 채용 면접에서 포트폴리오의 특정 문장이나 결론에 대해 그 근거와 실패 조건을 설명하게 하는 질문이 있는가
출처
- Bommasani, R. et al. / Stanford HAI (2024). AI Index Report 2024. Stanford University. AI 탐지 도구의 신뢰성 한계 분석 포함. 비영어권 언어와 후처리 텍스트에서 오탐률이 높아지는 문제 지적. 탐지 도구에 의존한 교육 및 채용 검증의 한계 논의.
- Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux. 전문성은 결과가 아닌 과정에서 드러난다는 판단 연구. 판단의 근거를 설명하는 능력이 전문성의 지표이며, 결과물 형식만으로는 판단 수준을 알 수 없다는 인지심리학적 근거.

