[뉴스스페이스=이승원 기자] 독자들은 인간들이 쓴 소설보다 인공지능이 생성한 단편소설에 더 높은 평가를 내렸다. 특히 그 작품이 인간이 쓴 것이라고 믿었을 때 더욱 그러했다.
AI가 쓴 소설, 이제는 "티가 안 난다"
bbc.com, eurekalert.org, techxplore.com의 보도와 캠브리지 대학교 출판부가 학술지 《Judgement and Decision Making》에 발표한 연구에 따르면, 빌라노바 대학교 연구진(시드니 시어스·디나 스콜닉 와이스버그)은 18세에서 81세 사이의 성인 총 2,587명을 대상으로 인간이 쓴 소설과 AI가 생성한 소설을 구별할 수 있는지를 세 차례 실험으로 검증했다.
한 실험에서 식별 정확도는 39.93%로 우연 수준에도 미치지 못했고, 다른 실험에서는 51.97%로 동전 던지기와 다를 바 없었다. 국내외 후속 연구와 대규모 조사를 종합하면, AI 생성 소설에 대한 독자들의 선호와 식별 실패는 개별 실험의 우연이 아니라 반복적으로 확인되는 패턴으로 드러난다.
숫자로 본 핵심 실험 결과
흥미로운 점은 오류의 방향성이다. 와이스버그 박사는 참가자들이 AI 글을 인간 글로 착각한 비율과 인간 글을 AI 글로 착각한 비율이 거의 동일했다고 밝히며, "참가자들이 사람들이 특징이라 믿는 것과 AI 글쓰기의 실제 특징에 대해 가진 기준 자체가 잘못됐다는 뜻"이라고 설명했다.
다만 AI 리터러시 자가평가 점수가 1점 오를 때마다 정답률이 14% 상승했고, 검증된 척도인 'AI Literacy Scale'을 사용한 세 번째 실험에서는 그 상승폭이 33%에 달했다. 반면 "문학에 능통하다"고 자부한 참가자들은 식별력에서 별다른 우위를 보이지 못했다. 와이스버그는 식별의 실마리로 "em dash(줄표) 사용이나 'It's not just X, it's Y' 같은 문장 구조"를 꼽았다.
파인튜닝이 게임을 바꾼다
특히 주목할 결과는 스토니브룩대·컬럼비아 로스쿨·미시간대 공동연구다. 한강, 살만 루슈디, 마거릿 애트우드 등 노벨상·부커상 수상 작가 50인의 스타일을 단순 프롬프트로 모방시켰을 때는 전문가 독자들에게 압도적으로 외면받아 인간 작가 대비 6~8배 뒤처졌지만, 해당 작가의 전작으로 AI를 파인튜닝하자 상황이 완전히 역전됐다.
전문가들은 파인튜닝된 AI 글을 스타일 충실도 8.16배, 품질 1.87배 더 선호했고, 최첨단 AI 탐지기조차 그 글의 97%를 인간 작품으로 오판했다. 경제적 함의도 크다. 작가당 파인튜닝·추론 비용은 중앙값 81달러였던 반면, 실제 참여 작가들이 같은 분량(10만 단어)에 청구한 금액은 2만 5,000달러로, AI가 인간 비용의 0.3% 수준으로 더 선호되는 결과물을 만들어낸 셈이다. 이는 저작권 소송에서 핵심 쟁점인 '시장 희석 효과' 입증에 직접적인 근거로 활용될 전망이다.
선호와 실제 행동은 다를 수 있다
한편 보든 칼리지 마틴 아벨 교수의 실험은 다른 각도의 균형을 제공한다. AI가 썼다고 안내받은 그룹은 예측 가능성·진정성·감정적 매력 면에서 해당 소설을 더 낮게 평가했지만, 실제로 그 글을 읽는 데 쓴 시간이나 지불 의사, 필사에 투자한 시간에서는 인간 작가의 글과 별 차이가 없었다. 즉 "말로는 인간 작품을 선호한다"고 하면서도 "실제 행동은 AI작이라도 크게 다르지 않게 대한다"는 이중적 태도가 확인된 셈이다.
남는 질문들
빌라노바 연구는 세 쌍의 이야기와 초기 버전 챗GPT만을 사용했다는 한계가 있으며, 와이스버그 본인도 "모델이 더 발전했으니 지금은 더 인간처럼 느껴지는 단편을 생성할 수 있을 것"이라고 인정했다. 커먼웰스 단편소설상에서 AI 생성 의심 출품작을 둘러싼 논란이 이미 현실화된 만큼, 출판·저작권·학술 평가 전 영역에서 "글의 출처를 인간의 직관만으로 판별할 수 없다"는 전제 위에 새로운 규범을 세워야 할 시점이 다가오고 있다.

































































