정답을 고르는 힘과 쓰는 힘
지금까지 수능 같은 대규모 시험은 대부분 객관식이었습니다. 주어진 선택지 중 옳은 것을 알아보는 능력, 즉 재인(recognition)을 재는 방식입니다. 서·논술형 평가는 다릅니다. 아는 것을 스스로 문장으로 구성해 표현하는 능력, 즉 생산(production)을 요구합니다. 언어평가 연구에서도 재인은 장기기억에서 곧바로 꺼내 쓰는 반면 생산은 상대적으로 더 어려운 인출 과정을 거친다고 구분해왔습니다.
문제는 이 '생산'을 잘 측정하려고 할수록 채점은 더 어려워진다는 데 있습니다. 평가 분야에서는 이를 타당도와 신뢰도의 상충으로 설명합니다 — 서·논술형은 실제 사고·표현 능력에 더 가깝게 다가가는 측정(타당도)이지만, 채점자마다 판단이 갈릴 여지가 커서 일관된 점수(신뢰도)를 담보하기는 상대적으로 어렵습니다. "무엇을 재는가"에서는 손을 들어주지만 "얼마나 믿을 수 있게 재는가"에서는 항상 뒷말이 남는 평가 방식인 셈입니다.
대입 핵심 키워드가 된 '문해력'
지난주 국가교육위원회가 대입제도 개편 공론화 작업에 들어가면서, 수능에 서·논술형 평가를 도입하는 방안이 다시 논의 테이블에 올랐습니다. 전 과목 절대평가, 내신 서·논술형 확대까지 함께 검토하는 안입니다.
가장 큰 쟁점은 채점의 공정성입니다. 교육당국은 인공지능(AI) 채점으로 일관성을 확보하겠다는 구상이지만, AI 오류 가능성과 평가 책임 소재, 사교육 시장 확대라는 우려가 함께 제기됐습니다.
수능처럼 55만여 명이 한꺼번에 치르는 시험에서는 이 어려움이 곧바로 실무 문제로 이어집니다. 한국교육과정평가원 관계자는 서·논술형 채점에 대해 "검토에 지금보다 더 많은 시간이 들고, 통일된 판단 기준을 세우기도 어려울 것"이라고 설명했습니다. 3주 안에 채점을 마치려면 수천 명 규모의 채점 위원이 필요하고, 당국이 구상하는 AI 평가지원 시스템도 "최종 판단은 결국 사람의 몫"이라는 한계가 있습니다. 실제로 일본은 2017년 서·논술형 도입을 추진했다가 채점 오류와 채점자 편차 우려로 계획을 접었습니다. 반면 프랑스 바칼로레아, 영국 A레벨은 이미 서·논술형 시험을 운영 중입니다.
현장 반응도 엇갈립니다. 한국교원단체총연합회는 "찬성이라는 답을 정해놓고 벌이는 논의는 동의하기 어렵다"는 입장을 냈고, 지역에서는 논술학원이 4년 새 거의 두 배로 늘었다는 조사도 나왔습니다. 그 사이 서울대 신입생 글쓰기 시험 평균 점수는 2017년 73.7점에서 2024년 61.7점으로 낮아졌습니다.