목차
▪️인간의 저자권을 말하면서 AI 채점을 꺼내다
▪️일본의 실패가 남긴 것은 기술보다 신뢰의 문제
▪️AI 가 긴 답안과 키워드를 정답으로 착각할 때
▪️평가의 효율이 교육의 목적을 대신할 수 있는가
▪️창의성은 효율적으로 생산되지 않는다
▪️가르치고 배우고 피드백하는 전 과정이 교육이다
▪️[전문 용어 사전]
▪️[칼럼니스트 소개]
▪️[같이 읽으면 좋을 기사]

산더미처럼 쌓여 있는 수많은 서술형 시험지들의 하중을 견디지 못하고 대학교 석조 관문이 쩍쩍 갈라지며 무너져 내리는 가운데, 주변 모니터 화면에 '신뢰 붕괴'와 'TRUST COLLAPSED'라는 붉은색 경고 문구가 선명하게 깜빡이는 일러스트
아이들이 자신의 생각을 글로 옮기는 시간엔 연필을 쥐고 문장을 썼다 지우기를 반복한다. 엉성하고 정제되어 있지 않은 논리와 삐뚤은 글씨로 쓴 글 안에는 세상을 바라보는 순수한 시각과 상상의 세계가 살아있다. 최근 교육계는 기계적 정답 암기를 탈피하고 비판적 사고를 기르겠다는 취지로 수능 서 ·논술형 평가 확대를 논의하고 있다.
이에 따라 대치동, 목동 등 학원가에서는 초등 논술 수업에 대한 문의와 대기 수요가 증가하는 현상도 나타났다. 하지만 국가교육위원회 토론회에서는 AI 가 1 차 채점 초안을 만들고 교사가 이를 검토해 최종 점수를 확정하는 방안이 제시됐다.
획일화된 정답을 버리고 비판적 사고와 창의성을 키우기 위해 글로 시험을 보면서, 그 글의 평가에는 효율을 기반으로 움직이는 인공지능을 활용하려는 아이러니한 구조가 거론되고 있는 것이다.
인간의 저자권을 말하면서 AI 채점을 꺼내다
교육 정책의 흐름과 실제 현장의 반응은 엇갈린 양상을 보인다. 한편에서는 학생이 AI 에 인지적으로 종속되지 않도록 주체적 저자권을 지키는 저작권 역량 강화 교육을 강조한다.
경북교육청과 KERIS 교육저작권지원센터가 진행한 연수도 단순한 AI 도구 시연을 넘어, 학교 현장에서의 생성형 AI 활용과 저작권 문제, AI 생성물의 한계와 검토 필요성을 다루는 데 초점을 맞췄다. AI 를 인간의 상상력을 대신하는 기계가 아니라 보조하는 도구로 활용해야 한다는 인간 중심의 교육관이다.
그러나 대입 영역에서는 대규모 서 ·논술형 답안을 처리해야 한다는 현실적 이유로 AI 1 차 채점 방안이 제시되고 있다. 교육부와 국교위가 학교 서 ·논술형 평가의 확대와 AI 평가 지원 시스템 구축을 논의하는 가운데, 학생의 고유한 사고와 표현을 평가하려는 제도에 다시 효율성과 표준화의 논리가 들어오고 있는 셈이다.
일본의 실패가 남긴 것은 기술보다 신뢰의 문제
대규모 서술형 평가의 한계는 일본 사례에서 드러났다. 일본은 2017 년 대학입학공통시험에 국어와 수학 서술형 문항을 도입하기로 했지만, 시행을 앞둔 2019 년 채점의 공정성과 신뢰성을 확보하기 어렵다는 이유로 계획을 철회했다.
50 만 명이 시험을 치를 경우 두 과목에서 약 100 만 장의 답안이 발생할 수 있어 대규모 채점 인력이 필요했고, 일본 정부는 민간 교육업체에 채점을 맡기는 방안을 추진했다. 그러나 해당 업체가 대학생 등 무자격자를 채점에 동원한 사실이 드러나면서 채점 체계에 대한 신뢰가 무너졌다.
한국 교육당국은 국가 차원의 AI 시스템과 교사 검토 절차를 통해 일본과 같은 문제를 피할 수 있다고 본다. 실제 제안된 방식은 교사와 전문가가 문항 및 루브릭을 설계하고, AI 가 1 차 채점한 뒤 교사가 최종 점수를 확정하는 구조다. 그러나 입시 일정 안에 수많은 답안을 처리하고, 채점 결과에 대한 이의신청과 재검토 절차까지 보장해야 한다는 문제는 여전히 남아 있다.
일본 사례가 보여준 핵심은 단순히 채점자를 사람으로 둘 것인가 AI 로 둘 것인가가 아니라, 학생과 사회가 그 평가 결과를 믿을 수 있는가의 문제다.
AI 가 긴 답안과 키워드를 정답으로 착각할 때
한국교육과정평가원이 발표한 『교과 서 ·논술형 평가 자동 채점을 위한 인공지능 모델 적용 방안 연구 (Ⅱ)』를 인용한 보도에서는 AI 자동채점의 기술적 한계가 제시됐다. 국어 ·사회 ·수학 ·과학 ·기술 교과의 자동채점 모델을 구축 ·검증한 결과, 일부 답안에서 AI 가 개념의 정확성이나 논리보다 문장 길이와 특정 어휘 등 형식적 요소에 영향을 받는 사례가 나타났다는 것이다.
보도된 사례 중에는 교사가 비문이나 논지 이탈을 이유로 낮은 점수를 준 답안에 AI 가 높은 점수를 부여한 경우가 있었다. 과학 문항에서도 원리를 반대로 서술했지만 특정 키워드가 포함됐다는 이유로 높은 점수가 나온 사례가 소개됐다.
이런 결과는 AI 채점이 모든 답안을 자동으로 잘못 평가한다는 뜻은 아니다. 다만 학생의 답안이 AI 가 인식하기 쉬운 단어를 많이 넣거나 문장을 길게 늘이는 방향으로 정형화될 가능성, 즉 채점 가능성이 문항과 답안의 형식을 거꾸로 결정할 가능성을 보여준다.

따스한 햇살이 비치는 교실 책상에 앉아 안경을 쓴 남자 교사가 미소를 지으며 학생들이 손글씨로 제출한 시험지를 읽고 빨간색 펜으로 격려와 애정이 담긴 피드백을 정성스레 적어주는 일러스트
평가의 효율이 교육의 목적을 대신할 수 있는가
교육은 가르치고, 익히고, 배우게 하며, 그 과정을 타인과 공유하고 평가받는 상호작용이다. 평가의 결과 역시 학생을 선별하는 데서 끝나는 것이 아니라, 학생이 무엇을 이해했고 어디에서 막혔으며 앞으로 무엇을 배워야 하는지를 알려주는 교육적 과정이어야 한다.
AI 채점은 교실에서 빠른 피드백을 제공하는 형성평가 도구로 활용될 수 있다. 그러나 입시와 같은 고부담 총괄평가에서는 속도보다 타당성 ·신뢰도 ·책임성이 먼저 검증되어야 한다.
기계적 효율성을 위해 아이들이 써 내려간 노력과 시간의 결과물을 문장 길이와 키워드 같은 형식적 지표로 치환해서는 안 된다. AI 를 도입하더라도 평가 기준을 설계하고 결과에 책임지며 이의신청을 판단하는 권한은 인간과 교육기관에 남아 있어야 한다.
창의성은 효율적으로 생산되지 않는다
상상하는 인간을 기르는 교육은 단기간에 완성될 수 없고, 효율적으로 처리할 수도 없다. 그렇다고 교육의 방향이 복잡한 것은 아니다. 아이에게 상상하고, 시도하고, 실패하고, 자신의 세계를 만들어갈 시간과 환경을 제공하면 된다. 인간의 상상력과 창의성, 비판적으로 생각하고 논리적으로 표현하는 능력은 정답을 주입한다고 길러지지 않는다. 직접 해보며 문제를 발견하고 해결책을 찾는 과정에서 자란다.
그 창의성을 이해하고 평가하려면 평가자 역시 학생의 사고 과정과 표현의 맥락을 읽을 수 있어야 한다. 물론 짧은 시간 안에 자신의 생각과 논지를 정확하게 표현하려면 별도의 훈련이 필요하다. 서 ·논술형 평가 도입 소식만으로 학원가가 움직이는 이유도 여기에 있다.
좋은 교육과 공들여 설계한 시험의 목적이 같아야 교육 전체가 일관되게 흘러간다. 한쪽에서는 문해력과 비판적 사고를 말하면서 다른 쪽에서는 채점 효율을 위해 답안을 정형화한다면, 아이들과 학부모는 다시 혼란에 빠질 수밖에 없다.
가르치고 배우고 피드백하는 전 과정이 교육이다.
AI 가 쓴 글은 AI 로 검증할 수 있다. 하지만 적어도 아이들이 자신의 경험과 생각을 담아 쓴 글은 신뢰할 만한 어른이 읽고, 무엇이 잘되었고 무엇을 더 고민해야 하는지 알려주어야 한다. 그것까지 모두 교육의 일환이다. 대입에서 학생들의 글을 평가하고 등수를 매기고 점수를 주는 일을 왜 하는 것인지 그 목적을 분명히 따져보고 도입하기 전에 물어야 한다. 이 교육과정은 누구를 위해, 무엇을 위해 존재하는가.
교육 정책과 평가 제도의 결정은 한 세대의 공부법만 바꾸는 일이 아니다. 아이들이 무엇을 배우고, 어떤 능력을 중요하게 여기며, 사회가 어떤 인간을 길러낼 것인지 결정하는 일이다. 인간의 창의성과 문해력을 말하려면, 그 능력을 평가하는 과정 역시 인간의 경험과 판단을 배제해서는 안 된다.
다른 건 몰라도 AI와 공존하는 시대를 살아갈 아이들 교육의 목적 그 무엇보다 인간만이 가질 수 있는 고유한 역랑들을 기르고 가르치는 순수하고 궁극적인 본질이 우선 되어야 한다. 그것이 곧 우리 모두의 미래이기 때문이다.
[전문 용어 사전]
▪️형식 편향 (Formal Bias): 인공지능(AI) 자동 채점 알고리즘이 글의 개념적 정확성이나 논리적 타당성보다, 문장 길이와 특정 단어 사용량, 어미의 다양성 등 외형적인 형식 요소에 더 크게 반응하여 점수를 왜곡 평가하는 기술적 한계이다.
▪️루브릭 (Rubric): 서·논술형 평가에서 채점의 공정성과 객관성을 담보하기 위해 평가 항목, 수행 수준별 성취 기준, 배점 등을 세분화하여 설계한 '글쓰기 채점 기준표'이다.
▪️형성평가 (Formative Assessment): 교수·학습 과정 중에 실시하여 학생이 무엇을 이해하고 어디에서 막혔는지 확인하고, 교수자가 즉각적이고 빠른 피드백을 제공하여 배움을 돕는 평가 방식이다.
▪️총괄평가 (Summative Assessment): 대학수학능력시험(수능)처럼 교육 과정이나 학기가 끝난 시점에 학생의 학업 성취도를 종합적으로 최종 판정하는 고부담(High-stakes) 평가로, 기계적 속도보다 타당성과 신뢰성이 최우선으로 요구된다.
▪️주체적 저자권 (Human Authorship): 학생들이 생성형 AI의 결과물에 인지적으로 종속되지 않고, 자신만의 생각과 경험, 관점을 고유의 서사와 문장으로 직접 직조하여 표현해 내는 주체적인 창작 권리이자 역량이다.
[칼럼니스트 소개]
책마법사(최상희)는 상상하는 인간을 연구하고 기록하는 스토리 아티스트이자 언론인이다. 2001년부터 아날로그 창작 교육과 북아트를 통해 상상력의 가치를 탐구해 왔으며, 2023년부터는 생성형 AI와 새로운 창작 환경을 연구하고 있다. 인터넷 신문 The Imaginary Pocus를 창간해 '상상하는 인간 중심 저널리즘'을 바탕으로 인간의 상상력과 창작, 기술이 만나는 지점을 기록하며 시사와 문화, 기술을 잇는 칼럼을 연재하고 있다.
[같이 읽으면 좋을 기사]
[Pocus 창작교육 칼럼] 4화: 노르웨이는 왜 초등학생에게 AI보다 읽고 쓰는 법을 먼저 가르치려 하나
[Pocus 창작교육 칼럼] 5화: AI 활용 교육에 왜 그림일기가 필요했을까
[Pocus 창작교육 칼럼] 6화: 문해력 시험은 '시험'을 여섯 번 쓴 아이를 몇 점 줄까
※ 이 기사의 이미지 제작 및 팩트체크 과정에는 생성형 AI 도구가 보조적으로 활용되었으며, 모든 정보의 최종 검증과 편집 책임은 인간 기자가 담당했습니다.

















