생성형 AI가 지식 검색과 초안 작성, 문제 해결의 일부 과정을 빠르게 대체하면서, 평가의 초점은 ‘무엇을 알고 있는가’에서 ‘맥락 속에서 지식을 어떻게 해석하고 적용하며 수행하는가’로 이동할 필요가 있다. 따라서 AI 시대의 평가는 학생이 낯선 상황이나 실제적인 문제 장면에서 지식을 재구성하고, 자신의 판단 근거와 사고 과정을 설명하며, 복합적인 과제를 해결하는 능력을 드러내도록 맥락 및 수행 기반으로 설계되어야 한다. 다시 말해 단순한 사실 지식에 대한 확인은 언제든 검색과 AI의 도움을 받을 수 있기 때문에 AI 시대의 평가는 실생활에서의 모호하고 복잡한 과제 속에서 학생이 어떤 질문을 만들고, 어떻게 타인과 소통하고 피드백을 반영하는지를 확인하는, 즉, 인간의 고유 역량에 대한 평가 방식으로 확장될 필요가 있다.
· 보고서명: AI and the Future of Education: Disruptions, Dilemmas and Directions
· 출처: UNESCO. (2025).
· 시그널: 사고 과정의 외현화
<원문> With generative AI, it will be possible to redirect feedback and assessment systems to deep learning or 'complex epistemic performance'… Along the way, students can be asked to externalize their thinking processes… explicitly articulating their underlying knowledge processes. (UNESCO, 2025, p. 83)
<번역> 생성형 AI를 통해, 피드백과 평가 체계를 깊은 학습(deep learning)이나 '복잡한 인식론적 수행(complex epistemic performance)'으로 재지향할 수 있게 된다… 학생들은 자신의 사고 과정을 외화(externalize)하도록 요구받을 수 있으며, 그 기저에 있는 지식 과정을 명시적으로 진술해야 한다. (UNESCO, 2025, p. 83)
· 인물: 알렉산드르 왕(메타 최고 AI 책임자)
· 출처: Y Combinator. (2025, June 18).
· 시그널: 실생활 문제 중심의 새로운 평가 방식으로의 전환
<원문> "The saving grace for the naming was that it is the last exam. The new eval will be sort of like real world tasks, real world activities which are sort of like fundamentally fuzzier and more complicated."
<번역> ('인류의 마지막 시험'이라는) 이름이 다행스러운 이유는 그것이 정말 마지막 지필 시험이기 때문입니다. 앞으로의 새로운 평가는 근본적으로 더 모호하고 복잡한 실생활의 과제나 활동 같은 형태가 될 것입니다.
· 보고서명: AI adoption in the education system
· 출처: OECD. (2025).
· 시그널: AI 시대 학업 성실성과 인간 역량 평가
<원문> Oral assessment practices are relational in nature, promoting student engagement and teacher-student interactions and feedback. (Selwyn, 2024; Gray et al., 2025, 인용 Borgonovi et al., 2025, p. 15). … they present a concrete approach to upholding academic integrity in the age of AI. … Answering live, in-person questioning cannot be aided by AI tools, requiring students to develop and demonstrate communication skills. (Komasawa & Yokohira, 2025, 인용, Borgonovi et al., 2025, p. 15)
<번역> 구두 평가 관행은 관계적 성격을 가지며, 학생 참여와 교사-학생 상호작용 및 피드백을 촉진한다. (Selwyn, 2024; Gray et al., 2025, 인용 Borgonovi et al., 2025, p. 15). … 이러한 관행은 AI 시대에 학업 성실성을 유지하기 위한 구체적 접근을 제시한다. … 실시간 대면 질문에 답하는 것은 AI 도구의 도움을 받을 수 없기 때문에, 학생들은 의사소통 역량을 개발하고 이를 보여주어야 한다. (Komasawa & Yokohira, 2025, 인용, Borgonovi et al., 2025, p. 15)
알렉산드르 왕 (Alexandr Wang)
AI 기반 평가가 확산될수록 오히려 교사의 전문적 판단이 더 중요하다. AI는 학생의 답안 분석, 채점 보조, 피드백 생성 등 평가 과정의 효율성과 일관성을 높이는 데 기여할 수 있지만, 평가가 루브릭 기반의 점수 판정과 같이 단순한 과정으로 이해되어서는 안 된다. 학생의 응답이 교육적 목표에 얼마나 부합하는지, 학습자의 맥락과 성장 과정 속에서 본 학습이 어떤 의미를 갖는지는 결국 교사가 해석해야 하는 영역이다. UNESCO 역시 AI가 평가의 문제를 단독으로 해결할 수 없으며, AI가 채점한 결과가 교육 목표에 부합하는지 인간 교사의 개입이 필수적이라 강조하고 있다.
· 보고서명: AI and the Future of Education: Disruptions, Dilemmas and Directions
· 출처: UNESCO. (2025).
· 시그널: 최종 판단은 사람이
<원문> AI cannot solve assessment challenges alone… human-in-the-loop systems are vital. Teachers regularly review AI-marked essays to ensure alignment with educational values and disciplinary expectations… Human oversight is essential not just for trust, but to prevent harm. (UNESCO, 2025, p. 122)
<번역> AI는 평가의 도전 과제를 혼자 해결할 수 없다… 사람이 개입된(human-in-the-loop) 시스템이 필수적이다. 교사들은 AI가 채점한 에세이를 정기적으로 검토하여, 그것이 교육적 가치와 학문 분야의 기대에 부합하는지 확인한다… 인간의 감독(human oversight)은 신뢰를 위해서만이 아니라, 피해를 방지하기 위해서도 필수적이다. (UNESCO, 2025, p. 122)
· 보고서명: Preparing educators for the AI-enhanced future: Insights from a teacher professional development for K-12 education in Singapore
· 출처: Looi, C.-K., Yang, Y., Velander, J., Milrad, M., & Sun, D. (2026).
· 시그널: AI 기반 평가 도구를 활용하되 교사의 최종 판단을 유지하는 원칙
<원문> - The “meta-autonomy” principle should be applied, emphasizing that teachers make a conscious effort to make the final marking decision. (Looi et al., 2026, p. 23, Table 7)
<번역> “메타-자율성(meta-autonomy)” 원칙이 적용되어야 하며, 이는 교사가 최종 채점 결정을 의식적으로 내리도록 강조한다. (Looi et al., 2026, p.23, Table 7)
AI 시대에는 교사의 역할이 약화되는 것이 아니라, 오히려 평가 결과를 교육적으로 해석하고 학생에게 적절하게 연결해 주는 방향으로 재정립되어야 한다. 실제 AI 피드백은 루브릭과의 정렬성이나 업무 경감 측면에서는 장점이 있으나, 정확성과 표현의 섬세함에서는 인간 피드백이 여전히 우수하다는 점이 제시되고 있다. 교사는 AI가 산출한 평가 결과를 그대로 전달하는 관리자에 머무르지 않고, 그것을 학생의 학습 과정과 성장 가능성에 비추어 재해석하는 해석자이자, AI의 분석과 학생의 이해 사이를 조정하는 중재자로 역할해야 한다. AI가 즉각적인 피드백과 기초 분석을 담당한다면, 교사는 그 결과를 바탕으로 더 깊이 있는 질문을 던지고, 학생의 사고를 확장하는 토론을 이끌며, 평가가 단순한 점수 부여가 아니라 학습을 촉진하는 과정이 되도록 해야 한다.
· 인물: 알렉산드르 왕(메타 최고 AI 책임자)
· 출처: Congress Clips. (2025, June 21).
· 시그널: AI 관리자 및 감독자
<원문> "Our view is that you know in many ways um our role uh you know humans role will go towards supervising and managing these AI systems these AI agents if you will um in a in a and give ourselves frankly more leverage."
<번역> 우리의 견해는 다방면에서 인간의 역할이 이러한 AI 시스템, 즉 AI 에이전트를 감독하고 관리하는 방향으로 나아가고, 솔직히 말해 우리 스스로에게 더 큰 레버리지를 제공하게 될 것이라는 점입니다.
· 보고서명: Generative AI in the K–12 Formative Assessment Process: Enhancing Feedback in the Classroom
· 출처: Maksimchuk, M., Roeber, E., & Store, D. (2025).
· 시그널: 인간 피드백의 우수성
<원문> Studies show AI feedback can align well with rubric criteria and reduce teacher burden, though human feedback remains superior in accuracy and tone (Steiss et al., 2024, 인용 Maksimchuk, Roeber, & Store, 2025, p. 108)
<번역> 연구에 따르면 AI 피드백은 루브릭 기준과 잘 정렬되며 교사의 부담을 줄일 수 있지만, 정확성과 톤 면에서 인간 피드백이 여전히 우수하다(Steiss et al., 2024, 인용 Maksimchuk, Roeber, & Store, 2025, p. 108)
· 인물: 살 칸(칸아카데미 창립자)
· 출처: Khan, S. (2025, June 19).
· 시그널: 깊이 있는 토론과 연결 형성
<원문> "Teachers will always be essential... AI can provide instant feedback on writing, coding, or problem-solving, allowing professors to focus on deeper discussions."
<번역> 교사는 항상 필수적입니다. AI가 글쓰기, 코딩, 문제 해결에 즉시 피드백을 주면, 교수는 깊이 있는 토론에 집중합니다.
알렉산드르 왕 (Alexandr Wang)
살 칸 (Sal Khan)
AI 활용 평가의 공정성 및 신뢰성 확보는 AI를 평가 과정에 활용하고자 할 때 반드시 전제되어야 하는 핵심 조건이다. AI는 채점, 피드백 생성, 학습 데이터 분석 등을 통해 평가의 효율성과 개별화의 가능성을 높일 수 있지만, 동시에 알고리즘 편향, 불투명한 판단 과정, 개인정보 침해, 평가 결과에 대한 책임 소재의 불명확성이라는 문제를 동반할 수 있다. 따라서 AI 활용 평가는 단순히 기술적으로 가능한가의 문제가 아니라, 그 평가가 학생에게 공정하게 작동하는지, 어떤 기준과 데이터에 의해 판단이 이루어졌는지, 결과에 대한 책임을 누가 지는지를 함께 검토하는 방식으로 설계되어야 한다.
또한 AI 평가의 신뢰성은 AI가 산출한 결과를 그대로 수용하는 데서 확보되는 것이 아니라, 교사의 검토와 교육적 판단을 통해 보완될 때 형성된다. 특히 생성형 AI를 피드백의 질을 분석하거나 학생 수준에 맞는 평가 정보를 제공하는 데 활용할 수 있지만, 그 피드백이 실제로 타당하고 학생에게 효과적인지는 교사가 검증해야 한다. AI가 생성한 평가 결과가 학생의 학습 과정과 맥락을 충분히 반영하지 못하거나 특정 집단에 불리하게 작동할 가능성이 있는 경우, 교사의 검토는 평가의 신뢰와 공정성을 보장하는 필수 절차가 된다. AI의 편리함을 활용하되, 투명한 기준, 개인정보 보호, 편향 점검, 교사 검증 절차를 함께 마련함으로써 평가가 교육적으로 타당하고 책임 있게 운영되도록 하는 것이 중요하다.
· 보고서명: Preparing educators for the AI-enhanced future: Insights from a teacher professional development for K-12 education in Singapore
· 출처: Looi, C.-K., Yang, Y., Velander, J., Milrad, M., & Sun, D. (2026).
· 시그널: FAST(공정성, 책임성, 지속가능성, 투명성) 원칙
<원문> Discuss FAST principles for ethical AI development: fairness, accountability, sustainability, transparency. - Ensure AI assessments are unbiased and respectful of student privacy. (Looi et al., 2026, p. 22, Table 6)
<번역> 공정성(fairness), 책임성(accountability), 지속가능성(sustainability), 투명성(transparency)의 FAST 원칙을 윤리적 AI 개발을 위해 논의한다. - AI 평가가 편향되지 않고 학생 프라이버스를 존중하도록 보장한다. (Looi et al., 2026, p. 22, Table 6)
· 보고서명: OECD Digital Education Outlook 2026
· 출처: OECD. (2026).
· 시그널: 인간 검증으로 신뢰성 확보
<원문> GenAI could also be used to assess the quality of the feedback provided based on research on high quality feedback… Ultimately, getting this feedback vetted by humans is essential for it to be trusted and effective for students (OECD, 2026).
<번역> GenAI는 고품질 피드백 연구 기반으로 피드백 품질을 평가하나, 인간 검증으로 신뢰와 효과를 확보해야 한다 (OECD, 2026).
AI 활용 평가의 공정성과 신뢰성을 확보하기 위해서는 AI를 활용한 개방형 평가만으로 평가 체계를 구성하기보다, 일정 부분 AI와 차단된 폐쇄형 평가를 병행할 필요가 있다. AI는 학생의 과제 수행, 피드백 반영, 탐구 활동을 지원할 수 있지만, 그 과정에서 학생이 실제로 어느 정도의 지식과 사고력을 스스로 내면화했는지는 별도로 확인되어야 한다. 특히 AI의 도움을 받아 학습하거나 과제를 수행한 학생이 겉으로는 높은 성과를 보이더라도, AI 도구가 차단된 환경에서는 그 성과가 유지되지 않을 수 있기 때문이다. 학습자의 성장을 평가하기 위해서는 앞서 도출했던 시그널과 같이 학습의 과정을 면밀히 살펴봐야 하는 것도 중요하지만 반드시 이해와 습득이 전제되어야 하는 지식에 대해서는 AI가 차단된 폐쇄형 환경에서의 평가를 병행하여 진행할 필요가 있겠다.
폐쇄형 평가의 병행 활용은 AI를 평가에서 배제하자는 의미가 아니라, AI 활용 과정에서 드러나는 수행 능력과 AI 없이 발휘되는 실제 이해 수준을 함께 확인해야 한다는 의미를 갖는다. 정기적인 지필 평가, 구술 확인, 비디지털 과제, 현장형 수행 점검 등은 학생이 AI에 의존하지 않고 핵심 개념을 이해한 상태에서 설명할 수 있는지를 확인하는 수단이 될 수 있다. 이는 학습자가 인지적 학습 과정의 부담을 줄이기 위해 기억하거나 생각해야 할 일을 AI에 맡기는 인지적 오프로딩을 줄일 수 있는 별도의 기준을 마련한다는 점에서도 중요하다.
· 보고서명: OECD Digital Education Outlook 2026
· 출처: OECD. (2026).
· 시그널: GenAI 의존 없이 실제 지식 확인
<원문> …when their knowledge was assessed in a closed-book environment, the performance gains vanished students who used the general-purpose GPT scored lower than those studying on their own (Bastani et al., 2024, as cited in OECD, 2026, Figure 1.5).
<번역> 폐쇄형 환경 평가에서 GenAI 연습 성과가 사라지며, 범용 GPT 사용자들이 자습자보다 낮은 점수 (Bastani et al., 2024, 인용 OECD, 2026, Figure 1.5).
· 보고서명: AI adoption in the education system
· 출처: OECD. (2025).
· 시그널: 디지털 도구의 사용을 제외한 오프라인 평가 운영
<원문> Regular ‘pen-and-paper’ or unplugged assessments could be routinely organised to monitor progress without digital aids. This simple rule counteracts cognitive off-loading by keeping retrieval practice in play giving teachers a reliable external benchmark for AI-reported progress. (Borgonovi et al., 2025, p. 24)
<번역> 정기적인 ‘펜과 종이’ 혹은 비디지털(unplugged) 평가를 통해 디지털 도구 없이 학습 진전을 모니터링하는 체계를 일상적으로 운영할 수 있다. 이 단순한 원칙은 인출 연습을 유지함으로써 인지적 오프로딩을 상쇄하고, 교사에게 AI가 보고하는 진전을 검증할 수 있는 신뢰할 만한 외부 기준을 제공한다. (Borgonovi et al., 2025, p. 24)
AI 기술의 발전은 평가의 본질을 근본적으로 바꾸고 있다. AI는 학생 학습 과정의 전반에 걸쳐 축적된 데이터를 기반으로 학생 성장에 대한 보다 정확한 평가와 깊이 있는 통찰의 가능성을 제공해주고 있다. 따라서 앞으로의 평가는 더 이상 판단의 수단이 아닌 성장의 도구로 존재해야 하며 학생의 강점과 약점을 분석하여 성장이 필요한 영역을 스스로 찾아갈 수 있도록 도와줄 수 있는 방법으로 평가가 이루어져야 한다. 오픈 AI의 최고경영자 샘 올트먼(2026)은 AI를 통해 놀라운 성취를 경험하고 스스로 자신의 학습 워크플로를 구축해가는 아이들의 모습을 언급한 바 있다. AI 시대에는 학생의 학습 과정에서 발생하는 풍부한 데이터를 의미 있는 성장 피드백으로 전환해주는 핵심 도구로 AI가 존재할 것이며, 평가를 ‘결과 확인’이 아닌 ‘성장 지원’의 과정으로 재정립할 필요가 있겠다.
· 보고서명: The Future of Learning: AI Revolutionizing Education 4.0
· 출처: World Economic Forum. (2024).
· 시그널: 학생 성장에 대한 정확한 정보 제공 가능
<원문> Refined assessment and decision-making processes, promising more accurate evaluations and insights into student progress. (World Economic Forum, 2024, p. 3)
<번역> 정교해진 평가와 의사결정 과정은 학생의 진전에 대한 보다 정확한 평가와 통찰을 약속한다.” (World Economic Forum, 2024, p. 3)
· 보고서명: Education in 2025/2026: 9 Trends
· 출처: Council of International Schools. (2025).
· 시그널: 성장 피드백을 중시하는 형성 평가로 이동
<원문> Assessments are becoming a development tool rather than a judgement. Schools are adopting formative assessment where feedback helps students understand their strengths and growth areas rather than demotivating them. (Council of International Schools, 2025)
<번역> 평가는 판단이 아니라 성장 도구가 되어 가고 있다. 학교는 피드백이 학생들이 자신의 강점과 성장 영역을 이해하도록 돕고, 의욕을 꺾기보다 돋우는 형성평가를 도입하고 있다. (Council of International Schools, 2025)
AI가 발전할수록 단순 암기를 통해 정해진 정답을 얼마나 정확히 재현하는가를 묻는 전통적 평가 방식은 그 가치를 빠르게 잃어가고 있다. 특히 정답을 얼마나 잘 맞췄느냐의 평가 방식을 고수한다면 AI의 활용을 허락할 것이냐, 막을 것이냐의 논쟁에서도 멈추지 못할 것이다. 이에 학습의 과정과 성찰의 과정, 고차원적 사고를 강조하는 평가로 전환되어야 할 필요가 있다. AI가 일상화된 학습 환경에서는 단편적 지식의 재생산이나 획일화된 결과물 비교는 더 이상 학생의 역량이나 학습의 성장을 가늠하는 기준이 되기 어렵기 때문이다. 앞으로의 평가는 '무엇을 산출했는가'에서 '어떻게 사고하고 학습했는가'로 옮겨가고 있다. 포트폴리오, 성찰 일지, 구술 발표와 같은 과정 중심 평가로 평가를 변경할 때 진정한 학습이 더 잘 드러나며, AI가 생성한 산출물의 진위 여부에 휘둘리지 않는 평가의 기본 역할도 확보할 수 있다. 즉, AI 시대의 평가는 '무엇을 알고 있는지 확인하는 일'을 넘어 '어떻게 배우고 성장하고 있는지를 이해하는 일'로 재정의될 필요가 있다.
· 보고서명: The Evolving Landscape of AI in Education
· 출처: Adan, M. Y., & Ahmed, S. A. (2025).
· 시그널: 과정, 성찰 중심 평가로의 평가 재설계
<원문> Rather than focusing solely on preventing misuse, recent scholarship advocates for assessment models that emphasize process, reflection, and higher-order thinking. (Adan & Ahmed, 2025, p. 14)
<번역> 최근 연구는 오용 방지에만 초점을 맞추기보다는 과정, 성찰, 고차원적 사고를 강조하는 평가 모델을 옹호한다. (Adan & Ahmed, 2025, p. 14)
· 보고서명: Educating in the AI Era: The Urgent Need to Redesign Schools
· 출처: Darling-Hammond, L. (2025, May 30).
· 시그널: 실제 수행과 깊은 학습을 반영하는 평가로 전환
<원문> This includes shifting accountability systems away from narrow test-based measures toward assessments that reflect real-world performance and deeper learning. (Darling-Hammond, 2025)
<번역> 이는 좁은 시험 기반 지표에서 실제 세계의 수행과 깊은 학습을 반영하는 평가로 책임체제를 전환하는 것을 포함한다. (Darling-Hammond, 2025)
· 보고서명: Aligning technology with cognitive development: a five-tiered framework to generative AI in K-12 education
· 출처: Tao, S. (2025).
· 시그널: 과정 중심 평가로 전환
<원문> Moreover, shifting assessment practices toward process-oriented evaluations, including portfolios, reflections, peer feedback, and oral defenses, can better measure authentic learning and resilience against AI-generated outputs. (Tao, 2025, p. 8)
<번역> 또한 포트폴리오, 성찰, 동료 피드백, 구술 발표를 포함한 과정 중심의 평가 방법으로 전환하면, 진정한 학습과 AI 생성 산출물에 대한 회복력을 더 잘 측정할 수 있다. (Tao, 2025, p. 8)
데이터 기반 맞춤형 평가는 AI 시대의 평가가 일회성 결과 확인이나 동일한 기준에 따른 성취 판정을 넘어, 학생 개개인의 학습 과정과 변화 양상을 지속적으로 파악하는 방향으로 전환될 가능성을 보여준다는 점에서 의미가 있다. AI와 학습 분석 기술은 학생의 응답, 과제 수행 과정, 피드백 반응, 학습 추세 등을 실시간으로 수집·분석함으로써 학생별 강점과 약점, 이해 수준, 추가 지원이 필요한 지점을 보다 정확하고 자세하게 드러낼 수 있다. 특히 AI는 즉각적이고 서술적이며 개별화된 피드백을 제공할 수 있기 때문에, 형성평가의 시의성과 빈도를 높이고 학생이 학습 과정 중에 자신의 부족한 부분을 빠르게 수정할 수 있도록 돕는다는 점에서 중요한 의미를 가진다.
· 보고서명: Generative AI in the K–12 Formative Assessment Process: Enhancing Feedback in the Classroom
· 출처: Maksimchuk, M., Roeber, E., & Store, D. (2025).
· 시그널: 즉각적·개별화된 피드백 제공
<원문> AI can provide immediate, descriptive, and individualized feedback, increasing both timeliness and frequency (Maksimchuk & Pentón Herrera, 2025, 인용 Maksimchuk, Roeber, & Store, 2025, p. 108)
<번역> AI는 즉각적이고 서술적이며 개별화된 피드백을 제공할 수 있어, 시의성과 빈도를 모두 높인다(Maksimchuk & Pentón Herrera, 2025, 인용 Maksimchuk, Roeber, & Store, 2025, p. 108)
· 보고서명: The Future of Learning: AI Revolutionizing Education 4.0
· 출처: World Economic Forum. (2024).
· 시그널: AI 활용을 통한 동적 분석
<원문> Integrating AI technologies into educational assessments offers the potential for educators to gain real-time, data-driven insights into student learning trends, identifying areas of strength and weakness and assessing instructional effectiveness on a large scale. (World Economic Forum, 2024, p. 7)
<번역> 교육 평가에 AI 기술을 통합하면, 교육자가 학생 학습 추세에 대한 실시간 데이터 기반 통찰을 얻고, 강점과 약점을 식별하며, 대규모로 수업 효과성을 평가할 수 있는 잠재력이 생긴다. (World Economic Forum, 2024, p. 7)