AI가 과제를 풀자, 평가는 설명 능력으로 옮겨갔다
AI가 만든 결과물을 평가하는 것과 학생이 이해했는지 평가하는 것은 다르다. 자동 채점으로 확보한 시간을 대면 설명과 검증에 돌리는 운영 설계가 중요해졌다.
AI 뉴스를 놓치지 마세요
매주 핵심 AI 소식을 이메일로 받아보세요.
학습 목표는 그대로인데 과제가 무너졌다
CMU에서 Machine Learning in Production을 가르치는 Christian Kästner가 9월 23일 수업 개편 경험을 공개했다. 그의 설명에 따르면 수강생은 보통 100~170명이며, 수업의 목표는 특정 언어로 코드를 빨리 쓰는 것이 아니라 공학적 절충, 위험 관리, 협업을 배우는 데 있다.
달라진 것은 목표보다 목표를 측정하는 방식이다. 집에서 제출한 답안이나 회고문이 학생의 이해를 얼마나 보여주는지 믿기 어려워지자, 과제 결과와 이해도 확인을 분리하기 시작했다. 다만 이 글은 한 교수의 실천 보고다. 개편이 학습 성과를 높였다는 통제 실험 결과로 읽어서는 안 된다. 작성자 자신도 학습 결과가 좋아졌는지 충분한 증거가 없다고 밝혔다.
공개 강의 자료는 모델 자체의 점수보다 실제 제품을 배포하고 운영하는 전체 수명주기를 강조한다. 이런 고급 수업의 사례를 프로그래밍 입문 수업에 그대로 복사하는 것도 주의해야 한다.
15분 대화가 회고문을 대체한다
가장 선명한 변화는 과제 후 학생별 15분 조교 면담이다. 과거에는 어려웠던 점이나 개선 방안을 글로 냈지만, 이제는 실제 해결 과정을 말로 설명하고 추가 질문에 답한다. 글에 따르면 이 점검은 현재 과제 점수의 20%를 차지하며 통과 여부로 평가한다. 실패해도 다시 시도할 수 있다.
시험 비중도 15%에서 25%로 높였다. 그러나 모든 평가를 고부담 시험 하나로 몰아넣은 것은 아니다. 반복 학습과 낮은 부담의 피드백을 유지하려는 의도도 분명하다. 작성자는 AI 때문에 교육학적으로 유익한 방식 일부를 포기하게 됐다고 인정한다.
| 평가 대상 | 이전의 주요 증거 | 개편 후의 주요 증거 | 남는 문제 |
|---|---|---|---|
| 해결 과정 이해 | 작성한 회고문 | 15분 대면 질의응답 | 조교 시간과 평가 일관성 |
| 기능 구현 | 코드와 보고서 | 코드·실행 영상·추가 설명 | 영상 자체의 진위와 실제 동작 |
| 팀 전체 이해 | 역할별 제출물 | 팀원에게 구현 설명 요청 | 기여도와 이해도의 차이 |
| 지식 습득 | 온라인 읽기 퀴즈 | 수업 토론과 시험 | 수업 밖 연습 유인 감소 |
그의 수업은 학생 대 조교 비율이 약 20 대 1이고 조교가 주당 약 10시간 일하는 조건이다. 학생 20명이 각 15분 면담하면 조교 한 명에게 2주마다 약 300분이 필요하다는 설명도 나온다. 한국 대학에서 같은 제도를 검토한다면 이 인력 조건부터 환산해야 한다.
AI를 금지하지 않고 검토 시간을 재배치한다
이 수업은 필기·구술 시험을 제외하면 AI 사용을 폭넓게 허용한다. 평가용 글쓰기를 금지하거나 탐지기로 잡아내는 대신, 자동화가 쉬워진 일을 인정하고 사람의 시간을 이해도 확인에 집중한다.
그 과정에서 조교도 AI를 쓴다. 작성자에 따르면 자동 채점은 기준별로 통과 또는 검토 필요를 제안하고, 감점은 반드시 사람이 확인한다. 조교 채점 시간이 50~80% 줄었다는 수치는 해당 수업에서 관찰한 경험이지 모든 학교에 적용할 생산성 보장은 아니다. 자동 통과 사례도 일부 표본 검토한다고 설명한다.
핵심은 모델에게 성적 결정권 전체를 넘기는 것이 아니다. 기계가 검토 우선순위를 정하고 사람이 중요한 판단을 맡는 분업이다. AI 글쓰기에서 편집의 역할과 마찬가지로 생성과 평가를 같은 일로 취급하지 않는 접근이다.
더 큰 코드베이스는 무엇을 시험하나
기존 과제는 약 1만 2천 줄 규모의 예제 앱에 AI 기능을 추가하는 것이었다. 작성자는 2025년 가을 Claude Code가 과제 설명만으로 보고서까지 만들 수 있었다고 회고한다. 새 과제는 50만 줄이 넘는다고 소개한 Zulip 코드베이스를 대상으로 한다.
공개된 기능 구현 과제는 학습자가 실제 시스템에 기능을 통합하는 방향을 보여준다. 다만 코드 규모 자체가 이해도를 보장하지는 않는다. 모델 성능이 좋아지면 오늘 어렵던 통합도 다시 쉬워질 수 있다. 그래서 구현 결과와 설명 능력을 함께 확인하는 장치가 필요하다.
이는 Linear의 AI 코딩 이후 CI 병목과 같은 구조다. 생산이 싸지면 생산물의 존재는 덜 희귀한 증거가 되고, 검토·통합·책임이 더 중요해진다. 교육에서는 그 책임이 “왜 이렇게 설계했는지 다른 조건에서도 설명할 수 있는가”로 나타난다.
한국 교육과 사내 훈련에 주는 시사점
국내 대학과 기업 교육은 먼저 평가하려는 능력을 분리할 필요가 있다. 문법 숙련이 목표라면 도움 없이 작성하는 시간이 필요할 수 있다. 시스템 설계가 목표라면 AI 사용을 허용하되 실패 조건, 권한 경계, 대안의 비용을 직접 설명하게 하는 편이 목표에 가깝다.
인력 부담이 크다면 모든 제출물을 장시간 면담하기보다, 핵심 과제에 짧은 설명과 요구사항 변경 질문을 붙이는 방식을 시험할 수 있다. 예를 들어 “사용자가 두 배가 되면 어디가 먼저 실패하는가”를 묻고 답안의 코드와 연결하게 한다. 이는 이 기사에서 제안하는 운영 예시이며 CMU에서 효과가 입증된 고정 문항은 아니다.
평가 편의만 추구하면 안 된다. 구술 평가의 불안, 장애 지원, 유료 도구 접근성, 조교별 기준 편차를 함께 고려해야 한다. Transformer Explainer 같은 학습 도구를 통해 개념을 탐색하는 연습과 엄격한 평가도 분리할 수 있다. 중요한 것은 AI를 썼는지 색출하는 기술보다 학생이 실제로 무엇을 배웠는지 설명 가능한 평가 체계다.
자주 묻는 질문
이 수업은 AI 사용을 금지했나?
아니다. 작성자는 필기·구술 시험을 제외한 광범위한 AI 사용을 허용한다고 밝혔다.
구술 평가는 과제 전체를 대체하나?
아니다. 코드와 과제는 남아 있으며, 구술 점검이 학생의 이해를 확인하는 별도 증거가 된다.
AI가 감점을 최종 결정하나?
작성자의 설명에 따르면 아니다. 감점 전에는 사람이 해당 답안을 확인한다.
학습 성과가 향상됐다는 증거가 있나?
이 경험담만으로 확정할 수 없다. 작성자도 학습 결과 개선을 판단할 충분한 증거가 없다고 명시했다.
회사의 개발자 교육에도 적용할 수 있나?
산출물 제출에 짧은 설계 설명과 변경 대응을 붙이는 방식은 시험할 만하다. 다만 교육 목표와 인력 조건에 맞춘 평가가 필요하다.
관련 토픽 더 보기
이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.