CMU 교수의 실험: AI가 과제를 다 풀자 집에서 끝나는 평가를 전부 없앴다
- 카네기멜론대 Christian Kästner이 맡은 Machine Learning in Production(수강생 100 to 170명)은 AI가 과제를 모두 풀어내자 과제와 평가 구조를 대폭 개편함
- 2021년경 Vincent Hellendoorn 제안으로 GPT-3에 읽기 퀴즈를 시험 삼아 풀게 했더니 논문을 읽지 않고도 루브릭을 통과하는 답안이 나옴
- 평가 원칙은 집에서 끝나는 과제로 이해도를 확인하지 않는 것이며 TA와 15분 대면 질답, 시험, 데모 영상 제출로 대체함
- 과목은 필기·구술 시험을 뺀 전 상황에서 AI 사용을 출처 표기 없이 허용하고 재제출에는 10% 감점을 물림
- 잦은 저부담 과제와 퀴즈를 권한 근거 기반 교수법(specifications grading, grading for equity 포함)은 AI 남용 탓에 시험 중심으로 후퇴했다는 것이 글쓴이의 판단임
Hacker News opinions
결과 말고 과정만 채점하면 끝인데. '왜 이게 최선인 솔루션인지 설명해봐' 한마디 던지면 AI는 10번 중 10번 박살 남.
AI 쓰지 말라고 막는 건 헛수고인 것 같더라. 못 막으니까 어떻게 쓰는지부터 가르치는 게 맞지.
나도 꽤 오래 가르치고 채점했는데 결국 구술 시험이 답이더라. 몇 분이면 학생이 개념을 제대로 소화했는지 보이던데, 유일한 문제는 확장이 안 된다는 점임.
오히려 AI 탓에 좋은 교육이 더 노동집약적으로 될 듯. 1:1 과외 받을 여유 있는 애들만 진짜 배우고 나머지는 사고를 아웃소싱할 걸.
구술 시험이 안 풀린다고? 독일 대학은 대면 필기시험만으로 대규모 강의를 수십 년간 굴렸고, 아르헨티나는 부채에 시달리면서도 대부분 과목을 구술로 채점함.
구술 시험을 AI한테 녹화 채점하게 하고, 플래그 걸린 것만 사람이 다시 보고, 이의 있으면 녹화본 재확인하면 되잖아. 안 풀릴 게 없음.
난 숙제를 필수로 두되 시험 응시 자격 요건으로만 썼거든. 점수에는 아예 안 들어가고. 확실히 동기 부여가 잘 되더라.
시험 포맷에 따라 성적이 완전히 갈리는 사람도 있냐? 나도 인터넷 쓸 수 있는 면접이나 열람 가능 시험은 잘 봤는데 막히면 못 하더라.
TA랑 15분 대면 질답은 결국 flipped classroom 아닌가? 근데 사전 학습 안 하고 오는 학생 섞이면 설명부터 다시 해야 돼서 순환 악화됨.
난 수학 과목 가르치는데, 학생들이 예제 문제 문서를 통째로 LLM에 넣고 '시험 가이드'를 뽑아 인쇄해 와서 그게 무슨 뜻인지 설명해달라고 하더라. 과제 채점할 가치가 없어졌음.
수업 시작할 때 무작위로 한 명 세워서 칠판에 풀게 하고, 기말은 종이 시험 하나로 끝내는 건 어때? 암기보다 사고에 무게를 주면 됨.
책임은 AI한테 넘길 수가 없음. 버그 고칠 때 보면 기존 상태 무시하고 자기 이벤트 큐, 자기 메시징 시스템을 덕지덕지 붙이더라. opus5.5랑 gpt5.6-astra 둘 다 여전히 초보임.