연구자료 ORM 2014-15-7
2014년 한국어 서답형 문항 자동채점 프로그램 개발 및 적용 결과
목 차
1. 한국어 자동채점 프로그램 개발 배경 ································· 3
2. 국내외 자동채점 프로그램 개발 현황 ································· 5
3. 2014년 한국어 자동채점 프로그램 개발 내용 ···················· 7
4. 2014년 한국어 자동채점 프로그램 채점 결과 분석 ········· 11
5. 한국어 자동채점 프로그램의 성과와 활용 방안 ················ 17
참고문헌 ············································································ 22
1. 한국어 자동채점 프로그램 개발 배경
□ 서답형 문항 요구 증대에 따른 채점 효율화 방안 강구
○ 서답형 문항은 선택형 문항에 비해 학습자의 고등 정신 능력을 평가하는 데 효과적임.
○ 미국, 영국, 호주 등의 국외 학업성취도 평가, PISA(Programme for International Student Assessment)와 TIMSS(Trends in International Mathematics and Science Study) 등의 국제 학업성취도 평가에서는, 전체 문항 수 중 서답형 문항의 비율이 30%~60%를 차지함.
○ 우리나라 국가수준 학업성취도 평가는 전체 문항 수 중 서답형 문항의 비율이 20%
정도임.
○ 국내 교육계에서도 점차로 서답형 문항(서술형 문항 포함)을 적극적으로 확대하고자 함. 이에 2009 개정 교육과정 총론에서는 ʻ교과의 평가는 선택형 평가보다는, 서술형 이나 논술형 평가 그리고 수행 평가의 비중을 늘려서 교과별 특성에 적합한 평가를 실시하도록ʼ 권고함.
○ 교육과학기술부는 ʻ창의성과 인성 함양을 위한 교육내용・방법・평가체제 혁신방안 VIP 보고ʼ(2010년 5월 19일), ʻ2011 창의・인성 교육 기본 계획ʼ(2011년 3월 11일), ʻ중등학교 학사 관리 선진화 방안ʼ(2011년 12월 14일) 등의 발표를 통해 재차 서답형 평가의 확대를 강력히 요청함.
○ 현재 국가수준 학업성취도 평가의 온라인 인간채점의 경우, 2014년 중3과 고2의 국어・
영어・수학 세 교과에서 출제된 서답형 문항의 채점으로 ʻ한 달ʼ여 기간에 걸쳐 대략 ʻ7,000여 명ʼ의 채점 인원이 동원되어 ʻ30억 원ʼ의 예산이 채점 비용으로 소요됨.
○ 대규모 평가인 국가수준 학업성취도 평가, 기초학습 진단평가 등에서는 평가의 객관 성을 유지하고 채점의 번거로움을 극복하기 위해 주로 한 문장 수준 내외의 서답형 문항을 주로 활용하고 있음. 이러한 서답형 문항의 경우 인간채점보다 자동채점이 채점 일관성과 신뢰도가 높을 수 있음.
○ 이에 대규모 평가에서 서답형 문항 채점의 효율화를 도모하기 위한 차원에서 자동채점 프로그램 연구가 요청됨.
□ 컴퓨터 기반 평가 체제 도래에 대비한 자동채점 필요성 제기
○ 세계 각국은 핵심역량을 갖춘 미래 인재를 양성하기 위해 컴퓨터와 인터넷을 활용하는 평가 체제의 도입을 서두르고 있음.
○ 미국은 2015년부터 차세대 학력평가 2.0을 통해, 단순지식을 측정하는 선택형 문항의 지필평가를 지양하고 서답형 및 수행형 문항을 포함하는 컴퓨터 기반 평가로 전환하는 계획을 추진 중임.
○ 국제 학업성취도 평가인 PISA의 경우 2006 과학 소양, 2009 디지털 읽기 소양, 2012 문제해결능력 평가 등에서 컴퓨터 기반의 평가 방식을 통해 학생들의 기본 소양을 측정해 왔으며 PISA 2015부터는 모든 영역에서 컴퓨터 기반 평가를 도입할 예정임.
○ 국제 수준의 대규모 평가인 ICILS(International Computer and Information Literacy Study)에서는 2013년부터 실제 웹기반 환경과 동일한 상황에서 정보를 검색・선택・
각색하는 능력을 평가함.
○ 향후 대규모 평가들이 컴퓨터 기반으로 시행된다면 무엇보다 채점 결과가 즉각적으로 산출되는 체제를 구축해야 함. 이때 자동채점 프로그램은 컴퓨터 기반 평가 체제에서 필연적으로 요구하는 시스템임.
○ 서답형 문항 자동채점 프로그램은 단기간에 연구・개발될 수 있는 과제가 아님. 따라서 컴퓨터 기반 평가 체제가 본격적으로 도입되기 전에, 시범적 연구 및 개발로 자동채점 프로그램에 대한 일정의 성과를 축적해 놓아야 함.
2. 국내외 자동채점 프로그램 개발 현황
□ 국내외 자동채점 프로그램 연구 및 개발 현황
○ 영어 자동채점 프로그램 연구 및 개발
- 영어 자동채점 프로그램의 경우는 1960년대부터 개발이 시작되어 대규모 평가에 대비하기 위해 꾸준하게 연구・개발되어 옴.
- 현재 미국은 Project Essay Grader(PEG), E-rater, C-rater, IntelliMetric, Intelligent Essay Assessor(IEA) 등의 자동채점 프로그램을 이용하여, 평가 기관의 상업용 시험과 대학의 에세이 입학시험 등을 채점하고 있음.
- 미국은 2015년부터 시행할 차세대 평가에 자동채점 프로그램 도입의 타당성을 점검 하기 위해, 자동채점 공개경쟁 대회를 개최하여 9개 에세이 자동채점 프로그램의 채점 수행 능력을 비교한 바 있음(Shermis & Hamner, 2013).
○ 일본어 자동채점 프로그램 연구 및 개발
- 일본 대학입시센터에서는 일본어 에세이형 자동채점 프로그램 Jess (Automated Japanese Essay Scoring System, 日本語小論文 評価採点システム)를 사용자 매뉴얼과 함께 시범적 으로 제공하고 있음.
○ 한국어 자동채점 프로그램 연구 및 개발
- 한국어는 언어 특성상 조사나 어미의 활용이 다양하고 문장성분 생략이 빈번하고 어순이 자유로워 자동채점이 용이하지 않음.
- 한국어 자동채점 프로그램 개발과 관련하여 특정 영역의 소규모 시험을 대상으로 실험실 수준의 몇몇 시도는 있었으나(정동경, 2001 ; 박희정・강원석, 2003 ; 권오영, 2004 ; 조우진, 2006 ; 강원석, 2011), 실험 결과를 타당도와 신뢰도 측면에서 검증하지 않았고 대규모 평가나 다른 영역에서 활용 가능한지는 논의가 필요한 상태임.
□ 한국교육과정평가원의 한국어 자동채점 프로그램 연구
○ 5년차 중장기 연구 계획을 통해 올해 3차년도 연구를 수행함.
- 국가수준 학업성취도 평가의 문항 개발 및 온라인 채점을 수행하고 있는 본원에서, 대규모 평가를 위한 서답형 문항의 자동채점 프로그램 연구 및 개발을 추진함.
- 현재 대규모 평가에서 주로 사용하고 있는 문장 수준 내외의 서답형 문항 채점을 목표로 프로그램 연구 및 개발을 시작함.
- 2012년부터 한국어 단어・구 수준 서답형 답안부터 자동채점할 수 있는 프로그램을 설계하고 국가수준 학업성취도 평가 문항을 통해 시범 적용함(노은희 외, 2012; 2013).
- 한국어 처리 기술 및 지식베이스의 여건이 충분하지 않은 상황에서, 짧은 답안의 자동 채점 연구로 시작하여 향후 확장된 언어 단위의 자동채점 연구로 점차 발전시키고자 함.
구분 2012 2013 2014 2015 2016
개발 목표
단어・구 자동채점 프로그램 프로토타입 설계
단어・구 자동 채점 프로그램 정교화 개발
단어・구 자동 채점 프로그램 실용화 개발
문장 자동채점 프로그램 프로토타입 설계
문장 자동채점 프로그램 정교화 개발
문장 자동채점 프로그램 실용화 개발
언어 단위 단어・구 단어・구 문장(단문) 문장(단문) 문장(복문)
<표 2-1> 한국교육과정평가원의 한국어 자동채점 프로그램 개발 계획
3. 2014년 한국어 자동채점 프로그램 개발 내용
□ 한국어 서답형 문항 자동채점 프로그램 개발 방향
○ 2014년 자동채점 프로그램 개발은 기 개발 시스템을 토대로 단어・구 수준 프로그램은 채점 전(全) 과정 처리 시스템 개발을 목표로, 문장 수준 프로그램은 프로토타입 설계를 목표로 함.
○ 채점 전문가를 돕는 채점 지원 도구로 개발
- 자동채점 프로그램은 한국어 처리 기술 여건에 따라 오류 가능성이 있음. 고부담 대규모 평가의 경우 채점 오류는 문제가 되므로, 채점 전문가가 주요 단계를 점검할 필요 있음.
- 따라서 현실적인 한국어 자동채점 프로그램은 자동화 비율을 점진적으로 높여가되, 채점 전문가가 개입하여 채점 과정을 진행하는 채점 지원 도구로 개발함.
○ 채점 정확도를 높이기 위한 단계적 채점 설계로 개발
- 한국어 자동채점 프로그램은 채점 정확성을 최우선으로 두고 채점을 단계적으로 진행하는 순환형 모니터링 시스템으로 설계함.
- 1단계는 학생 답안과 채점 기준의 일치 정도를 비교・판단하여 채점하는 것으로 채점 오류 가능성이 거의 없음.
- 2단계는 개념 기반이나 의미 유사도를 통해 채점하는 과정으로 답안 군집화 정도에 따라 채점 효율성과 정확성이 달라짐.
- 3단계는 의미 유사도에 따른 군집화로도 잘 걸러지지 않는 미채점 답안에 대해 채점 전문가가 핵심어나 출현 단어를 통해 정렬하거나 군집화하여 수작업으로 채점함.
- 조금이라도 채점 오류 가능성이 있는 2단계와 3단계 채점은 반복적으로 시행하고 점검하도록 설계함.
□ 2014년 한국어 단어・구 수준 자동채점 프로그램 실용화 개발
○ 단어・구 수준 자동채점 프로그램 개발 방향
- 2013년에 개발한 단어・구 수준 자동채점 프로그램은 개별 문항별로 채점하는 시스템임.
- 2014년에는 자동채점 프로그램의 실용성을 강화하기 위해 단일 교과의 전체 서답형 문항을 대상으로 일련의 통합된 채점 처리 과정을 지원하는 도구로 구현함.
○ 단어・구 수준 자동채점 프로그램 주요 개발 내용
- 학생 답안 정규화 과정의 분리 : 답안 정규화 과정을 자동채점과 분리하여 미리 진행함 으로써, 기존에 자동채점 전후 단계로 분산되어 있던 정규화 과정에서의 전문가 개입을 최소화함.
- 학생 답안 및 채점 결과 데이터 입출력 방식 수정 : 학생별로 작성된 답안 파일(입력 파일)을 문항별로 분리하고 각 문항에 대한 채점이 완료된 후에 다시 각 학생에 대한 답안 파일(출력 파일)로 작성하는 과정을 기존 시스템에 추가함.
- 정답 템플릿 작성 도구의 편의성 강화 : 채점자가 지식베이스에 저장된 정보를 활용하여 정답 템플릿을 작성할 수 있도록 도움.
- 채점 결과 보고서 작성 도구 보강 : 자동채점을 통해 산출된 문항별・학생별 정답 비율, 오답 비율, 평균 및 표준편차, 감점 요인 또는 오답 설명, 고빈도 답안 목록(출현 빈도 및 비율 포함) 등의 다양한 통계를 조합할 수 있는 도구를 제공함(p. 20 [그림 6-4] 참조).
- 한국어 처리 기술 및 데이터베이스 보강 : 맞춤법 교정 후보의 자동 생성, 유의어 목록 작성, 유의어・맞춤법 교정 목록의 별도 파일 생성 등을 통해 자동채점 프로그램을 지원함.
[그림 3-1] 단어・구 수준 자동채점 프로그램 시스템 구조도
□ 2014년 한국어 문장 수준 자동채점 프로그램 프로토타입 설계
○ 문장 수준 자동채점 프로그램 개발 방향
- 2014년 처음으로 문장 수준 답안을 처리할 수 있는 자동채점 프로그램의 프로토 타입을 설계함.
- 2009년~2013년 학업성취도 평가 문장 수준의 서답형 문항 및 학생 답안을 분석하여 개발에 필요한 한국어 처리 기술을 도출함.
- 거의 모든 문항에서 문서 정규화, 형태소 분석 및 품사 부착, 구묶음, 바꿔쓰기, 의존구조 분석, 군집화 등의 기술이 필요한 것으로 분석됨. 이러한 기술을 반영하여 시스템 절차를 최적화하여 구현함.
○ 문장 수준 자동채점 프로그램 주요 개발 내용
- 언어 분석 및 처리 단계 설계 : 학생 답안이나 모범 답안에 대해 자동채점에 필요한 언어 정보를 분석하는 단계임. 문서 정규화, 형태소 분석 및 품사 부착, 구묶음, 바꿔쓰기, 의존구조 분석 등의 절차를 거치도록 구현함.
- 채점 단계 설계 : 학생 답안과 모범 답안의 언어 분석 결과로부터 군집화에 필요한 자질을 추출하고 의미적으로 유사한 학생 답안을 반복적으로 군집화하여 채점을 지원하는 단계임. 학생 답안 유형 분류, 자질 추출, 자질 가중치 학습, 미채점 답안 군집화, 수작업 채점 등의 절차를 거치도록 구현함.
- 데이터베이스 및 지식베이스 지원 설계 : 문장 수준 답안을 처리할 수 있도록 띄어쓰기 사전, 형태소/복합어 사전, 구묶음 사전, 대표형/변이형 사전, 의존관계 규칙, 유의어・
반의어 시소러스를 부착함.
4. 2014년 한국어 자동채점 프로그램 채점 결과 분석
□ 2014년 자동채점 프로그램 채점 적용 문항 및 분석 항목
○ 2014년 자동채점 프로그램은 기 개발 프로그램을 토대로 단어・구 수준 프로그램은 실용성 강화를 목표로, 문장 수준 프로그램은 프로토타입 설계를 목표로 개발하고, 개발 목표에 따라 적용 대상 문항과 분석 항목을 차별화함.
[그림 4-1] 2014년 자동채점 프로그램 채점 적용 개요
□ 단어・구 수준 자동채점 프로그램 채점 결과 분석
○ 채점 정확성 분석
- 현행 합숙채점 최종점수1)와 자동채점 점수 간의 상관관계와 일치도를 살펴 본 결과, 단어・구 수준 자동채점의 정확성은 ʻ매우 우수ʼ한 것으로 나타남.
- <표 4-1>은 2014년 학업성취도 평가 중3 사회 서답형 14문항에 대한 최종점수와 자동채점 점수 간의 채점 결과를 요약한 것임.
1) 최종점수는 복수의 채점자가 3라운드에 걸쳐 확정한 채점자들의 최종점수를 말함. 국가수준 학업성취도 평가는 채점자 간에 점수 차이가 있는 경우 추가적인 채점 절차를 통해 최종적으로 하나의 점수를 확정함.
문항 번호 완전일치도 카파계수 상관계수
1 99.99 1.00 1.00
2 97.76 0.96 0.97
3-㉠ 99.97 1.00 1.00
3-㉡ 99.88 1.00 1.00
4-㉠ 99.95 1.00 1.00
4-㉡ 99.87 1.00 1.00
5-㉠ 99.97 1.00 1.00
5-㉡ 99.11 0.94 0.98
6-㉠ 99.99 1.00 1.00
6-㉡ 99.97 1.00 1.00
7 99.62 0.99 1.00
8-㉠ 99.99 1.00 1.00
8-㉡ 99.99 1.00 1.00
9 99.34 0.98 0.99
<표 4-1> 2014년 중3 사회 문항의 채점 결과 요약
- ʻ완전일치도ʼ는 각기 다른 방법으로 채점한 점수들이 완전히 일치하는 경우의 비율을 나타냄. ʻ카파계수ʼ는 두 점수가 우연히 같을 확률을 제거한 점수 간 일치도를 나타냄.2) ʻ상관계수ʼ는 점수 간 일관성을 확인하는 방법으로 점수 간의 선형적인 관계를 나타냄.
- 최종점수와 자동채점 점수 간 완전일치도는 97.76%~99.99%, 카파계수는 0.94~1, 상관계수는 0.97~1.00로 나타남. 이는 자동채점의 결과가 채점 전문가들이 부여한 점수와 매우 유사하다는 것을 의미하며, 단어・구 수준 자동채점 결과가 채점 전문가 만큼 정확하다는 것을 뜻함.
<표 4-2> 2014년 사회 교과 합숙채점 인원 구성
영역(문항 번호) 기획위원 채점자 평가위원 채점보조 총원
지리 (1, 2, 3) 1 11
1 1 38
역사 (4, 5, 6) 1 11
일사 (7, 8, 9) 1 11
<표 4-3> 2014년 사회 교과 자동채점 인원 구성
영역(문항 번호) 입력자 입력팀장 채점자 총원
지리 (1, 2, 3)
6 (2명 3개조) 1 4 (기획위원 3명
포함) 11
역사 (4, 5, 6) 일사 (7, 8, 9)
- 합숙채점은 사회 교과의 하위 영역인 지리, 역사, 일반사회로 나누어 각각 기획위원 1명, 채점자 11명이 배속되어 채점을 진행하고 이를 평가위원 1명과 채점 보조 1명이 지원하여, 총 38명이 참여함.
- 자동채점은 입력팀이 답안을 입력하고3) 추후 교과 전문가 1명이 자동채점 프로그램을 활용하여 전체 답안을 채점함. 이때 교과 전문가는 합숙채점의 기획위원 3명과 별도의 협의를 진행하여, 총 11명이 참여함.
- 합숙채점과 자동채점의 인원 수 비교 결과, 자동채점 인력은 합숙채점 인력의 ⅓ 이하 수준임.
- 합숙채점과 자동채점의 인력 수준 비교 결과, 자동채점은 채점자 4명을 제외하고 다른 인원에게는 별도의 교과 전문성을 요구하지 않음. 이에 비해 합숙채점의 경우 박사급 기획위원 및 평가위원 4명, 채점자인 중등교사 33명, 보조인력 1명으로 구성 되어 있어서 채점에 필요한 인력과 그 수준에 큰 차이가 있음.
- 인적 구성에 따른 현행 합숙채점과 자동채점의 비용 비교
3) 현재 국가수준 학업성취도 평가는 컴퓨터 기반 평가 체제가 아니므로 자동채점을 진행하기 위해 답안 입력 과정이 별도로 필요함.
<표 4-4> 2014년 사회 교과 합숙채점 비용
(단위 : 원)
직책 인원 인건비 숙박비 식비 합계
기 획 위 원 3
23,430,000 7,980,000 3,990,000 35,400,000 평 가 위 원 1
채 점 자 33
채 점 보 조 1
합 계 38
<표 4-5> 2014년 사회 교과 자동채점 비용
(단위 : 원)
직책 인원 인건비 숙박비 식비 합계
입 력 팀 장 1
8,700,000 2,940,000 1,860,000 13,500,000
입 력 자 6
채 점 자 4
합 계 11
- 2014년 학업성취도 평가 사회 교과는 합숙채점 방식으로 채점이 이루어짐. 자동채점 입력은 답안지 보안 문제로 동일한 합숙 장소에서 별도로 이루어짐.
- 합숙채점팀은 모두 38명으로 2박 3일 동안 7,442명의 학생 답안을 채점함. 채점본부 운영 및 장비 대여 등의 기타 비용을 제외할 경우, 소요 비용은 참여 인력의 3일 인건비 및 숙박비, 7회 식비이므로 총 비용은 모두 35,400,000원 정도임.
- 자동채점 팀은 모두 11명으로 5박 6일에 걸쳐 7,442명의 학생 답안을 입력하고, 자동채점은 합숙 장소가 아닌 별도의 회의실에서 교과 전문가 1명이 합숙채점 기획 위원 3명과 함께 채점 기준에 대한 협의를 포함하여 3일 동안 진행함. 총 경비는 13,500,000원 정도임.
- 사회 교과의 합숙채점과 자동채점의 인력 운영과 관련된 예산을 비교한 결과, 자동
□ 문장 수준 자동채점 프로그램 채점 결과 분석
○ 채점 정확성 분석
- 현행 채점 방식의 기준점수4)와 자동채점 점수 간의 상관관계와 일치도를 살펴 본 결과, 문장 수준 자동채점의 정확성은 ʻ적정하게 우수ʼ한 것으로 나타남.
- <표 4-6>은 2013년 학업성취도 평가 국어, 사회 11개 문항에 대한 기준점수와 자동 채점 점수 간의 채점 결과를 요약한 것임.
<표 4-6> 2013년 국어, 사회 문장 수준 문항의 채점 결과 요약
구분 문항 번호 완전일치도 카파계수 상관계수
중3 국어
2-(1) 97.3 0.80 0.82
2-(2) 96.1 0.87 0.93
4-(2) 92 0.81 0.93
고2 국어
2-(1) 100 1.00 1.00
2-(2) 96.3 0.87 0.87
4-(1) 91.5 0.83 0.88
5-(2) 92.3 0.88 0.93
6-(1) 97.2 0.94 0.94
6-(2) 92.4 0.84 0.90
중3 사회 4-(3) 99 0.95 0.95
8 97.8 0.92 0.92
- 기준점수와 자동채점 점수 간 완전일치도는 91.5~100%, 카파계수는 0.8~1, 상관 계수는 0.82~1로 나타남. 이는 문장 수준 자동채점 결과가 채점 전문가들이 부여한 점수와 유사하다는 것을 의미함.
4) 기준점수는 복수의 채점자가 3라운드에 걸쳐 확정한 채점자들의 최종점수를 교과 전문가가 다시 점검하여 오류를 수정한 것임. 즉, 기준점수는 최종점수에서 나아가 채점 오류 가능성을 최소화한 것임. 문장 수준 답안 채점은 단어・구 수준 답안에 비해 채점자의 채점 오류 및 비일관성이 증가할 여지가 있으므로, 문장 수준 자동채점의 정확성을 살피기 위해 최종점수를 다시 점검하여 기준점수를 상정함.
○ 채점 진행의 간결성 분석
- 프로그램의 간결성은 자동채점 프로그램의 언어 분석 및 처리 과정을 통해 채점 가능한 답안 유형 수를 감소시켜 채점의 효율성을 높이는 것을 의미함.
- 학생 답안과 기준 답안 간 의미 유사도를 살펴 답안을 군집화하고 이를 누적적인 기계학습을 통해 채점을 지원하는 과정은 채점을 효율적으로 진행하도록 도움.
- 2013년 학업성취도 평가 국어, 사회 11문항을 대상으로 프로그램을 시범 적용한 결과, 1차로 답안을 군집화하면 학생 답안 유형 수가 3.1%~37.5%로 감소하고 이를 바탕으로 1단계 고빈도 답안을 먼저 채점하면 평균 55.9%의 답안이 채점됨. 이는 군집화가 답안 유형 수를 줄이고 동시에 기계학습에 필요한 충분한 수의 답안을 확보하게 함으로써, 자동채점의 효율성에 기여함을 보여 줌.
- 기계학습에 필요한 충분한 답안 수가 확보되면 다음 단계의 자동채점 점수와 기준 점수 간 불일치가 줄어드는 경향을 보여, 군집화를 통한 채점의 간결성이 곧 자동채점의 정확성과도 연결됨을 확인함.
5. 한국어 자동채점 프로그램의 성과와 활용 방안
□ 자동채점 프로그램의 성과와 기대 효과
○ 의의 및 성과
- 대규모 한국어 서답형 답안을 기계로 채점하는 시스템을 최초로 구축함.
- 단어・구 수준 서답형 문항을 정확하고 신뢰롭게 채점함은 물론, 향후 문장 수준 문항의 채점 가능성도 적정하게 확보함.
- 단답형 처리로 출발하는 단계적 연구 및 개발은 현재 상태로서 실용성을 담보하면서도, 확장된 언어 단위의 자동채점 연구에 기반을 제공함.
- 자동채점을 통한 채점 결과 및 채점 정보는 교수・학습을 위한 정보로 즉각 제공 가능함.
○ 기대 효과
[그림 5-1] 한국어 자동채점 프로그램 개발 및 활용의 기대 효과
□ 자동채점 프로그램의 한계 및 대처
- 외부적 한계 : 현재 국가 단위의 주요 평가에서 본격적으로 컴퓨터 기반으로 검사를 시행하고 있지 않아 자동채점을 전격적으로 적용하기 어려움.
- 대응 방안 : 컴퓨터 기반 평가 체제가 정착되기 전까지는 지필 평가를 통해 얻은 학생들의 답안을 스캔하여 문자로 전환하는 방식이나 학생이 보조 단말기나 스마트 기기를 이용하여 답안을 입력하는 방식을 이용함.
- 내부적 한계 : 한국어 처리 기술과 지식베이스 축적이 충분하지 않음.
- 대응 방안 : 현재 한국어 처리 기술이 갖는 한계는 연구의 진행과 더불어 극복 가능함.
즉, 한국어 처리 분야 전문가들이 그간 자동채점 연구에 초점을 두지 않았으나, 실제적으로는 이와 관련한 상당한 기술적 역량을 축적하고 있음. 따라서 현재의 기술적 한계는 자동채점 프로그램 개발과 함께 극복해 나갈 수 있음.
□ 자동채점 프로그램 활용 1 : 대규모 평가의 채점 지원 도구
○ 국가수준 학업성취도 평가 표집채점 교과의 자동채점 적용
- 국가수준 학업성취도 평가의 교과별 문항 특성에 따라 표집학생을 대상으로 2015년 사회 교과, 2016년 과학・영어・수학 교과, 2017년 국어 교과를 순차적으로 자동채점에 적용 가능함.
○ 국가수준 학업성취도 평가 전수채점을 위한 채점 기준 및 답안 유형 제공
- 전수채점 교과인 국어・영어・수학의 경우, 표집학생들의 답안을 자동채점으로 처리 하고, 표집학생의 답안과 점수를 전집학생들의 답안 채점을 지원하는 자료로 활용할 수 있음.
- 자동채점을 위해 표집학생들의 답안을 모두 입력한 상태이기 때문에, 약 8,000명의
○ 채점 절차의 간소화
- 현행 국가수준 학업성취도 평가의 표집채점을 자동채점 방식으로 전환할 경우 채점 절차를 간략화할 수 있음.
- 현행 국가수준 학업성취도 평가는 복수의 채점자가 동일 답안을 채점하여 점수 차이가 있는 경우 추가적으로 3라운드까지 진행하고 이후 불일치한 답안은 교과 전문가가 4라운드에서 최종 결정함.
[그림 6-1] 현행 국가수준 학업성취도 평가 표집・전수답안의 온라인 채점 절차
- 자동채점 절차는 답안 입력 단계와 자동채점 단계로 나눔. 답안 입력 단계에서는 동일 답안에 대해 개별 입력자가 복수로 입력하여 일치한 경우만 자동채점 단계로 전달함. 채점의 정확성을 담보하기 위해 자동채점 프로그램을 활용하여 해당 교과 전문가 3인이 동일 답안에 대해 독립 채점하고 일치하는 경우를 학생의 최종 점수로 확정함.
[그림 6-2] 국가수준 학업성취도 평가 표집답안의 자동채점 절차 (안)
□ 자동채점 프로그램 활용 2 : 학교 단위의 교수・학습 지원 도구
○ 자동채점 결과 활용을 통한 교수・학습 지원
- 개별 학생에게 자동채점 도구로 최종 점수 외에 점수에 대한 채점 정보와 후속 학습 정보를 제공하여 학생의 자기주도적 학습을 도움.
[그림 6-3] 2013년 학업성취도 평가 국어 자동채점 결과표 예시
- 교사에게 자동채점 결과 정보를 제공하여 교수 설계를 도움. 올해 개발한 단어・구 수준 자동채점 프로그램은 교과 서답형 점수의 평균, 표준편차, 고빈도 답안 목록, 그 답안을 작성한 학생의 빈도 및 비율이 제공되고 이 정보들은 교사의 선택에 따라 지역, 학교, 학급 단위로 확인할 수 있음.
○ 교실 안 형성평가의 활성화 지원
- 학교 단위에서 웹서베이 도구5)를 활용해 답안 입력을 간편화할 수 있음. 현재 서답형 문항의 자동채점 활용이 어려운 이유 중 하나는 교사들이 학생들의 서답형 답안을 수동으로 입력해야 한다는 점임. 이에 대한 해결 방안의 하나로 웹서베이 도구를 학교 단위 평가에서 사용할 경우 학생들의 답안을 직접 입력하는 교사의 추가적인 노력이 필요 없음.
- [그림 6-5]는 스마트폰을 사용하여 서답형 문항의 답안을 입력하는 장면을 캡처한 것임. 이처럼 서답형 문항의 답안은 스마트기기(스마트폰, 태블릿 PC)를 사용하여 학생들이 직접 입력할 수 있음.
[그림 6-5] 구글 폼을 통해 입력한 서답형 답안 입력 예시
- 학생별로 개별 입력된 답안은 한 학급의 데이터 자료로 마련되고 이를 교사가 자동 채점할 수 있음. 이처럼 데이터화된 학생 답안은 자동채점을 거쳐 개별 학생에게 즉각적으로 그 결과를 제공하고, 나아가 학급이나 학교 단위의 점수 평균, 표준편차, 고빈도 답안 유형 목록 등의 결과를 산출하여 교사에게 수업에 도움이 되는 피드백 자원을 제공할 수 있음.
5) 대표적인 웹서베이 도구로는 구글 폼(google forms: www.google.com/google-d-s/createforms.html), 서베이 몽키(survey mongkeys: https://ko.surveymonkey.com/), 쿼트릭(Qultrics: http://www.qualtrics.com/panel-management/), 서베이기즈모(surveygizmo: http://www.surveygizmo.com/) 등이 있음.
❚ 참 고 문 헌❚
강원석(2011). 질의문 유형 분석을 통한 서답형 자동채점 시스템. 한국콘텐츠학회논문지, 11(2), 13-21.
교육과학기술부(2009. 12). 2009 개정 교육과정 총론(교육과학기술부 고시 제 2009-41호).
교육과학기술부(2010. 5). 창의성과 인성 함양을 위한 교육내용・방법・평가체제 혁신 방안 VIP 보고.
대통령 주재 제3차 교육개혁 대책회의(2010년 5월 19일).
교육과학기술부(2011. 3). 2011 창의・인성 교육 기본 계획. 보도자료(2011년 3월 11일).
교육과학기술부(2011. 12). 창의・인성교육 강화를 위한 「중등학교 학사관리 선진화 방안」 발표.
보도자료(2011년 12월 14일).
권오영(2004). 웹 기반 주관식 평가문항 채점 알고리즘 설계 및 구현. 한서대학교 교육대학원 석사학위 논문.
노은희, 심재호, 김명화, 김재훈(2012). 대규모 평가를 위한 서답형 문항 자동채점 방안 연구(연구보고 RRE 2012-6). 서울: 한국교육과정평가원.
노은희, 김명화, 성경희, 김학수(2013). 대규모 평가를 위한 서답형 문항 자동채점 프로그램 정교화 및 시범 적용 (연구보고 PRE 2013-5). 서울: 한국교육과정평가원.
박희정, 강원석(2003). 유의어 사전을 이용한 주관식 문제 채점 시스템 설계 및 구현. 한국컴퓨터 교육학회논문지 6(3), 207-216.
정동경(2001). 벡터 유사도와 시소러스를 이용한 주관식 답안의 채점 방법. 동국대학교 교육대학원 석사학위 논문.
조우진(2006). 의미 커널과 한글 워드넷에 기반한 지능형 채점 시스템. 한림대학교 대학원 석사학위 논문.
Landis, J.R.; Koch, G.G. (1977). The measurement of observer agreement for categorical data.
Biometrics, 33(1), 159–174.
Shermis, M. D., & Hamner, B. (2013). Contrasting state-of-the-art automated scoring of essays:
Analysis. Retrieved from http://www.scoreright.org/NCME_2012_Paper3-㉡9_12.pdf.