□ 국내외 자동채점 프로그램 연구 및 개발 현황
○ 영어 자동채점 프로그램 연구 및 개발
- 영어 자동채점 프로그램의 경우는 1960년대부터 개발이 시작되어 대규모 평가에 대비하기 위해 꾸준하게 연구・개발되어 옴.
- 현재 미국은 Project Essay Grader(PEG), E-rater, C-rater, IntelliMetric, Intelligent Essay Assessor(IEA) 등의 자동채점 프로그램을 이용하여, 평가 기관의 상업용 시험과
□ 한국교육과정평가원의 한국어 자동채점 프로그램 연구
3. 2014년 한국어 자동채점 프로그램 개발 내용
□ 2014년 한국어 단어・구 수준 자동채점 프로그램 실용화 개발
○ 단어・구 수준 자동채점 프로그램 개발 방향
- 2013년에 개발한 단어・구 수준 자동채점 프로그램은 개별 문항별로 채점하는 시스템임.
- 2014년에는 자동채점 프로그램의 실용성을 강화하기 위해 단일 교과의 전체 서답형 문항을 대상으로 일련의 통합된 채점 처리 과정을 지원하는 도구로 구현함.
○ 단어・구 수준 자동채점 프로그램 주요 개발 내용
- 학생 답안 정규화 과정의 분리 : 답안 정규화 과정을 자동채점과 분리하여 미리 진행함 으로써, 기존에 자동채점 전후 단계로 분산되어 있던 정규화 과정에서의 전문가 개입을 최소화함.
- 학생 답안 및 채점 결과 데이터 입출력 방식 수정 : 학생별로 작성된 답안 파일(입력 파일)을 문항별로 분리하고 각 문항에 대한 채점이 완료된 후에 다시 각 학생에 대한 답안 파일(출력 파일)로 작성하는 과정을 기존 시스템에 추가함.
- 정답 템플릿 작성 도구의 편의성 강화 : 채점자가 지식베이스에 저장된 정보를 활용하여 정답 템플릿을 작성할 수 있도록 도움.
- 채점 결과 보고서 작성 도구 보강 : 자동채점을 통해 산출된 문항별・학생별 정답 비율, 오답 비율, 평균 및 표준편차, 감점 요인 또는 오답 설명, 고빈도 답안 목록(출현 빈도 및 비율 포함) 등의 다양한 통계를 조합할 수 있는 도구를 제공함(p. 20 [그림 6-4] 참조).
- 한국어 처리 기술 및 데이터베이스 보강 : 맞춤법 교정 후보의 자동 생성, 유의어 목록 작성, 유의어・맞춤법 교정 목록의 별도 파일 생성 등을 통해 자동채점 프로그램을 지원함.
[그림 3-1] 단어・구 수준 자동채점 프로그램 시스템 구조도
□ 2014년 한국어 문장 수준 자동채점 프로그램 프로토타입 설계
○ 문장 수준 자동채점 프로그램 개발 방향
- 2014년 처음으로 문장 수준 답안을 처리할 수 있는 자동채점 프로그램의 프로토 타입을 설계함.
- 2009년~2013년 학업성취도 평가 문장 수준의 서답형 문항 및 학생 답안을 분석하여 개발에 필요한 한국어 처리 기술을 도출함.
- 거의 모든 문항에서 문서 정규화, 형태소 분석 및 품사 부착, 구묶음, 바꿔쓰기, 의존구조 분석, 군집화 등의 기술이 필요한 것으로 분석됨. 이러한 기술을 반영하여 시스템 절차를 최적화하여 구현함.
○ 문장 수준 자동채점 프로그램 주요 개발 내용
- 언어 분석 및 처리 단계 설계 : 학생 답안이나 모범 답안에 대해 자동채점에 필요한 언어 정보를 분석하는 단계임. 문서 정규화, 형태소 분석 및 품사 부착, 구묶음, 바꿔쓰기, 의존구조 분석 등의 절차를 거치도록 구현함.
- 채점 단계 설계 : 학생 답안과 모범 답안의 언어 분석 결과로부터 군집화에 필요한 자질을 추출하고 의미적으로 유사한 학생 답안을 반복적으로 군집화하여 채점을 지원하는 단계임. 학생 답안 유형 분류, 자질 추출, 자질 가중치 학습, 미채점 답안 군집화, 수작업 채점 등의 절차를 거치도록 구현함.
- 데이터베이스 및 지식베이스 지원 설계 : 문장 수준 답안을 처리할 수 있도록 띄어쓰기 사전, 형태소/복합어 사전, 구묶음 사전, 대표형/변이형 사전, 의존관계 규칙, 유의어・
반의어 시소러스를 부착함.
4. 2014년 한국어 자동채점 프로그램 채점 결과 분석
□ 2014년 자동채점 프로그램 채점 적용 문항 및 분석 항목
○ 2014년 자동채점 프로그램은 기 개발 프로그램을 토대로 단어・구 수준 프로그램은 실용성 강화를 목표로, 문장 수준 프로그램은 프로토타입 설계를 목표로 개발하고, 개발 목표에 따라 적용 대상 문항과 분석 항목을 차별화함.
[그림 4-1] 2014년 자동채점 프로그램 채점 적용 개요
□ 단어・구 수준 자동채점 프로그램 채점 결과 분석
○ 채점 정확성 분석
- 현행 합숙채점 최종점수1)와 자동채점 점수 간의 상관관계와 일치도를 살펴 본 결과, 단어・구 수준 자동채점의 정확성은 ʻ매우 우수ʼ한 것으로 나타남.
- <표 4-1>은 2014년 학업성취도 평가 중3 사회 서답형 14문항에 대한 최종점수와 자동채점 점수 간의 채점 결과를 요약한 것임.
1) 최종점수는 복수의 채점자가 3라운드에 걸쳐 확정한 채점자들의 최종점수를 말함. 국가수준 학업성취도 평가는 채점자 간에 점수 차이가 있는 경우 추가적인 채점 절차를 통해 최종적으로 하나의 점수를 확정함.
문항 번호 완전일치도 카파계수 상관계수
<표 4-2> 2014년 사회 교과 합숙채점 인원 구성
<표 4-4> 2014년 사회 교과 합숙채점 비용
□ 문장 수준 자동채점 프로그램 채점 결과 분석
○ 채점 진행의 간결성 분석
- 프로그램의 간결성은 자동채점 프로그램의 언어 분석 및 처리 과정을 통해 채점 가능한 답안 유형 수를 감소시켜 채점의 효율성을 높이는 것을 의미함.
- 학생 답안과 기준 답안 간 의미 유사도를 살펴 답안을 군집화하고 이를 누적적인 기계학습을 통해 채점을 지원하는 과정은 채점을 효율적으로 진행하도록 도움.
- 2013년 학업성취도 평가 국어, 사회 11문항을 대상으로 프로그램을 시범 적용한 결과, 1차로 답안을 군집화하면 학생 답안 유형 수가 3.1%~37.5%로 감소하고 이를 바탕으로 1단계 고빈도 답안을 먼저 채점하면 평균 55.9%의 답안이 채점됨. 이는 군집화가 답안 유형 수를 줄이고 동시에 기계학습에 필요한 충분한 수의 답안을 확보하게 함으로써, 자동채점의 효율성에 기여함을 보여 줌.
- 기계학습에 필요한 충분한 답안 수가 확보되면 다음 단계의 자동채점 점수와 기준 점수 간 불일치가 줄어드는 경향을 보여, 군집화를 통한 채점의 간결성이 곧 자동채점의 정확성과도 연결됨을 확인함.