<표 26> 대용어 인식 시스템의 자질 집합
9. 대용어 참조해소기
본 연구에서 제안된 시스템은 크게 두 부분으로 구성된다. 하나 는 대용어로서 대명사를 인식하는 시스템이고 다른 하나는 인식된 대명사의 선행어를 찾는 시스템이다. 전자를 대용어 인식 시스템 (anaphoric pronoun identifier)이라고 하고 후자를 선행어 결정 시 스템(pronoun resolver)이라고 한다. 품사가 대명사(PRP)라고 해서 모두 대용어는 아니다. 즉 문서 내에 어떤 선행어를 가리키지 않는 대명사가 존재한다는 것이다. 예를 들면 문장 “It is important not to give up”에서 ‘It’은 선행어를 가지지 않는 대명사이다. 대용어 인식 시스템은 품사가 대명사(PRP)인 단어 중에서 대용어를 찾아 내는 시스템이다.
대용어 인식 시스템에 의해서 인식된 대용대명사(anaphoric pronoun)를 대상으로 선행어를 결정하는 시스템이 선행어 결정 시 스템이다. 아래의 예문을 보면 2개의 대용대명사 ‘them’과 ‘it’이 있 으며 각각의 선행어는 ‘Those figure’와 ‘the government’이다.
<E id=1 Those figures> are almost exactly what the government proposed to legislators in September. If <E id=2 the
종 류 자 질 - Is indefinite NP - Is Demonstrative NP - 앞/뒤 단어의 품사
government> can stick with <E id =1 them>, <E id=1 it>
will be able to halve this year’s 120 billion ruble (US $193 billion) deficit.
조합하여 자질들을 생성하게 된다. 하지만 자질들의 수가 너무 많 고, 기계학습의 학습 속도 문제로 인해 이러한 자질의 모든 조합에 대해 실험하는 것은 사실상 불가능하므로, 기존 연구들을 참고하여 사용할 수 있는 자질들의 목록을 작성하고, 결정 트리에서 사용되 는 정보 이득(information gain)을 이용하여 선행어 결정 시스템을 위한 자질 집합을 <표 27>과 같이 결정하였다.
본 연구에서 선행어 결정을 위해 TCM(twin-candidate model) 을 사용한다. TCM은 대용대명사와 각각의 후보 선행어들 사이의 관계에 의해서 최종 선행어를 결정하는 것이 아니라 두 후보 선행 어들끼리 경쟁할 수 있도록 모델링된 것이다. TCM에 의해서 모델 이 되면 최종적으로 선행어를 결정하기 위해서 후보들끼리 경쟁을 하게 되는데 경쟁 방법에는 크게 두 가지 방법이 존재한다.
첫 번째는 승자진출전(tournament) 방법으로 모든 후보들 중 가 장 먼저 2개의 후보를 선택하고 경쟁을 붙이게 된다. 이 경쟁에서 살아남은 후보와 아직 선택되지 않은 후보 중 1개를 선택하여 다시 경쟁하는 형태이다. 모든 후보들이 선택되어 남아있는 후보가 없어 지면 경쟁은 끝이 나고 최후에 살아남아 있는 후보가 정답으로 결 정되는 시스템이다.
두 번째는 연맹전(league) 방법으로 모든 후보들에 대해 경쟁을 붙여서 가장 승률이 좋은 후보를 선택하는 시스템이다. 경쟁에 대 한 정답 태그는 총 3가지로 “00”, “10”, “01” 이 그것이다. “00”은 둘 다 정답이 아닌 경우이고 “10”은 앞의 것이, “01”은 뒤에 것이 경쟁에서 살아남은 것을 표시하는 태그이다. <표 28>은 승사진출 전 방식의 실제 경쟁하는 예를, <표 29>는 연맹전 방식의 실제 예 를 보여준다.
대명사 후보들 정답
[6 them]
[1 Those figures], [2 the government] 10 [1 Those figures], [3 legislators] 10 [1 Those figures], [4 September] 10 [1 Those figures], [5 the government] 10
[7 it]
[1 Those figures], [2 the government] 01 [2 the government], [3 legislators] 10 [2 the government], [4 September] 10 [2 the government], [5 the government] 01 [5 the government], [6 them] 10
<표 28> 승자진출전을 통한 선행어 결정
대명사 후보들 정답
[7 it]
[1 Those figures], [2 the government] 01 [1 Those figures], [3 legislators] 00 [1 Those figures], [4 September] 00 [1 Those figures], [5 the government] 01 [1 Those figures], [6 them] 00
구분 대용대명사 대용대명사
[2 the government], [3 legislators] 10 [2 the government], [4 September] 10 [2 the government], [5 the government] 01 [2 the government], [6 them] 10 [3 legislators], [4 September] 00 [3 legislators], [5 the government] 01 [3 legislators], [6 them] 00 [4 September], [5 the government] 01
[4 September], [6 them] 00
[5 the government], [6 them] 10
선행어 점수
[1 Those figures] 0
[2 the government] 4
[3 legislators] 0
[4 September] 0
[5 the government] 5
[6 them] 0
<표 30>을 살펴보면 승자진출전에 비해서 연맹전이 상당히 낮 은 정확률을 보이는 것을 알 수 있다. 이는 연맹전의 특성상 모든 후보들 간의 경쟁이 일어남에 따라 정답 태그 중 “00”의 비율이 너 무 높아져서 학습 결과가 "00"쪽으로 치우치는 현상 때문이다.
대용대명사의 수 선행어를 정확하게 인식한 대용대명사의 수 정확률 (%)
676 526 83.13
<표 31> 선행어 결정 시스템의 정확률
구분 대용대명사의 수 선행어를 정확하게 인식한
대용대명사의 수 정확률 (%)
승자진출전 676 426 63.01
<표 32> 대용대명사 결정 시스템을 거치지 않은 시스템 정확률
<표 31>은 대용대명사 결정 시스템의 결과를 이용하지 않고 대 용대명사 만을 대상으로 선행어 결정 시스템을 적용시킨 결과이다.
<표 31>을 살펴보면 대용대명사 시스템에서 전파되는 에러율이 상 당히 높은 것을 알 수 있다(정확률 83.13%). 이러한 이유로 대용대 명사 결정 시스템을 사용하지 않고, 모든 대명사를 대상으로 선행 어를 결정하되, 대용대명사가 아닐 경우는 최종 정답 태그가 “00”
되도록 선행어 결정 시스템을 구성하였다. 최종 시스템의 성능은
<표 32>와 같다. <표 30>에서 살펴본 대용대명사 결정 시스템을 거친 선행어 결정 시스템 보다 약 6%정도 높은 정확률을 보인다.
본 연구에서는 최종적으로 대용 대명사 결정 시스템을 거치지 않는 승자 진출전 방식을 선택하였다.