• 검색 결과가 없습니다.

저작자표시-비영리-변경금지 2.0 대한민국 이용자는 아래의 ... - S-Space

N/A
N/A
Protected

Academic year: 2024

Share "저작자표시-비영리-변경금지 2.0 대한민국 이용자는 아래의 ... - S-Space"

Copied!
151
0
0

로드 중.... (전체 텍스트 보기)

전체 글

(1)

저작자표시-비영리-변경금지 2.0 대한민국 이용자는 아래의 조건을 따르는 경우에 한하여 자유롭게

l 이 저작물을 복제, 배포, 전송, 전시, 공연 및 방송할 수 있습니다. 다음과 같은 조건을 따라야 합니다:

l 귀하는, 이 저작물의 재이용이나 배포의 경우, 이 저작물에 적용된 이용허락조건 을 명확하게 나타내어야 합니다.

l 저작권자로부터 별도의 허가를 받으면 이러한 조건들은 적용되지 않습니다.

저작권법에 따른 이용자의 권리는 위의 내용에 의하여 영향을 받지 않습니다. 이것은 이용허락규약(Legal Code)을 이해하기 쉽게 요약한 것입니다.

Disclaimer

저작자표시. 귀하는 원저작자를 표시하여야 합니다.

비영리. 귀하는 이 저작물을 영리 목적으로 이용할 수 없습니다.

변경금지. 귀하는 이 저작물을 개작, 변형 또는 가공할 수 없습니다.

(2)

의학박사학위논문

체계적 문헌고찰을 위한 텍스트 분류 모델링 방법에 대한 연구

2015 년 2 월

서울대학교 대학원

(3)

체계적 문헌고찰을 위한 텍스트 분류 모델링 방법에 대한 연구

지도교수 최 진 욱

이 논문을 의학박사학위논문으로 제출함

2014 년 10 월

서울대학교 대학원 의학과 의공학전공

김 승 희

김승희의 의학박사 학위논문을 인준함 2014 년 12 월

위 원 장 ( 인 )

부 위 원 장 ( 인 )

위 원 ( 인 )

위 원 ( 인 )

위 원 ( 인 )

(4)

국문 초록

근거중심의학

(Evidence Based Medicine, EBM)

이란 임상 경험과 현존

(current)

하는 최상의 근거

(best evidence)

를 성실

(conscientious)

하고

,

명 백

(explicit)

하고

,

신중

(judicious)

하게 사용하여 개별 환자 치료에 관한 의 사 결정을 하는 것으로

,

근거중심의학을 한다는 것은 개별 임상가의 전 문성과 체계적 연구에서 얻어진 사용 가능한 최상의 외적 임상 근거의 통합을 의미한다

.

근거중심의학을 가능하도록 지원하는 체계적 문헌고찰 은 사전에 정해진 기준에 맞는 모든 연구들을 수집

,

분석하여 문헌에서 제시한 방대한 결과를 질적 수준에 대한 평가와 함께 통합해 줌으로 해 당 질문에 대한 결론을 도출하는 연구방법이다

.

이러한 체계적 문헌고찰 을 위해서는 모든 관련문헌을 확인하여 정해진 기준에 부합하는 문헌을 선택하고 결과를 합성해야 하기 때문에 상당한 시간과 노력이 요구된다

.

이에 체계적 문헌고찰을 지원하는 시스템 개발로 체계적 문헌고찰을 수 행하는 저자의 노력을 줄어주는 것이 필요하다

.

이미 많은 선행연구에서 선택문헌과 배제문헌을 분류해줌으로 체계적 문헌고찰을 지원하는 시스템을 제안하고 있다

.

그러나 대부분의 연구에 서 실험데이터와 동일한 주제의 훈련데이터를 사용하고 있으며

,

실험데 이터와 다른 주제의 훈련데이터를 사용한 일부 선행연구에서는 낮은 분 류 성능을 보이고 있다

.

그러나 체계적 문헌고찰은 핵심 질문에 관련된 모든 문헌을 확인하여 결론을 도출하는 연구방법이기 때문에 동일한 핵 심 질문을 가지는 두 개 이상의 체계적 문헌고찰은 거의 이루어지지 않
(5)

헌고찰을 업데이트하는 경우가 아니라면 동일 주제의 데이터를 훈련데이 터로 사용하기는 어렵다

.

또한 핵심 질문에 따라 선택

/

배제 기준이 다양 하기 때문에 좋은 분류 성능을 보일 것으로 예상되는 관련된 훈련데이터 를 찾는 것은 쉽지 않다

.

이에 본 연구에서는 관련 데이터가 없는 새로운 주제의 체계적 문헌고 찰을 수행할 때 다른 주제로 수행된 기존의 체계적 문헌고찰 데이터를 훈련데이터로 사용하여 새로운 주제의 체계적 문헌고찰에 포함되지 않을 배제문헌을 분류함으로 저자의 문헌 선택 노력을 줄여주고자 하였다

.

본 연구에서는 주제가 다른 데이터를 훈련데이터로 사용하기 때문에 주제에 따라 선택문헌이 되기도 하고

,

배제문헌이 되기도 하는 주제특이 적 배제문헌은 분류 성능을 저하시킬 수 있다고 생각되어 배제문헌에서

공통배제문헌

을 분류하여 실험하였다

.

공통배제문헌이란 체계적 문헌고 찰 주제에 상관없이 모든 체계적 문헌고찰에서 배제되는 문헌으로

,

초록 만 있는 회색문헌

(grey literature),

리뷰

사설 등의 원저가 아닌 문헌

(non-original articles),

동물 연구

,

기전

(mechanism)

에 관한 전임상시험 연구

(pre-clinical studies)

를 말한다

.

배제문헌 중 공통배제문헌을 제외한 나머지 배제문헌은 모두 주제특이적

(topic-specific)

배제문헌으로

,

체계적 문헌고찰 주제에 따라 선택되기도 하고 배제되기도 하는 문헌이다

.

또한 훈련데이터의 비대칭성으로 인해 분류자

(classifier)

가 훈련데이터에서 차 지하는 비중이 큰 배제문헌 쪽으로 학습되고

,

대부분 배제문헌이라고 분 류하지 않도록 훈련데이터의 선택문헌과 배제문헌의 수를 동일하게 한

대칭적

(even)

훈련데이터

를 만들어 실험하였다

.

연구 재료는 시술 분야 체계적 문헌고찰

19

개와 약 분야 체계적 문헌 고찰

4

개를 사용하였다

.

특징으로는 모든 특징을 사용한 제목

,

초록

,

Mesh,

출판유형 조합

(TAMP)

과 이전 연구에서 분류성능이 좋았던

Mesh,

(6)

출판유형 조합

(MP)

을 사용하였다

.

첫 번째 실험

(

실험

1)

은 훈련데이터와 실험데이터의 조합이 다른 세 가지 모델을

SVM

Na

ї

ve Bayesian

으로 각각 훈련시켜 분류하였다

.

모델

1

의 훈련데이터와 실험데이터는 기존 연구에서와 같이 체계적 문헌고찰에 포함되어 있는 선택문헌과 배제문헌 을 그대로 사용하였다

.

모델

2

의 훈련데이터는 선택문헌과 모든 체계적 문헌고찰에서 공통적으로 배제되는 공통배제문헌을

,

실험데이터는 선택 문헌과 배제문헌을 사용하였다

.

모델

3

은 훈련데이터와 실험데이터 모두 선택문헌과 공통배제문헌을 사용하였다

.

세 가지 모델 모두 훈련데이터 에는 실험데이터 주제의 선택문헌과 배제문헌이 포함되지 않도록 하였 다

.

두 번째 실험

(

실험

2)

은 선택문헌이 배제되는 것을 줄이기 위해 실험

1

의 훈련데이터를

Na

ї

ve Bayesian

으로 훈련시킨 후

,

실험

1

에서

SVM

으 로 배제문헌이라고 분류된 문헌을 한 번 더 분류함으로 민감도를 높이고 자 하였다

.

시술의 실험

1

결과인

SVM

의 평균

AUC

TAMP

(모델 1/모델 2 : 0.81/0.83)와

MP

(모델 1/모델 2 : 0.81/0.81)가 유사했고

,

모델

1

과 모델

2

도 유사했다

.

평균 정확도는

TAMP

(모델 1/모델 2 : 0.83/0.73)가

MP

(모델 1/

모델 2 : 0.75/0.61)보다 높았고

,

모델

1

이 모델

2

보다 높았다

.

평균 민감도 는

MP

(모델 1/모델 2 : 0.70/0.86)가

TAMP

(모델 1/모델 2 : 0.51/0.75)보다 높았고

,

모델

2

가 모델

1

보다 높았다

.

평균 특이도는

TAMP

(모델 1/모델 2 : 0.85/0.73)가

MP

(모델 1/모델 2 : 0.76/0.59)보다 높았고

,

모델

1

이 모델

2

보다 높았다

.

시술의 실험

1

결과인

Na

ї

ve Bayesian

의 평균 정확도는

TAMP

(모델
(7)

.

평균 특이도는

TAMP

(모델 1/모델 2 : 0.79/0.69)가

MP

(모델 1/모델 2 : 0.67/0.55)보다 높았고

,

모델

1

이 모델

2

보다 높았다

.

시술 실험데이터에는 선택문헌보다 배제문헌이 더 많이 포함되어 있어 정확도는 특이도의 영향을 많이 받아 특이도가 높으면 정확도도 높아지 고

,

특이도가 낮으면 정확도도 낮아지는 경향을 보였다

.

그러므로 전반적 분류 결과는 정확도보다는

AUC

로 평가해야 할 것이다

. SVM

을 통해 제 시된

AUC

는 특징조합

(TAMP, MP)

에 따라

,

모델

(

모델

1,

모델

2)

에 따라 거의 차이가 없어 본 연구에서는 특징조합과 모델이 분류 결과에 큰 영 향을 미치지 않았음을 확인할 수 있었다

.

이는 일부 특징

(MP)

과 적은 훈 련데이터

(

모델

2)

를 사용함에도 불구하고 모든 특징

(TAMP)

과 모든 훈련 데이터

(

모델

1)

를 사용한 경우와 유사한 분류 성능을 보인 것이므로 의 미 있는 결과라 하겠다

.

민감도와 특이도는 특징조합과 모델에 따라 달라졌다

.

특징조합에 따 라서는 특징 전체를 사용한 경우

(TAMP)

보다 메타데이터를 사용한 경우

(MP)

의 민감도가 높았고

,

특이도는 낮았다

.

모델에 따라서는 문헌 전체 를 훈련데이터로 사용한 경우

(

모델

1)

보다 공통배제문헌만 훈련데이터로 사용한 경우

(

모델

2)

의 민감도는 높았고

,

특이도는 낮았다

.

이를 통해 데 이터가 구체화

(specific)

될수록 민감도는 낮아지고 특이도는 높아지는 것 으로 생각되었다

. SVM

Na

ї

ve Bayesian

으로 실험한 결과 특징조합과 모델의 전반적 경향은 유사했으나

, SVM

은 특이도가

, Na

ї

ve Bayesian

은 민감도가 높았다

.

약의 실험

1

결과인

SVM

의 평균

AUC

TAMP

(모델 1/모델 2 : 0.78/0.73)와

MP

(모델 1/모델 2 : 0.77/0.75)가 유사했고

,

모델

1

모델

2

보다 높았다

.

평균 정확도는

TAMP

(모델 1/모델 2 : 0.80/0.67)가

MP

(모델 1/모델 2 : 0.78/0.62)보다 높았고

,

모델

1

이 모델

2

보다 높았다

.

평균 민감
(8)

도는

MP

(모델 1/모델 2 : 0.57/0.73)가

TAMP

(모델 1/모델 2 : 0.49/0.68)보다 높았고

,

모델

2

가 모델

1

보다 높았다

.

평균 특이도는

TAMP

(모델 1/모델 2 : 0.85/0.67)가

MP

(모델 1/모델 2 : 0.81/0.61)보다 높았고

,

모델

1

이 모델

2

보다 높았다

.

약의 실험

1

결과인

Na

ї

ve Bayesian

의 평균 정확도는

TAMP

(모델 1/ 2 : 0.73/0.56)가

MP

(모델 1/모델 2 : 0.61/0.50)보다 높았고

,

모델

1

이 모 델

2

보다 높았다

.

평균 민감도는

MP

(모델 1/모델 2 : 0.74/0.85)가

TAMP

(모델 1/모델 2 : 0.66/0.76)보다 높았고

,

모델

2

가 모델

1

보다 높았다

.

평균 특이도는

TAMP

(모델 1/모델 2 : 0.75/0.55)가

MP

(모델 1/모델 2 : 0.60/0.47) 보다 높았고

,

모델

1

이 모델

2

보다 높았다

.

시술 실험데이터와 다르게 약 실험데이터에는 선택문헌이 많은 주제도 있고 배제문헌이 많은 주제도 있어 정확도가 민감도 또는 특이도에 편중 되어 영향 받지 않았다

. SVM

을 통해 제시된

AUC

는 모델

1

에서는

TAMP

MP

보다 높고

,

모델

2

에서는

MP

TAMP

보다 높아 특징조합 에 따른 일관된 결과를 도출할 수 없었다

. AUC

를 제외한 나머지 결과 지표들은 특징조합에 영향을 받았는데

,

정확도와 특이도는

TAMP

,

민 감도는

MP

가 높았다

.

모델에 따라서는

AUC,

정확도

,

특이도는 모델

1

,

민감도는 모델

2

가 높았다

.

약 체계적 문헌고찰 데이터에는 배제사유가 대부분

'Nonspecifically

excluded'

라고 되어 있어 공통배제문헌으로 분류된 배제문헌이 적었다

.

그러나 본 연구에서는 한쪽으로 편향되어 훈련되지 않도록 하기 위해 동 일한 수의 선택문헌과 배제문헌으로 훈련데이터를 만들었기 때문에 공통
(9)

Bayesian

결과는 시술과 동일한 경향을 보였다

.

시술의 실험

2

결과인

TAMP(SVM)+MP(Na

ї

ve Bayesian)

의 평균 민감 도(모델 1/모델 2 : 0.84/0.93)는

TAMP(SVM+Na

ї

ve Bayesian)

의 평균 민감 도(모델 1/모델 2 : 0.72/0.87) 보다 높았고

,

모델

2

가 모델

1

보다 높았다

.

약의 실험

2

결과인

TAMP(SVM)+MP(Na

ї

ve Bayesian)

의 평균 민감도( 1/모델 2 : 0.80/0.88)는

TAMP(SVM+Na

ї

ve Bayesian)

의 평균 민감도( 1/모델 2 : 0.69/0.81) 보다 높았고

,

모델

2

가 모델

1

보다 높았다

.

이는 실험

1

에서 특징 전체를 사용한 경우

(TAMP)

보다 메타데이터를 사용한 경우

(MP)

의 민감도가 더 높았던 것이 실험

2

에 그대로 반영되어

, MP(Na

ї

ve Bayesian)

로 추가 분류한 경우의 민감도가

TAMP(Na

ї

ve

Bayesian)

로 추가 분류한 경우보다 민감도가 높았던 것으로 생각되었다

.

또한 모델

2

가 모델

1

보다 민감도가 높았는데

,

이는 실험

1

에서 문헌 전 체를 훈련데이터로 사용한 경우

(

모델

1)

보다 공통배제문헌만 훈련데이터 로 사용한 경우

(

모델

2)

의 민감도가 높았던 것이 실험

2

에 그대로 반영 되어 모델

2

의 민감도가 모델

1

보다 여전히 높은 것으로 생각되었다

.

연구를 진행하면서 나타난 제한점과 이를 보완하기 위한 향후 연구과 제로 첫째

,

체계적 문헌고찰에는 핵심 질문과 관련된 문헌이 모두 포함 되어야 하기 때문에 민감도는

“1”

이 되어야 하나

,

본 연구의 평균 최대 민감도는

0.93(

시술

)

으로 민감도 향상을 위한 추가 연구가 필요하다

.

둘 째

,

본 연구의 검증을 위해 이전 연구들에서 사용한 약 주제 체계적 문 헌고찰

4

개를 실험에 포함하였으나

,

실험에 포함된 문헌은

4,700

여 편

,

이 중 공통배제문헌은

161

편으로 그 수가 적어 더 많은 데이터로 본 연 구를 검증하는 것이 추가적으로 필요하다

.

셋째

,

체계적 문헌고찰에 포함 되지 않는 문헌

(

배제문헌

)

을 배제해 줌으로 저자가 확인해야 할 문헌의 수를 줄여주기 위해서는 기계적으로 배제된 문헌이 왜 배제되었는지에
(10)

대한 배제사유가 필요하다

.

그러나 본 연구 범위에 실험에서 배제된 문 헌에 적절한 배제사유를 할당해 주는 것은 포함하지 않아

,

추후

decision tree

등의 방법으로 배제문헌에 배제사유를 할당해주는 시스템 개발이 필요하다

.

넷째

,

본 연구에서 기계학습 방법으로 사용한

SVM

Na

ї

ve Bayesian

에는 다양한 옵션들이 있지만

,

본 연구에서는 디폴트 세팅으로 실험하였기 때문에 향후 커널을 포함한 다양한 옵션들을 조정하여 최적 화 시킨다면 분류성능을 더 향상시킬 수 있을 것이다

.

본 연구는 관련 데이터가 없는 새로운 주제의 체계적 문헌고찰을 수행 할 때 다른 주제로 수행된 기존의 체계적 문헌고찰 데이터를 훈련데이터 로 사용하여 새로운 주제의 체계적 문헌고찰에 포함되지 않을 배제문헌 을 높은 민감도로 분류함으로 저자가 확인해야 할 문헌의 수를 줄여주었 다

.

본 연구에서 제안한 방법을 통해 새로운 주제의 체계적 문헌고찰을 수행하는 저자의 체계적 문헌고찰 과정을 지원할 수 있을 것이다

.

주요어

:

분류

(Classification),

기계학습

(Machine Learning),

체계적 문헌고찰

(Systematic Review),

근거중심의학

(Evidence-based Medicine)

학 번

: 2007-30969

(11)

목 차

제 1 장 서론 ···1

1.

연구 배경

···1

1)

근거 중심 의학

(Evidence Based Medicine)

의 역사

···1

2)

체계적 문헌고찰

(Systematic Review) ···2

.

체계적 문헌고찰의 역사

···2

.

체계적 문헌고찰 수행 방법

···3

3)

연구의 필요성

···6

4)

선행 연구

···7

2.

연구 목적

···14

3.

연구의 독창성

···15

제 2 장 연구 재료 및 방법 ···16

1.

연구 재료

···16

2.

연구 방법

···22

1)

데이터 수집 및 전처리

···22

2)

훈련 및 실험 데이터

(Training and Test data) ···24

3)

분류 시스템

···28

. Support Vector Machine(SVM) ···28

. Na

ї

ve Bayesian ···34

3.

평가

···37

1)

실험

1 : SVM

Na

ї

ve Bayesian

으로 각각 문헌 분류

···37

2)

실험

2 : SVM

으로 분류 후

Na

ї

ve Bayesian

으로 추가 분류

··· 38

제 3 장 연구 결과 ···40

1.

실험

1 : SVM

Na

ї

ve Bayesian

으로 각각 문헌 분류

···40

(12)

1)

시술

···40

.

모든 특징

(

제목

,

초록

, Mesh,

출판유형

)

조합

: TAMP ···40

. Mesh

와 출판유형 조합

: MP ···60

2)

···78

.

모든 특징

(

제목

,

초록

, Mesh,

출판유형

)

조합

: TAMP ···78

. Mesh

와 출판유형 조합

: MP ···85

2.

실험

2 : SVM

으로 분류 후

Na

ї

ve Bayesian

으로 추가 분류

··· 92

1)

시술

···92

. TAMP(SVM) + TAMP(Na

ї

ve Bayesian) ···92

. TAMP(SVM) + MP(Na

ї

ve Bayesian) ···99

2)

···105

. TAMP(SVM) + TAMP(Na

ї

ve Bayesian) ···105

. TAMP(SVM) + MP(Na

ї

ve Bayesian) ···109

제 4 장 고찰 ···113

제 5 장 결론 및 향후 과제 ···124

참고문헌 ···126

Abstract ···133

(13)

표 목차

Table 1-1. Summary of Previous Related Articles ···12 Table 2-1. Coded Values for Article Triage Decisions in Procedure

Topics ···17 Table 2-2. Number of Articles Included and Excluded across 19

Procedure Systematic Reviews ···18 Table 2-3. Coded Values for Article Triage Decisions in Drug Topics ···· 20 Table 2-4. Number of Articles Included and Excluded across 4 Drug

Systematic Reviews ···21 Table 2-5. Number of Training and Test Data Sets across 19

Procedure Systematic Reviews ···26 Table 2-6. Number of Training and Test Data Sets across 4 Drug

Systematic Reviews ···27 Table 3-1. Mean AUCs of the Three Models across 19 Procedure

Systematic Reviews using SVM with TAMP ···41 Table 3-2. Mean Accuracies of the Three Models across 19 Procedure

Systematic Reviews using SVM with TAMP ···44 Table 3-3. Mean Sensitivities of the Three Models across 19

Procedure Systematic Reviews using SVM with TAMP ··· 46 Table 3-4. Mean Specificities of the Three Models across 19

Procedure Systematic Reviews using SVM with TAMP ··· 49 Table 3-5. Mean Accuracies of the Three Models across 19 Procedure

Systematic Reviews using Na

ї

ve Bayesian with TAMP ··· 52 Table 3-6. Mean Sensitivities of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian with

TAMP ···55

(14)

Table 3-7. Mean Specificities of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian with TAMP ···58 Table 3-8. Mean AUCs of the Three Models across 19 Procedure

Systematic Reviews using SVM with MP ···61 Table 3-9. Mean Accuracies of the Three Models across 19 Procedure

Systematic Reviews using SVM with MP ···63 Table 3-10. Mean Sensitivities of the Three Models across 19

Procedure Systematic Reviews using SVM with MP ··· 65 Table 3-11. Mean Specificities of the Three Models across 19

Procedure Systematic Reviews using SVM with MP ··· 67 Table 3-12. Mean Accuracies of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian with MP ···70 Table 3-13. Mean Sensitivities of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian with MP ···73 Table 3-14. Mean Specificities of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian with MP ···76 Table 3-15. Mean AUCs of the Three Models across 4 Drug

Systematic Reviews using SVM with TAMP ···78 Table 3-16. Mean Accuracies of the Three Models across 4 Drug

Systematic Reviews using SVM with TAMP ···79

Table 3-17. Mean Sensitivities of the Three Models across 4 Drug

(15)

Table 3-19. Mean Accuracies of the Three Models across 4 Drug Systematic Reviews using Na

ї

ve Bayesian with TAMP · 82 Table 3-20. Mean Sensitivities of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian with TAMP · 83 Table 3-21. Mean Specificities of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian with TAMP · 84 Table 3-22. Mean AUCs of the Three Models across 4 Drug

Systematic Reviews using SVM with MP ···85 Table 3-23. Mean Accuracies of the Three Models across 4 Drug

Systematic Reviews using SVM with MP ···86 Table 3-24. Mean Sensitivities of the Three Models across 4 Drug

Systematic Reviews using SVM with MP ···87 Table 3-25. Mean Specificities of the Three Models across 4 Drug

Systematic Reviews using SVM with MP ···88 Table 3-26. Mean Accuracies of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian with MP ··· 89 Table 3-27. Mean Sensitivities of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian with MP ··· 90 Table 3-28. Mean Specificities of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian with MP ··· 91 Table 3-29. Mean Sensitivities of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian after SVM with TAMP ···94 Table 3-30. Mean Specificities of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian after SVM with TAMP ···97 Table 3-31. Mean Sensitivities of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian with

(16)

MP after SVM with TAMP ···100 Table 3-32. Mean Specificities of the Three Models across 19

Procedure Systematic Reviews using Na

ї

ve Bayesian with MP after SVM with TAMP ···103 Table 3-33. Mean Sensitivities of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian after SVM with TAMP ···106 Table 3-34. Mean Specificities of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian after SVM with TAMP ···108 Table 3-35. Mean Sensitivities of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian with MP after SVM with TAMP ···110 Table 3-36. Mean Specificities of the Three Models across 4 Drug

Systematic Reviews using Na

ї

ve Bayesian with MP after SVM with TAMP ···112 Table 4-1. Results Summary of Experiment 1 across Procedure

Systematic Reviews ···116 Table 4-2. Results Summary of Experiment 1 across Drug Systematic

Reviews ···119 Table 4-3. Results Summary of Experiment 1 and Experiment 2 across

Procedure Systematic Reviews ···121 Table 4-4. Results Summary of Experiment 1 and Experiment 2 across

Drug Systematic Reviews ···123

(17)

그림 목차

Figure 2-1. Data Collection Method ···22

Figure 2-2. Example of the Feature Representation ···23

Figure 2-3. Building the Training and Test Sets ···25

Figure 2-4. Boundary Hyperplanes ···29

Figure 2-5. Optimal Hyperplane decision ···31

Figure 2-6. Support Vectors ···33

Figure 2-7. Process of Experiment 1 ···37

Figure 2-8. Process of Experiment 2 ···39

(18)

제 1 장 서론

1. 연구 배경

1)

근거 중심 의학

(Evidence Based Medicine)

의 역사

근거 중심 의학

(Evidence Based Medicine, EBM)

의 개념은

1972

Archibald Cochrane

「Effectiveness and Efficiency」

에서 태동하였다

. Archibald Cochrane

은 이 책을 통해 많은 검사

,

치료 등이 효과적이라는 근거 없이 사용되고 있고

,

실제로 유용하기보다는 해로울 수 있다고 주 장하였다

[1].

이후

1992

년 과거 의사결정은 주로 임상의의 권위와 의견이 강조되었지만

,

앞으로는 임상의의 의사 결정에 있어 임상 문헌을 근거로 사용하는 것이 의료의 새로운 패러다임이라고 소개

[2]

Evidence-Based Medicine Working Group

을 통해 근거 중심 의학이란 용어가 정착되었 다

[3].

1996

Dr. David Sackett

은 근거 중심 의학을 정의하였다

.

근거 중심 의학이란 임상 경험과 현존

(current)

하는 최상의 근거

(best evidence)

를 성실

(conscientious)

하고

,

명백

(explicit)

하고

,

신중

(judicious)

하게 사용하여 개별 환자 치료에 관한 의사 결정을 하는 것이다

.

,

근거 중심 의학을 한다는 것은 개별 임상가의 전문성과 체계적 연구에서 얻어진 사용 가능 한 최상의 외적 임상 근거의 통합을 의미한다

.

개별 임상가의 전문성이 란 임상 경험에서 얻는 숙련도와 판단력을 의미하며

,

체계적 연구에서 얻어진 사용 가능한 최상의 외적 임상 근거란 진단검사의 정확성

,

예후
(19)

치료적 중재가 무엇인지 알 수 있다

.

좋은 의사는 본인의 전문성과 사용 가능한 최상의 외적 임상 근거를 환자 진료에 함께 사용할 것이다

[4].

이를 위해서는 우선 관련 임상 근거를 확보하고

,

내용을 확인해야 한 다

.

그러나 현재 발간되는 의학연구의 수는 매우 방대한 수준으로 연간

20,000

종의 의학학술지가 발간되고

, MEDLINE

에 등재되는 논문은 연간

40

여만 개에 이르기 때문에 한 개인의 노력으로 모든 관련 문헌을 확인 하여 환자 진료에 사용하기는 매우 어렵다

[5].

이에 근거 중심 의학을 가 능하도록 지원하는 연구방법이 필요한데

,

이것이 바로 체계적 문헌고찰

(Systematic Review, SR)

이다

.

2)

체계적 문헌고찰

(Systematic Review)

체계적 문헌고찰

(Systematic Review, SR)

이란 사전에 정해진 기준에 맞는 모든 연구들을 수집

,

분석하여 문헌에서 제시한 방대한 결과를 질 적 수준에 대한 평가와 함께 통합해 줌으로 해당 질문에 대한 결론을 도 출하는 연구방법

[6]

으로

,

체계적 문헌고찰을 근거로 사용하는 근거 중심 의학은 치료의 일관성 뿐 아니라 최적의 의료 결과와 환자 삶의 질 향상 을 가져올 것이다

[7].

.

체계적 문헌고찰의 역사

의학 분야의 첫 번째 체계적 문헌고찰은

1904

Karl Pearson

이 장티 푸스에 대항하는 백신 효과를 발표한 연구들을 통합한 것이었다

[8].

이후

1970

년대부터 체계적 문헌고찰이 본격적으로 이루어지기 시작하였다

[9].

1972

Archibald Cochrane

「Effectiveness and Efficiency」

에서 의료 서비스의 효과를 입증하기 위해서는 무작위 임상연구가 중요함을 주장
(20)

[1]

하였고

, 1979

년 의학의 각 분야별로 무작위 임상연구 결과를 수집하고 엄격히 평가하여 그 결과를 주기적으로 개정하여 보급하는 것이 필요함 을 언급하였다

[10].

이후

1992

년 코크란 연합

(Cochrane Collaboration)

이 설립됨으로 체계적 문헌고찰 발전에 크게 기여하였다

[11].

.

체계적 문헌고찰 수행 방법

체계적 문헌고찰은 핵심질문 정의

,

문헌검색

,

문헌선택

,

문헌의 비뚤림 위험 평가

,

자료 분석 및 결과 제시의 과정으로 진행된다

[7, 9, 12].

(1)

핵심질문

(Key question)

정의

체계적 문헌고찰을 수행하기 위해서는 먼저 연구목적에 맞는 핵심질문 을 작성해야 한다

.

핵심 질문은 일반적으로 다음의 네 가지 요소로 작성 되며

,

각 요소의 첫 번째 알파벳을 따서

‘PICO’

라고 부른다

.

관심 환자집단은 어떻게 정의할 것인가

(Patient)

어떤 중재법을 평가할 것인가

(Intervention)

무엇과 비교하여 결과를 평가할 것인가

(Comparator)

결과 측정은 무엇으로 할 것인가

(Outcome)

핵심 질문은 문헌검색 및 문헌선택의 기준이 되기 때문에 명확하고 구 체적으로 작성해야 한다

.

(2)

문헌검색
(21)

문헌검색 과정 첫 번째는 검색어 선정이다

.

검색어로는

PICO

에 해당 하는 주요 개념어를 추출하고

,

이와 관련된 용어들을 목록화한다

.

두 번 째는 검색원 결정이다

.

검색원은 관련 문헌을 모으는 범위를 결정하는 것으로

,

일반적 검색원은 미국립의학도서관

(National Library of Medicine, NLM)

에서 제시한

COSI(COre search, Standard search, Ideal search)

모델을 사용한다

[13]. Core

는 핵심 검색 범위로

, MEDLINE[14], EMBASE[15], Cochrane CENTRAL[16], KoreaMed[17],

한국의학논문데 이터베이스

(Kmbase)[18],

한국학술정보

(KISS)[19],

국가과학기술정보센터

(NDSL)[20],

한국과학기술정보연구원

(KSITI)[21]

등의 데이터베이스를 포 함한다

. Standard

는 표준 검색 범위로

, Web of Science, DARE, CINAHL, PsycINFO, ERIC, CANCERLIT

등의 데이터베이스를 포함한 다

. Ideal

은 이상적 검색 법위로

,

학술대회 초록집

,

출판되지 않은 문헌

,

현재 진행 중인 임상시험 등을 포함한다

.

(3)

문헌선택

문헌선택은 문헌을 선택

/

배제하는 기준에 의해 핵심질문에 해당하는 문헌을 선택하는 과정으로

,

최소 두 명 이상의 연구자가 독립적으로 수 행해야 하며

,

핵심질문에 해당하는 문헌이 배제되지 않도록 하는 것이 중요하다

.

문헌선택은 크게 세 단계로 이루어진다

.

첫 번째 단계는 문헌 선택

/

배 제기준을 정하는 것이다

.

어떤 문헌을 선택하고

,

어떤 문헌을 배제할지 핵심질문에 기초하여 논리적으로 만들어야 한다

.

예를 들어

,

핵심질문 중 환자집단을 위암 환자라고 했다면

,

선택기준은 위암 환자를 대상으로 연 구한 문헌이 되고 배제기준은 위암 환자를 대상으로 하지 않은 연구가 될 것이다

.

두 번째 단계는 검색된 문헌의 제목과 초록을 보면서 문헌
(22)

선택

/

배제기준에 의거해 문헌을 선택

/

배제하는 것이다

.

세 번째 단계는 두 번째 단계에서 선택된 문헌의 전문을 보면서 문헌 선택

/

배제 기준에 의거해 핵심 질문에 답으로 제시될 문헌을 최종적으로 선택

/

배제한다

.

문헌선택 과정의 일반적 원칙은 배제기준 중 하나라도 해당되는 문헌은 배제문헌이 되고

,

모든 선택기준을 만족시키는 문헌만 최종 결론도출에 사용되는 선택문헌이 된다는 것이다

.

배제된 문헌은 배제이유를 확인할 수 있도록 배제사유를 배제문헌 목 록과 함께 제공함으로 문헌선택 과정에 대한 명확성과 투명성을 확보해 야 한다

.

문헌검색 단계에서 민감도 높은 검색을 수행했기 때문에 핵심 질문과 관련 없는 문헌들이 많이 포함되어 있어 문헌선택 과정은 많은 시간과 노력을 요구한다

.

(4)

문헌의 비뚤림

(bias)

위험 평가

비뚤림이란 체계적 오류로 결과나 추정에 있어 참값으로부터 벗어남을 의미한다

.

비뚤림은 중재 효과를 과소추정하거나 과다추정하게 하는 요 소가 될 수 있어 이러한 오류가 발생할 위험을 평가하는 것은 매우 중요 하다

.

왜냐하면 비뚤림에 의해 잘못된 결론을 내린 연구를 선택문헌으로 한 체계적 문헌고찰은 잘못된 결과를 도출할 수밖에 없기 때문이다

.

비뚤림 위험을 평가하는 도구는 연구 설계에 따라 다양하다

.

무작위 임상연구는 코크란 그룹의

Risk of bias(Rob)

가 대표적이며

,

선택 비뚤림

,

실행 비뚤림

(

중재시행여부에 대한 정보의 충실성

,

눈가림 등

),

결과확인 비뚤림

(

결과평가의 정확성

,

눈가림 등

),

탈락 비뚤림

,

보고 비뚤림

(

출판
(23)

평가한다

[23].

(5)

자료 합성 및 결과 제시

자료 합성은 선택문헌에서 추출한 내용을 결합하는 과정으로

,

통계적 합성이 가능한 경우에는 메타분석을 통해 정량적 합성

(quantitative synthesis)

을 하고

,

통계적 합성이 불가능한 경우에는 결과를 기술적

(descriptive)

으로 제시함으로 정성적 합성

(qualitative synthesis)

을 한다

.

3)

연구의 필요성

MEDLINE

에 등재되는 논문은 연간

40

여만 개로 과학적 논문의 수는 매우 빠르게 늘어나고 있지만

,

소수의 연구들만이 체계적 문헌고찰에 포 함되고 있다

[24, 25].

코크란 연합은 임상 진료와 관련된 중요한 연구들 이 체계적 문헌고찰에 포함되기 위해서는 적어도

10,000

개의 체계적 문 헌고찰이 필요하다고 추정한다

[26].

그러나 하루에 생성되는 체계적 문헌 고찰은 약

11

(4,015

/1

)

,

새로운 근거뿐 아니라 다른 임상 문제와 중재를 포함하는 더 많은 체계적 문헌고찰이 필요하다

[25, 27].

모든 관련문헌을 확인하여 정해진 기준에 부합하는 문헌을 선택하고 결과를 합성하는 과정은 상당한 시간과 노력을 요구하기 때문에 현재의 체계적 문헌고찰 방법으로는 새로운 주제 뿐 아니라

,

기존의 체계적 문 헌고찰 중 절반도 최신의 근거를 포함하여 업데이트 할 수 없다

[27, 28].

근거를 생성하고 보고하는데 있어 저자의 노력을 줄여준다면 더 많은 체계적 문헌고찰이 생성되는데 도움이 될 것인데

,

체계적 문헌고찰을 지 원하는 시스템이 체계적 문헌고찰에 포함되는 문헌을 선택하는데 요구되 는 노력을 줄여줄 수 있을 것

[24, 29]

이기 때문에 체계적 문헌고찰에 포 함되는 문헌을 선택하는 저자의 노력을 줄여주는 시스템 개발이 필요하다

.

(24)

4)

선행 연구

Aphinyanaphongs

(2005)

의 연구

[30]

에서는

ACP Journal Club[31]

에 요약되고 인용된 논문을 질 좋은 논문

(high-quality article)

이라고 다양한 기계학습 방법

(Naïve Bayes[32], AdaBoost[33], Support Vector Machine(SVM)-Light[34])

을 훈련시킨 후

, MEDLINE

논문 중 내과 분야 의 질 좋은 논문을 분류하고자 하였다

.

특징으로는

MeSH,

출판유형

,

제 목

,

초록을 사용하였다

.

기계학습이

Clinical Query Filter

보다 민감도

,

특이도

,

정확도 모두 더 높았으며

,

기계학습 방법 중에서는

Polynomial SVM

의 성능이 가장 좋았다

.

Cohen

(2006)

의 연구

[35]

에서는 약 분야의 체계적 문헌고찰

15

개를 각 주제별로 데이터를 랜덤하게 반으로 나눠 반은 훈련데이터로

,

나머지 반은 실험데이터로 사용하였다

.

각 주제별 훈련데이터의 선택문헌과 배 제문헌으로

voting perceptron

을 훈련시킨 후

,

해당 주제 실험데이터의 선택문헌과 배제문헌을 분류하고자 하였다

.

특징은

MeSH,

출판유형

,

제 목

,

초록을 사용하였다

.

이 논문에서는

WSS(Work Saved over Sampling)

라는 개념을 사용하여 성능을 측정하였다

. WSS

란 재현율

(recall)

을 고정 했을 때 전체 문헌 중

voting perceptron

이 배제문헌이라고 분류한 문헌

(True Negative+False Negative)

의 비율로

,

수식은

(1)

과 같다

.

WSS = (TN + FN)/N - (1.0 - R) … (1)

TN(True Negative,

진음성

)

은 실제 배제문헌을 실험결과 배제문헌이라 고 분류한 문헌 수

, FN(False Negative,

위음성

)

은 실제 선택문헌을 실험
(25)

실험결과 선택문헌이라고 분류한 문헌이

40

개라면 재현율은

80%

가 된 다

.

재현율을

100%

로 고정한다면 이는 실제 모든 선택문헌을 실험결과 선택문헌이라고 분류한 것이기 때문에

WSS

는 전체 문헌 중 실제 배제 문헌을 실험결과 배제문헌이라고 분류한 문헌의 비율이 된다

.

예를 들어

100

개의 문헌이 있을 경우 재현율을

100%

로 고정했을 때

WSS

40%

라 면

,

이는 전체 문헌 중 실제 배제문헌을 실험결과 배제문헌이라고 분류 한 문헌이

40

개라는 의미이다

.

이 수치는 저자의 수고를

100

이라고 했을 때 저자는 실험결과 배제문헌이라고 분류된 문헌

40

개는 확인하지 않아 도 되기 때문에

40%

의 수고가 줄었다고 해석할 수 있다

.

이 연구에서는

15

개 주제의 체계적 문헌고찰 중

11

개 주제의 체계적 문헌고찰에서

10%

이상의 수고

(WSS≥10%)

를 줄여주었고

, 3

개 주제의 체계적 문헌고찰에서 는

50%

이상의 노력

(WSS≥50%)

을 줄여주었다

.

평균적으로는

23.4%

의 수고

(WSS=23.4%)

를 줄여주었다

.

Cohen

(2008)

의 연구

[36]

에서는

15

개의 체계적 문헌고찰에 포함된 선택문헌과 배제문헌을 훈련데이터와 실험데이터로 나눠 훈련데이터로

SVMLight

를 훈련시킨 후 실험데이터의 선택문헌과 배제문헌을 분류하

게 하여 하였다

.

특징은 제목

,

초록

, MeSH, UMLS(Unified Medical

Language System) CUI

를 사용하였다

.

제목과 초록은 한 단어

unigram

(ABTITLE),

두 단어

(NGRAM12),

세 단어

(NGRAM13),

네 단어

(NGRAM14)

를 각각 특징으로 사용하였고

, UMLS CUI

Metamap

을 이용하여 가장 높은 점수로 매칭된

UMLS CUI(MMTXFIRST)

와 매칭된 모든

UMLS

CUI(MMTXALL)

를 각각 특징으로 사용하였다

.

7

개의 특징 중 하나의 특징만 사용했을 경우와 특징을 조합하여 사용했을 경우의

AUC(Area

Under the receiver operating Curve)

를 비교하였다

.

또한 실험데이터와 동일한 주제의 데이터를 훈련데이터로 사용한 경우와 실험데이터와 다른
(26)

주제의 데이터를 훈련데이터로 사용한 경우의

AUC

를 비교하였다

. AUC

가 가장 높았던 특징조합은 제목

,

초록의 한 단어를 사용한

unigram (ABTITLE),

두 단어를 사용한

NGRAM12, MeSH

조합이었다

.

또한 실험 데이터와 동일한 주제의 데이터를 훈련데이터로 사용한 경우의

AUC

가 다른 주제의 데이터를 훈련데이터로 사용한 경우의

AUC

보다 대부분 통 계적으로 유의하게 높았다

.

Cohen

(2009)

의 연구

[27]

에서는 약물 분야의 체계적 문헌고찰을

SVMLight

로 훈련시켜 동일 주제의 훈련데이터가 없는 새로운 주제의 체계적 문헌고찰이나

,

훈련데이터가 적은 체계적 문헌고찰을 업데이트할 때 선택문헌과 배제문헌을 분류해줌으로 저자의 업무를 줄여주고자 하였 다

.

이 연구에서는 세 가지 시스템의 분류성능을

AUC

로 비교하였다

.

첫 번째는 실험데이터와 동일한 주제의 데이터로

SVM

을 훈련시키는 방법

(

기준시스템

),

두 번째는 실험데이터와 다른 주제의 데이터로

SVM

을 훈 련시키는 방법

(

비주제시스템

),

세 번째는 실험데이터와 주제가 같은 데이 터와 주제가 다른 데이터 모두 훈련데이터로 사용하는 방법

(

혼합시스템

)

이다

.

약 분야의 체계적 문헌고찰

24

개로 실험했으며

,

특징으로는 제목

,

초록

, MeSH

를 사용하였다

.

제목과 초록은 한 단어와 두 단어를 각각 특

징으로 사용하였다

.

혼합시스템은 기준시스템과 유사한 성능을 보였고

,

실험데이터와 동일한 주제의 훈련데이터가 적을 경우 혼합시스템의 평균

AUC

는 기준시스템보다 통계적으로 유의하게 높았다

.

또한 실험데이터와 주제가 같은 훈련데이터가 가장 적었던 경우를 제외하고는 모든 주제에 서 혼합시스템이 비주제시스템보다

AUC

가 높았다

.

그러나 실험데이터와
(27)

개발하기 위해 만들었던 데이터

[38]

를 훈련데이터와 실험데이터로 나누 어 훈련데이터로 다양한 기계학습 방법

(Na

ї

ve Bayes, SVM, Boosting,

Stacking)

을 훈련시킨 후 실험데이터의 선택문헌과 배제문헌을 분류하게

하였다

.

특징으로는 단어

(word),

메타데이터

(metadata),

술어

(predication),

엔티티

(entity),

관계

(relation)

를 사용하였다

.

단어

(word)

는 제목과 초록 을

,

메타데이터

(metadata)

MeSH

와 출판유형을 의미한다

.

술어

(predication)

SemRep[39]

시스템을 이용하여 해당 문헌의 제목과 초록에서 추출한

술어

(ex. TREATS, PREVENTS, INHIBITS

)

를 의미한다

.

엔티티

(entity)

는 해당 문헌의 제목과 초록으로 추출한

UMLS Metathesaurus

개념

(concepts)

,

관계

(relation)

UMLS Semantic Network

관계

(relations)

를 의미한다

. 4

가지 기계학습 방법과

5

가지 특징을 다양하게 조합하여 성능을 비교하였다

.

특징 조합별로는 메타데이터

(metadata)

와 엔티티

(entity)

조합의 성능이 전반적으로 좋았고

,

기계 학습 방법별로는

Na

ї

ve Bayes

이 민감도에서

, SVM

이 특이도에서

, Boosting

이 정확도와 재현율의 균형에서 좋은 결과를 보였다

.

또한 특징과 기계학습을 짝 지은 특징

-

계학습

stacking

방법은 하나의 기계학습 방법을 쓰는 경우보다 더 좋은

분류 성능을 보였다

.

Matwin

(2010)

의 연구

[24]

에서는

Cohen

(2006)

의 연구

[35]

에서 사 용한 약 분야의 체계적 문헌고찰

15

개를 랜덤하게 반으로 나눠 반은 훈 련데이터로

,

나머지 반은 실험데이터로 사용하였다

.

훈련데이터의 선택문 헌과 배제문헌으로

Factorized version of the Complement Na

ї

ve Bayes

(FCNB)

을 훈련시킨 후

,

실험 데이터의 선택문헌과 배제문헌을 분류하고

자 하였다

.

특징은

MeSH,

출판유형

,

제목

,

초록을 사용하였다

.

이 논문에 서도

Cohen

(2006)

의 연구

[35]

에서 사용한

WSS

로 분류 성능을 평가하 였다

. WSS

8.5-62.2%

이었고

,

평균

WSS

33.5%

Cohen

(2006)

(28)

연구

[35]

보다

15%

의 수고를 더 줄여주었다

.

Kim

(2012)

의 연구

[40]

에서는 시술과 약 분야의 체계적 문헌고찰을

SVMLight

로 훈련시킨 후 다른 주제의 선택문헌과 배제문헌을 분류하고

자 하였다

.

특징은 제목

,

초록

, MeSH,

출판유형을 사용하였다

.

이 논문에 서는 모든 체계적 문헌고찰에서 배제되는

공통배제문헌

을 분리하여 공 통배제문헌과 선택문헌으로 훈련데이터와 실험데이터를 만들어 전체 데 이터로 실험한 결과와 비교하였다

.

또한 체계적 문헌고찰 특성상 배제문 헌이 선택문헌보다 많아 배제문헌으로 치우쳐 분류될 수 있기 때문에 배 제문헌과 선택문헌의 수를 동일하게 하여 실험하였다

.

특징 조합별로는

MeSH

와 출판유형 조합의 정확도

(accuracy)

가 가장 높았고

,

공통배제문 헌 데이터로 훈련시킨 분류자의 분류 정확도가 전체 데이터로 훈련된 분 류자의 분류 정확도보다 시술은

15%,

약은

11%

더 높았다

.

선행 연구를 요약하면

<Table 1-1>

과 같다

.

(29)

Author(year) Gold standard Features Classification Method Aphinyanaphongs

(2005)

Internal articles cited by the ACP Journal Club

Mesh, Publication type, Title, Abstract

Naïve Bayes, AdaBoost, SVM-Light Cohen(2006) 15 systematic

drug class reviews

Mesh, Publication type, Title, Abstract

Voting perceptron Cohen(2008) 15 systematic

drug class reviews

Mesh, Title, Abstract,

UMLS CUI SVM-Light

Cohen(2009) 24 systematic

drug class reviews Mesh, Title, Abstract SVM-Light

Kilicoglu(2009)

Articles used in the development of PubMed clinical query filters forms

Mesh, Publication type, Title, Abstract, SemRep Predication, UMLS Concepts, UMLS Semantic Network Relations

Naїve Bayes, SVM, Boosting, Stacking

Matwin(2010) 15 systematic drug class reviews

Mesh, Publication type, Title, Abstract

Factorized version of the Complement Naїve Bayes Kim(2012)

19 procedure and 15 drug

systematic reviews

Mesh, Publication

type, Title, Abstract SVM-Light

Table 1-1. Summary of Previous Related Articles

선행 연구

[27, 36]

를 통해 주제가 같은 데이터로 훈련된 시스템의 분류 성능은 좋았으나

,

주제가 다른 데이터로 훈련된 시스템의 분류 성능은 좋지 않았음을 확인할 수 있었다

.

이는 체계적 문헌고찰을 업데이트 할 때에는 기존 체계적 문헌고찰의 선택문헌과 배제문헌을 훈련데이터로 사 용할 수 있기 때문에 업데이트에 선택될 문헌을 비교적 좋은 성능으로 분류할 수 있지만

,

훈련데이터로 사용할 동일 주제의 데이터가 없는 새
(30)

로운 주제의 체계적 문헌고찰의 선택문헌과 배제문헌은 잘 분류할 수 없 음을 의미한다

.

이에 본 연구에서는 관련 데이터가 없는 새로운 주제의 체계적 문헌고 찰을 수행할 때 다른 주제의 체계적 문헌고찰 데이터를 훈련데이터로 사 용하여 새로운 주제의 체계적 문헌고찰에 포함되지 않는 문헌을 배제함 으로 저자가 확인해야 할 문헌의 수를 줄여주고자 한다

.

(31)

2. 연구 목적

본 연구의 목적은 관련 데이터가 없는 새로운 주제의 체계적 문헌고찰 을 수행할 때

,

다른 주제로 수행된 기존의 체계적 문헌고찰 데이터를 훈 련데이터로 사용하여 새로운 주제의 체계적 문헌고찰에 포함되지 않는 배제문헌을 분류함으로 저자가 확인해야 할 문헌의 수를 줄여주는 것이 다

.

이를 위해 세 가지 모델링 방법을 제안하고

,

두 가지 기계학습 방법

(SVM, Na

ї

ve Bayesian)

을 사용하여 각각의 성능을 비교하고자 한다

.

(32)

3. 연구의 독창성

본 연구에서는

공통배제문헌

이라는 개념을 고안하여 배제문헌에서 공 통배제문헌을 분류하였다

.

공통배제문헌은 체계적 문헌고찰 주제에 상관 없이 모든 체계적 문헌고찰에서 배제되는 문헌으로

,

초록만 있는 회색문 헌

(grey literature),

리뷰

사설 등의 원저가 아닌 문헌

(non-original articles),

동물 연구

,

기전

(mechanism)

에 관한 전임상시험 연구

(pre-clinical

studies)

를 말한다

.

배제문헌 중 공통배제문헌을 제외한 나머지 배제문헌

은 모두 주제특이적

(topic-specific)

배제문헌으로

,

체계적 문헌고찰 주제 에 따라 선택되기도 하고 배제되기도 하는 문헌이다

.

본 연구에서는 주 제가 다른 데이터를 훈련데이터로 사용하기 때문에 주제에 따라 선택문 헌이 되기도 하고

,

배제문헌이 되기도 하는 주제특이적 배제문헌은 분류 성능을 저하시킬 수 있다고 생각하여 공통배제문헌만을 사용하여 분류 성능을 높이고자 하였다

.

체계적 문헌고찰은 관련 문헌을 가능한 모두 검색한 후 검색된 문헌 중 미리 정해진 기준에 맞는 문헌을 선택하기 때문에 대부분의 경우 배 제문헌이 선택문헌보다 많다

[24].

이와 같이 적은 수의 선택문헌과 많은 수의 배제문헌으로 구성된 훈련데이터를 사용할 경우

,

훈련데이터의 비 대칭성으로 인해 분류자

(classifier)

는 훈련데이터에서 차지하는 비중이 큰 배제문헌 쪽으로 학습되고

,

대부분 배제문헌이라고 분류

[41]

하기 때문 에 비대칭적 훈련데이터의 선택문헌과 배제문헌 수를 유사하게 만들어 주는 것이 필요하다

.

이에 본 연구에서는 훈련데이터의 선택문헌과 배제 문헌의 수를 동일하게 한

대칭적

(even)

훈련데이터

를 만들어 실험하였
(33)

제 2 장 연구 재료 및 방법

1. 연구 재료

본 연구에서는 시술 분야 체계적 문헌고찰

19

개와 약 분야 체계적 문 헌고찰

4

개를 실험에 사용하였다

.

시술 분야 체계적 문헌고찰은 신의료 기술평가사업본부

[42]

에서 수행한 체계적 문헌고찰 중 선택문헌이

10

개 이상인 체계적 문헌고찰을 선택하였고

,

약 분야 체계적 문헌고찰은 선행 연구

[27, 35, 36]

에서 사용한

15

개의 체계적 문헌고찰

[35]

중 공통배제문 헌에 대한 정보가 있는 체계적 문헌고찰을 선택하였다

.

신의료기술평가사업본부

[42]

는 국내에 새로운 의료기술이 도입되고자 할 때 체계적 문헌고찰 방법으로 해당 기술의 안전성과 유효성을 평가하 는 기관이다

.

신의료기술평가사업본부에서는

EPC(Evidence-based Practice

Centers)[43]

의 체계적 문헌고찰 방법과 동일하게 체계적 문헌고찰을 수

행하고 있다

.

두 명의 저자가 검색된 문헌의 초록을 보면서 미리 정해진 기준에 따라

1

차적으로 문헌을 선택

/

배제한 후

,

선택된 문헌의 전문을 보면서 문헌을 최종적으로 선택

/

배제한다

.

본 연구에서는 최종적으로 선 택

/

배제된 문헌을 사용하였으며

,

문헌 선택

/

배제에 사용된 기준은

<Table 2-1>

과 같다

.

기준

(code) 1-4

에 의해 배제된 문헌이 공통배제문헌 이며

,

기준

5

에 의해 배제된 문헌이 주제특이적 배제문헌이다

.

(34)

Code Meaning Article Type 0 Included at article level Inclusion article 1 Excluded due to grey literature

Common exclusion article 2 Excluded due to non-original articles

3 Excluded due to non-human articles 4 Excluded due to pre-clinical studies

5 Excluded due to topic-specific reasons Topic-specific exclusion article

Table 2-1. Coded Values for Article Triage Decisions in Procedure

Topics

(35)

Topics Included Excluded

(com*) Total

Auditory Brainstem Implant 14 156(46) 170

Autologous Noncultured Epidermal

Cellular Transplantation 18 126(23) 144

Continuous Intraarticular Pain Control 22 742(38) 764 Endoscopic Cryotherapy of Lung Tumors 14 334(172) 348

Glaucoma Aqueous Tube Insertion 10 500(102) 510

Hand Transplantation 10 227(113) 237

Holmium Laser Treatment of Benign

Prostatic Hyperplasia 34 155(93) 189

Impedance-Controlled Endometrial

Ablation 11 55(22) 66

Intrastromal Corneal Ring Surgery for

Keratoconus 31 140(26) 171

Magnetic Navigation Assisted Catheter

Technique 14 365(86) 379

Radiofrequency Ablation of Primary and

Secondary Lung Malignancy 18 506(192) 524

Small Bowel Transplantation 27 911(184) 938

Somatic Nerves Stimulation 12 378(42) 390

Surgical Ablation of Atrial Fibrillation 13 185(66) 198 Therapeutic Temperature Management

with Endovascular Catheters 16 293(62) 309

Table 2-2. Number of Articles Included and Excluded across 19 Procedure Systematic Reviews

시술에 관한

19

개 주제의 체계적 문헌고찰 선택문헌과 배제문헌의 수 는

<Table 2-2>

와 같다

.

(36)

Topics Included Excluded

(com*) Total Therapeutic Use of Autologous Bone

Marrow Cells in Peripheral Arterial Disease

28 249(143) 277

Transanal Endoscopic Microsurgery 10 246(43) 256

Transarterial Radioembolization 32 473(156) 505

Trigeminal Nerve Stimulation 11 730(50) 741

TOTAL 345 6,771

(1,659) 7,116

*the number of common exclusion articles excluded by the common exclusion criteria among excluded articles excluded by all exclusion criteria

(37)

약에 관한 체계적 문헌고찰도 시술 체계적 문헌고찰과 마찬가지로 최 종적으로 선택

/

배제된 문헌을 사용하였으며

,

문헌의 선택

/

배제에 사용된 기준은

<Table 2-3>

과 같다

.

본 연구에서는 기준

(code) 8, 9

에 의해 배제 된 문헌만 공통배제문헌으로 분류하였다

.

공통배제문헌과 주제특이적 배 제문헌으로 구분하기에는 정보가 부족한 기준

(E, 1, 5, 6)

을 포함하여 기 준

E-7

에 의해 배제된 문헌은 모두 주제특이적 배제문헌으로 분류하였 다

. Cohen

(2006)

의 연구

[35]

에서 사용한 데이터는

15

개 주제의 체계적 문헌고찰이었으나

,

대부분

E

로 분류되어 있어 공통배제문헌이 있는

4

개 주제

(AtypicalAntipsychotics, BetaBlockers, CalciumChannelBlockers, Uri- naryIncontinence)

의 체계적 문헌고찰만 본 연구에 포함하였다

.

Table 2-3. Coded Values for Article Triage Decisions in Drug Topics

Code Meaning Article Type

I Included at article level Inclusion article E Nonspecifically excluded

Topic-specific exclusion article

1 Excluded due to foreign language 2 Excluded due to wrong outcome 3 Excluded due to wrong drug 4 Excluded due to wrong population 5 Excluded due to wrong publication

type

6 Excluded due to wrong study design 7 Excluded due to wrong study duration 8 Excluded due to background article

Common exclusion article 9 Excluded due to only abstract being

available

(38)

약에 관한

4

개 주제의 체계적 문헌고찰 선택문헌과 배제문헌의 수는

<Table 2-4>

와 같다

.

Table 2-4. Number of Articles Included and Excluded across 4 Drug Systematic Reviews

Topics Included Excluded(com*) Total

AtypicalAntipsychotics 146 974(11) 1,120

BetaBlockers 42 2,030(104) 2,072

CalciumChannelBlockers 100 1,118(25) 1,218

UrinaryIncontinence 40 287(21) 327

TOTAL 328 4,409(161) 4,737

*the number of common exclusion articles excluded by the common exclusion criteria among excluded articles excluded by all the exclusion criteria

(39)

2. 연구 방법

1)

데이터 수집 및 전처리

시술에 관한 체계적 문헌고찰

19

개에 포함된

7,116

개의 문헌과 약에 관한 체계적 문헌고찰

4

개에 포함된

4,737

개의 문헌은

PubMed[14]

에서 검색하여

xml

형식으로 다운받았다

.

본 연구에서는 제목

,

초록

, MeSH,

출판형태를 특징

(feature)

으로 사용했기 때문에

[Figure 2-1]

과 같이

PMID,

제목

,

초록

, MeSH,

출판형태를 추출하였다

.

Figure 2-1. Data Collection Method

추출된 문헌은 해당 체계적 문헌고찰에서 선택된 문헌인지

,

배제된 문 헌인지에 따라 선택문헌은

‘1’

,

배제문헌은

‘–1’

로 클래스

(class)

를 할 당하였다

.

제목과 초록은 띄어쓰기 단위로 구분한 후 특수기호

,

숫자

,

stop word[44]

를 제거하였고

, Porter stemming

알고리즘

[45]

을 사용하여
(40)

stemming

하였다

. MeSH

와 출판형태는

PubMed

에서 제시하는 구

(phrase)

단위로 구분하였다

.

제목과 초록은 서술적인 부분이기 때문에 출현 빈도로 특징을 표현하는 것이 더 좋은 성능을 보이고

, MeSH

와 출 판형태는 하나의 문헌에서 두 번 이상 반복되지 않기 때문에 존재 유

무로 특징을 표현하는 것이 더 좋은 성능을 보인다는 이전 연구

[24]

에 따라 본 연구에서도 제목과 초록은 빈도

(frequency)

, MeSH

와 출판형 태는 존재 유

(binary)

로 특징의 값

(value)

을 할당하였다

.

제목 또는 초록에 포함된 단어

, MeSH,

출판형태는 중복 제거 후 각각 특징번호

(Feature number)

가 부여되었고

,

제목과 초록은

Feature number:Frequency

형태로

, MeSH

와 출판형태는

Feature number:Binary

형태로

[Figure 2-2]

와 같이 특징

:

값 세트를 만들었다

.

예를 들어

, ‘13676:2’

는 특징번호가

‘13676’

인 단어

‘pulsatil’

이 제목 또는 초록에 두 번 포함되어 있다는 의 미이다

.

Figure 2-2. Example of the Feature Representation

(41)

2)

훈련 및 실험 데이터

(Training and Test data)

선택문헌과 배제문헌의 수가 동일한 대칭적 훈련데이터를 만들기 위해 각 주제별로 선택문헌과 동일한 수의 배제문헌

,

선택문헌과 동일한 수의 공통배제문헌을

5

번 무작위

(random)

샘플링한 후 해당 주제의 선택문헌 과 합하여 주제별로

5

개의 선택

배제문헌 훈련데이터세트

, 5

개의 선 택

공통배제문헌 훈련데이터세트를 만들었다

.

이렇게 만들어진 대칭적 훈련데이터는 실험할 주제와 동일한 주제의 훈련데이터는 제외하고

,

나 머지 주제의 훈련데이터를 모두 합하여 실험할 주제의 데이터를 분류하 는 훈련데이터로 사용하였다

[Figure 2-3].

예를 들어

,

시술 주제

19

개 중 주제

1

의 선택문헌과 배제문헌을 분류하기 위해서 나머지

18

개 주제의 대칭적 훈련데이터를 사용하였다

.

실험데이터는 각 주제의 선택

배제문 헌

,

선택

공통배제문헌으로 하였다

.

(42)

Figure 2-3. Building the Training and Test Sets

IE means inclusion(I) and exclusion(E) articles. ICE means inclusion(I) and common exclusion(CE) articles.

(43)

Topics

Train Test

with excluded

with excluded_

com*

with excluded

with excluded_

com*

Auditory Brainstem Implant 662 652 170 60

Autologous Noncultured Epidermal Cellular Transplantation

654 644 144 41

Continuous Intraarticular Pain

Control 646 636 764 60

Endoscopic Cryotherapy of Lung

Tumors 662 652 348 186

Glaucoma Aqueous Tube

Insertion 670 660 510 112

Hand Transplantation 670 660 237 123

Holmium Laser Treatment of

Benign Prostatic Hyperplasia 622 612 189 127

Impedance Controlled

Endometrial Ablation 668 658 66 33

Intrastromal Corneal Ring

Surgery for Keratoconus 628 628 171 57

Magnetic Navigation Assisted

Catheter Technique 662 652 379 100

Radiofrequency Ablation of Primary and Secondary Lung Malignancy

654 644 524 210

Small Bowel Transplantation 636 626 938 211

Somatic Nerves Stimulation 666 656 390 54

각 주제 별 훈련데이터와 실험데이터 수는

<Table 2-5>, <Table 2-6>

에 제시하였다

.

Table 2-5. Number of Training and Test Data Sets across 19

Procedure Systematic Reviews

(44)

Topics

Train Test

with excluded

with excluded_

com*

with excluded

with excluded_

com* Surgical Ablation of Atrial

Fibrillation 664 654 198 79

Therapeutic Temperature Management with Endovascular Catheters

658 648 309 78

Therapeutic Use of Autologous Bone Marrow Cells in Peripheral Arterial Disease

634 624 277 171

Transanal Endoscopic

Microsurgery 670 660 256 53

Transarterial Radioembolization 626 616 505 188

Trigeminal Nerve Stimulation 668 658 741 61

*the number of common exclusion articles excluded by the common exclusion criteria

Table 2-6. Number of Training and Test Data Sets across 4 Drug Systematic Reviews

Topics

Train Test

with excluded

with excluded_

com*

with excluded

with excluded_

com*

Atypical Antipsychotics 364 176 1,120 157

Beta Blockers 572 114 2,072 146

Calcium Channel Blockers 456 148 1,218 125

Urinary Incontinence 576 156 327 61

(45)

3)

분류 시스템1)

문헌을 분류하는 기계 학습 방법에는 여러 가지가 있으나

, SVM

Na

ї

ve Bayesian

은 이전 연구들

[24, 30, 36, 37]

에서 체계적 문헌고찰을 위한 문헌 분류 시 좋은 성능을 보였고

,

다른 텍스트 분류 작업

[46, 47]

에서도 좋은 성능을 보였다

.

이에 본 연구에서도 체계적 문헌고찰을 위한 문헌 분류에 사용할 기계 학습 방법으로

SVMlight[48]

Na

ї

ve Bayesian[49]

을 선택하였다

.

. Support Vector Machine(SVM)

SVM

은 지도학습

(Supervised learning)

방법을 사용하여 정답이 있는 훈련데이터를 통해 클래스를 엄밀하게 분류해주는 최적의 분리경계면

(optimal boundary hyperplane)

을 찾은 후 실험데이터가 위치하는 클래 스로 분류해주는 기계학습 방법이다

.

다른 기계학습 방법들은 경험적 위 험 최소화 원칙

(empirical risk minimization principle)

에 따라 훈련데이 터에 대한 오차를 최소화하는 것과 달리

, SVM

은 구조적 위험 최소화 원 칙

(structural risk minimization principle)

에 따라 새로운 데이터를 분류 할 때 기대되는 위험

(risk)

을 최소화하기 때문에

SVM

은 뛰어난 일반화 능력을 보인다

.

최적의 분리경계면이란 분리경계면에 가장 근접한 데이터

(support vector)

와 분리경계면 사이의 거리

(margin)

가 가장 큰 분리경계면을 의미 한다

.

예를 들어

, [Figure 2-4]

와 같이 분리경계면

가 있을 때

, ①

보다 분리경계면과

support vector

사이의

margin

이 더 크므로

이 최적의 분리경계면이 될 것이고

, ①

을 분리경계면으로 하여 새로운

1) SVMNaїve Bayesian의 설명은 이전 연구[56-63]에 기술되어 있는 내용을 참고하여 정리함.

(46)

데이터를 분류한다면

를 분리경계면으로 할 때보다 오분류를 줄일 수 있을 것이다

.

Figure 2-4. Boundary Hyperplanes

출처 : 오일석. 패턴인식. 2008.[50]

훈련데이터

(input)

는 두개의 클래스인

‘-1’

또는

‘+1’

에 속하는

y

i

d

차 원 공간의 특징

x

i

(x

i

⊆X)

로 구성되며

,

훈련데이터로 생성된 분류기

(classifier)

에 의해 실험데이터

(output) x (x⊆X)

‘-1’

또는

‘+1’

로 분류 한다

.

 
(47)

 

  

→     ∈

(2.1)

과 같은 경계면

(hyperplane) H

가 있다고 가정하자

.

   ′    

(

2.1)

여기서

w

는 단위길이를 갖는 경계면과 직교하는 벡터이며

,

원점에서 이 경계면과의 수직거리는 ∥∥

 가 된다

.

또한 식

(2.1)

과 평행인 경계면

H

1

H

2가 있다고 가정하자

.

,

두 경 계면 사이에는 데이터가 없어야 한다

.

   ′    

(

2.2a)

   ′     

(

2.2b)

(2.2a)

의 경계면은 클래스

1

의 데이터 중 식

(2.1)

의 분리경계면에서 가장 가까운 데이터를 지나며

,

(2.2b)

의 경계면은 분리경계면에서 클래 스

-1

의 가장 가까운 데이터를 지나게 된다

.

따라서

H

1

H

2의 거리

(margin)

는 ∥∥

 이다

.

(48)

수치

Table 2-1. Coded Values for Article Triage Decisions in Procedure Topics
Table 2-2. Number of Articles Included and Excluded across 19 Procedure Systematic Reviews
Table 2-6. Number of Training and Test Data Sets across 4 Drug Systematic Reviews
Table 3-1. Mean AUCs of the Three Models across 19 Procedure Systematic Reviews using SVM with TAMP
+7

참조

관련 문서

Our study focused on lung microenvironment, and using microfluidic devices we demonstrated lung cancer cells in hydrogels mimicking lung ECM which are composed of collagen type Ⅰ,

In vitro control of photothermal anticancer effect by induction of GGT Photothermal effects of Au/PGA hNPs in vitro were assessed in vitro in MCF-7, HeLa, and HeLa_MB cells.. Efficacies

Conclusions: We conclude that, in patients undergoing off-pump coronary artery bypass graft surgery, compared with crystalloid, the use of hydroxyethyl starch 670/0.75 did not result

ABSTRACT Effect of Parent-child Relationships on Positive Peer Relationships among School-aged Children: Mediating Roles of Empathy and Altruism Juyeon Lee Department of Social

Keywords: Smartphones, Apps, Energy consumption optimization, Utility function, Usage behavior, Cloud computing, Application classification, Energy allocation, Computation Offloading,

i Abstract FOXO1 suppression–induced positive crosstalk between HER2 and MET and its effect on acquired lapatinib resistance in HER2-positive gastric cancer cells Jinju Park

vii List of Figures Figure 1 Eleven sitting posture categories ··· 6 Figure 2 Physical construction of the mixed sensor system ··· 7 Figure 3 The confusion matrix of the posture

Whether these pulp cells have really differentiated into odontoblasts can be examined by the morphology of the newly generated mineralized tissue called “reparative dentin.” In the