• 검색 결과가 없습니다.

4. 지도 학습 알고리즘 Ⅲ 1강. 지도 학습 알고리즘(6)

N/A
N/A
Protected

Academic year: 2022

Share "4. 지도 학습 알고리즘 Ⅲ 1강. 지도 학습 알고리즘(6) "

Copied!
6
0
0

로드 중.... (전체 텍스트 보기)

전체 글

(1)

4. 지도 학습 알고리즘 Ⅲ 1강. 지도 학습 알고리즘(6)

학습내용 - 랜덤 포레스트 - 그래디언트 부스팅

학습목표

- 결정 트리의 앙상블인 랜덤 포레스트를 설명할 수 있다.

- 그래디언트 부스팅을 설명할 수 있다.

1. 랜덤 포레스트 1) 결정 트리의 단점

가. 훈련 데이터의 과대적합

→ 조금씩 다른 결정 트리 묶음

→ 각 트리 비교적 좋은 예측 수행

→ 데이터 일부 과대적합되는 사항에 기초

→ 서로 다른 방향으로 과대적합되는 트리 나. 생성 후 결과 사용 → 과대적합 해결 가능 2) 랜덤 포레스트 구축

가. 트리의 개수 결정 - 독립적인 트리들

- 각 트리가 고유하게 만들어지도록 알고리즘 무작위 선택 나. 트리 생성

- 부트스트랩 샘플 생성

- n_samples개의 데이터 포인트 중 무작위 데이터를 n_samples 횟수 만큼 반 복 추출

- 원래 데이터셋 크기와 동일 - 데이터 포인트 누락 및 중복 가능 다. 데이터셋을 이용한 트리 생성

- 후보 특성을 무작위로 노드 선택

(2)

- 후보들 중에서 최선의 테스트 선택 - 특성 개수 : max_features 조절 가능 라. 부트스트랩 샘플링

- 조금씩 다른 데이터셋 이용

- 각 노드 특성 일부 사용 → 각기 다른 특성 부분 집합 사용 마. 랜덤 포레스트 예측

- 모든 트리의 예측 생성

- 평균된 예측으로 최종 예측 생성(회귀)

- 가능성 있는 출력 레이블의 확률 제공으로 간접적 예측(분류) - 예측한 확률의 평균으로 가장 높은 확률의 클래스가 예측값

3) 랜덤 포레스트 분석

(3)

4) 장.단점과 매개변수 가. 장점

- 뛰어난 성능

- 낮은 매개변수 튜닝 나. 단점

- Random_state 지정으로 전혀 다른 모델로 생성 가능 - 높은 차원, 희소 데이터 미 작동(선형 모델)

다. 매개변수

(4)

2. 그래디언트 부스팅 1) 특징

가. 회귀와 분류에 모두 사용 가능

나. 이전 트리의 오차 보완 방식으로 순차 트리 생성 다. 무작위성 없음

라. 사전 가지치기 허용

마. 간단한 모델 연결(얕은 트리) 바. 트리가 추가될수록 높은 성능

2) 매개변수

(5)

나. n_estimators - 앙상블에 트리 추가

- 높은 복잡도 → 과대적합 가능성

- 훈련 세트에서의 실수 수정 기회 높아짐 다. n_iter_no_change

- 반복동안 검증 점수 향상이 일어나지 않으면 훈련 종료 3) 장단점

가. 장점

- 강력한 가지치기

- 적은 메모리 사용과 빠른 예측 나. 단점

- 매개변수 조절 - 긴 훈련 시간

(6)

평가하기

1. 랜덤 포레스트 모델의 핵심 매개변수는 max_feature로 이를 1로 설정하면 트 리의 분기는 테스트할 특성을 고를 필요가 없다.

O X

- 정답 : O

해설 : 랜덤 포레스트 모델의 핵심 매개변수는 max_feature로 이를 1로 설정하 면 트리의 분기는 테스트할 특성을 고를 필요가 없으며, 무작위로 선택한 특성의 임계값만 찾습니다.

2. 그래디언트 부스팅 결정 트리가 가지는 가장 큰 단점은 무엇인가?

① 사전 가지치기 매개변수 사용으로 과대적합 예방

② 민감한 매개변수 조절과 긴 훈련 시간

③ 낮은 차원이면서 희소 데이터에 높은 미동작 가능

④ 이진 특성이나 연속적 특성에 동작 - 정답 : ②

해설 : 그래디언트 부스팅 결정 트리의 가장 큰 단점은 매개 변수 조절이 힘들 고, 훈련 시간이 길다는 것입니다.

학습정리 1. 랜덤 포레스트

- 과대적합 회피 모델

- 데이터 포인트 무작위 선택과 분할 테스트에서 특성 무작위 선택 - 뛰어난 성능, 낮은 매개변수 튜닝

- random_state 지정으로 전혀 다른 모델 생성 가능 2. 그래디언트 부스팅

- 회귀와 분류에 사용 가능

- 이전 트리 오차 보완하는 순차적 트리 생성

- learning_rate, n_estimators, n_iter_no_change 등의 매개변수 조절로 오차 보장 및 과대적합 조절

- 강력한 가지치기와 적은 메모리 사용으로 빠른 예측

참조

관련 문서

충북대학교 전기전자컴퓨터공학부

페이지 대치 알고리즘...

눈이 빨간 사 람은 마법에 걸려 있기 때문에 스스로 눈이 빨갛다는 사실을 깨 닫게 되면 그날 밤 자정에 섬을 떠나야 한다.. 또한 자신의

 다루기 힘들다고 증명되지 않았고, 다차시간 알고리즘도 찾지 못한 문제.

 수학 , 기초과학, 공학의 지식과 정보기술을 응용할 수 있는 능력 저장장치의 특성을 이해하고 이를 고려하여 알고리즘을 작성할.  저장장치의 특성을 이해하고 이를 고려하여

 발견학습-수학 그 자체를 직접 다루는 학습 지도 방법 으로서, 수학자가 하는 일과 똑같은 일을 하도록 한다 는 것은 수학이라는 지식의 구조의 내용을 수학자가 학문의 최점단에

[r]

토끼를 무서워하는 아이에게 멀리서 토끼를 보면서 좋아하는 우유 와 쿠키를 먹게 하는 것,