Notice
Recent Posts
Recent Comments
Link
«   2026/09   »
1 2 3 4 5
6 7 8 9 10 11 12
13 14 15 16 17 18 19
20 21 22 23 24 25 26
27 28 29 30
Tags
more
Archives
Today
Total
관리 메뉴

SERi

2-1. 데이터 전처리 본문

온라인강의/혼자공부하는 머신러닝+딥러닝

2-1. 데이터 전처리

링다링 2022. 12. 2. 01:11

혼자 공부하는 머신러닝+딥러닝 유투브 강의

'혼자 공부하는 머신러닝+딥러닝'의 유투브 강의 및 도서를 통해 공부한 내용입니다.


📌 np.column_stack() 

- 전달받은 리스트를 일렬(열)로 세운 다음 차례대로 나란히 연결

 

📌 np.concatenate()

- 전달받은 리스트를 1차원으로 배열을 연결

 

 

📌 np.zero()

- 원하는 개수만큼 배열을 0으로 채움

 

📌 np.ones()

- 원하는 개수만큼 배열을 1로 채움

 

📌 train_test_split()

- 전달되는 리스트나 배열을 비율에 맞게 훈련 세트와 테스트 세트로 나눔

- from sklearn.model_selection import train_test_split

- stratify 매개변수 : target로 지정해주면 target의 class비율을 유지한채 데이터셋을 split

 

📌 KNeighborsClassifier.kneighbors()

- 이웃까지의 거리와 이웃 샘플의 인덱스를 반환

 

📌 xlim()

- matplotlib 에서 X축 범위 지정 가능

 

📌 ylim()

- matplotlib 에서 y축 범위 지정 가능

 

📌 표준점수

- 가장 널리 사용하는 전처리 방법 중 하나

- 각 특성값이 평균에서 표준편차의 몇 배만큼 떨어져 있는지를 나타냄

- 평균을 빼고 표준편차로 나누어줌

 

📌 np.mean()

- 평균값

 

📌 np.std()

- 표준편차

 

📌 axis = 0

- 배열의 열을 선택

 

📌 axis = 1

- 배열의 행을 선택

 

📌 브로드캐스팅

- 일정 조건을 부합하는 다른 형태의 배열끼리 연산을 수행하는 것을 의미

 

📝 

대부분의 머신러닝 알고리즘은 특성의 스케일이 다르면 잘 작동하지 않는다. 그래서 이 강의에서는 특성을 표준점수로 변환 하였다.

- 특성의 스케일을 조정하는 방법으로 표준점수가 가장 널리 사용하는 방법

 

데이터 전처리할때 주의할 점

훈련 세트를 변환한 방식 그대로 테스트 세트를 변환해야 함

 


 

2-2
Comments