목록전체 글 (34)
SERi
https://www.kaggle.com/datasets/alexattia/the-simpsons-characters-dataset In [1]: import numpy as np import pandas as pd import matplotlib.pyplot as plt import seaborn as sns import os import cv2 In [2]: root_dir = 'C:/Users/tpfl1/Desktop/dataset/simpson/simpsons_dataset/' # image_label = os.listdir(root_dir) In [3]: # 캐릭터이름 별 이미지개수 char_dict = {} image_label = os.listdir(root_dir) for c..
혼자 공부하는 머신러닝+딥러닝 유투브 강의 '혼자 공부하는 머신러닝+딥러닝'의 유투브 강의 및 도서를 통해 공부한 내용입니다. 📌 np.column_stack() - 전달받은 리스트를 일렬(열)로 세운 다음 차례대로 나란히 연결 📌 np.concatenate() - 전달받은 리스트를 1차원으로 배열을 연결 📌 np.zero() - 원하는 개수만큼 배열을 0으로 채움 📌 np.ones() - 원하는 개수만큼 배열을 1로 채움 📌 train_test_split() - 전달되는 리스트나 배열을 비율에 맞게 훈련 세트와 테스트 세트로 나눔 - from sklearn.model_selection import train_test_split - stratify 매개변수 : target로 지정해주면 target의 cl..
혼자 공부하는 머신러닝+딥러닝 유투브 강의 '혼자 공부하는 머신러닝+딥러닝'의 유투브 강의 및 도서를 통해 공부한 내용입니다. 머신러닝 알고리즘은⭐ 지도 학습 과 비지도 학습 으로 나뉜다. 데이터와 정답을 입력과 타깃이라고 부르며, 이것을 훈련데이터라고 부른다. 1️⃣ 지도 학습 - 입력(데이터)와 타깃(정답)으로 이루어진 훈련데이터가 필요 - 입력과 타깃을 전달하여 모델을 훈련한 다음 새로운 데이터를 예측하는데 활용 2️⃣ 비지도 학습 - 입력(데이터)만 있을 경우 비지도 학습 알고리즘을 사용 - 타깃 데이터가 없음. 따라서 무엇을 예측하는것이 아니라 입력 데이터에서 어떠한 특증을 찾는데 주로 활용 머신러닝 알고리즘의 성능을 제대로 평가하려면 훈련 데이터와 평가에 사용할 데이터가 각각 달라야 한다. 📁..
DataFrame.sort_values( by: 'IndexLabel', # 정렬 기준이 되는 이름 또는 이름 목록 *, axis: 'Axis' = 0, ascending: 'bool | list[bool] | tuple[bool, ...]' = True, inplace: 'bool' = False, kind: 'str' = 'quicksort', na_position: 'str' = 'last', ignore_index: 'bool' = False, key: 'ValueKeyFunc' = None, ) # 1개의 컬럼을 기준으로 내림차순 titanic.sort_values(by=["class"], ascending=False) # 2개의 컬럼을 기준으로 내림차순 titanic.sort_values(by..
DataFrame.agg(func=None, axis=0, *args, **kwargs) 연산종류 mean(), max(), min(), sum(), count(), size(), var(), std(), describe(), info(), first(), last() 등 # 1개 행에 sum titanic["age"].agg(["sum"]) # 1개 컬럼에 여러 연산함수 적용 titanic[["age"]].agg(["count", "mean", "sum"]) # 컬럼별 다른 연산함수 적용 titanic.groupby(["class", "who"]).agg({"age":"mean", "fare":"mean", "deck":"count"})
특정 행, 열, 행열 등 조회가능 # fare이 50 이상인 데이터 추출 titanic.loc[titanic["fare"] > 50] # fare이 50 이상, place가 2인 데이터 추출 titanic.loc[(titanic["fare"] > 50) & (titanic["pclass"] == 2)] # fare이 50 이상인 alive 컬럼 데이터 추출 titanic.loc[titanic["fare"] > 50, ["alive"]] # 조건 2개 + 특정 컬럼만 출력 titanic.loc[(titanic["fare"] > 50) & (titanic["embarked"] == "S"), ["age"]] 많이 사용하는 방법 숙지해두자 이건제발..! # 추출한 컬럼을 values에 대입 titanic.lo..
DataFrame.describe( percentiles=None, # 출력에 포함할 백분위수 include=None, # 선택 사항 결과에 포함할 데이터 유형 exclude=None, # 선택 사항 결과에서 생략할 데이터 유형 datetime_is_numeric=False # datetime dtype을 숫자로 처리할지 여부 ) titanic.describe(include = ["int","float"]) titanic.describe(exclude = "object")
다수결 투표 분류기는 Ensemble에 포함된 개별 분류기 중에서 가장 뛰어난 것보다도 정확도가 높을 경우가 많음 예를 들어서 Accuracy. 첫 번째 분류기는 60%의 정확도를 보이고 두 번째는 70%, 세 번째는 80%, N번째는 65% 이렇게 개별적으로 봤을 때는 이런 성능이 쭉 나올 텐데 세번째가 가장 높은 정확도라고 할때 , 80%. 그럼 이 80%보다도 정확도가 높은 경우들이 굉장히 많다는 것이 경험적으로 잘 밝혀졌 여기서 80%가 가장 좋은거면 Ensemble했을 때는 Ensemble 모형은 이 80%보다 더 높다. Weak Learner, Strong Learner Weak와 Strong의 기준? 성능 쉽게 이야기해서 분류 문제는 분류 성능 아니면 Regression 문제는 수치를 예측한..