전체 글 (14) 썸네일형 리스트형 K-means Clustering 이번 시간에는 K-means Clustering에 대해서 알아보고자합니다. 이에 앞서 먼저 Clustering에 대한 이해가 필요하기 때문에 간략하게 소개하겠습니다. Clustering(군집분석) 이란? 개체를 분류하기 위한 명확한 분류기준이 존재하지 않거나 기준이 밝혀지지 않은 상태에서 주어진 데이터의 특성을 고려하여 같은 그룹(클러스터)을 정의하고 다른 그룹의 개체보다 서로 더 유사한 개체가 되도록 그룹화하여 그룹의 대표성을 찾아내는 방법입니다. * 그룹(클러스터) : 비슷한 특성을 가진 데이터들의 집합 군집분석은 유사한 성향을 가진 개체를 모아 군집을 형성하여 군집간의 특성을 관찰하거나 목표변수와의 관계를 파악하기 위한 목적이 있습니다. 예측성 분석이 아니기 때문에 주로 분석 초기 단계에서 데이터의.. Batch Normalization(배치 정규화) Batch Normalization 이란? 배치정규화는 2015년 arXiv에 발표된 후 ICML 2015에 게재된 아래 논문에서 나온 개념입니다. Batch Normalization: Accelerating Deep Network Training b y Reducing Internal Covariate Shift https://arxiv.org/pdf/1502.03167.pdf Gradient Vanishing / Exploding 문제 신경망에서 학습시 Gradient 기반의 방법들은 파라미터 값의 작은 변화가 신경망 출력에 얼마나 영향을 미칠 것인가를 기반으로 파라미터 값을 학습시키게 됩니다. 만약 파라미터 값의 변화가 신경망 결과의 매우 작은 변화를 미치게 될 경우 파라미터를 효과적으로 학습 시킬.. 회귀모델(Regression)의 평가 지표 이번 시간에는 회귀모델(수치형 모뎰)에 평가 지표에 대해 알아보고자 합니다. 평가 지표는 데이터에 있어 모든 값을 예측할 수는 없기 때문에 어느정도의 성능을 나타내는지 확인하는 아주 중요한 작업입니다. 평균적으로 사용하는 평가 지표 방법에는 다음과 같이 MAE, MSE, RMSE, MAPE, RMSLE, R2 score, EVS 등이 있습니다. 이제 차례대로 알아보겠습니다. 1. MAE(Mean Absolute Error) 모델의 예측값과 실제값의 차이를 모두 더한다는 개념입니다. 수식에서 절댓값을 취하기 때문에 가장 직관적으로 알 수 있는 지표이지만 오히려 절댓값을 취하기 때문에 모델이 Underperformance인지 Overperformance인지 알 수 가 없다는 단점이 있습니다. Underper.. 머신러닝 Boosting Algorithm Boosting이란?? 부스팅은 앙상블 기법(배깅(Bagging) / 부스팅(Boosting) / 스태킹(Stacking) 등) 중 하나로 순서적인(Sequential) 약한 학습기(Week learner)들을 여러개 결합하여 예측 혹은 분류 성능을 높이는 알고리즘입니다. 보통 약한 학습기는 Decision tree를 자주 이용합니다. Basic of Boosting 우리는 데이터를 통해 모델링을 하고 결국에는 새로운 데이터가 들어왔을 때, 예측이나 분류를 해야하는데 모델은 학습 데이터에 과적합(Overfiting)하면 안됩니다. 앙상블 모델이란 하나의 모델이 학습 데이터에 과적합 되는 것을 막기 위해 약한 모델을 여러 개 결합시켜 그 결과를 종합하는 것을 의미합니다. 배깅(Bagging)은 여기에 병렬.. PCA(Principal Component Analysis, 주성분 분석) PCA(Principal Component Analysis, 주성분 분석)란 차원축소(dimensionality reduction)와 변수추출(feature extraction)의 기법으로 널리 쓰이는 방법입니다. 차원축소란 많은 feature로 구성된 다차원 데이터 세트의 차원을 축소해 새로운 차원의 데이터 세트를 생성하는 것입니다. 일반적으로 차원이 증가할수록, 즉 feature가 많아질수록 예측 신뢰도가 떨어지고, 과적합(overfitting)이 발생하고, 개별 feature간의 상관관계가 높을 가능성이 있습니다. 차원축소를 왜 하는가?? 1. 시각화 (Visualization) 3차원이 넘어간 시각화는 우리 눈으로 볼 수 없습니다. 따라서 차원 축소를 통해 시각화를 할 수 있습니다. 시각화를 통해.. 흉부(폐렴) X-ray 이미지를 통한 이진분류 학습 Code States Section4 Project 이번 프로젝트는 흉부(폐렴) X-ray 이미지를 통하여 Keras 라이브러리를 이용하여 CNN 모델 이진분류학습으로 정상 X-ray인지 환자의 X-ray인지 검증하는 프로젝트입니다. 프로젝트 순서는 데이터 선정 이유 및 가설 설정 -> 데이터 전처리 -> 모델 학습 -> 모델 성능 확인 순으로 진행됩니다. 1. 데이터 선정 이유 및 가설 설정 우리나라 1인당 외래진료는 2010년~2019년 기간 중 2011년 한 해를 제외하고 1위를 차지하였으며, 2위인 일본과도 상당한 격차를 보이고 있습니다. 만약 X-ray, MRI, CT 등 다양한 검사가 진행된 후에 문제가 있는 경우에만 외래진료를 하게 된다면 외래진료가 상대적으로 확실히 줄어들게 되고 나아가 환.. 와인 분석 프로젝트(with machine learning) Code States Section2 Project 이번 프로젝트는 다음과 같은 순서로 진행됩니다. 데이터 수집 및 추출 -> 데이터 전처리 -> 모델 구축 및 파라미터 설정 -> 모델 평가 1. 데이터 수집 및 추출 이번 데이터 셋은 캐글에서 가져온 데이터 셋으로 와인에 대한 품질을 평가하는 항목들이 존재합니다. 5497개의 행과 13개의 열로 이루어진 데이터 셋입니다. 1-1. 데이터 셋 파악하기 wine data set features quality : 와인의 품질 fixed acidity : 고정산, 와인의 산도를 제어 volatile acidity : 휘발산, 와인의 향과 연관 citric acid : 구연산, 와인의 신선함을 올림 residual sugar : 잔여 당분, 와인의 단 맛 올림 .. Data analysis and visualization project Code States Section1 Project 프로젝트 목적 : 게임 회사 데이터 팀에 일하는 입장으로 가정하에 다음 분기에 어떤 게임을 설계해야할지 기존의 데이터에 기반하여 인사이트를 얻고, 의사결정을 하고자 하는 것이 목표인 프로젝트입니다. 기존 데이터 셋 Data Description 9개의 열과 16598개의 행으로 이루어진 데이터 셋입니다. Name : 게임의 이름입니다. Platform : 게임이 지원되는 플랫폼의 이름입니다. Year : 게임이 출시된 연도입니다. Genre : 게임의 장르입니다. Publisher : 게임을 제작한 회사입니다. NA_Sales : 북미지역에서의 출고량입니다. EU_Sales : 유럽지역에서의 출고량입니다. JP_Sales : 일본지역에서의 출고량입니다... 이전 1 2 다음