시작
10/10/30 문제 4/4/12개 아래로 틀려야 합
빅분기 필기 합격상태에서 정리한 흔적
https://www.youtube.com/watch?v=mgck3KJQGGI&list=PLWtr7MRpQi5CW-jFYgAsX4jZcSp77O3a5&index=1
1단원 - 데이터 이해
데이터의 이해
데이터와 정보
- 데이터의 정의
- 데이터 : 있는 그대로의 객관적 사실, 가공되지 않은 상태 (주문수량)
- 존재적 특성 : 데이터는 현실을 그대로 반영
- 당위적 특성 : 맥락 속 의미부여 가능
- 정보 : 데이터로부터 가공된 자료 (베스트셀러)
- 데이터 : 있는 그대로의 객관적 사실, 가공되지 않은 상태 (주문수량)
- DIKW 피라미드 ***
- Data : 가공 전의 객관적 사실
- Information : 데이터를 통해 패턴 인식
- Knowledge : 패턴을 통해 의사결정 활용
- Wisdom : 창의적인 전략
- 데이터의 유형
- 형태에 따른 분류
- 정형데이터 : 행과 열로 구성된 구조화, 관계형DB, CSV
- 반정형 데이터 : 데이터를 설명하는 메타데이터를 포함, HTML, XML, JSON, RDF
- 비정형 데이터 : 구조화되지 않은 자유로운 형테, SNS, 음원
- 표현 방식에 따른 분류
- 정량적 데이터 : 수치로 측정된 데이터, 온도, 풍속
- 정성적 데이터 : 자료의 특징을 풀어서 설명, 기상특보, 주관식 응답
- 분석 목적에 따른 분류
- 수치형 : 연속형(키, 온도), 이산형(고객수, 판매건수) - 회귀
- 범주형 : 명목형(성별, 혈액형), 순서형(학점, 만족도 등급) - 분류
- 형태에 따른 분류
- 암묵지, 형식지간 상호작용
- 암묵지 : 개인에게 습득되고 겉으로 드러나지 않음
- 형식지 : 문서, 메뉴얼 등의 형상화된 지식
- 공통화 : 암묵지 지식을 다른 사람에게 알려줌
- 표출화 : 암묵지 지식을 메뉴얼이나 문서로 전환
- 연결화 : 교재, 메뉴얼에 새로운 지식 추가
- 내면화 : 만들어진 교재, 메뉴얼에서 다른 사람의 암묵지를 터득
- 공표연내
데이터베이스의 정의와 특징
- 데이터베이스의 특징
- 대표적인 4가지 특징 ***
- 공용 데이터 : 여러 사용자가 다른 목적으로 데이터 공동이용
- 통합된 데이터 : 동일한 데이터 중복되어 있지 않음
- 저장된 데이터 : 저장매체에 저장
- 변화되는 데이터 : 새로운 데이터 추가, 수정, 삭제에도 현재의 정확한 데이터 유지(무결성)
- 공통저변
- 대표적인 4가지 특징 ***
- 데이터베이스 설계 절차
- 요구사항 분석
- 개념적 설계 : 개념적 스키마 생성
- 논리적 설계 : 개념적 ERD를 활용한 논리적 모델링
- 물리적 설계 : 저장 구조 설계
- 개논물
- 데이터베이스 시스템
- DBMS : DB를 관리, 접근환경 제공 소프트웨어
- 관계형DBMS : 테이블, 표로 정리, 정형
- NoSQL DBMS : 비정형데이터 (HBase, MongoDB, CouchDB, Redis, Cassandra)
- 데이터베이스 스키마 : DB 구조와 제약조건에 관한 전반적 명세
- 메타데이터 : 데이터를 설명하는 데이터, 데이터 구조를 설명하고 검색하는데 활용
- 데이터 사전 : 메타데이터와 데이터 구조 정보를 포함하는 시스템 내 저장소
- 인스턴스 : 데이터 개체를 구성하는 속성에 대한 데이터 타입과 값
- 인덱스 : 정렬, 탐색 위한 보조도구
- SQL : DB에 접근하도록 지원하는 국제표준언어
- DDL, 정의 : create, alter, drop
- DML, 조작 : select, insert, delete, update
- DCL, 제어 : grant, revoke
- TCL : commit, rollback
- DBMS : DB를 관리, 접근환경 제공 소프트웨어
데이터베이스 활용
- 기업 내부 활용 데이터베이스
- OLTP(Transaction) : 다량의 단기 거래를 실시간 처리
- OLAP(Analytics) : 다차원 데이터를 대화식으로 분석
- CRM(C) : 고객과 관련 자료 분석하여 마케팅에 활용
- SCM(Supply Chain) : 공급망 연결 최적화
- ERP(Enterprise Resource) : 기업 경영 자원을 효율화
- RTE(Real Time) : 최신 정보로 신속한 의사결정 지원
- BI : 기업 보유 데이터 정리, 분석하는 리포트 중심 도구
- BA : 통계 기반 비즈니스 통찰력
- BlockChain : 네트워크에 참여한 모든 사용자가 정보를 분산, 저장
- KMS(K) : 기업의 모든 지식을 포함
- 데이터 웨어하우스(DW), 거대한 DB
- 기업 내외부 다양한 데이터를 한곳에 저장한 중앙 저장소
- 구성요소
- ETL : 다양한 소스 데이터 추출, 변형, 적재
- ODS : 다양한 DBMS에서 추출한 데이터를 임시저장
- 특징
- 주제지향성 : 분석목적 설정이 중요
- 데이터 통합 : 일관화된 형식으로 저장
- 시계열성 : 히스토리를 가진 데이터
- 비휘발성 : 읽기전용 - 넣기만함, 수시로 변하지 않음
- 데이터 레이크
- 비정형 데이터를 저장하여 하둡과 연계하여 처리
- 하둡 : 여러 컴퓨터를 하나로 묶어 대용량 데이터를 처리하는 오픈 소스 빅데이터 솔루션
- HDFS : 분산형 파일 저장 시스템
- MapReduce : 분산된 데이터를 병렬로 처리
데이터의 가치와 미래
빅데이터의 이해
- 빅데이터 출현 배경
- 클라우드 컴퓨팅, 분산 처리 기술(하둡 기반), 비정형 데이터 확산, 디지털화, 인터넷 모바일 기기 보급, IoT 발달
- 데이터 단위
- KB, MB, GB, PB 2^50, EB 2^60, ZB, YB
- 페타 엑사 제타 요타, PEZY
- 빅데이터 3V (가트너 정의) ***
- Volume 규모 : 데이터 양 증가
- Variety 다양성 : 데이터 유형 증가
- Velocity 속도 : 데이터 생성, 처리 속도 증가
- 규다소
- Value 가치
- Veracity 신뢰성
- Validity 정확성
- Volatility 휘발성
- 빅데이터에 대한 비유
- 산업혁명 석탄, 철
- 원유
- 렌즈
- 플랫폼
- 빅데이터가 만들어내는 변화 ***
- 표본조사 > 전수조사
- 사전처리 > 사후처리
- 질 > 양
- 인과관계 > 상관관계
- 전후양상
빅데이터의 가치와 영향
- 빅데이터 가치 산정이 어려운 이유
- 특정 데이터를 언제 어디서 누가 활용할지 알수 없다
- 기존에 가치없는 데이터도 새로운 분석기법으로 가치 창조
비즈니스 모델
- 빅데이터 주요 분석기법
- 회귀분석 : 독립변수와 종속변수간 관계 분석
- 분류분석 : 데이터가 어떤 그룹에 속하는지 판별
- 연관규칙 : 여러 요소들간 규칙 상관관계 존재
- 유전자 알고리즘 *** : 최적화 필요한 문제의 해결책 (택배차량 배치, 최대 시청률 얻으려먼 어떤 프로그램을 어느 시간대 방송?)
- 기계학습 : 훈련 데이터로부터 컴퓨터가 학습하고 미래를 예측
위기 요인과 통제 방안
- 위기 요인과 통제 방안 ***
- 사생활 침해 : SNS 올린 데이터가 사생활 침해
- 제공자 동의해서 사용자 책임으로 전환
- 책임 원칙 훼손 : 범죄 예측 프로그램으로 체포하는 문제
- 아직 결과가 일어나지 않았으니, 결과 기반 책임 원칙 고수
- 데이터의 오용 : 분석결과가 항상 옳은건 아님
- 알고리즘 접근 허용 및 알고리즈미스트 필요
- 사생활 침해 : SNS 올린 데이터가 사생활 침해
- 데이터 3법
- 개인정보보호법, 정보통신망법, 신용정보법
- 가명정보의 개념 도입(통계작성, 연구, 공익적 기록보존 목적하 동의 없이 활용가능) ***
- 개정신
- 개인정보, 가명정보, 익명정보
- 개인정보 : 개인을 알아볼 수 있는 정보, 동의를 받아 활용 가능, 홍길동 33세
- 가명정보 : 가명처리를 통해 추가정보 없이 특정 불가, 홍xx 30대 초반
- 익명정보 : 더이상 개인을 알아볼수 없는 정보, xxx 30대
- 개인정보 비식별화 ***
- 가명처리 , 홍길동 35세 > 임꺽정 30세
- 총계처리 , 170cm 180cm > 평균 키 175cm
- 데이터삭제, 901111 - 1111111 > 90년대 생 남자
- 데이터 범주화, 홍길동 35세 > 30-40세
- 데이터 마스킹, 홍길동 35세 > 홍xx 35세
미래의 빅데이터
- 빅데이터 활용 위한 3대 요소
- 인력, 자원(데이터), 기술
- 인자기
가치 창조를 위한 데이터 사이언스와 전략 인사이트
빅데이터분석과 전략 인사이트
- 전략 인사이트 확보 방향
- 빅에 초점 맞추지 말기 : 분석 목적에 맞는 데이터 구성과 기법이 중요
- 전략적 인사이트 확보 : 단순 분석을 넘어서 실행 가능성 고려
- 가치 기반 분석 수행 : 일차원적 분석을 넘어서 가치를 창출하는 다범위 분석 요구
전략 인사이트 도출을 위한 필요 역량
- 데이터 사이언스
- 데이터와 관련된 모든 분야의 전문지식을 종합한 학문
- 정형, 비정형 데이터 막론하고 데이터를 분석, 총체적 접근법
- 데이터사이언스 핵심 구성요소
- 분석 : 수학, 확률, 머신러닝, 분석학 등
- IT : 프로그래밍, 데이터 엔지니어링, 컴퓨팅 등
- 비즈니스 분석 : 커뮤니케이션, 스토리텔링, 시각화 등
- 데이터 사이언티스트의 필요역량 ***
- 하드스킬 : 이론적 지식, 분석기술에 대한 숙련, 이과적
- 소프트스킬 : 통찰력, 설득력, 협력, 문과적
- 가트너가 제시한 역량 : 데이터관리, 분석모델링, 비즈니스분석, 소프트스킬
빅데이터 그리고 데이터 ㄴ사이언스의 미래
- 빅데이터 가치 패러다임 변화
- Digitalization > Connection > Agency
- Digitalization : 아날로그 세상을 디지털로 전환
- Connection : 디지털화된 정보들의 연결
- Agency : 연결된 정보가 스스로 행동하는 주체
- DigitalCA메라
2단원 - 데이터분석 기획
데이터분석 기획의 이해
분석 기획 방향성 도출
- 분석대상과 방법에 따른 유형
- 분석대상과 방법이 알려져 있는지에 따라 분류
- 방법|대상 - Known - Unknown
- Known - 최적화 - 통찰
- Unknown - 솔루션 - 발견
- 둘다모르면 발견, 둘다 알면 최적화, 방법모르면 솔루션, 대상모르면 통찰
- 네가지 유형을 복합적으로 넘나들며 분석을 수행
- 접근 방식에 따른 유형
- 과제중심적 접근 : 빠르게 해결 목적, Speed & Test, Quick & Win, ProblemSolving
- 장기적 마스터 플랜 : 지속적 분석 원인 해결, Accuracy & Deploy, Long Term View, Problem Definition
- 분석 기획시 고려사항
- 가용 데이터 파악, 적절한 유스케이스 탐색, 장애요소에 대한 사전계획 수립
분석 방법론
- 분석 방법론의 구성요소
- 절차, 방법, 도구와 기법, 템플릿과 산출물
- 분석 모델의 유형
- 계층적 프로세스 모델 : 단계(Baseline으로 관리) > 태스크 > 스텝(단기간 수행), 빅데이터 분석 방법론의 기반
- 폭포수 모델 : 이전단계 완료되어야 다음단계 진행, 탑다운, 다시 돌아가기 어렵
- 프로토타입 모델 : 일부분, 프로토타입을 우선 개발하고 보완
- 나선형 모델 : 여러 개발과정 거쳐 점진적으로 완성, 위혐요소 제거 초점
- 애자일 : 짧은 개발 주기를 가지고 고객 피드백을 지속적으로 반영하여 반복적인 개발
- KDD 분석 방법론
- 데이터 선택 > 전처리 > 변환 > 마이닝 > 평가
- 데이터 선택 : 원시데이터나 DB에서 필요한 데이터 선택
- 전처리 : 이상값, 잡음식별 및 데이터 가공
- 변환 : 변수 선택 및 차원축소
- 마이닝 : 알고리즘을 선택하여 분석 수행
- 평가 : 결과에 대한 해석, 결과가 충족되지 않으면 절차를 반복 수행
- Crisp-DM 분석 방법론
- 업무이해 > 데이터이해 > 데이터준비 > 모델링 > 평가 > 전개
- 업데데이트모델평가전
- 업무이해 : 업무목적 파악, 상황파악, 목표설정, 프로젝트 계획 수립
- 데이터 이해 : 초기 데이터 수집, 기술 분석, EDA, 데이터 품질 확인
- 데이터 준비 : 데이터 셋 선택 및 정제, 통합
- 모델링 : 모델링 기법 선택, 테스트 기획 설계, 모델 작성 및 평가 - 모델링에서 하는거임
- 평가 : 분석결과 평가, 모델링 과정 평가, 모델 적용성 평가
- 전개 : 전개 계획, 모니터링 및 유지보수 계획 수립, 프로젝트 종료 보고서 작성, 프로젝트 리뷰 (평가 > 전개에서 위대한실패 - 업무 이해로 다시 돌아감 발생가능)
- 빅데이터 분석 방법론 ***
- 분석기획 > 데이터준비 > 데이터분석 > 시스템구현 > 평가 및 전개
- 분석기획 : 비즈니스 이해 및 범위 설정 - Statement of Works SOW, 프로젝트 정의 및 계획 수립, 프로젝트 위험계획 수립 - 회피 전이 완화 수용, 회전완수
- 데이터준비 : 필요 데이터 정의, 데이터 스토어 설계, 데이터 수집 및 정합성 점검
- 데이터분석 : 분석용 데이터 준비, 텍스트 분석, 탐색적 분석 EDA - 기초통계량 및 시각화를 통해 데이터 특성 파악, 모델링 - 분류 회귀 군집 등 알고리즘 적용, 모델 평가 및 검증, 모델 적용 및 운영방안 수립
- 시스템구현 : 설계 및 구현, 시스템 테스트 및 운영
- 평가 및 전개 : 모델 발전계획 수립, 프로젝트 평가 및 보고
분석 과제 발굴
- 분석과제 명세
- 분석과제 정의서 : 분석 계획서 수립을 위한 핵심 입력 자료
- 분석 활용 시나리오 : 분석 결과를 어떻게 적용할지 구체적으로 정의한 실행 중심 문서
- 하향식 접근 방법
- 문제가 먼저 주어지고 해답을 찾기 위해 진행
- 문제탐색 - 문제정의 - 해결방안탐색 - 타당성 검토
- 문제 탐색
- 비즈니스 모델 기반 탐색 : 업무, 제품, 고객, 규제와 감사, 지원인프라 - 지원인프라 업무 중에 고객이 제품을 규제와 감사 했따
- 발굴 범위 확장
- 거시적 관점 : STEEP (사회, 기술, 경제, 환경, 정치)
- 경쟁자 확대 관점 : 대체자, 경쟁자, 신규 진입자
- 시장의 니즈 탐색 관점 : 고객, 채널, 영향자
- 역량의 재해석 : 내부 역량, 파트너 네트워크
- 내/외부 사례 참조
- 외부 참조모델 기반(벤치마킹), 분석 유스케이스(과거 유사 사례)
- 문제 정의 : 비즈니스 문제를 데이터 문제로 변환하여 정의
- 해결방안 탐색 : 기존 시스템 활용, 시스템 고도화, 인적 자원 확보, 아웃소싱 등
- 타당성 검토 : 경제적 타당성, 데이터 타당성, 기술적 타당성
- 상향식 접근 방법
- 문제 정의 자체가 어려울떄, 사물을 그대로 인식, 아래에서 쌓아가야
- 프로세스 분류 > 프로세스 흐름 생성 > 분석요건 식별 > 분석요건 정의
- 상향식 접근법의 적용 방법 : 비지도학습(정답x), 프로토타입 접근법
- 혼합 접근 방법
- 발산 단계 : 상향식 접근 방법으로서, 가능한 방안들을 도출
- 수렴 단계 : 하향식 접근 방법으로서, 도출된 방안들을 분석
- 디자인싱킹 : 사용자 공감으로 시작해서 아이디어 발산, 수렴 과정을 통해 발전하는 방식
- 공감하기>문제정의>아이디어도출>프로토타입>테스트
분석 프로젝트 관리 방안
- 분석 과제에서 고려해야할 5가지 요소
- 데이터의 양, 속도, 데이터 복잡성, 분석 복잡성, 정확도/정밀도
- 정확도와 정밀도는 트레이드 오프 관계에 있다. 3과목의 오분류표와는 다른 개념이다. 여기서는 분석결과가 얼마나 일치하는지/여러번 분석 반복시 비슷한 결과가 계속 나오는지 물어보는것
- 데이터의 양, 속도, 데이터 복잡성, 분석 복잡성, 정확도/정밀도
- 프로젝트 관리 지식 체계 10가지 영역, PMP
- 통합, 범위, 시간(일정), 원가, 품질, 인적자원, 의사소통, 리스크(위험), 조달(아웃소싱), 이해관계자
- 이범통이 의자에서 시원한 조리품을 먹었다
분석 마스터 플랜
마스터플랜 수립
- IT 프로젝트의 우선순위 선정 기준
- 중장기 마스터 플랜을 수립 위하여 ISP를 활용
- 전략적 중요도 : 전략적 필요성 - 조직의 비전, KPI, 시급성 - 해결 지연시 리스크
- 실행 용이성 : 투자 용이성 - 예산확보, ROI, 기술 용이성 - 기술 구현 난이도
- 중장기 마스터 플랜을 수립 위하여 ISP를 활용
- 데이터 분석 프로젝트의 우선순위 선정 기준
- 시급성 관점 : 비즈니스 효과 Return - Value
- 난이도 관점 : 투자비용 요소 Investment - 3V, Volume Varacity Velocity
- 어려움 - 1 - 2
- 난이도
- 쉬움 - 3 - 4
- ;;; - 현재 - 시급성 - 미래
- 시급성 중심 전략 : 3>4>2, 시급성이 먼것을 앞으로 당겨와서 진행
- 난이도 중심 전략 : 3>1>2, 난이도가 먼것을 앞으로 당겨와서 진행
- 시급성이 현재에 해당한다는 것은 시급성이 높다는 의미
- 데이터 분석 로드맵
- 데이터 기반 의사결정을 조직에 정착시키기 위한 중장기 계획
- 체계 도입 단계 > 유효성 검증 단계 (파일럿 프로젝트 수행 - 시험비행) > 확산 및 고도화 단계
분석 거버넌스 체계 수립
- 분석 거버넌스(규칙, 구조) 체계 구성요소
- 조직, 프로세스, 시스템, 데이터, 분석관련 교육 및 마인드 육성체계
- 시조프로마인드데
- 데이터 분석 수준 진단
- 분석 준비도
- IT 인프라, 분석문화, 분석데이터, 분석기법, 인력및조직, 분석적업무파악
- IT문데기인파
- 분석 성숙도
- ;;; - 비즈니스 부문, 조직 및 역량부분, IT부문
- 도입
- 활용
- 확산
- 최적화
- 분석 성숙도 진잔은 CMMI 모형 (5단계)를 기반
- 분석 준비도
- 분석 수준 결과 진단
- 높음^ - 정착형 - 확산형
- 성숙도 - 준비형 - 도입형
- ;;; - 준비도 -> 높음
- 가로가 준비도, 세로가 성숙도, 4사분면부터 시계방향으로 도준정확
- 준비형 - 데이터, 인력, 조직, 분석업무, 분석기법 적용 안되어 사전준비 필요
- 정착형 - 인력, 조직, 분석업무, 분석기법 등을 제한적으로 사용
- 도입형 - 조직 및 인력 등 준비도는 높으나, 분석업무 및 기법 부족
- 확산형 - 6가지 분석 구성요소가 모두 갖추고 있으며, 지속적 확산이 가능
- 빅데이터 거버넌스 프레임워크
- 데이터 거버넌스 : 전사 차원에서 데이터 대해 표준화된 관리 체계 수립
- 데이터 거버넌스 구성요소 : 원칙, 조직, 프로세스
- 데이터 거버넌스 체계 : 데이터 표준화, 데이터 관리체계, 저장소 관리, 표준화 활동
- 분석 지원 인프라 방안 수립
- 확장성을 고려한 플랫폼 구조 적용 (중앙집중적 관리)
- 광의의 분석 플랫폼 : 분석 서비스 제공엔진, 분석 어플리케이션, 분석 서비스 API, 하드웨어
- 협의의 분석 플랫폼 : 데이터 처리 프레임워크, 분석엔진, 분석 라이브러리
- 광의의 분석 플랫폼은 협의의 분석 플랫폼 요소들을 포함하는 개념
- 확장성을 고려한 플랫폼 구조 적용 (중앙집중적 관리)
- 조직 및 인력방안 수립 (DSCoE : 분석조직)
- 집중 구조 : 독립적인 전담 조직 구성 (중복업무 가능성 존재)
- 기능 구조 : 해당 부서에서 직접 분석 (DSCoE가 없음)
- 분산 구조 : 분석 조직 인력을 현업 부서에 배치
- 집기분
3단원 - 데이터분석
R 기초와 데이터 마트
R 기초
데이터 마트
- 데이터 마트 DM
- 특정 주제에 맞게 데이터를 모아놓은 소규모 데이터 웨어하우스
- 원천 데이터 수집 > 데이터 웨어하우스 > 데이터 마트
- 요약변수와 파생변수
- 요약변수 : 수집된 정보를 종합한 변수로서 재활용성이 높음, 1개월간 수입
- 파생변수 : 의미를 부여한 변수, 논리적 타당성 필요, 고객구매등급
결측값 처리와 이상값 탐색
- EDA, 탐색적 자료 분석
- 데이터의 의미를 찾기 위해 통계, 시각화를 통해 파악
- EDA 의 4가지 주제
- 저항성의 강조 : 자료변동에 민감하지 않음
- 잔차 계산 : 값들이 주경향으로부터 얼마나 벗어나 있는지 확인하는 척도
- 자료변수의 재표현 : 원래 변수를 적당한 척도로 변환
- 그래프를 통한 현시성 : 시각화를 통하여 효율적으로 파악
- 저잔재현
- 결측값 처리
- 존재하지 않는 데이터, Null/NA 로 표시
- 단순대치법
- 완전 분석법 : 결측값 가지는 데이터 그냥 완전히 삭제
- 평균 대치법
- 비조건부 평균 대치법 : 단순 평균으로 대치
- 조건부 평균 대치법 : 회귀분석 결과로 대치
- 단순 확률 대치법 : 확률적으로 선택하여 대치
- Hot-Deck : 현재 데이터 셋에서 비슷한 성향으로 대체
- Cold-Deck : 유사한 외부 출처에서 비슷한 성향으로 대체
- Nearest Neighbor : 바로 가까운 응답으로 대체
- 다중 대치법
- 여러 번 대치하여 종합, 대치 > 분석 > 결합
- 다중 대치법은 분산 과소 추정 문제 해결이 가능
- 이상값 검색
- 극단적으로 크거나 작은값, 의미있는 데이터일수도 있다, 키 230
- 항상 제거하거나 변환하는건 아님
- ESD(Extreme Studentized Deviation)
- 평균으로부터 표준편차의 3배 넘어가는 데이터는 이상값으로 판단
- 정규분포 그래프에서. 평균으로부터 표준편차 3배 넘어가는건 이상값으로 보자. 3시그마 밖에있는 0.3퍼센트를 이상치 후보로
- 사분위수 ***
- Q1-1.5IQR보다 작거나, Q3+1.5IQR 보다 크면(상한 하한) 이상값으로 판단
- 상한, 하한, 최솟값, 1-3사분위값, 최댓값 등을 표현하며, 평균값은 표현하지 않음
- 박스플롯
- Q1-Q2-Q3 25,50,75% 값
- 상 하한에서 벗어나면 이상값
- 분산 중앙값 이상치 존재여부 알수있다
- A,B 의 평균은 알수가 없다(전체 데이터의 합을 개수로 나누어야 하는데, 전체 데이터 정확히 알수 없고 개수도 모름) ***
- Z-Score : 데이터를 표준화(평균0 표준편차1), 일정 임계값을 초과시 이상값으로
- DBScan : 밀도를 이용하여 밀도가 적은 부분의 데이터를 이상값으로 판단
통계분석
통계학 개론
- 자료의 척도 구분
- 질적 척도
- 명목척도 : 어느 집단에 속하는지 나타내는 자료, 대학교, 성별
- 순서 척도, 서열척도 : 서열관계가 존재하는 자료, 학년, 순위
- 양적 척도
- 등간척도, 구간척도 : 구간사이 간격이 의미가 있으며, 덧셈뺄셈만 가능, 온도 (섭씨 화씨 다름…), 지수
- 비율척도 : 절대적 기준 0이 존재하고 사칙연산 가능, 가장 많이 수집되는 자료, 무게, 나이
- 질적 척도
- 기초 확률의 이해
- 사건
- 표본공간
- 확률
- 확률의 덧셈 정리
- 조건부 확률
- 독립사건
- 배반사건
- 기초 통계의 이해
- 확률변수
- 이산확률분포
- 기댓값
- 분산
- 이항분포
- 이항분포의 평균 :
- 분산 :
- 정규분포 :
- 표준정규분포
- 기초통계량
- 중심경향성 측면
- 평균
- 중앙값
- 최빈값
- 분산 정도 측면
- 범위
- 분산
- 표준편차
- 사분위수, IQR : 데이터의 상위 75%와 하위 25%의 중간범위
- 변동계수, CV : 표준편차에서 평균을 나눈 백분율, 단위 다른 변수간 상대적 비교에 유용
- 관계 측면
- 공분산 : 두 확률변수의 상관정도
- 공분산 = 0 : 상관이 전혀 없는 상태
- 공분산 > 0 : 양의 상관관계
- 공분산 < 0 : 음의 상관관계
- 문제는 플마 무한이라서, 특정 숫자가 나와도 관계가 큰지 알수가 없다.
- 상관계수 : 공분산의 단위와 범위 영향을 표준화, 상관정도를 -1 ~ 1 값으로 표현
- 상관계수 = 1 : 정비례 관계
- 상관계수 = 0 : 상관없음
- 상관계수 = -1 : 반비례 관계
- 두 변수가 독립이면 공분산은 0이다, 그러나 역은 성립안함. 공분산 0이라고 두 변수가 독립이라고 할수 없다.
- 공분산이나 상관계수는 선형관계만 본다, 두 변수가 이차함수 형태면 독립이라고 할수 없지만 공분산이나 상관계수 계산시 0 나와버린다. 그래서 0 나온다고 독립은 아님
- 공분산 : 두 확률변수의 상관정도
- 중심경향성 측면
- 첨도와 왜도
- 첨도 : 자료의 분포가 얼마나 뾰족한지 나타내는 척도
- 첨도 = 3 이면 정규분포 형태. 그런데 3을 빼서 0을 기준으로 정규분포 형태를 판단하기도 함
- 값이 클수록 뾰족한 모양
- 왜도 : 자료 분포의 비대칭 정도. 0일때 대칭이다.
- 왜도 < 0 : 최빈 > 중앙 > 평균
- 왜도 > 0 : 최빈 < 중앙 < 평균
- 중앙값은 항상 중앙. 높은쪽이 최빈값, 꼬리길고 낮은쪽이 평균값. 평균값은 꼬리를 따라감 이상치가 있는쪽으로.
- 음수면 왼쪽이 높다. 최빈 중앙 평균
- 양수면 오른쪽이 높다. 평균 중앙 최빈
- 수평선에서 높은쪽이 부호인거임..
- 첨도 : 자료의 분포가 얼마나 뾰족한지 나타내는 척도
- Summary 함수의 해석
Age Survived Min. : 0.17 0:266 1st Qu.:21.00 1:152 Median :27.00 Mean :30.27 3rd Qu.:39.00 Max. :76.00 NA's :86- Mean, Median 값 등 존재 : 수치형 변수
- 25%지점 1Q, 75% 지점 3Q 등 확인가능
- Median < Mean 이라면 왜도 > 0인것도 알수있다
- 결측치 NA’s 개수 도 알수 있다.
- 우측 Survived 변수는 집단의 빈도수가 나온다. 범주형 변수인것.
- 추론통계
- 일부 표본의 데이터를 바탕으로 모집단을 추정하거나 가설을 검정하는 통계 기법
- 모집단 > 표본추출 > 표본집단 > 모집단 예측 (추정, 가설검정)
- 표본추출 방법
- 랜덤추출법
- 계통추출법 : 번호 부여하여 일정 간격으로 추출
- 집락 추출법, 군집 추출법
- 여러 군집으로 나눈 뒤 군집을 선택하여 랜덤 추출, 군집 내 이질적 특징, 군집 간 동질적 특징
- 학년당 7반까지 있다고 할때, 1,2,3 학년 1~7 반중 숫자 하나 골라서 1,2,3 학년 뽑는것. 학년-반 에서 반이 같은거 뽑는거임…
- 층화 추출법
- 군집 내 동질적 특징, 군집 간 이질적 특징
- 같은 비율로 추출시, 비례 층화 추출법
- 1,2,3 학년 있다고 할때 학년 1-1 ~ 1-7 반 통째로 뽑는건 층화추출법임. 같은 학년이 같은 층인걸 뽑아서 층화인거임… 그럼 군집 내 동질적(같은학년끼리) 특징이 된다. 층간은 이질적이게 되고.
- 그리고 학년당 비율을 맞춘다면 비례 층화 추출이 되고
- 복원추출
- 비복원추출
- 확률분포
- 확률 변수의 개별 값들이 가지는 확률 값의 분포
- 이산 확률 분포
- 값을 셀 수 있는 분포, 확률질량함수로 표현
- 베르누이분포 : 결과가 두가지중 한가지로 나타나는 베르누이시행으로 나타나는 분포, 동전던지기, 합격 불합격
- 이항분포 : N번의 베르누이 시행중, K번 성공할 확률의 분포, 동전을 20번 던져서 앞면 나오는 횟수
- 기하분포 : 성공확률 p인 베르누이 시행에서 처음으로 성공할때까지 시행횟수의 분포, 동전을 던져 처음으로 앞면이 나오기까지 던진 횟수
- 음이항분포 : 성공확률 p인 베르누이 시행을 r 번 성공할때까지 반복 시행횟수의 분포, 동전을 던져 앞면이 5번 나오기까지 던진 횟수
- 초기하분포 : N개중 비복원추출로 n번 추출했을때 원하는 결과가 k번 나올 확률의 분포, 10개 구슬 중 4개의 구슬이 당첨 구슬일때, 4번 뽑았을때 당첨 구슬을 2번 뽑을 확률
- 다항분포 : N번 시행에서 각 시행이 여러 개의 결과를 가질 수 있는 확률 분포, 주사위를 20번 던져 각 면이 나오는 횟수
- 포아송분포 : 단위 시간 내 발생할 수 있는 사건의 발생 횟수에 대한 분포, 하루동안 발생하는 출생자 수, 한시간동안 사무실에 걸려온 전화 수
- 누포항하
- 베르누이 분포가 N번이면 이항분포, 이항분포를 비복원 추출로 하면 초기하분포, 이항분포 시행수를 무한히 하면 포아송 분포가 된다.
- 기하분포 일반화하면 음이항분포
- 연속확률분포
- 값을 셀 수 없는 분포, 확률밀도함수로 표현
- 균일분포 : 모든 값 동일한 확률
- 정규분포 : 우리가 일상에서 흔히 보는 확률변수의 평균 분포를 근사한 분포
- t분포 : 정규분포와 유사하지만, 꼬리 부분이 더 두껍고 긴 분포
- t검정에서 활용, 표본이 30개보다 작은 집단에 대한 평균 검정
- 카이제곱분포 : 독립적인 정규분포를 따르는 변수들의 제곱합으로 구성된 분포
- 카이제곱검정 활용, 두 집단의 동질성 검정, 단일 집단의 모분산 검정
- F분포 : 두개의 서로 다른 카이제곱분포의 비율
- F검정 활용, 두 집단의 분산 동질성 검정
- 지수분포 : 사건 간 시간간격 분포
- 감마분포 : 지수분포의 일반화
- 베타분포 : 두 모수 알파, 베타에 대한 0~1 사이 비율 분포
- 확률분포의 기댓값
- 이산적 확률변수 : 시그마
- 연속적 확률변수 : 적분 xF(x) 하는거
- 중심극한정리
- 임의의 모집단으로부터 추출된 표본분포는 표본크기가 충분히 크면 정규분포, 30개 이상
- 모집단의 분포에 상관없이 표본정규분포가 정규분포를 이룸
- 표본평균의 분포
- 평균(기댓값):
- 분산:
- 표준편차(표준오차):
- n이 커질수록 표본평균의 분포가 좁아짐, 표본 크기가 커질수록 표본평균들이 덜 퍼진다
- 표준화:
- 점추정
- 모집단이 특정한 값으로 추정하며, 추정량 Estimator으로 모수를 추정
- 추정량의 조건
- 불편성, unbiasedness : 추정량의 기댓값이 실제 모수와 같음, 편향이 0이 되는 경우, 중심이 맞는가
- 효율성, efficiency : 여러 추정량 중 분산이 작은 것이 더 효율적인 추정량, 얼마나 덜 흔들리는가
- 일치성, consistency : 표본 크기가 증가할수록 추정량이 모수에 가까워짐
- 충족성, sufficiency : 추정량이 모집단의 정보를 최대한 반영
- 불효일충
- 대표적인 추정량
- 모평균 → 표본평균
- 모분산 → 표본분산
- 표본분산은 불편성을 위해 n-1로 나눔, 표본집단의 분산은 모집단보다 줄어들수밖에 없다 일부를 뽑은거니까, 그래서 보정해줌
- 자유도 개념, 관측값은 n개지만 독립적으로 움직일수 있는 편차는 n-1개 뿐이다. 평균이 정해져 있으니 하나가 종속되어 n-1
- 구간추정
- 모집단이 특정한 분산으로 추정 (95%, 99% 를 가장 많이 사용)
- 모집단의 분산을 알고 있는 경우
- 신뢰수준 95%
- 신뢰수준 99%
- 모집단의 분산을 모르는 경우
- 자유도가 n-1인 t분포를 이용하여 신뢰구간을 추정
- 가설검정
- 모집단의 특성에 대한 주장을 가설로 세우고, 표본조사로 가설의 채택여부를 판정
- 귀무가설 : 일반적으로 생각하는 가설, 차이가 없다
- 대립가설 : 귀무가설을 기각하는 가설, 증명하고자 하는 가설, 차이가 있다, 크다/작다
- 유의수준 : 귀무가설이 참일때 기각하는 1종오류를 범할 확률의 허용 한계, 일반적으로 0.05
- 유의 확률 p-value : 귀무가설을 지지하는 정도를 나타내는 확률
- 실제 | 검정결과 - 가 사실이라고 판정 - 가 거짓이라고 판정
- 가 사실 - 옳은 결정 - 1종 오류
- 가 거짓 - 2종 오류 - 옳은 결정
- 귀무가설이 맞는데 기각해버리면 매우 큰 오류다. 그래서 1종오류임
- 가설검정 R결과 해석
- 귀무가설/대립가설 설정
- 차이가 없다, 혹은 동일하다 > 귀무가설
- 양측 혹은 단측 검정 확인
- 대립가설의 값이 같지 않다 - 양측검정, 값이 크다/작다 - 단측검정
- 일표본 혹은 이표본 확인
- 하나의 모집단 - 일표본, 두개의 모집단 - 이표본
- 귀무가설 기각 혹은 채택
- p-value < 유의수준 알파 - 귀무가설 기각
- p-value > 유의수준 알파 - 귀무가설 채택
- t검정인 경우 - 단일표본, 대응표본, 독립표본 확인
- 모집단에 대한 평균검정 > 단일표본
- 동일 모집단에 대한 평균비교 검정 > 대응표본
- 서로 다른 모집단에 대한 평균비교 검정 > 독립표본
- 귀무가설/대립가설 설정
- 모수 검정
- r 결과 해석
- 신뢰수준, 유의수준, t.test
- alternative hypothesis - 대립가설
- 같지 않다면 양측검정
- t.test인자 2개면 이표본
- pvalue 값이 0.05보다 큰지 확인하고… 귀무가설 채택하거나 기각
- 서로다른 모집단에 대한 평균비교 검정이면 독립표본..
- 그냥 해석할줄 알면 된다
- 독립표본 t검정은 두 집단의 분산이 같다는 가정(등분산가정) 이 전제가 되며, 등분산을 가정하지 않는 경우 Welch의 t검정을 활용
- r 결과 해석
- 비모수검정
- 모집단에 대한 아무런 정보가 없어서, 특정 분포를 따른다고 가정이 불가시
- 두 관측값의 순위나 차이로 검정 ***
- 부호검정, 순위합검정, 맨-휘트니 U검정, 크루스칼-왈리스 검정, 콜모고로프-스미르노프 검정, 카이제곱 검정 ***
- 카이제곱 검정은 범주형 변수간의 검정에 주로 활용되며, 적합도, 독립성, 동질성 검정에 활용
기초 통계분석
-
회귀분석
- 독립변수들이 종속변수에 영향을 미치는걸 파악하는 분석방법
- 독립변수 : 원인
- 종속변수 : 결과
- 잔차, 오차 : 계산값과 예측값의 차이
- 회귀분석은 독립변수와 종속변수간 상관관계를 분석하는 방법이며, 인과관계를 보장하지 않음
- 회귀계수 측정 방법
- 최소제곱법 : 잔차의 제곱합 SSE 가 최소가 되는 회귀계수와 절편을 구하는 방법
- 회귀모형 평가
- R-square : 총 변동 중에서 회귀모형에 의해 설명되는 변동이 차지하는 비율 (0~1)
- SST : 전체의 변동 (SST = SSE + SSR)
- SSE : 모형에 의해 설명되지 않는 변동
- SSR : 모형에 의해 설명되는 변동
- R^2 = SSR / SST = 1 - SSE / SST
-
회귀분석 종류
- 단순회귀
- 다중회귀 : 2개 이상의 독립변수
- 다항회귀 : 2개이상 독립변수와 종속변수가 2차함수 이상의 관계
- 규제항이 포함된 회귀
- 라쏘회귀 L1규제
- 릿지회귀 L2규제
- 엘라스틱넷 : L1 L2 동시에 규제
- 교호항이 포함된 회귀 : 독립변수들의 교호작용이 포함된 회귀 모형
- 교호작용 : 2개 이상의 독립변수가 상호작용을 하여, 종속변수에 영향을 미치는 경우
- x1 = 10배, x2 = 20배, x1*x2 = 300배 (이 교호항도 사용하는게 맞을것, 교호작용)
-
선형회귀분석의 가정
- 선형성 : 종속변수와 독립변수는 선형관계
- 등분산성 : 오차의 분산이 고르게 분포
- 정규성 : 오차가 정규분포의 특성을 가짐
- 독립성 : 오차가 서로 독립
- 선분정독, 3개가 오차에 관련 내용
-
다중공선성 문제
- 독립변수들간 강항 상관관계가 나타나는 문제
- 진단방법
- 변수간 상관계수 절댓값이 0.8 이상이면 의심
- VIF(분찬팽창인수) 값이 10 이상이면 다중공선성 존재한다고 판단 (VIF = 1/(1-R^2)), R 증가시 VIF도 증가. R은 0~1 인데 너무 완벽해도 문제가 있다고 판단하는것
- 해결방안 : 독립변수 제거, 차원축소, 변수선택, 규제항이 포함된 회귀
-
최적의 회귀 방정식 탐색 방법
- 전진선택법 : 변수를 하나씩 추가하면서 최적의 회귀방정식을 찾아내는 방법
- 후진제거법 : 변수를 하나씩 제거하면서 최적의 회귀방정식을 찾아내는 방법
- 단계별 선택법 : 전진 + 후진 으로 변수 추가시 벌점을 고려
- 아카이케 정보 기준, AIC : 편향과 분산이 최적화 되는 지점 탐색, 자료가 많을수록 부정확
- 베이즈 정보 기준, BIC : AIC보완했지만 더 패널티가 큰 단점
- Mallow’s Cp : 잔차제곱합 SSE 를 이용한 판단
- AIC, BIC모두 작을수록 좋다
-
회귀분석의 분산분석(ANOVA)표
요인 제곱합 자유도 제곱평균 F비 회귀 (회귀계수 수) 잔차 (전체 데이터 수) 총 - ANOVA 검정 : 3개 이상의 그룹의 평균을 비교하는 검정 (회귀모형의 유의성 분석 시 활용)
- 전체 데이터 수 = 자유도 + 1
- 결정계수(R-Square) =
- 수정된 결정계수 =
- 다중 회귀에서는 수정된 R-square 값을 일반적으로 사용
-
회귀 모형의 검정
- 독립변수와 종속변수 설정
- 회귀계수 값의 추정
- 모형이 통계적으로 유의미한가? : 모형에 대한 F 통계량, p-value
- 귀무가설 : “모든 회귀계수는 0이다” - 모델이 유의미하지 않음, 귀무가설 기각하려면 p-value 가 알파보다 작아야함.
- 회귀계수들이 유의미한가? : 회귀계수들의 t 통계량, p-value
- 각각의 회귀계수에 대한 귀무가설 : “회귀계수는 0이다”
- 위 1), 2) 모두를 기각하면 해당 모형을 활용
- 모형이 설명력을 갖는가 : 결정계수(R square) 값
다변량 분석
- 상관관계의 유형
- 두 변수간 선형적 관계가 존재하는지 파악하는 분석
- 피어슨 상관분석 : 양적 척도, 연속형 변수, 선형관계 크기 측정
- 스피어만 상관분석 : 서열척도, 순서형변수, 선형/비선형적 관계 나타냄
- 스피어만 상관계수는 x,y가 선형관계가 아니더라도 +-1이 될 수 있다.
- 두 변수간 선형적 관계가 존재하는지 파악하는 분석
- 주성분분석 PCA
- 상관성 높은 변수들의 선형결합으로 차원을 축소하여 새 변수를 생성
- 자료의 분산이 가장 큰 축이 첫 번째 주성분, 고유값 고려
- 두번쨰 주성분은 첫번째 주성분과 직교하면서 다음으로 분산이 큰 방향
- 70-90%의 설명력을 갖는 수를 결정
- 결과해석 : cumulative proportion 에서… PC2가 0.8 넘으면 2차원 선택시 전체 데이터의 약 80%을 설명하게 되는것
- 스크리플롯 Screeplot
- 기울기가 완만해지는 지점 앞까지 고르면 된다. 더 주성분을 추가해도 분산, 설명력이 좋아지는 정도가 낮아지니까.
- 절대적인건 아님
- 다차원 척도법 MDS, Multi-Dimensional Scaling
- 데이터 간 거리정보의 근접성을 보전하는 방식으로 차원축소하여 시각화
- 특징 : 데이터 축소 목적, Stress 값이 0 에 가까울수록 좋음, 글로벌 최적점 도달 어려움
- 종류 : 계량적 MDS(양적척도 활용), 비계량적 MDS(순서척도 활용)
시계열 예측
- 시계열 분석
- 시간의 흐름에 따라 관찰된 자료의 특성을 파악하여 미래를 예측, 주기데이터, 기온데이터
- 시계열 데이터의 변동 요인
- 추세 요인 : 장기적으로 증가, 감소하는 추세
- 계절 요인 : 계절과 같이 고정된 주기에 따라 변화
- 순환 요인 : 알려지지 않은 주기를 갖고 변화, 경제 전반, 특정 산업
- 불규칙 요인 : 위 3가지로 설명 불가한 요인
- 추운 계절의 순환이 불규칙하다
- 정상성
- 시계열 예측을 위해서는 모든 시점에 일정한 평균과 분산을 가지는 정상성을 만족해야 함
- 정상시계열로 변환 방법
- 차분 : 현 시점의 자료를 이전 값으로 빼서 평균을 일정하게 만드는 방법
- 변환 : 로그변환, 제곱근변환, 박스콕스 변환 등으로 분산을 안정화
- 평활화
- 이동평균법 : 일정 기간의 평균
- 지수평활법 : 최근 시간 데이터에 가중치를 부여
- 백색 잡음
- 시계열 모형의 오차항을 의미 (평균 및 분산 일정, 자기상관 없음, 정상성 만족 ***)
- 평균이 0이면 가우시안 백색잡음
- 시계열 모형
- 자기회귀 AR 모형
- 자기자신의 과거 값이 미래를 결정하는 모형
- 부분자기상관함수 PACF 를 활용하여 p+1 시점부터 급격 감소하면 AR(p) 모형 선정
- 이동평균 MA 모형
- 이전 백삭잡음들의 선형결합으로 표현되는 모형
- 자기상관함수 ACF 를 활용하여 q+1시점붜 급격히 감소하면 MA(q) 모형 선정
- 자기회귀누적이동평균(ARIMA) 모형
- AR + MA 모형
- ARIMA(p,d,q)
- p와 q는 AR모형과 MA모형이 관련 있는 차수
- d는 정상화시에 차분 몇번 했는지의 의미
- d=0 : ARMA 모델, p=0 : IMA 모델, q=0 : ARI 모델
- 계절성이 있는 경우 SARIMA 사용을 고려
- 자기회귀 AR 모형
정형 데이터 마이닝
데이터 마이닝 개요
- 데이터마이닝
- 방대한 데이터 속에서 새로운 규칙패턴을 찾고 예측을 수행하는 분야
- 목표정의 > 데이터 수집 및 이해 > 데이터 전처리 > 데이터 마이닝 기법 적용 > 평가 및 해석
- 데이터 마이닝의 유형
- 지도학습 : 정답이 있는 데이터 활용
- 분류 : 인공신경망, 로지스틱회귀분석, 나이브베이즈, 분류트리, KNN, SVM 등
- 회귀 : 인공신경망, 선형회귀분석, 회귀트리 등
- 비지도학습 : 정답이 없는데이터들 사이 규칙을 파악
- 군집분석, 연관규칙분석, 차원축소
- 지도학습 : 정답이 있는 데이터 활용
- 과대적합과 과소적합
- 과대적합 : 모델이 지나치게 데이터를 학습하여, 매우 복잡해진 모드레, 높은 분산, 낮은 편향
- 과소적합 : 데이터를 충분히 설명하지 못하는 단순한 모델, 낮은 분산, 높은편향, 직선하나로 그어졌으니
- 데이터 분할과 교차검증
- 과대적합과 과소적합을 방지하고, 데이터가 불균형한 문제를 해결하기 위해 사용
- 분할된 데이터 셋 종류
- 훈련용, 검증용, 평가용
- 분할된 데이터의 학습 및 검증 방법
- 홀드아웃 : 전체 데이터를 학습용과 검증용으로 한 번만 나누어서 사용
- K-fold 교차검증 : 데이터를 k 개 집단으로 구분하여 k-1개 학습, 나머지 1개로 검증
- LOOCV : 1개의 데이터로만 검증 나머지로 학습, 신뢰도가 높지만 연산량이 많음
- 부트스트래핑 : 복원추출을 활용하여 데이터셋을 생성, 데이터부족, 불균형 문제 해소
분류분석 Classification
- 로지스틱 회귀분석
- 종속변수가 범주형데이터, 성공과 실패 2개집단 분류하는 문제에 활용
- 로지스틱 회귀분석의 원리
- 오즈 Odds
- 성공할 확률과 실패할 확률의 비
- Odds = P/(1-P) = 성공/실패 확률
- 로짓변환
- 오즈에 자연로그를 취하여 선형환계로 변환
- 식 생략
- 시그모이드 함수
- 로짓함수의 역함수를 통하여 0~1사이 확률을 도출하는 함수
- 로지스틱 회귀분석의 검정
- 회귀계수 추정 : 최대우도법, 가능성 최대
- 회귀분석에서는 최소제곱법, 오류가 낮은지점을 찾았다. 로지스틱 회귀분석은 확률이므로 가능성이 높으면 좋다. 최대우도법
- 모형전체 검정 : 우도비검정(카이제곱검정)
- 회귀계수 추정 : 최대우도법, 가능성 최대
- 오즈 Odds
- KNN (K-Nearest Neighbors)
- 거리 기반으로 이웃에 더 많은 데이터가 포함되어 잇는 범주로 분류
- 단순하고 효율적이며, 훈련이 따로 필요없는 Lazy Model
- K에 따라 결과 달라짐
- 나이브베이즈 분류
- 베이즈 정리
- 과거 경험 활용하는 귀납적 추론 방법
- 나이브베이즈 분류
- 나이브(독립) + 베이즈정리 기반으로 계산을 단순화하여 범주에 속할 확률을 계산
- 서로 독립적이라는 가정이 필요
- 베이즈 정리
- 의사결정나무
- 노드 내 동질성 커지고, 노드간 이질성이 커지는 방향으로 분리하는 트리 구조 모델
- 특징
- 화이트박스 모델, 높은 과적합 위험
- 과적합 방지
- 정지규칙 : 분리 더이상 수행하지 않고 나무 성장 멈춤
- 가지치기 : 일부 가지를 제거하여 과적합 방지
- 노드 분할 방법 ***
- 분류(범주형)에서의 분할 방법
- CHAID 알고리즘 : 카이제곱 통계량
- CART 알고리즘 : 지니지수 활용 ***
- C4.5/C5.0 알고리즘 : 엔트로피지수 활용
- 회귀(연속형)에서의 분할 방법
- CHAID 알고리즘 : ANOVA, F-통계량
- CART 알고리즘 : 분산감소량
- 분류(범주형)에서의 분할 방법
- 서포트벡터머신(SVM)
- 마진이 최대가 되는 초평면을 찾아 선형이나 비선형 이진분류, 회귀에서 활용 가능한 다목적 모델
- 구성요소
- 하이퍼플레인(초평면) : 데이터를 구분하는 기준이 되는 경계, 가중치벡터와 편향으로 결정
- 서포트벡터 : 클래스를 나누는 하이퍼플레인과 가까운 위치의 샘플
- 마진 : 하이퍼플레인과 서포트벡터 사이의 거리
- 커널함수 : 저차원 데이터를 고차원 데이터로 변경하는 함수, 공간에 맵핑
- 유형
- 하드마진분류 : 오류 비허용
- 소프트마진분류 : 마진 내 어느 정도 오류 허용
- 앙상블
- 여러 개의 예측 모형을 조합하는 기법
- 보팅(Voting)
- 다수결 방식으로 최종 결과 결정
- 하드보팅 : 예측값을 다수결 투표
- 소프트보팅 : 각 예측 확률의 평균으로 최종 결과 결정
- 배깅(Bagging)
- 복원추출 기반 부트스트랩(Bootstrap) 표본을 여러 개 생성해 각각 학습 후 결합
- OOB : 부트스트랩 표본에 선택되지 않은 데이터
- 하나의 데이터가 선택되지 않을 확률은 약 36.8%
- 랜덤포레스트 : 배깅 + 의사결정나무
- 분산 감소, 과적합에 강함
- 블랙박스 모델
- 부스팅(Boosting)
- 잘못 분류된 데이터에 큰 가중치를 주면서 순차적으로 학습
- 이상치에 민감
- AdaBoost, GBM, XGBoost, LightGBM
- 스태킹(Stacking)
- 여러 모델의 예측 결과를 다시 메타 학습기로 학습
- 병렬처리
- 보팅, 배깅, 랜덤포레스트 : 가능
- 부스팅 : 순차 학습이므로 일반적으로 어려움
- 인공신경망
- 퍼셉트론의 등장과 한계
- 인간의 뉴런을 모방한 단층 퍼셉트론의 등장, XOR 문제 해결의 불가
- 가중치는 각 퍼셉트론간 연결 강도를 의미. 곱하고 합 마지막에 편향 더하기
- 다층 퍼셉트론
- 입력층과 출력층 사이에 하나 이상의 은닉층을 삽입한 구조
- 활성함수
- 시그모이드 함수를 통한 비선형 문제 해결
- 인공신경망의 특징
- 블랙박스 모델
- 은닉층 수와 노드 수는 사용자가 직접 설정하는 하이퍼파라미터
- 은닉층 수가 많아지면 복잡한 문제 해결 가능하지만, 과적합 위험 증가
- 은닉층 수가 적어지면 복잡한 패턴 학습 문제에서 과소적합 가능성
- 인공신경망 학습 방법
- 순전파(피드포워드) : 정보가 전방으로 전달
- 역전파 알고리즘 : 가중치를 수정하여 손실함수의 값을 줄임, 활성함수의 미분 활용
- 경사하강법 : 경사의 내리막길로 이동하여 오차가 최소가 되는 최적의 해를 찾는 기법, 편미분 활용
- 기울기 소실 문제
- 다수의 은닉층에서 시그모이드 함수 사용 시 학습이 제대로 되지 않는 문제
- 활성함수와 손실함수
- 은닉층에서의 활성함수 : 인공신경망의 선형성을 극복
- 시그모이드 함수 : 0~1 사이의 확률 값을 가지며, 로지스틱 회귀 분석과 유사
- 하이퍼볼릭 탄젠트(Tanh) 함수 : -1~1 사이 값, 시그모이드 함수의 기울기 소실문제를 지연
- ReLU 함수 : 기울기 소실문제를 극복,
- 출력층에서의 활성함수
- 시그모이드 함수 : 이진분류 모델, 0~1 사이 확률
- 소프트맥스 함수 : 다중분류 모델, 확률의 총합이 1
- 손실함수 : 예측값과 실제값의 차이를 측정하는 함수
- MSE(Mean Square Error) : 회귀 모델
- 크로스 엔트로피(Cross-Entropy) : 분류 모델
- 은닉층에서의 활성함수 : 인공신경망의 선형성을 극복
- 퍼셉트론의 등장과 한계
- 분류모델 평가지표
- 오분류표(혼동행렬)
| 실제 TRUE | 실제 FALSE | |
|---|---|---|
| 예측 TRUE | TRUE POSITIVE (TP) | FALSE POSITIVE (FP) |
| 예측 FALSE | FALSE NEGATIVE (FN) | TRUE NEGATIVE (TN) |
- 예측과 실제가 같으면 TRUE, 예측이 TRUE면 POSITIVE
- 평가지표
| 지표 | 계산식 |
|---|---|
| 정밀도(Precision) | |
| 재현율(Recall) | |
| 특이도(Specificity) | |
| 정확도(Accuracy) | |
| FP Rate (False Alarm Rate) | |
| F-1 Score | |
| F- Score |
- 재현율(Recall) : 민감도(Sensitivity), TP Rate, Hit Rate라고도 함
- F1-Score : Precision과 Recall의 조화평균
- Precision과 Recall은 Trade-off 관계
- F- Score
- : 재현율(Recall)에 큰 비중
- : 정밀도(Precision)에 큰 비중
- : F1-Score와 동일
- ROC Curve
- 가로축 : 1-특이도(FPR)
- 세로축 : 민감도(TPR)
- 그래프 면적(AUC)은 0.5~1 사이이며, 1에 가까울수록 모델의 성능이 좋다고 평가
- 이익도표(Lift Chart)
- 임의로 나눈 각 등급별로 반응률, 리프트 등의 정보를 산출하여 나타내는 도표
- 향상도 곡선 : 이익도표를 시각화한 곡선
군집분석
- 군집분석
- 비지도학습으로 데이터들간 거리나 유사성을 기준으로 군집을 나누는 분석
- 계층적 방법 : 데이터간 유사성을 기준으로 군집을 생성, 덴드로그램
- 비계층적 방법 : 계층적 방법 외 군집분석 방법
- 거리 측정 방식
- 데이터 간 거리 측정 방식
- 연속형 변수
- 유클리디안 거리 : 두 점 사이의 직선 거리
- 맨해튼 거리 : 각 변수들의 차이의 단순 합
- 체비셰프 거리 : 변수 거리 중 최대값
- 민코우스키 거리 : 유클리드, 맨해튼 거리를 일반화한 거리
- 마할라노비스 거리 : 표준화 과정에서 변수의 상관관계를 고려
- 표준화 거리 : 변수의 스케일을 맞춘 뒤 거리 계산
- 범주형 변수
- 자카드 유사도 :
- 코사인 유사도 :
- 연속형 변수
- 군집 간 거리 측정 방식
- 최단 연결법(단일 연결법) : 군집 간 가장 가까운 데이터 사이의 거리
- 최장 연결법(완전 연결법) : 군집 간 가장 먼 데이터 사이의 거리
- 평균 연결법 : 군집의 모든 데이터들의 평균 거리
- 중심 연결법 : 두 군집의 중심 간 거리
- 와드 연결법 : 두 군집을 합쳤을 때 군집 내 제곱합이 최소가 되는 위치
- 데이터 간 거리 측정 방식
- K평균 군집화(K-means Clustering)
- 비계층적 군집화 방법으로 거리 기반
- 특징
- 군집의 수 K를 사전에 지정
- 초기 중심점 설정에 따라 군집 결과가 달라질 수 있음
- 이상치나 초기 중심점 설정에 민감
- 과정
- 군집의 개수 K 설정
- Elbow Method를 활용하여 최적의 K 설정
- 임의로 K개의 초기 중심점 설정
- 데이터를 가장 가까운 중심점의 군집에 할당
- 데이터의 평균으로 중심점 재설정
- 중심점의 위치가 변하지 않을 때까지 할당과 재설정 반복
- 군집의 개수 K 설정
- K-means의 변형
- K-modes : 범주형 데이터에서 최빈값(mode)을 중심으로 활용
- K-medoids : 실제 데이터의 대표값을 중심점으로 사용하여 이상치에 강건
- DBSCAN
- 비계층적 군집화 방법으로 밀도 기반
- 특징
- 군집 수를 사전에 정하지 않아도 됨
- 노이즈와 이상치에 강함
- Eps와 MinPts를 사전에 설정
- 기타 비계층적 군집분석
- 퍼지군집화
- 확률 기반
- 각 데이터가 특정 군집에 속할 확률을 각각 계산하여 군집화
- EM 알고리즘
- 분포 기반
- Likelihood의 기댓값을 계산하는 E단계와 기댓값 최대화 추정값을 계산하는 M단계를 반복
- 자기조직화지도(SOM)
- 그리드 기반
- 신경망을 활용하여 차원축소를 통해 지도로 형상화하여 군집화하는 방법
- 완전연결 형태를 가지며 순전파 방식만 사용
- 각 노드가 승자가 되기 위한 경쟁 학습
- 퍼지군집화
- 군집분석 평가지표
- 실루엣 계수
- , 범위
- : i번째 데이터와 자신이 속한 군집 내 다른 데이터 포인트들과의 평균 거리
- : i번째 데이터와 가장 가까운 다른 군집 내 데이터 포인트들과의 평균 거리
- WCSS(Within Clusters Sum of Squares)
- 군집 내 데이터와 군집 중심 간 거리의 제곱합
- : 군집의 중심값
- : 클러스터 내에 있는 데이터
- Elbow Method
- 최적의 군집 개수 K를 선택하는 방법
- WCSS 그래프에서 경사가 완만해지는 지점이 최적의 K
- 같은 군집 간에는 응집도가 높고, 다른 군집 간에는 응집도가 낮아야 좋은 모델
- 실루엣 계수
연관분석
- 연관분석
- 항목들 간의 조건-결과로 이루어지는 패턴을 발견하는 기법, 장바구니 분석
- 특징
- 결과가 단순하고 분명함 (IF-THEN)
- 비목적성 분석기법
- 품목 수가 증가할수록 계산량이 기하급수적으로 증가
- 연관분석에 시간 개념을 추가하면 순차패턴분석 수행
- 연관분석의 지표
- 지지도(Support)
- A와 B 품목이 동시에 포함된 거래 비율
- 신뢰도(Confidence)
- A 품목을 구매했을 때 B 품목도 구매할 확률, 조건부 확률
- 향상도(Lift)
- A 품목과 B 품목의 상관성
- 향상도 > 1 : 양의 상관관계
- 향상도 = 1 : 상관없음
- 향상도 < 1 : 음의 상관관계
- 지지도(Support)
- 빈발항목 도출 알고리즘
- Apriori 알고리즘
- 최소 지지도를 만족하는 빈발 항목을 추출하여 연관규칙 분석의 연산량을 줄이는 기법
- 절차
- 빈도수 집합 탐색
- 최소 지지도 확인
- 후보 집합 생성
- 반복 탐색
- 연관규칙 도출
- FP-Growth 알고리즘
- Apriori 알고리즘의 반복 과정을 트리 기반으로 대체하여 연산 효율 향상
- Apriori 알고리즘
adsp 50회 시험 후기
3과목에 시계열 분석 문제가 엄청 많이 나왔었다. 밤 새고 시험을 치뤘는데, 학교 가는길도 멀고 학교 자체가 너무 넓어서 시험보러 가는길이 너무 괴로웠다. 한여름이었는데 온도가 몇도였는지 기억이 나지 않는다. 온몸에 땀 범벅인 상태로 시험을 봤고 속이 별로 좋지 않았다.
시험 난이도는 엄청 어려웠고, 나만 이런 생각을 했던것은 아닌가보다. 시험장에서는 2번째로 나왔었다. 특별히 계산하거나 깊게 고민하거나 이럴게 아닌데 한참 들여다보거나 아예 마킹을 안하고 있는 사람도 많았다. 시험 치고 나서 결과가 어떻게 될지 짐작이 안가서 고민이 많았었다.
사전점수로 합격은 받았는데 커트라인 아슬아슬한 점수였고 예상대로 1,2과목에 비해서 시계열 분석 문제가 너무 많이 나와서 문제가 생소했던 3과목 점수가 많이 낮았다. 합격해서 다행이다.
달력에는 2주간 시험공부를 하겠다고 적어놨지만 행정체험 시간이 오후에 있다보니 공부시간이 자연스럽게 짧아졌고, 다른 일정에 신경쓰는 일도 있어서 벼락치기처럼 되었다. 빅분기 필기랑 내용이 비슷하면서도… 완전히 같은 느낌은 또 아니었다. 이게 지금의 나에게 얼마나 유용한 내용일지는 잘 모르겠으나, 빅분기 필기를 먼저 치르고 다시 adsp를 공부한 덕분에 관련 내용이나 용어나 익숙해졌다는 느낌은 들었고, 다른 공부를 하거나 필요한 상황이 있을때 도움이 되지 않을까 싶다.
시험점수가 높지도 않고, 시험치러 가서 시험장 사진을 찍은것도 아니고… 글에 사진을 올릴만한게 없다. 쉽다고 생각했었는데 힘든 시험이었다. 날이 더워서 행정체험 끝나고 공부하러 가는 길도 너무 힘들었고… 많이 힘들었던 시기에 자격증 하나 더 취득한것에 의미를 두자

Comments