데이터분석가(Data Analyst)

[패스트캠퍼스 데이터분석 부트캠프 15기] 2주차 학습 블로그_통계를 활용한 데이터 분석

diary536 2024. 6. 27. 17:19

벌써 2주차 학습이 마무리 되어가고 있다! 1주차는 엑셀에서 유용하게 활용 가능한 기능들을 주로 학습 및 실습하였다.

 

2주차는 통계 기초와 통계를 활용한 데이터 분석을 실습해보았다. 통계와 데이터 분석과 어떤 연관성이 있는지 배우고, Raw data들을 선형 회귀분석을 통해 유의미한 데이터를 해석을 도출해 낼 수 있었다.

 

다음은 2주차 학습내용 요약 정리이다:)

 

1. P-value / 귀무가설 및 대립가설

 

P-value은 유의 확률로, 귀무 가설이 맞다는 전제 하에 표본에서 실제로 관측된 통계치와 '같거나 더 극단적인' 통계치가 관측된 확률이다.

 

귀무가설과 대립가설 서로 반대되는 주장의 가설이다. 귀무가설과 대립가설을 아래와 같이 세우고 유의수준은 95%로 설정한다고 가정해보자 :)

1) 귀무가설: 우리가 만든 회귀 모형이 유의미하지 않다.

2) 대립가설: 우리가 만든 회귀 모형이 유의미하지 않다.

 

2. 단순 선형 회귀분석

 

1. 엑셀에서 Raw data를 지정한 뒤 데이터->데이터분석->Regression(회귀분석)을 클릭해준다.

 

2. 아래와 같이 R-squared, t-value, P-value 등의 결과를 얻을 수 있다.

이중 R-squared(결정계수)는 우리가 만든 회귀 모형이 실제 데이터 관계를 얼마나 설명하는지 보여주는 수치로, 아래의 수치가 약 0.397 이기 때문에 40%를 설명하는 회귀 모형이라는 것을 알 수 있다. 

선형방정식을 세우려면 위에서 3번째 표의 Coefficients 값을 확인하면 된다.

Intercept의 Coefficients는 y절편이고, 광고비의 Coefficients의 값은 기울기이다. 이 값을 통해 도출되는 선형 방정식은 y=6.747x+3E+07이다.

 

실제 분산형 그래프를 삽입하여 추세선을 추가하면 동일한 선형 방정식이 나타남을 알 수 있다. 수치들이 선형 방정식에서 멀리 떨어져 있을 수로 상관 관계가 약함을 알 수 있다.

 

 

 

반응형