회귀(regression) 회귀란 ${y=f(x)}$라는 함수를 통해 변수 사이의 관계를 공식화하는 것을 가리킨다. 회귀에서는 ${y=f(x)}$에 대해, ${x}$를 설명변수(explanatory variable) 또는 독립변수, ${y}$를 반응변수(response variable) 또는 종속변수라 한다. 회귀분석에서는 얻은 데이터에 잘 들어맞는 ${f(x)}$를 추정하고, 2개 변수 간 관계를 구한다. 선형회귀(linear regression) 회귀식 ${f(x)}$가 1차 함수 ${y=a+bx}$가 될 때, 이를 선형회귀라고 한다. 회귀식 ${f(x)}$의 형태를 결정하는 파라미터 ${a}$, ${b}$를 회귀계수(regression coefficient)라 한다. 회귀에서도 모집단과 실제 표본의..
전체 글
데이터 분석 관련 지식을 공부하고 포스팅하는 블로그입니다.안녕하세요! 면정입니다. 오랜만에 글을 쓰는 것 같네요ㅎㅎ 저는 현재 GA4를 사용해서 프로젝트를 진행하고 있는데요 프로젝트를 진행하면서 알게 되었거나 공부한 내용에 대해 글을 썼었어요 그런데!! 이번에 좋은 기회로 [Do it! 구글 애널리틱스 4] 책의 서평을 작성하게 되었습니다👏👏👏 사실 저도 GA 사용이 처음이라 문제가 생겼을 때 구글링을 하거나 유튜브를 찾아보며 해결했었어요..ㅎ 그래서 '개념과 활용방법에 대해서 체계적으로 정리가 된 책이 있었으면 좋겠다..'라는 생각을 하던 차에 책을 통해 자세히 공부해 볼 수 있게 되어 매우 기대가 됩니다 1️⃣ 책 소개 ✔데이터를 꿰뚫어 보면 진짜 고객이 보인다! ✔데이터 보는 눈을 길러 주는 GA4 보고서·대시보드 활용법! 사람을 모으고 매출을 올리는 디..
데이터 기반 의사결정(data-driven decision making)은 다음과 같은 순서로 이루어진다. 1. 가설 설정 2. 검증 방법 선택 3. 검증 4. 의사결정 가설 검정(hypothesis testing) 가설검정이란, 분석자가 세운 가설을 검증하기 위한 방법이다. 가설검정에서는 ${p}$값${(p-value)}$이라는 수치를 계산하여 가설을 지지하는지 여부를 판단한다. 예를 들어, 신약의 효과를 검증하기 위해 신약을 투여한 모집단${A}$과 위약을 투여한 모집단${B}$을 비교한다고 가정해 보자. 이때, "신약에 효과가 있다"라는 가설은 평균값이 다르므로 ${\mu_{A}\neq\mu_{B}}$으로 표현할 수 있으며 "신약에 효과가 없다"는 평균값이 동일하므로 ${\mu_{A}=\mu_{B}..
안녕하세요! 면정입니다. 이전 글에서는 웹사이트를 GA에 연결하고 GTM 세팅하는 법에 대해 다루었는데요 이번엔 UTM 파라미터를 만들고 사용자 유입이 잘 되는지 확인해 보겠습니다😊 #2. UTM 파라미터 설정하고 사용자 유입 확인하기 UTM 파라미터란? 먼저 UTM 파라미터란 뭘까요 UTM 파라미터란 'Urchin Tracking Module'의 약자로, 마케팅 캠페인의 추적 및 분석을 위해 사용되는 파라미터입니다. 추적하고자 하는 URL 주소 뒤에 UTM 파라미터를 형식에 맞게 붙여주면 구글 애널리틱스가 UTM 파라미터에 있는 값을 수집하고 이를 통해 유입을 추적할 수 있습니다. UTM 파라미터 규칙 다음은 UTM 파라미터의 요소들입니다. 'utm_source', 'utm_medium', 'utm_c..
통계적 추론은 목적과 방법에 따라 추정(estimation)과 가설검정(hypothesis testing)으로 나눌 수 있습니다. 이번 글에서는 추정에 대해 작성해보겠습니다. 추정량(Estimator) 모집단의 성질을 추정하는 데 사용하는 통계량이다. 미지의 모수로써, $\theta$로 표시하고 모수를 추론하기 위해 표본으로부터 설정한 추정량을 $\hat{\theta}$ 로 표시한다. 1) 점 추정(Point estimation) : $\hat{\theta}$ 표본의 특성치인 통계량을 이용하여 모수의 참값이라고 추정되는 하나의 수치를 결정하는 것. 모집단으로부터 표본을 추출하는 방법은 표본추출 개수와 추출 방법에 따라 무수히 많으면 그 때마다 통계량 또한 달라진다. 점 추정량 선택 기준 불편성/불편의성(..
정규분포(Normal distribution) 평균 ${\mu}$, 표준편차 ${\sigma}$에 대해 연속적인 랜덤변수 ${X}$가 다음과 같은 확률밀도함수를 가지는 경우 정규분포라고 하며 가우시안 분포(Gaussian distribution)라고도 한다. 랜덤 변수 X가 정규분포를 따른다는 것을 다음과 같이 표현한다. 정규분포의 특징 평균 ${\mu}$를 중심으로 한 종형(bell shape)으로, 좌우대칭 분포이다. 평균 ${\mu}$ 근처에 값이 가장 많고, 평균 ${\mu}$에서 멀어질수록 적어진다. 키나 몸무게 등 정규분포로 근사할 수 있는 현상이 많다. 위의 그림에서 알 수 있듯이, 정규분포의 파라미터 ${\mu}$는 분포의 위치를 결정한다. 이와 함께 파라미터 ${\sigma}$는 분포의 ..
안녕하세요! 면정입니다. 운이 좋게도 좋은 분들을 만나 현재까지 이어가고 있는 데이터 분석 스터디가 있는데요 이번에 각자의 웹사이트를 이용해서 GA4 프로젝트를 진행하게 되었습니다 과정을 티스토리에 정리해 보겠습니다 😊 #1. 웹사이트(블로그, oopy 등) 간단하게 만들고 GA4, GTM 세팅하기 연결할 웹사이트 정하기 먼저 웹사이트가 있어야 분석을 하죠! 다른 스터디원 분들은 각자의 티스토리 블로그에 연결하셨고 저는 기존에 만들어 놓은 mbti 테스트 사이트가 있어 여기에 연결했습니다. 웹사이트 링크 : https://hojakjil-test.netlify.app/?utm_source=tistory&utm_medium=page&utm_campaign=communication 나와 찰떡인 에그타르트 찾..
확률분포(Probability distribution) 확률 변수가 특정한 값을 가질 확률을 나타내는 함수를 의미한다. 확률 분포는 확률 변수가 어떤 종류의 값을 가지는가에 따라서 크게 이산확률분포와 연속확률분포 중 하나에 속하며, 둘 중 어디에도 속하지 않는 경우도 존재한다. *이산형 변수와 연속형 변수에 대해 궁금하다면? 👉 데이터의 유형 데이터의 유형 범주형(Categorical) 그룹이나 범주를 나타냄. 예/아니오로 대답할 수 있음 명목형(Nominal) : 순서가 없는 범주형 데이터 (ex. 성별, 종교, 색상 등) 순서형(Ordinal) : 순서가 있는 범주형 데이터 (ex. 사계 rnarnie.tistory.com 1) 이산확률분포(Discrete probability distribution..
변동계수(Coefficient of variation, CV) 두 집단의 산포를 비교할 때, 두 종류의 자료값의 차이가 크거나 측정단위가 다른 두 그룹의 산포를 비교하고자 할 때 유용하게 사용되며, 다음과 같이 정의된다. Q. 소말리아의 1인당 국민소득이 평균=50달러, 표준편차=5이고 북한의 1인당 국민소득이 평균=20달러, 표준편차=5일 때, 소말리아의 개인차가 북한의 개인차보다 크다고 할 수 있는가? A. 두 나라의 표준편차가 같더라도 측정단위가 다르므로 빈부격차에 차이가 없다고 할 수 없다. 이 경우 소말리아의 1인당 국민소득의 변동계수는 10%이고, 북한의 1인당 국민소득의 변동계수는 25%이다. 따라서 북한의 빈부격차가 더 심하다고 볼 수 있다. 공분산(Covariance) 서로 다른 확률변수..
분산(Variance) 먼저 편차란 평균(mean)에 대한 차이이다. 실제 데이터 값이 평균을 기준으로 할 때 얼마나 떨어져 있는 가를 나타내는 값이다. 편차를 모두 합하면 0이 되므로 분산을 구하기 위해서는 편차를 그냥 더하지 않고 제곱해서 더하는 과정을 거친다. 즉, 데이터가 평균에 가까울수록 편차는 작아지므로 분산은 작아지고, 평균과 멀리 떨어져 있을수록 편차는 커지고 분산 또한 증가하게 된다. 위 그림과 같이, 데이터가 좁은 범위에 몰려있으면 분산이 작고, 데이터가 넓은 범위에 퍼져있다면 분산이 크다는 것을 알 수 있다. 표준편차(Standard deviation) 분산을 제곱근한 값이다. 분산은 편차를 제곱하면서 값이 크게 증가한다. 이는 값 자체의 의미를 파악하기 어려운 경향이 있으므로 제곱하..
평균(mean) 집단에서 관측 또는 측정된 수치를 집단의 크기로 나눈 값을 의미하는데, 정확한 용어는 산술평균이다. 산술평균은 아래와 같은 4가지 특징을 가진다. 이상치(outlier)에 영향을 쉽게 받는다 극단적인 값에 취약함을 뜻한다. 예를 들어 {1, 2, 3}에서 평균은 2이고 중간값도 2이다. 하지만 여기에 99를 추가한 {1, 2, 3, 99}의 경우를 살펴보면, 중간값은 2와 3의 평균인 5/2로 약간 높아지지만 평균은 105/4=26.25로 매우 크게 변한다. 그래서 이렇게 극단적인 자료에는 중앙값을 사용하는 것이 좋다. 편차의 합이 0이 된다 분산이 가장 작다 표본 값의 평균이 모집단과 크게 다르지 않다 중앙값(median) 어떤 주어진 값들을 순서대로 정렬했을 때, 가장 중앙에 있는 값..
범주형(Categorical) 그룹이나 범주를 나타냄. 예/아니오로 대답할 수 있음 명목형(Nominal) : 순서가 없는 범주형 데이터 (ex. 성별, 종교, 색상 등) 순서형(Ordinal) : 순서가 있는 범주형 데이터 (ex. 사계절, 만족도 설문조사 결과 등) 수치형(Numerical) 이산형(Discrete) : 연속되지 않는 수치형 데이터이며 셀 수 있다 (ex. 주사위 결과 등) 연속형(Continuous) : 연속되는 수치형 데이터이며 소수점으로 표현이 가능하다 (ex. 몸무게, 시간, 길이 등) 예를 들어, 키가 171.5cm인 사람의 키를 반올림하여 172cm로 기록한 데이터는 이산의 형태를 띄는 것처럼 보이지만 실제로 관측 가능한 값은 연속적인 척도로 주어지기 때문에 연속형이라고 한..