🛒 시장 바구니 분석(Apriori Algorithm) 완전 정복!
마트에서 과자와 콜라를 함께 샀더니, 다음 날 쿠폰에 치킨이 떴다고요?
알고 보면 다 이유가 있습니다.
바로 시장 바구니 분석 덕분이죠!

안녕하세요! 오늘은 비지도학습의 마지막 주제인 시장 바구니 분석(Apriori 알고리즘)에 대해 쉽고 재밌게 풀어볼게요. 쇼핑몰에서 "이 상품을 구매한 고객은 이런 상품도 함께 샀어요" 같은 추천 보셨죠? 그게 바로 연관 규칙 학습의 대표적인 활용 사례랍니다. Orange Data Mining을 통해 직접 실습도 가능하니까, 끝까지 따라오시면 여러분도 '추천 알고리즘 장인'이 될 수 있어요! 😎 그럼 본격적으로 시작해 볼까요?
목차
1. 시장 바구니 분석이란? 🧺
여러분, 마트에서 장을 볼 때 어떤 패턴으로 물건을 고르시나요? 예를 들어, 우유와 시리얼, 라면과 김치처럼 자주 같이 구매되는 상품들이 있죠. 바로 이런 관계를 찾아내는 것이 시장 바구니 분석(Market Basket Analysis)입니다. 이 분석 기법은 고객의 구매 행태를 이해하고, 상품 진열이나 추천 시스템에 활용되죠.
📌 시장 바구니 분석의 목적
- 고객의 구매 습관을 분석하여 맞춤형 마케팅 전략 수립
- 연관된 제품을 함께 진열해 교차 판매(Cross-selling) 증진
- 개인화된 추천 시스템 구축 (예: "이 상품을 본 고객이 함께 본 상품")
📈 Orange에서의 연관 규칙 분석
Orange Data Mining에서는 'Association Rules' 위젯을 통해 시장 바구니 분석을 손쉽게 시각화할 수 있어요. 다양한 거래 데이터가 주어졌을 때, 어떤 아이템들이 자주 함께 등장하는지를 자동으로 탐색해 보여주죠.
💡 예를 들어볼까요?
예를 들어 1,000개의 거래 데이터에서 ‘맥주’와 ‘기저귀’가 함께 등장하는 비율이 높다면, 그건 단순한 우연이 아니라 연관 규칙일 수 있어요. 마트는 이를 활용해 맥주 옆에 기저귀를 배치할 수도 있죠. 실화입니다.
🧾 시장 바구니 분석이 자주 쓰이는 분야
| 적용 분야 | 활용 사례 |
|---|---|
| 온라인 쇼핑몰 | '이 상품을 본 고객은 이것도 함께 봤어요' 추천 기능 |
| 오프라인 매장 | 상품 진열 전략 수립 (맥주+기저귀 전설 👶🍺) |
| 마케팅 | 이메일 캠페인에 연관 제품 포함 |
이제 감이 좀 오시죠? 😄 그럼 다음 단계에서는 이 시장 바구니 분석의 핵심인 Apriori 알고리즘을 본격적으로 파헤쳐볼게요!
2. Apriori 알고리즘의 핵심 개념 🔍
Apriori 알고리즘은 시장 바구니 분석에서 가장 널리 사용되는 연관 규칙 학습 알고리즘이에요. 이름에서 알 수 있듯이, '사전 지식(apriori knowledge)'을 바탕으로 규칙을 점진적으로 확장해가는 방식이 특징이죠. 복잡해 보이지만, 실제 원리는 아주 간단합니다. 🤓
🧠 Apriori 알고리즘의 작동 방식
- 모든 단일 아이템의 지지도(Support)를 계산한다.
- 지지도가 기준 이상인 아이템만을 남긴다 (최소 지지도: minsup).
- 2개 아이템 조합 → 3개 조합 → 점차 확장하면서 지지도 조건을 만족하는 조합만 추려낸다.
- 남은 아이템 집합으로부터 신뢰도(Confidence)와 향상도(Lift)를 계산해 유용한 규칙을 도출한다.
이 알고리즘의 핵심은 바로 "자주 등장하는 아이템 집합만 규칙으로 고려한다"는 전제에요. 덕분에 계산량을 확 줄일 수 있죠!
📋 간단한 예시로 살펴보기
| 거래 번호 | 구매 품목 |
|---|---|
| T1 | 우유, 빵, 버터 |
| T2 | 빵, 버터 |
| T3 | 우유, 버터 |
이 거래 데이터를 바탕으로 Apriori는 먼저 각 아이템의 지지도를 계산합니다. 그 중 자주 등장하는 조합만 남겨, 예를 들면 "빵 → 버터" 같은 규칙을 만들어 내죠. 이런 방식으로 수많은 거래 데이터에서 의미 있는 구매 패턴을 도출하는 게 핵심입니다.
💬 그럼 왜 'Apriori'일까요?
Apriori는 '사전에 미리 알려진'이라는 뜻의 라틴어에서 왔어요. 이 알고리즘은 작은 아이템 집합에서 큰 집합으로 나아갈 때, 빈번하지 않은 집합은 이후 조합에서도 제외한다는 전제를 두고 시작하죠. 그래서 시간과 계산을 절약하면서도 핵심적인 규칙만 찾아낼 수 있는 거랍니다.
이해가 좀 되셨나요? 😄 이제 다음 Step에서는 Apriori를 이해하는 데 필수인 지지도(Support), 신뢰도(Confidence), 향상도(Lift)라는 개념들을 하나씩 파헤쳐볼 거예요. 준비되셨죠?
3. 지지도, 신뢰도, 향상도란? 📊
Apriori 알고리즘이 작동하려면 반드시 3대 핵심 지표가 필요합니다. 바로 지지도(Support), 신뢰도(Confidence), 향상도(Lift)인데요, 이 세 가지가 있어야 '유의미한 규칙인지'를 판단할 수 있어요. 헷갈릴 수 있으니 하나씩 예시와 함께 정리해볼게요.
📌 지지도 (Support)
지지도는 전체 거래 중 어떤 아이템 조합이 얼마나 자주 등장하는지를 나타냅니다. 예를 들어, 100건의 거래 중 20건에서 ‘우유와 빵’이 함께 구매되었다면?
→ 우유 ∩ 빵의 지지도 = 20 / 100 = 0.2 (20%)
✅ 신뢰도 (Confidence)
신뢰도는 A를 샀을 때 B도 함께 살 확률을 나타냅니다. 예시: 30건의 거래 중 15건에서 ‘우유 → 빵’이 함께 등장했다면?
→ Confidence(우유 → 빵) = 우유 ∩ 빵 / 우유 = 15 / 30 = 0.5 (50%)
📈 향상도 (Lift)
향상도는 A와 B가 함께 나타나는 비율이 우연에 비해 얼마나 높은지를 나타내는 값입니다. 즉, 둘의 관계가 진짜로 의미 있는지 확인하는 지표예요.
→ Lift(우유 → 빵) = Confidence / Support(B) → 0.5 / 0.4 = 1.25 → 1보다 크면 양의 상관관계, 작으면 음의 상관관계!
🧾 정리해볼게요!
| 지표 | 정의 | 의미 |
|---|---|---|
| 지지도 | A ∩ B / 전체 거래 수 | 얼마나 자주 함께 등장하는가 |
| 신뢰도 | A ∩ B / A | A를 샀을 때 B를 살 확률 |
| 향상도 | Confidence / Support(B) | 우연보다 얼마나 더 자주 발생하는지 |
이제 연관 규칙에서 어떤 규칙이 진짜 의미 있고, 어떤 건 무시해야 할지를 판단할 수 있겠죠? 다음 Step에서는 Orange를 이용해 실제로 이 분석을 수행해보는 실습으로 들어가요. 직접 해보면 이 개념들이 더 쏙쏙 들어올 거예요!
4. Orange로 연관 규칙 실습하기 🍊
드디어 이론은 끝! 이제 Orange Data Mining을 활용해서 연관 규칙 분석을 실제로 해보는 시간입니다. 설치도 간단하고 노코드 기반이라 초보자도 클릭 몇 번이면 Apriori 분석을 끝낼 수 있어요. 자, 따라와 보세요! 🧑💻
🛠️ 준비 단계: 데이터 로딩
- Orange 실행 후, File 위젯을 추가합니다.
- 샘플 데이터로 Market Basket 데이터를 선택하거나, CSV로 거래 데이터를 불러옵니다.
- Transpose 위젯을 사용해 아이템-거래 형태로 변환합니다.
🧮 Association Rules 위젯 연결
- Association Rules 위젯을 연결합니다.
- min support(최소 지지도)와 min confidence(최소 신뢰도)를 설정하세요. 예: 0.2, 0.5
- Run 버튼을 누르면 연관 규칙이 쫘르륵 나옵니다!
📊 시각화로 규칙 해석하기
- Association Rules 위젯 결과를 더블 클릭하면, 규칙 리스트와 각 지표(Support, Confidence, Lift 등)를 볼 수 있어요.
- Scatter Plot 위젯을 연결하면, 규칙들의 관계를 시각적으로 확인할 수 있습니다.
🧾 예시 규칙
| 규칙 | 지지도 | 신뢰도 | 향상도 |
|---|---|---|---|
| {우유} → {시리얼} | 0.3 | 0.7 | 1.5 |
| {빵} → {버터} | 0.25 | 0.6 | 1.2 |
이렇게 Orange에서는 클릭 몇 번으로도 충분히 강력한 연관 규칙 분석이 가능해요! 이제 우리가 배운 Apriori 알고리즘과 지표들을 실제 데이터에 적용해볼 수 있겠죠? 😉
5. 실전 예제로 보는 적용 사례 💼
시장에서 Apriori 알고리즘 기반 시장 바구니 분석은 단순히 슈퍼마켓에서만 쓰이는 게 아니에요. 이 기법은 정말 다양한 분야에서 고객 행동을 분석하고 매출을 끌어올리는 핵심 도구로 활용되고 있답니다. 아래에서 실제 적용 사례들을 하나씩 만나보세요!
🛒 1. 오프라인 유통매장 – 상품 진열 전략
한 대형마트에서는 고객들이 자주 같이 사는 품목 조합을 분석해 상품 진열을 재배치했어요. 예를 들어 라면과 김치, 콜라와 치킨을 가까운 곳에 배치했더니, 해당 품목 매출이 15% 이상 증가했다고 합니다. 실제로 우리는 가깝게 놓인 상품을 더 자주 구매하죠.
🛍️ 2. 온라인 쇼핑몰 – 추천 시스템
‘이 상품을 구매한 고객은 이런 상품도 함께 구매했습니다’ 👀 이 문장, 다들 본 적 있으시죠? 이것도 연관 규칙 기반 추천 알고리즘입니다. 예컨대 쇼핑몰에서 ‘유모차를 산 사람은 기저귀도 함께 샀다’는 패턴을 발견해 기저귀를 추천해주는 거예요.
💳 3. 금융 – 신용카드 이상 거래 탐지
신용카드 회사에서도 연관 규칙 분석이 유용하게 쓰입니다. 고객들의 일반적인 카드 사용 패턴을 학습해, 일반적이지 않은 조합이 발생했을 때 이상 거래로 의심하는 거죠. 예: 한 고객이 평소엔 카페와 편의점만 이용하던 사람이었는데, 갑자기 해외 전자상거래와 귀금속 매장을 동시에 결제? 이상 징후일 수 있겠죠!
🧬 4. 헬스케어 – 병원 진료 패턴 분석
병원에서는 연관 규칙을 활용해 질병과 처방의 상관관계를 분석합니다. 예: 고혈압 환자는 고지혈증 약도 함께 처방받는 경우가 많다 → 함께 관리해야 할 질환이라는 시사점을 도출할 수 있어요. 이는 진료 가이드라인 개선이나 예방적 진단에도 큰 도움이 됩니다.
🧾 다양한 적용 가능성 요약
| 분야 | 활용 사례 |
|---|---|
| 유통 | 상품 진열 및 패키지 판매 전략 |
| 전자상거래 | 개인화 추천 및 구매 유도 |
| 의료 | 질병군/처방군 분석 및 진료 가이드 개선 |
| 보안/금융 | 비정상 거래 탐지 및 사기 방지 |
이처럼 Apriori 알고리즘은 생각보다 훨씬 더 다양한 곳에서 우리의 삶에 영향을 주고 있답니다. 다음 Step에서는 이 분석이 실제 비즈니스 인사이트로 어떻게 연결되는지, 즉 데이터를 통해 어떻게 돈이 되는 인사이트를 얻을 수 있는지를 살펴보겠습니다! 💸
6. 데이터로 돈 버는 인사이트 만들기 💡
지금까지 Apriori 알고리즘의 원리와 실습, 적용 사례까지 살펴봤죠? 그렇다면 이제 진짜 중요한 질문! “이걸로 어떻게 돈을 벌 수 있을까?”입니다. 데이터는 그 자체로 가치가 있는 게 아니라, 인사이트로 연결되어야 비로소 의미가 생겨요. 이번에는 시장 바구니 분석이 어떻게 비즈니스 전략과 수익 창출로 이어지는지 살펴볼게요.
📦 1. 번들 패키지 전략 기획
고객이 자주 함께 구매하는 상품을 묶어서 패키지 상품으로 구성해 판매해보세요. 예: ‘핫도그 + 머스터드 소스 + 탄산음료’ → 세트 구성으로 구매 전환율 2배 상승 효과도 가능해요.
🎯 2. 마케팅 타겟팅 정확도 향상
연관 규칙을 통해 고객의 구매 성향을 분석하면, 광고 타겟을 세밀하게 분류할 수 있어요. 예: ‘다이어트 식품’과 함께 ‘홈트 용품’을 자주 사는 고객 → 피트니스 관련 광고 타겟으로 분류!
📊 3. 매장 진열 최적화로 구매 유도
자주 함께 구매되는 상품을 가까운 매대에 배치하면, 소비자 행동에 큰 영향을 줍니다. 예: 커피 필터 근처에 드립 커피 가루를 배치 → 무심코 집어가는 상품 증가 이건 오프라인뿐 아니라 이커머스에서도 ‘연관 상품 섹션’으로 동일하게 작동합니다.
🧠 4. 고객 이탈 예측과 보상 전략
갑자기 기존에 구매하던 연관 상품 조합이 끊긴 고객? 뭔가 이상하죠! 패턴의 단절은 곧 고객의 이탈 신호일 수 있어요. 이럴 때, 할인 쿠폰이나 리마인드 메시지를 발송하면 이탈 방지를 유도할 수 있죠.
💡 핵심은 '연결'입니다.
Apriori 알고리즘을 통해 얻게 되는 규칙들은 단순한 데이터 통계가 아니라 비즈니스 전략의 뼈대가 될 수 있어요. 이 규칙이 어떤 고객 행동을 설명하고, 그것이 어떤 전략으로 이어질 수 있는지 고민하는 것! 그게 바로 데이터로 돈을 버는 관점입니다. 💸
🔚 마무리: 연관 규칙으로 세상을 읽는 법
여기까지 따라오셨다면 이제 Apriori 알고리즘과 시장 바구니 분석이 어떤 방식으로 작동하고, 어떻게 비즈니스에 진짜 도움이 되는지 확실히 이해하셨을 거예요. 단순한 데이터 숫자들의 나열이 아니라, 그 안에서 고객의 마음을 읽고 행동을 예측하는 힘, 바로 그것이 연관 규칙 학습의 진짜 매력이죠.
Orange Data Mining처럼 쉬운 툴을 통해 누구나 이 강력한 분석 기법을 손쉽게 경험할 수 있는 시대입니다. 초보자도 클릭 몇 번으로 데이터를 시각화하고, 지지도를 조정하면서 결과를 눈으로 확인할 수 있죠. 이제 남은 건 단 하나! 여러분의 비즈니스에 직접 적용해 보는 겁니다. 데이터를 믿고, 실험하고, 피드백을 받아 최적의 규칙을 찾아가세요. 그게 바로 성장의 첫걸음이에요. 😊
🔖 이 글의 핵심 요약
- 시장 바구니 분석은 고객의 구매 패턴을 분석하는 강력한 비즈니스 도구입니다.
- Apriori 알고리즘은 연관 규칙 도출에 가장 널리 쓰이며, 지지도/신뢰도/향상도로 유용성을 판단합니다.
- Orange를 활용하면 코드 없이도 누구나 쉽고 직관적으로 연관 규칙 분석을 실행할 수 있어요.
'OrangeDataMining' 카테고리의 다른 글
| 강화학습의 핵심 요소: Agent, Environment, Reward, Policy (1) | 2025.04.29 |
|---|---|
| 강화학습 개요 및 지도학습과의 차이점 완전 정복 (0) | 2025.04.28 |
| 연관 규칙 학습(Association Rule Learning) 완전 정복 (0) | 2025.04.28 |
| t-SNE 개념과 데이터 시각화 (1) | 2025.04.27 |
| 주성분 분석(PCA) 개념과 적용 (0) | 2025.04.26 |