ACID
Atomicity, Consistency, Isolation, Durability — 트랜잭션 신뢰성을 보장하는 4대 속성.
인덱스, 파티셔닝, 뷰, ACID
· Advanced Data Engineering SQL, Q21-27 (pp.10-13)
Learn · Glossary
총 73개 용어
Atomicity, Consistency, Isolation, Durability — 트랜잭션 신뢰성을 보장하는 4대 속성.
인덱스, 파티셔닝, 뷰, ACID
· Advanced Data Engineering SQL, Q21-27 (pp.10-13)
메달리온 아키텍처의 3계층. Bronze=원본 append-only 데이터, Silver=정제·중복제거·정합화된 데이터, Gold=특정 소비자를 위한 비즈니스 수준 집계.
레이크하우스와 메달리온 아키텍처 — Bronze/Silver/Gold 경계 설계
· Why Lakehouse Has Become the Default Conversation / Lake vs DW vs Lakehouse Comparison 1-6 (pp.9-14); 100+ Interview Q4 Medallion Architecture (p.3); 40 System Design Q8 Medallion boundary, Q16 e-commerce warehouse design (pp.5-6, 9-10)
소스 데이터베이스의 삽입·수정·삭제를 추출해 다운스트림에 전달하는 기법. 쿼리 기반(폴링)과 로그 기반(트랜잭션 로그 직접 읽기)으로 나뉜다.
CDC 패턴 — 로그 기반 vs 쿼리 기반 변경 데이터 캡처
· Q9. What are CDC patterns... (pp.5-6); Q18. Design a CDC pipeline... (p.10-11); 100+ Interview Q59 CDC, FAQ 'What is CDC?' (p.19, 30-31)
인자를 순서대로 평가해 처음 나오는 NULL이 아닌 값을 반환하는 함수.
SQL 기초 — JOIN, 집합 연산, NULL과 키
· Basic SQL & Joins, Q1-10 · Q19-20 (pp.2-6, 9-10)
두 테이블의 모든 행 조합(카티션 곱)을 생성하는 조인. 조건 없이 곱셈만큼 행이 늘어난다.
SQL 기초 — JOIN, 집합 연산, NULL과 키
· Basic SQL & Joins, Q1-10 · Q19-20 (pp.2-6, 9-10)
WITH 절로 정의하는, 쿼리 실행 동안만 존재하는 이름 붙은 임시 결과 집합.
SQL 중급 — 집계, 윈도우 함수, CTE
· Intermediate SQL & Aggregations, Q11-18 (pp.7-9) + FAQ
Hub(비즈니스 키)·Link(관계)·Satellite(이력 속성)로 구성된, 감사 가능성과 유연성에 특화된 모델링 방법론.
고급 모델링 패턴 — 스노우플레이크, Data Vault, OBT
· Advanced Patterns, Q29-33 (pp.10-12)
여러 데이터 품질 체크의 결과(체크명, 위반 건수, PASS/FAIL)를 한 행씩 모아 파이프라인 게이팅에 쓰는 결과 테이블.
실전 데이터 품질 체크 — 집계 단위 검증과 파이프라인 게이팅
· Check 6-7 + Wiring all seven checks (pp.11-18)
소스에서 추출한 원본 데이터를 먼저 웨어하우스에 적재하고, 웨어하우스 자체 컴퓨트(SQL/dbt)로 필요할 때 변환하는 데이터 통합 방식.
ELT란 무엇인가 — 클라우드 웨어하우스가 바꾼 변환의 위치
· What Is ELT and Why It Became Popular? / Benefits / Challenges (pp.4-5); ETL vs ELT: The Real Difference — What is ELT? (pp.3-5)
소스에서 데이터를 추출한 뒤, 웨어하우스에 적재하기 전에 별도 처리 서버에서 정제·변환을 마치는 데이터 통합 방식.
ETL이란 무엇인가 — Extract-Transform-Load의 원칙과 한계
· What Is ETL in Data Engineering? / When ETL Works Best / Limitations (pp.2-4); ETL vs ELT: The Real Difference — What is ETL? (pp.2-3)
현재 상태 대신 상태를 변화시킨 모든 이벤트를 저장하고, 현재 상태는 이벤트를 재생해 도출하는 데이터 저장 패턴. 완전한 감사 추적과 임의 시점 재구성을 제공하는 대신 읽기·스토리지·스키마 진화에서 복잡성 비용이 크다.
서빙 레이어 설계 — Materialized View, 사전 집계 테이블, Event Sourcing
· Q13. Materialized view vs pre-computed aggregate table (pp.7-8); Q10. Event Sourcing vs state-based storage (pp.6-7)
배치 계층 없이 모든 데이터를 하나의 스트리밍 파이프라인으로 처리하는 패턴. 재처리는 이벤트 로그 재생으로 수행하며, 코드 발산 문제는 없지만 극단적 규모에서 재생 비용이 커질 수 있다.
데이터 아키텍처 패턴 — Lambda, Kappa, Data Mesh
· Q6. Lambda Architecture (pp.4-5); Q7. Kappa Architecture (p.5); Q11. Data Mesh (pp.6-7); FAQ 'Lambda vs Kappa' (p.20)
현재 행 기준으로 이전(LAG)/이후(LEAD) 행의 값을 가져오는 윈도우 함수.
SQL 중급 — 집계, 윈도우 함수, CTE
· Intermediate SQL & Aggregations, Q11-18 (pp.7-9) + FAQ
배치 계층(정확성, 전체 재처리)과 스피드 계층(저지연, 최근 데이터)을 병렬로 운영하고 서빙 계층에서 병합하는 데이터 아키텍처 패턴. 두 코드베이스 간 로직 불일치(코드 발산)가 대표적 실패 모드다.
데이터 아키텍처 패턴 — Lambda, Kappa, Data Mesh
· Q6. Lambda Architecture (pp.4-5); Q7. Kappa Architecture (p.5); Q11. Data Mesh (pp.6-7); FAQ 'Lambda vs Kappa' (p.20)
쿼리 워크로드를 여러 노드에 분산해 동시에 처리하는 아키텍처. Snowflake, BigQuery 등이 채택한다.
쿼리 최적화와 실전 시나리오
· Scenario-Based & Optimization, Q31-39 (pp.14-17)
목록 조회 쿼리 1번 후 각 항목의 상세를 개별 쿼리 N번으로 가져오는 비효율적 패턴.
쿼리 최적화와 실전 시나리오
· Scenario-Based & Optimization, Q31-39 (pp.14-17)
모든 차원을 미리 조인해 만든 넓고 완전히 역정규화된 서빙용 단일 테이블.
고급 모델링 패턴 — 스노우플레이크, Data Vault, OBT
· Advanced Patterns, Q29-33 (pp.10-12)
웨어하우스에서 변환이 끝난 데이터를 다시 운영 SaaS 툴(CRM, 마케팅 자동화 등)로 동기화하는 패턴. Gold 계층 이후의 서빙 경계에 위치하며, 동기화 빈도와 충돌 해결, 증분 변경 감지가 핵심 설계 요소다.
ETL/ELT 선택 기준, 툴 지형, 그리고 Reverse ETL
· How to Choose (pp.12-13); The Real Difference — Real-World Guide & Tools You Will See (pp.8-9); 40 System Design Q12 Reverse ETL (pp.7-8)
쿼리 조건이 인덱스를 활용할 수 있는 형태로 작성되었는지를 가리키는 개념.
SQL 심화 기술 — Upsert, PIVOT, 샤딩, Sargability
· Technical Deep Dive, Q41-50 (pp.17-20)
시간에 따라 변하는 차원 테이블 속성값을 다루는 설계 패턴. Type 0~6까지 여러 유형이 있다.
SCD와 이력 관리
· SCDs & History Tracking, Q21-28 (pp.7-10)
같은 테이블을 서로 다른 별칭으로 두 번 참조해 조인하는 기법. 재귀적 관계 표현에 쓰인다.
SQL 기초 — JOIN, 집합 연산, NULL과 키
· Basic SQL & Joins, Q1-10 · Q19-20 (pp.2-6, 9-10)
두 결과 집합을 중복 제거 없이 그대로 이어 붙이는 집합 연산자. UNION보다 빠르다.
SQL 기초 — JOIN, 집합 연산, NULL과 키
· Basic SQL & Joins, Q1-10 · Q19-20 (pp.2-6, 9-10)
고유 키가 있으면 갱신(Update), 없으면 삽입(Insert)하는 데이터베이스 연산.
SQL 심화 기술 — Upsert, PIVOT, 샤딩, Sargability
· Technical Deep Dive, Q41-50 (pp.17-20)
별도의 변환 파이프라인을 구축하지 않고, 데이터가 있는 곳에서 직접 쿼리하거나 지속적으로 복제/스트리밍해 접근하는 데이터 통합 접근 방식. 데이터 전략이 아니라 접근 패턴으로 이해해야 한다.
Zero ETL — 접근 패턴이지 전략이 아니다
· What Is Zero ETL and Why It Feels So Appealing? / Where It Can Quietly Cause Problems / How Beginners Should Think About It (pp.5-7)
엔티티와 관계만 상위 수준에서 정의하는 데이터 모델. 특정 DB 엔진과 무관하다.
데이터 모델링 기초 — 개념/논리/물리 모델, 정규화와 역정규화
· Core Concepts & Fundamentals, Q1-5 (pp.1-3) + SQL doc Q28-29
동일한 기반 테이블에 의존하는 다수의 Materialized View가, 그 테이블의 데이터 변경 한 번으로 동시에 재구축되며 웨어하우스 컴퓨트를 포화시키는 현상.
서빙 레이어 설계 — Materialized View, 사전 집계 테이블, Event Sourcing
· Q13. Materialized view vs pre-computed aggregate table (pp.7-8); Q10. Event Sourcing vs state-based storage (pp.6-7)
기본적인 소유권·정의·품질 기준이 갖춰지기 전에 지나치게 많은 도구나 프로세스를 도입해 오히려 복잡도만 늘리는 상태.
레이크하우스 시대의 거버넌스 — 유연성과 통제, 옵저버빌리티
· Lakehouse/Modern Architectures; Observability; Tooling sections (pp.5-10)
쿼리 결과를 물리적으로 저장해 두고 필요 시 갱신하는 뷰. 일반 뷰보다 읽기 성능이 좋다.
인덱스, 파티셔닝, 뷰, ACID
· Advanced Data Engineering SQL, Q21-27 (pp.10-13)
그레인을 구성하는 키 조합이 두 번 이상 나타나는 상태. GROUP BY + HAVING COUNT(*) > 1로 탐지한다.
웨어하우스 실전 이슈와 흔한 모델링 실수
· Warehouse Design & Real-World Scenarios, Q44-50 (pp.16-18)
팩트 테이블의 한 행이 나타내는 세부 수준. 차원 모델링에서 가장 먼저, 명확히 정해야 하는 결정이다.
스타 스키마와 차원 모델링 기초
· Star Schema & Dimensional Modeling, Q11-14, 17-18 (pp.4-7) + SQL doc Q30
속성, 데이터 타입, 키를 포함하지만 특정 DB 엔진 구현은 고려하지 않는 데이터 모델.
데이터 모델링 기초 — 개념/논리/물리 모델, 정규화와 역정규화
· Core Concepts & Fundamentals, Q1-5 (pp.1-3) + SQL doc Q28-29
시작과 끝이 정해진 프로세스(주문 접수→배송→배달)를 단계마다 같은 행을 갱신하며 추적하는 팩트 테이블.
스타 스키마와 차원 모델링 기초
· Star Schema & Dimensional Modeling, Q11-14, 17-18 (pp.4-7) + SQL doc Q30
팩트 레코드가 관련 차원 레코드보다 먼저 도착하는 상황. 자리표시 행으로 처리한다.
SCD와 이력 관리
· SCDs & History Tracking, Q21-28 (pp.7-10)
데이터셋의 소유권, 정의, 변경 승인 절차를 정하는 구조. 데이터 품질 체크가 의미를 갖기 위한 전제 조건이다.
데이터 거버넌스와 데이터 품질의 관계 — 소유권이 먼저다
· Data Governance vs Data Quality; Ownership sections (pp.1-5)
데이터 소유권을 중앙 팀에서 도메인 팀으로 분산시키고, 중앙 팀은 셀프서비스 인프라(컴퓨트/카탈로그/거버넌스)만 제공하는 분산형 데이터 아키텍처.
데이터 아키텍처 패턴 — Lambda, Kappa, Data Mesh
· Q6. Lambda Architecture (pp.4-5); Q7. Kappa Architecture (p.5); Q11. Data Mesh (pp.6-7); FAQ 'Lambda vs Kappa' (p.20)
거버넌스 없이 방치된 데이터 레이크가 중복·비일관 스키마·신뢰 불가능한 데이터로 뒤덮여 활용 가치를 잃은 상태.
데이터 레이크란 무엇인가 — 스키마 온 리드와 유연성의 대가
· What Is a Data Lake? / Where Data Lakes Work Really Well / Where Data Lakes Start to Break Down (pp.3-4)
스토리지·컴퓨트 분리를 활용해 카피-온-라이트 스냅샷으로 프로덕션 데이터의 개발/실험용 복제 브랜치를 즉시 만들고 버릴 수 있는 서버리스 DB의 기능.
서버리스 SQL의 실전 이슈 — 콜드 스타트, 커넥션 풀링, 데이터베이스 브랜칭
· Understanding Cold Starts and Connection Limits / The Game-Changer: Database Branching / When Should You Use Serverless? / Popular Serverless Databases (pp.6-11)
별도 차원 테이블 없이 팩트 테이블에 직접 존재하는 차원 키. 주문번호, 영수증 번호 등.
스타 스키마와 차원 모델링 기초
· Star Schema & Dimensional Modeling, Q11-14, 17-18 (pp.4-7) + SQL doc Q30
저렴한 오브젝트 스토리지 위에 오픈 파일 포맷과 ACID 트랜잭션을 결합한 아키텍처. Delta Lake/Iceberg/Hudi가 대표 구현체다.
웨어하우스 설계 실전 — 파티셔닝, 클러스터링, 레이크하우스
· Warehouse Design & Real-World Scenarios, Q39-43 (pp.13-16) + SQL doc Q40
MySQL binlog, Postgres WAL 같은 데이터베이스 트랜잭션 로그를 직접 읽어 모든 변경(삭제 포함)을 낮은 지연시간·낮은 소스 부하로 포착하는 CDC 방식.
CDC 패턴 — 로그 기반 vs 쿼리 기반 변경 데이터 캡처
· Q9. What are CDC patterns... (pp.5-6); Q18. Design a CDC pipeline... (p.10-11); 100+ Interview Q59 CDC, FAQ 'What is CDC?' (p.19, 30-31)
레이크하우스 데이터를 Bronze(원본)-Silver(정제)-Gold(비즈니스 집계) 3계층으로 조직화하는 설계 패턴. Databricks가 대중화했지만 지금은 벤더 중립적인 일반 용어로 쓰인다.
레이크하우스와 메달리온 아키텍처 — Bronze/Silver/Gold 경계 설계
· Why Lakehouse Has Become the Default Conversation / Lake vs DW vs Lakehouse Comparison 1-6 (pp.9-14); 100+ Interview Q4 Medallion Architecture (p.3); 40 System Design Q8 Medallion boundary, Q16 e-commerce warehouse design (pp.5-6, 9-10)
컬럼 타입, 인덱스, 파티셔닝 전략까지 포함한 실제 구현 수준의 데이터 모델.
데이터 모델링 기초 — 개념/논리/물리 모델, 정규화와 역정규화
· Core Concepts & Fundamentals, Q1-5 (pp.1-3) + SQL doc Q28-29
빠르게 변하는 속성만 큰 차원 테이블에서 분리한 작은 별도 차원 테이블.
SCD와 이력 관리
· SCDs & History Tracking, Q21-28 (pp.7-10)
단일 컬럼으로는 유일성을 보장할 수 없을 때 두 개 이상의 컬럼을 조합한 키.
키 설계와 카디널리티
· Core Concepts & Fundamentals, Q6-10 (pp.3-4)
일별 평균 등 집계값이 과거 정상 범위(예: 중앙값의 3배) 밖으로 벗어나는지 검사하는 체크. 행 단위로는 무효하지 않은 값이 만드는 이상을 잡아낸다.
실전 데이터 품질 체크 — 집계 단위 검증과 파이프라인 게이팅
· Check 6-7 + Wiring all seven checks (pp.11-18)
N:M 관계를 두 개의 1:N 관계로 분해하기 위해 팩트와 차원 사이에 두는 연관 테이블.
Kimball 방법론, 컨포밍 디멘션, 브릿지 테이블
· Star Schema & Dimensional Modeling, Q15-16, 19-20 (pp.6-7)
데이터를 여러 개의 독립된 데이터베이스 인스턴스에 수평으로 분산하는 확장 기법.
SQL 심화 기술 — Upsert, PIVOT, 샤딩, Sargability
· Technical Deep Dive, Q41-50 (pp.17-20)
비즈니스적 의미 없이 시스템이 생성하는 식별자. 보통 자동 증가 정수나 UUID를 쓴다.
키 설계와 카디널리티
· Core Concepts & Fundamentals, Q6-10 (pp.3-4)
서버가 존재하지 않는다는 뜻이 아니라, 클라우드 공급자가 서버 프로비저닝·운영·보안을 전담해 사용자가 서버를 신경 쓰지 않아도 되는 운영 모델.
서버리스 SQL 데이터베이스란 — 스토리지·컴퓨트 분리와 스케일-투-제로
· What Makes a Database Serverless / Decoupling Storage and Compute / Scaling to Zero / Instant Elasticity / comparison table (pp.2-6); 100+ Interview Q64 Snowflake architecture, Q66 Serverless, Q14 OLTP vs OLAP (pp.3, 20-21)
사용되지 않는 동안 컴퓨트 리소스를 완전히 종료해 컴퓨트 비용을 0으로 만들고, 스토리지 비용만 부담하는 서버리스 DB의 특성.
서버리스 SQL 데이터베이스란 — 스토리지·컴퓨트 분리와 스케일-투-제로
· What Makes a Database Serverless / Decoupling Storage and Compute / Scaling to Zero / Instant Elasticity / comparison table (pp.2-6); 100+ Interview Q64 Snowflake architecture, Q66 Serverless, Q14 OLTP vs OLAP (pp.3, 20-21)
데이터를 저장하기 전에 정제·검증·구조화를 마치는 방식. 데이터 웨어하우스의 핵심 특성으로, 일관성과 신뢰성을 우선하는 대신 수집 유연성은 낮아진다.
데이터 웨어하우스란 무엇인가 — 스키마 온 라이트와 신뢰의 계약
· What a Data Warehouse Is Designed For? / Where Data Warehouses Work Really Well / Struggle (pp.5-6)
데이터를 저장할 때가 아니라 쿼리할 때 구조를 적용하는 방식. 데이터 레이크의 핵심 특성이며, 수집 속도와 유연성을 높이는 대신 데이터 정합성 보장은 소비 시점의 책임으로 미룬다.
데이터 레이크란 무엇인가 — 스키마 온 리드와 유연성의 대가
· What Is a Data Lake? / Where Data Lakes Work Really Well / Where Data Lakes Start to Break Down (pp.3-4)
데이터가 저장되는 스토리지 계층과 이를 처리하는 컴퓨트 계층을 분리하는 아키텍처. 서버리스 DB의 스케일-투-제로와 순간 탄력성의 기반이 된다.
서버리스 SQL 데이터베이스란 — 스토리지·컴퓨트 분리와 스케일-투-제로
· What Makes a Database Serverless / Decoupling Storage and Compute / Scaling to Zero / Instant Elasticity / comparison table (pp.2-6); 100+ Interview Q64 Snowflake architecture, Q66 Serverless, Q14 OLTP vs OLAP (pp.3, 20-21)
쿼리 옵티마이저가 쿼리를 처리하기 위해 밟을 단계를 인덱스·조인 방식·비용과 함께 보여주는 보고서.
쿼리 최적화와 실전 시나리오
· Scenario-Based & Optimization, Q31-39 (pp.14-17)
LEFT JOIN 후 매칭되지 않은(참조 대상이 NULL인) 행만 남겨 참조 무결성 위반을 찾는 조인 패턴.
실전 데이터 품질 체크 — 행 단위 검증(볼륨·유일성·완전성·참조무결성·유효성)
· Check 1-5 (pp.5-11)
모든 사용자 행동을 entity_id/activity_type/timestamp/JSON feature를 가진 단일 좁은 테이블에 담는 현대적 이벤트 모델링 패턴.
현대적 모델링 패턴 — 역할연기 차원, 액티비티 스키마, 반정형 데이터
· Advanced Patterns, Q34-38 (pp.12-14)
배열이나 반복 필드를 CROSS JOIN을 통해 별도의 행으로 풀어내는 작업.
현대적 모델링 패턴 — 역할연기 차원, 액티비티 스키마, 반정형 데이터
· Advanced Patterns, Q34-38 (pp.12-14)
하나의 물리 차원 테이블이 같은 팩트 테이블 안에서 여러 의미(역할)로 재사용되는 패턴.
현대적 모델링 패턴 — 역할연기 차원, 액티비티 스키마, 반정형 데이터
· Advanced Patterns, Q34-38 (pp.12-14)
신선도, 볼륨, 스키마 드리프트, 사용 패턴 등을 지속적으로 관찰해 이상 징후를 사전에 포착하는 접근. 사전 규칙 강제보다 변화가 빠른 환경에 적합하다.
레이크하우스 시대의 거버넌스 — 유연성과 통제, 옵저버빌리티
· Lakehouse/Modern Architectures; Observability; Tooling sections (pp.5-10)
컬럼별로 다르게 설정하는 허용 가능한 NULL 비율. 전역 규칙이 아니라 컬럼의 중요도에 따라 정한다.
실전 데이터 품질 체크 — 행 단위 검증(볼륨·유일성·완전성·참조무결성·유효성)
· Check 1-5 (pp.5-11)
OVER() 절을 사용해 원본 행을 유지한 채 관련 행 집합에 대한 계산 결과를 덧붙이는 함수.
SQL 중급 — 집계, 윈도우 함수, CTE
· Intermediate SQL & Aggregations, Q11-18 (pp.7-9) + FAQ
비키 컬럼이 기본 키가 아닌 다른 비키 컬럼에 의존하는 관계. 3NF에서 제거 대상이다.
데이터 모델링 기초 — 개념/논리/물리 모델, 정규화와 역정규화
· Core Concepts & Fundamentals, Q1-5 (pp.1-3) + SQL doc Q28-29
여러 저카디널리티 플래그를 하나의 작은 차원 테이블로 묶어 팩트 테이블을 단순하게 유지하는 기법.
고급 모델링 패턴 — 스노우플레이크, Data Vault, OBT
· Advanced Patterns, Q29-33 (pp.10-12)
외래 키가 가리키는 부모 레코드가 항상 실제로 존재하도록 보장하는 제약 조건.
SQL 기초 — JOIN, 집합 연산, NULL과 키
· Basic SQL & Joins, Q1-10 · Q19-20 (pp.2-6, 9-10)
데이터셋이나 도메인에 대해 질문이 생겼을 때 최종 의사결정을 내리는 담당자. 모든 작업을 직접 하지는 않는다.
데이터 거버넌스와 데이터 품질의 관계 — 소유권이 먼저다
· Data Governance vs Data Quality; Ownership sections (pp.1-5)
쿼리 옵티마이저가 그 경계를 넘어 계획을 재구성하지 못하게 막는 지점. 구버전 PostgreSQL의 CTE가 대표적 예다.
SQL 중급 — 집계, 윈도우 함수, CTE
· Intermediate SQL & Aggregations, Q11-18 (pp.7-9) + FAQ
두 엔티티 간의 수치적 관계(1:1, 1:N, N:M).
키 설계와 카디널리티
· Core Concepts & Fundamentals, Q6-10 (pp.3-4)
여러 팩트 테이블·데이터 마트에서 동일한 키와 정의로 공유되는 차원 테이블.
Kimball 방법론, 컨포밍 디멘션, 브릿지 테이블
· Star Schema & Dimensional Modeling, Q15-16, 19-20 (pp.6-7)
유휴 상태로 종료되어 있던 서버리스 컴퓨트가 새 요청을 받아 다시 기동하는 데 걸리는 지연. 사전 예열된 풀이나 경량 마이크로VM으로 완화한다.
서버리스 SQL의 실전 이슈 — 콜드 스타트, 커넥션 풀링, 데이터베이스 브랜칭
· Understanding Cold Starts and Connection Limits / The Game-Changer: Database Branching / When Should You Use Serverless? / Popular Serverless Databases (pp.6-11)
테이블의 물리적 저장 순서 자체를 결정하는 인덱스. 테이블당 하나만 가능하다.
인덱스, 파티셔닝, 뷰, ACID
· Advanced Data Engineering SQL, Q21-27 (pp.10-13)
파티션 내부에서 데이터를 물리적으로 재정렬해 블록 단위 스킵을 가능하게 하는 기법. Snowflake는 마이크로 파티션 프루닝, Redshift는 정렬 키라 부른다.
웨어하우스 설계 실전 — 파티셔닝, 클러스터링, 레이크하우스
· Warehouse Design & Real-World Scenarios, Q39-43 (pp.13-16) + SQL doc Q40
쿼리 필터 조건과 일치하지 않는 파티션을 엔진이 스캔에서 아예 제외하는 최적화 기법.
인덱스, 파티셔닝, 뷰, ACID
· Advanced Data Engineering SQL, Q21-27 (pp.10-13)
숫자 측정값 없이 차원 키만으로 이벤트나 조건을 기록하는 테이블.
Kimball 방법론, 컨포밍 디멘션, 브릿지 테이블
· Star Schema & Dimensional Modeling, Q15-16, 19-20 (pp.6-7)