3단계 네임스페이스 (three-level namespace)
Unity Catalog에서 테이블을 가리킬 때 쓰는 `catalog.schema.table` 표기법. Catalog(부서)→Schema(방)→Table(파일) 계층을 그대로 반영한다.
Unity Catalog: 거버넌스 계층 구조
· Core Architecture & Fundamentals, Q10 (pp.4-5) 및 beginner guide 'Unity Catalog and Schema in Databricks' (pp.11-12) + FAQ 'What is Unity Catalog in Databricks?' (p.19)
Adaptive Query Execution (AQE)
Spark 3.0부터 제공되는 기능으로, 실행 중 실제 데이터 통계를 바탕으로 셔플 파티션 병합, 조인 전략 전환, 스큐 조인 분할을 자동으로 수행한다.
Spark 성능 최적화 기초: Shuffle, Broadcast Join, AQE, Data Skew
· Performance Tuning & Optimization, Q31-Q36 (pp.11-12) 및 Q45 시나리오 (pp.14-15)
Auto Loader
클라우드 스토리지에 도착하는 신규 파일을 `cloudFiles` 포맷의 Structured Streaming으로 증분 처리하는 Databricks 기능. 디렉터리 리스팅 또는 파일 알림 방식을 지원한다.
메달리온 아키텍처와 Auto Loader 기반 수집
· Data Engineering & ETL Pipelines, Q21-Q23, Q29 (pp.8-9, 11) 및 beginner guide 'Project: E-Commerce Customer Reviews Pipeline' (pp.13-19)
Change Data Feed (CDF)
Delta 테이블의 커밋마다 행 단위 삽입·삭제·업데이트(전후 값 포함)를 기록·출력하는 기능. 증분 다운스트림 처리에 사용된다.
선언형 파이프라인(구 Delta Live Tables)과 증분 처리 패턴
· Data Engineering & ETL Pipelines, Q24-Q28, Q19-Q20 (pp.8-11)
Compute Plane (Data Plane)
실제 Spark 처리가 실행되는 계층. 클래식 컴퓨트는 고객의 VPC/VNet 안에서 실행되고, 서버리스 컴퓨트는 Databricks가 관리하는 별도 플레인에서 실행된다.
Databricks의 3-Plane 아키텍처 (Control / Compute / Storage)
· Core Architecture & Fundamentals, Q3 (pp.2-3)
Control Plane
Databricks의 클라우드 계정에서 호스팅되는 관리 계층. 웹 UI, 노트북 관리, 워크스페이스 설정, 잡 스케줄링 메타데이터를 담당한다.
Databricks의 3-Plane 아키텍처 (Control / Compute / Storage)
· Core Architecture & Fundamentals, Q3 (pp.2-3)
Databricks Asset Bundles (DABs)
코드, 잡, 클러스터, 설정을 하나의 배포 단위(번들)로 정의해 CLI로 여러 환경(Dev/QA/Prod)에 배포할 수 있게 하는 Databricks의 IaC 도구.
Jobs & Workflows 운영: 스케줄링, CI/CD, 프로덕션 장애 대응
· Operations, Security & Scenarios, Q41-Q44 (pp.13-15) 및 beginner guide 'Jobs & Workflows in Databricks' (pp.12-13)
Databricks Repos
Git 저장소(GitHub, GitLab, Azure DevOps 등)를 워크스페이스에 직접 연결해 브랜치·커밋·PR 같은 표준 Git 워크플로우를 노트북에 적용할 수 있게 하는 기능.
워크스페이스와 노트북 협업
· Workspace in Databricks (pp.6-7) 및 인터뷰 문항 Q8 'What languages can you use in a Databricks notebook?' (p.4)
Databricks Runtime (DBR)
Databricks 클러스터에서 실제로 실행되는 소프트웨어 스택. Apache Spark를 기반으로 최적화된 커넥터, 라이브러리, 실행 엔진(Photon)을 포함한다.
Databricks란 무엇인가 — Lakehouse 아키텍처 개요
· Core Architecture & Fundamentals, Q1-Q2 (pp.2) 및 FAQ 'What is Databricks and why do data engineers use it?' (p.18)
DBFS (Databricks File System)
클라우드 오브젝트 스토리지 위에 Unix 스타일 파일 경로를 매핑해주는 추상화 계층. 현재는 프로덕션 데이터 저장보다 편의성 목적으로만 권장된다.
스토리지 레이어: DBFS와 클라우드 오브젝트 스토리지
· Core Architecture & Fundamentals, Q7 (pp.4) 및 beginner guide 'Storage Layer in Databricks' (pp.9-10)
DBU (Databricks Unit)
Databricks에서 컴퓨트 처리 능력과 비용을 측정하는 표준 단위. VM 유형·티어·컴퓨트 종류에 따라 요율이 달라진다.
클러스터 종류와 DBU 과금 모델
· Core Architecture & Fundamentals, Q5-Q6 (pp.3-4)
Delta Log
Delta Lake가 테이블에 가해진 모든 변경을 기록하는 JSON 기반 트랜잭션 로그. ACID 보장과 타임트래블의 기반이 된다.
Delta Lake 핵심 개념 (Databricks 플랫폼 이해에 필요한 만큼만)
· Delta Lake & Storage, Q11-Q18 (pp.5-8)
Dynamic File Pruning (DFP)
큰 테이블과 필터링된 작은 테이블을 조인할 때, 작은 테이블의 필터 결과를 런타임에 활용해 큰 테이블에서 읽을 파일을 추가로 줄이는 최적화.
디버깅과 모니터링: Spark UI, Spill, 파티션 크기, 작은 파일 문제
· Performance Tuning & Optimization, Q36-Q39, Q47, Q49-Q50 (pp.11-17)
Job Cluster
예약된 작업(Job) 실행을 위해 자동으로 생성·종료되는 클러스터. All-Purpose Cluster보다 낮은 DBU 요율이 적용된다.
클러스터 종류와 DBU 과금 모델
· Core Architecture & Fundamentals, Q5-Q6 (pp.3-4)
Lakeflow Declarative Pipelines
Databricks의 선언형 ETL 파이프라인 프레임워크의 현재 공식 명칭. 과거 'Delta Live Tables(DLT)'로 불렸으며 2024~2025년 Lakeflow 재편을 거쳤다.
선언형 파이프라인(구 Delta Live Tables)과 증분 처리 패턴
· Data Engineering & ETL Pipelines, Q24-Q28, Q19-Q20 (pp.8-11)
Lakehouse
데이터 레이크의 저비용 유연성과 데이터 웨어하우스의 ACID 트랜잭션·거버넌스를 결합한 아키텍처 패턴. Databricks에서는 Delta Lake가 이를 구현하는 스토리지 레이어다.
Databricks란 무엇인가 — Lakehouse 아키텍처 개요
· Core Architecture & Fundamentals, Q1-Q2 (pp.2) 및 FAQ 'What is Databricks and why do data engineers use it?' (p.18)
pandas API on Spark (pyspark.pandas)
pandas와 유사한 API를 분산 환경에서 쓸 수 있게 하는 PySpark 내장 모듈. 과거 독립 프로젝트였던 Koalas가 Spark 3.2부터 여기에 병합되었다.
Databricks Runtime과 Photon 엔진
· Core Architecture & Fundamentals, Q4 (pp.3-4) 및 Performance Tuning & Optimization, Q40 (p.11) + FAQ 'What is Photon in Databricks?' (p.19)
Photon
Databricks가 C++로 새로 작성한 네이티브 벡터화 실행 엔진. 표준 JVM 기반 Spark 엔진을 대체/보완하며 SQL·DataFrame 워크로드를 가속한다.
Databricks Runtime과 Photon 엔진
· Core Architecture & Fundamentals, Q4 (pp.3-4) 및 Performance Tuning & Optimization, Q40 (p.11) + FAQ 'What is Photon in Databricks?' (p.19)
Rescued Data Column
Auto Loader가 예상 스키마와 맞지 않는 데이터를 유실시키지 않고 별도로 담아두는 컬럼.
메달리온 아키텍처와 Auto Loader 기반 수집
· Data Engineering & ETL Pipelines, Q21-Q23, Q29 (pp.8-9, 11) 및 beginner guide 'Project: E-Commerce Customer Reviews Pipeline' (pp.13-19)
Secret Scope
API 키 등 민감한 자격 증명을 코드에 노출하지 않고 저장·참조할 수 있게 하는 Databricks의 시크릿 관리 단위. Databricks-backed 또는 Azure Key Vault-backed로 만들 수 있다.
시크릿 관리와 PII 데이터 보호
· Core Architecture & Fundamentals, Q9 (pp.4-5) 및 Operations, Security & Scenarios, Q46, Q48 (pp.14-16)
Shuffle
groupBy·join·distinct 같은 넓은 변환에서 같은 키의 데이터를 같은 executor로 재배치하는 과정. 직렬화·디스크 I/O·네트워크 전송을 수반해 Spark에서 가장 비용이 큰 연산이다.
Spark 성능 최적화 기초: Shuffle, Broadcast Join, AQE, Data Skew
· Performance Tuning & Optimization, Q31-Q36 (pp.11-12) 및 Q45 시나리오 (pp.14-15)
Spill (to Disk)
태스크에 할당된 데이터가 executor 메모리를 초과해 로컬 디스크에 넘쳐 쓰이는 현상. 디스크 I/O가 느려 작업 속도를 크게 저하시킨다.
디버깅과 모니터링: Spark UI, Spill, 파티션 크기, 작은 파일 문제
· Performance Tuning & Optimization, Q36-Q39, Q47, Q49-Q50 (pp.11-17)
Unity Catalog
Databricks Lakehouse 전반의 데이터·AI 자산에 대한 어카운트 레벨 통합 거버넌스 솔루션. ACL, 데이터 리니지, 감사를 여러 워크스페이스에 걸쳐 관리한다.
Unity Catalog: 거버넌스 계층 구조
· Core Architecture & Fundamentals, Q10 (pp.4-5) 및 beginner guide 'Unity Catalog and Schema in Databricks' (pp.11-12) + FAQ 'What is Unity Catalog in Databricks?' (p.19)
Unity Catalog Volumes
정형화되지 않은 파일(이미지, 문서 등)을 Unity Catalog의 거버넌스 체계 안에서 관리할 수 있게 하는 스토리지 객체. DBFS 마운트의 최신 대안이다.
스토리지 레이어: DBFS와 클라우드 오브젝트 스토리지
· Core Architecture & Fundamentals, Q7 (pp.4) 및 beginner guide 'Storage Layer in Databricks' (pp.9-10)
Workflow
여러 태스크(노트북 등)를 순서대로 연결해 실행하는 Databricks의 오케스트레이션 단위. 현재는 'Lakeflow Jobs' 제품군의 일부로도 불린다.
Jobs & Workflows 운영: 스케줄링, CI/CD, 프로덕션 장애 대응
· Operations, Security & Scenarios, Q41-Q44 (pp.13-15) 및 beginner guide 'Jobs & Workflows in Databricks' (pp.12-13)
Z-Ordering
특정 컬럼 기준으로 관련 데이터를 같은 파일에 모아 데이터 스킵 효율을 높이는 데이터 레이아웃 최적화 기법. OPTIMIZE와 함께 사용한다.
Delta Lake 핵심 개념 (Databricks 플랫폼 이해에 필요한 만큼만)
· Delta Lake & Storage, Q11-Q18 (pp.5-8)
동적 데이터 마스킹 (Dynamic Data Masking)
Unity Catalog에서 사용자의 권한·그룹에 따라 특정 컬럼 값을 실시간으로 리댁션해 보여주는 컬럼 레벨 보안 기법.
시크릿 관리와 PII 데이터 보호
· Core Architecture & Fundamentals, Q9 (pp.4-5) 및 Operations, Security & Scenarios, Q46, Q48 (pp.14-16)
매직 커맨드 (Magic Command)
노트북 셀 맨 앞에 붙여 그 셀의 실행 언어를 전환하는 지시어. `%python`, `%sql`, `%scala`, `%r`, `%fs` 등이 있다.
워크스페이스와 노트북 협업
· Workspace in Databricks (pp.6-7) 및 인터뷰 문항 Q8 'What languages can you use in a Databricks notebook?' (p.4)
메달리온 아키텍처 (Medallion Architecture)
데이터를 Bronze(원본)→Silver(정제)→Gold(집계) 세 레이어로 점진적으로 정제해나가는 데이터 파이프라인 설계 패턴.
메달리온 아키텍처와 Auto Loader 기반 수집
· Data Engineering & ETL Pipelines, Q21-Q23, Q29 (pp.8-9, 11) 및 beginner guide 'Project: E-Commerce Customer Reviews Pipeline' (pp.13-19)
체크포인트 (Checkpoint)
Structured Streaming 쿼리가 처리 진행 상황을 저장하는 영구 스토리지 디렉터리. 장애 복구 시 정확히 중단 지점부터 재개해 exactly-once 처리를 보장한다.
선언형 파이프라인(구 Delta Live Tables)과 증분 처리 패턴
· Data Engineering & ETL Pipelines, Q24-Q28, Q19-Q20 (pp.8-11)