← Databricks 모듈로

Learn · Glossary

Databricks 용어 사전

총 30개 용어

3단계 네임스페이스 (three-level namespace)

Unity Catalog에서 테이블을 가리킬 때 쓰는 `catalog.schema.table` 표기법. Catalog(부서)→Schema(방)→Table(파일) 계층을 그대로 반영한다.
Unity Catalog: 거버넌스 계층 구조 · Core Architecture & Fundamentals, Q10 (pp.4-5) 및 beginner guide 'Unity Catalog and Schema in Databricks' (pp.11-12) + FAQ 'What is Unity Catalog in Databricks?' (p.19)

Adaptive Query Execution (AQE)

Spark 3.0부터 제공되는 기능으로, 실행 중 실제 데이터 통계를 바탕으로 셔플 파티션 병합, 조인 전략 전환, 스큐 조인 분할을 자동으로 수행한다.
Spark 성능 최적화 기초: Shuffle, Broadcast Join, AQE, Data Skew · Performance Tuning & Optimization, Q31-Q36 (pp.11-12) 및 Q45 시나리오 (pp.14-15)

Auto Loader

클라우드 스토리지에 도착하는 신규 파일을 `cloudFiles` 포맷의 Structured Streaming으로 증분 처리하는 Databricks 기능. 디렉터리 리스팅 또는 파일 알림 방식을 지원한다.
메달리온 아키텍처와 Auto Loader 기반 수집 · Data Engineering & ETL Pipelines, Q21-Q23, Q29 (pp.8-9, 11) 및 beginner guide 'Project: E-Commerce Customer Reviews Pipeline' (pp.13-19)

Compute Plane (Data Plane)

실제 Spark 처리가 실행되는 계층. 클래식 컴퓨트는 고객의 VPC/VNet 안에서 실행되고, 서버리스 컴퓨트는 Databricks가 관리하는 별도 플레인에서 실행된다.
Databricks의 3-Plane 아키텍처 (Control / Compute / Storage) · Core Architecture & Fundamentals, Q3 (pp.2-3)

Databricks Asset Bundles (DABs)

코드, 잡, 클러스터, 설정을 하나의 배포 단위(번들)로 정의해 CLI로 여러 환경(Dev/QA/Prod)에 배포할 수 있게 하는 Databricks의 IaC 도구.
Jobs & Workflows 운영: 스케줄링, CI/CD, 프로덕션 장애 대응 · Operations, Security & Scenarios, Q41-Q44 (pp.13-15) 및 beginner guide 'Jobs & Workflows in Databricks' (pp.12-13)

Databricks Repos

Git 저장소(GitHub, GitLab, Azure DevOps 등)를 워크스페이스에 직접 연결해 브랜치·커밋·PR 같은 표준 Git 워크플로우를 노트북에 적용할 수 있게 하는 기능.
워크스페이스와 노트북 협업 · Workspace in Databricks (pp.6-7) 및 인터뷰 문항 Q8 'What languages can you use in a Databricks notebook?' (p.4)

Databricks Runtime (DBR)

Databricks 클러스터에서 실제로 실행되는 소프트웨어 스택. Apache Spark를 기반으로 최적화된 커넥터, 라이브러리, 실행 엔진(Photon)을 포함한다.
Databricks란 무엇인가 — Lakehouse 아키텍처 개요 · Core Architecture & Fundamentals, Q1-Q2 (pp.2) 및 FAQ 'What is Databricks and why do data engineers use it?' (p.18)

DBFS (Databricks File System)

클라우드 오브젝트 스토리지 위에 Unix 스타일 파일 경로를 매핑해주는 추상화 계층. 현재는 프로덕션 데이터 저장보다 편의성 목적으로만 권장된다.
스토리지 레이어: DBFS와 클라우드 오브젝트 스토리지 · Core Architecture & Fundamentals, Q7 (pp.4) 및 beginner guide 'Storage Layer in Databricks' (pp.9-10)

DBU (Databricks Unit)

Databricks에서 컴퓨트 처리 능력과 비용을 측정하는 표준 단위. VM 유형·티어·컴퓨트 종류에 따라 요율이 달라진다.
클러스터 종류와 DBU 과금 모델 · Core Architecture & Fundamentals, Q5-Q6 (pp.3-4)

Job Cluster

예약된 작업(Job) 실행을 위해 자동으로 생성·종료되는 클러스터. All-Purpose Cluster보다 낮은 DBU 요율이 적용된다.
클러스터 종류와 DBU 과금 모델 · Core Architecture & Fundamentals, Q5-Q6 (pp.3-4)

Lakehouse

데이터 레이크의 저비용 유연성과 데이터 웨어하우스의 ACID 트랜잭션·거버넌스를 결합한 아키텍처 패턴. Databricks에서는 Delta Lake가 이를 구현하는 스토리지 레이어다.
Databricks란 무엇인가 — Lakehouse 아키텍처 개요 · Core Architecture & Fundamentals, Q1-Q2 (pp.2) 및 FAQ 'What is Databricks and why do data engineers use it?' (p.18)

pandas API on Spark (pyspark.pandas)

pandas와 유사한 API를 분산 환경에서 쓸 수 있게 하는 PySpark 내장 모듈. 과거 독립 프로젝트였던 Koalas가 Spark 3.2부터 여기에 병합되었다.
Databricks Runtime과 Photon 엔진 · Core Architecture & Fundamentals, Q4 (pp.3-4) 및 Performance Tuning & Optimization, Q40 (p.11) + FAQ 'What is Photon in Databricks?' (p.19)

Photon

Databricks가 C++로 새로 작성한 네이티브 벡터화 실행 엔진. 표준 JVM 기반 Spark 엔진을 대체/보완하며 SQL·DataFrame 워크로드를 가속한다.
Databricks Runtime과 Photon 엔진 · Core Architecture & Fundamentals, Q4 (pp.3-4) 및 Performance Tuning & Optimization, Q40 (p.11) + FAQ 'What is Photon in Databricks?' (p.19)

Rescued Data Column

Auto Loader가 예상 스키마와 맞지 않는 데이터를 유실시키지 않고 별도로 담아두는 컬럼.
메달리온 아키텍처와 Auto Loader 기반 수집 · Data Engineering & ETL Pipelines, Q21-Q23, Q29 (pp.8-9, 11) 및 beginner guide 'Project: E-Commerce Customer Reviews Pipeline' (pp.13-19)

Secret Scope

API 키 등 민감한 자격 증명을 코드에 노출하지 않고 저장·참조할 수 있게 하는 Databricks의 시크릿 관리 단위. Databricks-backed 또는 Azure Key Vault-backed로 만들 수 있다.
시크릿 관리와 PII 데이터 보호 · Core Architecture & Fundamentals, Q9 (pp.4-5) 및 Operations, Security & Scenarios, Q46, Q48 (pp.14-16)

Shuffle

groupBy·join·distinct 같은 넓은 변환에서 같은 키의 데이터를 같은 executor로 재배치하는 과정. 직렬화·디스크 I/O·네트워크 전송을 수반해 Spark에서 가장 비용이 큰 연산이다.
Spark 성능 최적화 기초: Shuffle, Broadcast Join, AQE, Data Skew · Performance Tuning & Optimization, Q31-Q36 (pp.11-12) 및 Q45 시나리오 (pp.14-15)

Unity Catalog

Databricks Lakehouse 전반의 데이터·AI 자산에 대한 어카운트 레벨 통합 거버넌스 솔루션. ACL, 데이터 리니지, 감사를 여러 워크스페이스에 걸쳐 관리한다.
Unity Catalog: 거버넌스 계층 구조 · Core Architecture & Fundamentals, Q10 (pp.4-5) 및 beginner guide 'Unity Catalog and Schema in Databricks' (pp.11-12) + FAQ 'What is Unity Catalog in Databricks?' (p.19)

Unity Catalog Volumes

정형화되지 않은 파일(이미지, 문서 등)을 Unity Catalog의 거버넌스 체계 안에서 관리할 수 있게 하는 스토리지 객체. DBFS 마운트의 최신 대안이다.
스토리지 레이어: DBFS와 클라우드 오브젝트 스토리지 · Core Architecture & Fundamentals, Q7 (pp.4) 및 beginner guide 'Storage Layer in Databricks' (pp.9-10)

Workflow

여러 태스크(노트북 등)를 순서대로 연결해 실행하는 Databricks의 오케스트레이션 단위. 현재는 'Lakeflow Jobs' 제품군의 일부로도 불린다.
Jobs & Workflows 운영: 스케줄링, CI/CD, 프로덕션 장애 대응 · Operations, Security & Scenarios, Q41-Q44 (pp.13-15) 및 beginner guide 'Jobs & Workflows in Databricks' (pp.12-13)

동적 데이터 마스킹 (Dynamic Data Masking)

Unity Catalog에서 사용자의 권한·그룹에 따라 특정 컬럼 값을 실시간으로 리댁션해 보여주는 컬럼 레벨 보안 기법.
시크릿 관리와 PII 데이터 보호 · Core Architecture & Fundamentals, Q9 (pp.4-5) 및 Operations, Security & Scenarios, Q46, Q48 (pp.14-16)

매직 커맨드 (Magic Command)

노트북 셀 맨 앞에 붙여 그 셀의 실행 언어를 전환하는 지시어. `%python`, `%sql`, `%scala`, `%r`, `%fs` 등이 있다.
워크스페이스와 노트북 협업 · Workspace in Databricks (pp.6-7) 및 인터뷰 문항 Q8 'What languages can you use in a Databricks notebook?' (p.4)

메달리온 아키텍처 (Medallion Architecture)

데이터를 Bronze(원본)→Silver(정제)→Gold(집계) 세 레이어로 점진적으로 정제해나가는 데이터 파이프라인 설계 패턴.
메달리온 아키텍처와 Auto Loader 기반 수집 · Data Engineering & ETL Pipelines, Q21-Q23, Q29 (pp.8-9, 11) 및 beginner guide 'Project: E-Commerce Customer Reviews Pipeline' (pp.13-19)

체크포인트 (Checkpoint)

Structured Streaming 쿼리가 처리 진행 상황을 저장하는 영구 스토리지 디렉터리. 장애 복구 시 정확히 중단 지점부터 재개해 exactly-once 처리를 보장한다.
선언형 파이프라인(구 Delta Live Tables)과 증분 처리 패턴 · Data Engineering & ETL Pipelines, Q24-Q28, Q19-Q20 (pp.8-11)