← 학습 카테고리

Learn

Databricks

14개 모듈 · 현재 1번째

Databricks 모듈 1/14 databricks-learn-01

Databricks란 무엇인가 — Lakehouse 아키텍처 개요

60 Databricks Interview Questions Senior DEs Actually Ask (2026) — 미상 (DataVidhya 블로그, 2026) Core Architecture & Fundamentals, Q1-Q2 (pp.2) 및 FAQ 'What is Databricks and why do data engineers use it?' (p.18)

이 모듈을 다 읽으면

  • Databricks와 오픈소스 Apache Spark의 관계를 설명할 수 있다
  • Lakehouse 아키텍처가 데이터 레이크와 데이터 웨어하우스의 장점을 어떻게 결합하는지 설명할 수 있다
  • Databricks가 데이터 엔지니어링·분석·ML 워크로드를 하나의 플랫폼으로 묶는 이유를 판단할 수 있다

Databricks는 Apache Spark 위에 구축된 통합 클라우드 분석 플랫폼으로, 오픈소스 Spark 엔진에 관리형 런타임·협업 노트북·거버넌스 기능을 얹은 상용 제품이다. 핵심 설계 철학은 Lakehouse 아키텍처로, 클라우드 오브젝트 스토리지의 저비용·유연성과 데이터 웨어하우스의 ACID 트랜잭션·거버넌스를 Delta Lake라는 오픈 포맷 스토리지 레이어로 결합해, 스트리밍·데이터 과학·머신러닝·BI 리포팅을 데이터 이동 없이 단일 소스에서 지원한다.

Databricks와 Apache Spark의 관계

Apache Spark는 오픈소스 분산 처리 엔진이다. Databricks는 이 엔진을 자체 관리형 환경으로 감싸 제공하는 회사이자 플랫폼으로, 원문은 이 관리형 실행 계층을 'Databricks Runtime(DBR)'이라 부른다. DBR에는 성능을 높이는 독자 최적화가 포함되는데, 원문은 이를 'Delta Engine'이라는 이름으로 소개한다.

— 정정: 'Delta Engine'은 Databricks가 2020년 무렵 사용하던 옛 브랜드명이다. 이후 이 네이티브 벡터화 실행 엔진은 'Photon'으로 이름이 통합되어, 2026년 현재는 Delta Engine이 아니라 Photon이 공식 명칭이다(자세한 내용은 이 카테고리의 'Databricks Runtime과 Photon 엔진' 모듈 참고). 또한 오픈소스 Spark만으로는 얻을 수 없는 것은 Photon 실행 엔진뿐 아니라, 관리형 클러스터 프로비저닝, 협업 노트북(버전 관리 내장), Unity Catalog 기반 거버넌스·보안 기능도 포함된다.

핵심 포인트

  • Apache Spark는 오픈소스 엔진, Databricks는 그 위에 관리형 런타임과 거버넌스를 더한 상용 플랫폼이다
  • DBR(Databricks Runtime)의 벡터화 실행 엔진은 과거 'Delta Engine'으로 불렸으나 현재 공식 명칭은 'Photon'이다 — 정정
  • Databricks가 제공하는 부가가치는 실행 엔진뿐 아니라 클러스터 관리, 노트북 협업, 거버넌스까지 포함한다

Lakehouse 아키텍처: 레이크와 웨어하우스의 결합

Lakehouse 아키텍처는 데이터 레이크의 저비용·유연한 저장 방식과, 데이터 웨어하우스가 전통적으로 제공해온 성능·ACID 트랜잭션·거버넌스를 하나로 묶은 하이브리드 설계다. 클라우드 오브젝트 스토리지(S3, ADLS 등) 위에 Delta Lake라는 오픈 포맷 스토리지 레이어를 얹어 구조(schema)를 부여함으로써, 별도의 데이터 이동 없이 스트리밍·데이터 과학·머신러닝·BI 리포팅을 단일한 소스 오브 트루스에서 지원할 수 있게 한다.

이 설계가 해결하려는 문제는 전통적인 2단계 아키텍처의 비효율이다. 과거에는 저비용 저장을 위한 데이터 레이크와, 빠른 SQL 분석을 위한 별도의 데이터 웨어하우스를 동시에 운영하며 그 사이에서 데이터를 계속 복제·동기화해야 했다. Lakehouse는 이 이중 구조를 하나의 계층으로 합치는 것이 목표다.

핵심 포인트

  • Lakehouse는 데이터 레이크의 저비용 저장과 데이터 웨어하우스의 ACID·거버넌스를 하나의 계층으로 결합한다
  • Delta Lake가 클라우드 오브젝트 스토리지 위에서 그 '구조'를 담당하는 오픈 포맷 스토리지 레이어다
  • 스트리밍, 데이터 과학, 머신러닝, BI를 데이터 이동 없이 단일 소스에서 지원하는 것이 목표다