← Python 모듈로

Learn · Glossary

Python 용어 사전

총 30개 용어

.loc / .iloc

.loc는 레이블 기반, .iloc는 정수 위치 기반 인덱싱. .loc 슬라이싱은 끝 레이블을 포함한다.
데이터 조작 — Pandas와 NumPy 활용 · Section 3: Data Manipulation (Pandas/NumPy) (pp.7-11); FAQ 보충 (p.16)

chunksize

pd.read_csv 등에서 데이터를 지정한 행 수 단위로 나눠 순회하며 읽게 하는 파라미터. 메모리보다 큰 파일 처리에 쓰인다.
데이터 조작 — Pandas와 NumPy 활용 · Section 3: Data Manipulation (Pandas/NumPy) (pp.7-11); FAQ 보충 (p.16)

IQR(사분위범위)

3사분위수와 1사분위수의 차이. 이상치 탐지 시 정상 범위의 기준으로 흔히 사용된다.
데이터 조작 — Pandas와 NumPy 활용 · Section 3: Data Manipulation (Pandas/NumPy) (pp.7-11); FAQ 보충 (p.16)

predicate pushdown

WHERE 절 필터를 스토리지 레이어까지 내려보내, row group 통계(최솟값/최댓값)로 조건에 안 맞는 row group을 아예 읽지 않고 건너뛰는 최적화.
빅데이터와 분산 시스템 — PySpark 관점 · Section 5: Big Data & Distributed Systems (pp.13-14)

split-apply-combine

groupby 연산의 처리 과정 — 데이터를 그룹으로 나누고(split), 각 그룹에 함수를 적용하고(apply), 결과를 결합한다(combine).
데이터 조작 — Pandas와 NumPy 활용 · Section 3: Data Manipulation (Pandas/NumPy) (pp.7-11); FAQ 보충 (p.16)

메달리온 아키텍처(medallion architecture)

브론즈(원본)→실버(정제)→골드(비즈니스 집계) 3계층으로 데이터를 단계적으로 정제하는 레이크하우스 설계 패턴.
ETL과 파이프라인 엔지니어링 원칙 · Section 4: ETL & Pipeline Engineering (pp.11-13)

멱등성(idempotency)

동일한 입력으로 여러 번 실행해도 항상 같은 결과를 내고 부작용이 쌓이지 않는 성질.
ETL과 파이프라인 엔지니어링 원칙 · Section 4: ETL & Pipeline Engineering (pp.11-13)

버킷팅(bucketing)

데이터를 고정 개수의 파일로 해시 분산시켜 저장하는 기법. 세밀한 조직화와 조인 시 셔플 감소에 쓰인다.
빅데이터와 분산 시스템 — PySpark 관점 · Section 5: Big Data & Distributed Systems (pp.13-14)

벡터화(vectorization)

개별 원소 반복 대신 배열 전체에 연산을 적용해 C 레벨 최적화를 활용하는 기법.
데이터 조작 — Pandas와 NumPy 활용 · Section 3: Data Manipulation (Pandas/NumPy) (pp.7-11); FAQ 보충 (p.16)

브로드캐스팅(broadcasting)

shape이 다른 배열 간 산술 연산을 메모리 복사 없이 가능하게 하는 NumPy의 규칙.
데이터 조작 — Pandas와 NumPy 활용 · Section 3: Data Manipulation (Pandas/NumPy) (pp.7-11); FAQ 보충 (p.16)

서킷 브레이커(Circuit Breaker) 패턴

품질 체크가 실패하면 즉시 파이프라인 실행을 중단해 나쁜 데이터의 전파를 막는 패턴.
ETL과 파이프라인 엔지니어링 원칙 · Section 4: ETL & Pipeline Engineering (pp.11-13)

스키마 드리프트(schema drift)

소스 시스템이 예고 없이 데이터 구조(컬럼, 타입 등)를 바꾸는 현상.
ETL과 파이프라인 엔지니어링 원칙 · Section 4: ETL & Pipeline Engineering (pp.11-13)

컬럼 프루닝(column pruning)

쿼리에 필요한 컬럼만 읽고 나머지는 건너뛰는 최적화. 프로젝션 푸시다운이라고도 한다.
빅데이터와 분산 시스템 — PySpark 관점 · Section 5: Big Data & Distributed Systems (pp.13-14)

파라미터화 쿼리(parameterized query)

SQL 값 부분을 플레이스홀더로 두고 드라이버가 이스케이프 처리하게 하는 쿼리 작성 방식. SQL 인젝션을 방지한다.
ETL과 파이프라인 엔지니어링 원칙 · Section 4: ETL & Pipeline Engineering (pp.11-13)

파티셔닝(partitioning)

컬럼 값 기준으로 물리적 디렉터리를 나눠 저장, 쿼리 엔진이 무관한 폴더를 건너뛸 수 있게(파티션 프루닝) 하는 기법.
빅데이터와 분산 시스템 — PySpark 관점 · Section 5: Big Data & Distributed Systems (pp.13-14)