본문 바로가기
📊

Data 348개 용어

ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진

데이터 품질 프레임워크👁 337
Great Expectations·Soda·dbt tests·Elementary.
임베딩 모델 선택👁 334
OpenAI·Cohere·BGE·ko-sroberta 등.
모던 데이터 스택 2026👁 332
Snowflake·Databricks·Fabric·BigQuery 중심의 2026년 현황.
벡터 검색 벤치마크👁 323
ANN Benchmarks·VectorDBBench·BEIR.
데이터 관측성 플랫폼👁 316
Monte Carlo·Bigeye·Soda·Datafold·Elementary.
데이터 레이크 파일 포맷👁 311
Parquet·ORC·Avro·Arrow. 사용 시나리오별 선택.
AARRR👁 242
Pirate Metrics
Dave McClure가 만든 스타트업 퍼널. Acquisition·Activation·Retention·Referral·Revenue.
Milvus👁 241
대규모 벡터 DB. GPU 가속·수십억 벡터.
NATS👁 230
클라우드 네이티브 메시징. 초저지연·간단함 강조. Go·Rust 작성.
Data Pipeline👁 225
소스에서 목적지까지 데이터가 흐르는 자동화 경로. ETL/ELT·스트리밍 모두 포함.
Apache Superset👁 206
Airbnb 출신의 오픈소스 엔터프라이즈 BI. 기능 많고 커스터마이징 강력.
Databricks Notebook👁 204
Databricks의 협업 노트북 환경. Spark·SQL·Python·R 혼용. 버전 관리 통합.
Amplitude👁 201
제품 분석·실험 플랫폼. 행동 분석·제품 주도 성장에 특화.
Cube (Semantic Layer)👁 201
SQL 위의 메트릭 정의 레이어. REST·GraphQL·SQL API.
ETL👁 201
Extract-Transform-Load
데이터를 추출·변환·적재하는 전통적 데이터 파이프라인 패턴.
Polars👁 198
Rust로 작성된 차세대 데이터프레임 라이브러리. Pandas보다 5~10배 빠름.
Fivetran👁 195
관리형 ELT SaaS. 유지보수 없는 데이터 파이프라인. 고가지만 안정적.
Tableau👁 192
Salesforce가 인수한 BI의 거인. 드래그앤드롭 시각화 선구자.
Data SLA👁 191
데이터 신선도·정확도·가용성에 대한 서비스 수준 계약.
dbt👁 191
data build tool
Warehouse 내부 SQL 변환을 모델링·테스트·문서화하는 도구. ELT의 T를 담당.
OLAP Cube👁 191
차원·측정값으로 미리 집계된 다차원 데이터 구조. 전통 BI의 기반.
Airbyte👁 190
오픈소스 ELT 도구. 300+ 커넥터로 소스 → Warehouse 동기화.
Amundsen👁 190
Lyft가 오픈소스화한 데이터 발견 UI. DataHub 경쟁.
Kimball 방법론👁 190
Ralph Kimball의 Dimensional Modeling. 상향식·스타 스키마 중심.
Apache Pulsar👁 189
Yahoo가 만든 분산 메시징. Kafka 대안. 스토리지·컴퓨트 분리.
Jupyter👁 188
Python·R·Julia를 대화형으로 실행하는 노트북 환경. 데이터 분석의 표준.
Dashboard👁 187
KPI·지표를 시각화해 한눈에 모니터링하는 UI. BI 도구의 주 산출물.
BI👁 186
Business Intelligence
비즈니스 데이터 분석·시각화로 의사결정을 돕는 플랫폼. Tableau·Power BI·Looker.
Supervised Learning👁 186
입력과 정답(레이블)이 쌍으로 주어진 데이터로 학습하는 ML. 분류·회귀가 대표.
Stitch👁 184
Talend가 인수한 간단한 ELT SaaS. Fivetran보다 저렴하고 작은 팀용.
Apache Arrow👁 183
컬럼 지향 인메모리 데이터 포맷 표준. 언어·시스템 간 제로 카피 교환.
Google Colab👁 183
Google의 무료 Jupyter 호스팅. GPU·TPU 접근 가능. ML 튜토리얼·프로토타입 표준.
Snowflake👁 183
클라우드 네이티브 Data Warehouse. 스토리지와 컴퓨트 분리, 자동 확장으로 업계 선두.
Data Lineage👁 181
데이터가 소스에서 소비까지 어떻게 변환·이동되는지 추적하는 메타데이터.
Modern Data Stack👁 181
2020년 이후 주류 SaaS 조합. Fivetran+dbt+Snowflake+Looker+Hightouch.
Data Lake👁 180
정형·비정형 데이터를 원본 그대로 저장하는 대용량 스토리지. S3·GCS 기반.
Data Modeling👁 180
분석 목적에 맞게 테이블·관계를 설계하는 작업. Star Schema·Dimensional Modeling.
Debezium👁 180
Red Hat의 오픈소스 CDC 플랫폼. MySQL·Postgres·Mongo 로그를 Kafka 이벤트로.
TensorFlow👁 180
Google이 개발한 딥러닝 프레임워크. 프로덕션·모바일 배포에 강점.
Data Lakehouse👁 179
Lake의 저장 + Warehouse의 성능을 결합한 아키텍처. Delta Lake, Iceberg, Hudi가 주도.
ELT👁 179
Extract-Load-Transform
ETL의 현대 변형. 원본 그대로 적재 후 Warehouse 내부에서 변환. dbt가 대표 도구.
Recall@K👁 179
상위 K개 결과에 관련 아이템이 포함된 비율. 추천·검색 기본 지표.
Apache Airflow👁 177
오픈소스 워크플로 오케스트레이터. DAG를 Python으로 정의. 데이터 파이프라인 스케줄링 표준.
Data Platform👁 177
데이터 수집·저장·처리·분석을 통합한 인프라. 현대 데이터 팀의 기반.
Feast👁 177
오픈소스 Feature Store. Gojek이 시작, 현재 Linux Foundation.
PLG👁 177
Product-Led Growth
제품 자체를 마케팅·성장 엔진으로 삼는 전략. 무료 → 유료 전환.
Semantic Layer👁 177
비즈니스 지표를 중앙 정의해 여러 BI·앱에서 재사용하는 추상화 계층. Cube·dbt Semantic Layer.
Zero-ETL👁 177
복사 없이 소스 DB를 직접 Warehouse에서 쿼리. AWS가 제안.
Data Enrichment👁 176
기존 데이터에 외부 소스의 정보를 결합해 가치를 높이는 작업.
Event Streaming👁 176
이벤트 스트림(Kafka·Pulsar)을 기반으로 앱을 설계하는 아키텍처 패러다임.