📊
Data — 348개 용어
ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진
Unity Catalog Lineage👁 153
테이블·컬럼 수준 데이터 계보 자동 추적.
Vanna.ai👁 153
Text-to-SQL 오픈소스. RAG 기반으로 스키마 이해.
Data Cleaning👁 152
raw 데이터의 결측·이상·중복·오타를 정리하는 작업. 데이터 사이언스 시간의 80%.
Data Observability 5 Pillars👁 152
Freshness·Volume·Distribution·Schema·Lineage.
ksqlDB👁 152
Kafka 스트림에 SQL로 쿼리하는 엔진. Confluent 제공.
Metric Layer👁 152
비즈니스 지표를 중앙 정의해 여러 BI 툴이 일관된 값 사용. Cube·dbt Semantic Layer·MetricFlow.
MLflow👁 152
오픈소스 ML 수명 주기 관리 도구. 실험 추적·모델 레지스트리·배포.
SCD👁 152
Slowly Changing Dimension
디멘션 테이블의 변경 이력 처리 방식. Type 1·2·3·6 등.
Steampipe👁 152
클라우드 API를 SQL로 쿼리하는 도구. AWS·GCP·Azure·Kubernetes.
Superset vs Metabase👁 152
OSS BI 비교. Superset은 복잡·강력, Metabase는 단순.
Weights & Biases 심화👁 152
실험·모델·데이터·LLM 프롬프트 관리.
Apache Spark 4👁 151
2025년 릴리스. ANSI 기본, VARIANT·String Collation·Python Data Source.
DVC👁 151
Data Version Control
ML용 Git-like 버전 관리. 데이터·모델을 외부 스토리지에 두고 Git으로 참조.
Feature Store👁 151
ML 피처를 저장·공유·서빙하는 플랫폼. 학습-서빙 간 일관성 보장.
Headless Semantic Layer👁 151
dbt Semantic·Cube·AtScale. BI 도구 중립 메트릭 정의.
Reverse ETL Use Cases👁 151
Warehouse 데이터를 SaaS(Salesforce·Mailchimp)로 동기화해 실행 가능하게 만듦.
Segment👁 151
이벤트 추적·전달 플랫폼. 하나의 SDK로 여러 destination에 분배.
Zero-ETL 통합👁 151
Aurora→Redshift·S3→Snowflake 등 ETL 없는 자동 복제.
Dagster👁 150
데이터 애셋 중심 오케스트레이터. Airflow·Prefect 대비 타입·테스트 강함.
Data 팀 역할👁 150
Data Engineer·Analytics Engineer·Data Scientist·ML Engineer·Data Analyst 구분.
North Star Metric👁 150
조직의 유일한 핵심 지표. 모든 팀이 이것에 정렬.
Photon👁 150
Databricks의 C++ 벡터화 쿼리 엔진. Spark SQL 10배+ 빠름.
Prefect👁 150
현대적 워크플로 오케스트레이터. Airflow의 Python 네이티브 대안.
Profile-based Reverse ETL👁 150
Rudderstack Profiles처럼 dbt 모델이 프로파일을 생성.
RudderStack👁 150
Segment의 오픈소스 대안. Warehouse-first 접근.
Spark Connect👁 150
Spark 클라이언트-서버 프로토콜. 원격 실행·다국어 클라이언트.
Preset.io👁 149
Superset의 매니지드 SaaS. 엔터프라이즈 기능 추가.
Presto/Trino👁 149
분산 SQL 쿼리 엔진. Facebook이 시작(Presto), 창시자들이 포크한 Trino가 주류.
Semantic Search (Data)👁 149
키워드가 아닌 의미 기반 데이터 검색. 임베딩 활용.
Vector Search 알고리즘👁 149
HNSW·IVF·PQ·ScaNN. ANN 알고리즘.
Apache Iceberg👁 148
대규모 Data Lake용 오픈 테이블 포맷. Netflix가 오픈소스화. Delta Lake와 경쟁.
Census👁 148
Hightouch 경쟁 Reverse ETL. Marketo·Hubspot·Iterable 동기화.
Rockset👁 148
실시간 인덱스 DB. 2024 OpenAI 인수. Converged Index.
Snowflake Iceberg Tables👁 148
Snowflake가 외부 Iceberg 테이블 네이티브 지원. 벤더 락 감소.
StarRocks👁 148
MPP 분석 DB. Apache Doris 포크. Iceberg 네이티브.
Data Contract👁 147
데이터 생산자와 소비자 간 스키마·품질·SLA 계약. 데이터 품질 문제 예방.
Datafold👁 147
데이터 차이(diff)·리그레션 테스트 SaaS. PR마다 자동 데이터 검증.
DataHub👁 147
LinkedIn이 오픈소스화한 데이터 카탈로그·거버넌스. Metadata graph.
Data Mesh👁 147
중앙 데이터 팀이 아닌 도메인 팀이 데이터를 "제품처럼" 소유하는 조직·기술 아키텍처.
Inmon 방법론👁 147
Bill Inmon의 "Corporate Information Factory". 하향식·3NF 중앙 Warehouse.
Medallion Architecture👁 147
Databricks의 Bronze·Silver·Gold 3단계 데이터 레이크.
OpenLineage👁 147
데이터 리니지 오픈 표준. Marquez·OpenMetadata·DataHub 지원.
Prefect 3👁 147
2024년 메이저 업데이트. 동기 API·빠른 실행·엔진 리팩터.
Retention Curve👁 147
사용자가 시간에 따라 얼마나 남아있는지 그리는 곡선. 평평해지는 지점이 PMF 시그널.
SQLGlot👁 147
Python SQL 파서·변환기. 방언 간 쿼리 변환.
Apache Pinot👁 146
LinkedIn의 실시간 OLAP. 저지연·고처리량.
Data Contracts 실무👁 146
Protobuf·JSON Schema로 데이터 스키마 계약. 배포 전 검증.
Data Maturity 모델👁 146
조직의 데이터 활용 수준. Reactive→Predictive→Prescriptive.
dbt Mesh👁 146
여러 dbt 프로젝트를 조직 단위로 연결. 데이터 메시 구현.
Fivetran vs Airbyte👁 146
매니지드 vs 오픈소스. 비용·커넥터·유연성 트레이드오프.