📊
Data — 348개 용어
ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진
Vector Search 알고리즘👁 101
HNSW·IVF·PQ·ScaNN. ANN 알고리즘.
BigQuery Omni👁 100
AWS·Azure 데이터를 BigQuery에서 쿼리. 멀티 클라우드.
Fivetran vs Airbyte👁 100
매니지드 vs 오픈소스. 비용·커넥터·유연성 트레이드오프.
Metric Layer👁 100
비즈니스 지표를 중앙 정의해 여러 BI 툴이 일관된 값 사용. Cube·dbt Semantic Layer·MetricFlow.
Parquet👁 100
컬럼 지향 파일 포맷. Lake·Warehouse 표준. 압축·쿼리 효율 탁월.
Presto/Trino👁 100
분산 SQL 쿼리 엔진. Facebook이 시작(Presto), 창시자들이 포크한 Trino가 주류.
Reverse ETL Platforms👁 100
Hightouch·Census·Rudderstack Profiles 비교.
Reverse ETL Use Cases👁 100
Warehouse 데이터를 SaaS(Salesforce·Mailchimp)로 동기화해 실행 가능하게 만듦.
SCD👁 100
Slowly Changing Dimension
디멘션 테이블의 변경 이력 처리 방식. Type 1·2·3·6 등.
Spark Structured Streaming👁 100
Spark의 스트리밍 API. 배치처럼 작성·실시간 실행.
Starburst / Trino Galaxy👁 100
Trino 상용 매니지드. 연합 쿼리 플랫폼.
Time-Series Database👁 100
시계열 특화 DB. InfluxDB·TimescaleDB·VictoriaMetrics.
Windmill👁 100
오픈소스 개발자 플랫폼. 스크립트·워크플로·UI 통합.
Apache Beam👁 99
배치·스트리밍 통합 프로그래밍 모델. Dataflow·Flink·Spark 러너.
KPI👁 99
Key Performance Indicator
비즈니스 목표를 측정하는 핵심 지표. 매출·MAU·Churn·NPS 등.
Medallion Architecture👁 99
Databricks의 Bronze·Silver·Gold 3단계 데이터 레이크.
MLflow👁 99
오픈소스 ML 수명 주기 관리 도구. 실험 추적·모델 레지스트리·배포.
OpenLineage👁 99
데이터 리니지 오픈 표준. Marquez·OpenMetadata·DataHub 지원.
Pinecone Serverless👁 99
Pinecone 서버리스 벡터 DB. 사용량 과금.
PyTorch👁 99
Meta(Facebook)의 딥러닝 프레임워크. 연구 커뮤니티 주류. 동적 그래프.
SQLGlot👁 99
Python SQL 파서·변환기. 방언 간 쿼리 변환.
Airflow TaskFlow API👁 98
@task 데코레이터로 함수 기반 DAG. XCom 자동.
Datafold👁 98
데이터 차이(diff)·리그레션 테스트 SaaS. PR마다 자동 데이터 검증.
Data Product👁 98
데이터를 제품처럼 취급. SLA·문서·소유자·사용자 경험. Data Mesh 핵심.
DuckDB UI👁 98
DuckDB 내장 웹 UI. 2024년 출시, 로컬 분석 편의.
Modern ETL/ELT 선택👁 98
Warehouse 내 SQL 변환이 강력해져 ELT가 주류.
Prefect 3👁 98
2024년 메이저 업데이트. 동기 API·빠른 실행·엔진 리팩터.
Preset.io👁 98
Superset의 매니지드 SaaS. 엔터프라이즈 기능 추가.
Redshift👁 98
AWS의 Data Warehouse. PostgreSQL 포크 기반. Snowflake·BigQuery와 경쟁.
Retention Curve👁 98
사용자가 시간에 따라 얼마나 남아있는지 그리는 곡선. 평평해지는 지점이 PMF 시그널.
Spark Connect👁 98
Spark 클라이언트-서버 프로토콜. 원격 실행·다국어 클라이언트.
Text-to-SQL👁 98
자연어를 SQL로 변환. LLM 기반. BI 민주화의 핵심.
Windowing👁 98
무한 스트림을 유한 창으로 분할. Tumbling·Sliding·Session.
Census👁 97
Hightouch 경쟁 Reverse ETL. Marketo·Hubspot·Iterable 동기화.
ClickStream👁 97
사용자의 웹·앱 클릭·탐색 이벤트 데이터. 제품 분석의 핵심 원료.
Dagster👁 97
데이터 애셋 중심 오케스트레이터. Airflow·Prefect 대비 타입·테스트 강함.
Data Contracts 실무👁 97
Protobuf·JSON Schema로 데이터 스키마 계약. 배포 전 검증.
Data Mart👁 97
특정 부서·주제에 특화된 작은 Warehouse. 분석 속도·보안 분리.
dbt Macros👁 97
Jinja 기반 재사용 SQL 함수. 복잡 로직 캡슐화.
Kafka Connect👁 97
Kafka와 외부 시스템 연결을 위한 프레임워크. Source·Sink 커넥터.
Mixpanel👁 97
제품 분석 SaaS의 대표. 이벤트 기반 퍼널·리텐션·코호트.
MTEB👁 97
Massive Text Embedding Benchmark
임베딩 모델 종합 벤치마크. Hugging Face 리더보드.
Prefect👁 97
현대적 워크플로 오케스트레이터. Airflow의 Python 네이티브 대안.
Redpanda👁 97
C++로 작성된 Kafka API 호환 스트리밍 플랫폼. JVM 없음, 10배 빠름.
Rockset👁 97
실시간 인덱스 DB. 2024 OpenAI 인수. Converged Index.
Snowflake Copilot👁 97
Snowflake의 AI 어시스턴트. Cortex 기반 자연어 SQL.
Spark DataFrame👁 97
Spark의 분산 DataFrame API. SQL처럼 편리·Catalyst 최적화.
Text-to-SQL (NL2SQL)👁 97
자연어 질문을 SQL로 변환. BI·분석의 민주화.
Unity Catalog👁 97
Databricks의 데이터 거버넌스 계층. 2024년 OSS.
Unity Catalog Lineage👁 97
테이블·컬럼 수준 데이터 계보 자동 추적.