본문 바로가기
📊

Data 348개 용어

ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진

Polaris Catalog👁 94
Snowflake가 Apache Foundation에 기증한 Iceberg REST 카탈로그.
StarRocks👁 94
MPP 분석 DB. Apache Doris 포크. Iceberg 네이티브.
Apache Airflow 3👁 93
2024 Airflow 3. DAG 버저닝·UI 재작성·데이터 자산.
Apache Spark👁 93
분산 빅데이터 처리 엔진. Hadoop MapReduce 대체. Python·Scala·SQL 지원.
Baseline Model👁 93
실험의 기준이 되는 단순 모델. Majority·Random·간단한 규칙.
dbt Mesh👁 93
여러 dbt 프로젝트를 조직 단위로 연결. 데이터 메시 구현.
GraphRAG (Microsoft)👁 93
지식 그래프 기반 RAG. 엔티티·커뮤니티 수준 요약.
Inmon 방법론👁 93
Corporate Information Factory. 3NF 기반 중앙 Warehouse.
Kafka Offset👁 93
파티션 내 메시지 위치. 컨슈머가 자신의 진행 상태로 커밋.
lakeFS👁 93
데이터 레이크의 Git. 브랜치·커밋·머지로 데이터 관리.
Master Data👁 93
조직의 핵심 엔티티(고객·상품·직원) 정보. 여러 시스템 간 일관성 필요.
ML 평가 지표 선택👁 93
분류·회귀·랭킹·생성 각기 다른 지표. 비즈니스 목표와 정렬 필수.
Customer 360 / CDP Profile👁 92
고객을 중심으로 행동·거래·서포트를 통합한 레코드.
Databricks Genie👁 92
Databricks의 자연어 → SQL·분석 챗봇.
Databricks LakeFlow👁 92
2024 발표 통합 데이터 엔지니어링. ingest·transform·orchestrate.
Databricks Serverless SQL👁 92
SQL Warehouse의 서버리스 옵션. 기동 없이 즉시 쿼리.
Data Clean Room👁 92
여러 회사가 데이터를 공유 없이 조인·분석. 광고·의료.
Data Contracts with Protobuf👁 92
Protobuf·Buf로 스키마 강제. 업스트림·다운스트림 계약.
dbt Exposures👁 92
dbt 모델을 사용하는 downstream(대시보드·앱) 정의.
dbt Seeds👁 92
CSV 파일을 Warehouse 테이블로 로드. 기준 데이터용.
DuckDB Extensions👁 92
DuckDB 확장 시스템. httpfs·parquet·vss·spatial·delta.
Event Schema👁 92
제품 분석 이벤트 명명·속성 스키마. 일관성이 분석 품질.
Feast Architecture👁 92
오픈소스 Feature Store. Registry·Online·Offline·Serving.
Funnel Analysis👁 92
사용자가 목표(구매·가입)에 도달하기까지 단계별 이탈률 분석.
GE Test Suite👁 92
Great Expectations의 expectation 묶음. 재사용·CI 통합.
Lambda Architecture👁 92
Batch + Speed 레이어 혼합 아키텍처. Kappa로 단순화 추세.
Metabase Embedding👁 92
Metabase 대시보드를 앱에 임베드. SaaS 분석 제공.
ORC👁 92
Optimized Row Columnar
Hive 최적화 컬럼 포맷. Parquet과 경쟁.
Ray Train👁 92
Ray의 분산 훈련 라이브러리. PyTorch DDP·FSDP 추상화.
Advanced RAG 패턴👁 91
Self-RAG·CRAG·HyDE·Query Expansion·ReRanker.
Apache Kafka👁 91
분산 스트리밍 플랫폼. 대용량 이벤트 처리의 사실상 표준. LinkedIn이 오픈소스화.
Catalog 비교👁 91
Amundsen·DataHub·OpenMetadata. 오픈소스 데이터 카탈로그.
dbt Docs👁 91
dbt 프로젝트의 자동 문서·Lineage 그래프.
dbt Test👁 91
스키마 테스트·커스텀 SQL 테스트. 데이터 품질 게이트.
dbt Unit Tests👁 91
dbt 1.8+ 모델 단위 SQL 테스트. 가짜 입력·기대 출력.
Delta Liquid Clustering👁 91
Databricks Delta의 동적 파티셔닝. Z-Ordering 후속.
Delta Live Tables (DLT)👁 91
Databricks 선언적 ETL. 데이터 품질 규칙·자동 오케스트레이션.
Flink CDC👁 91
Ververica 오픈 CDC 커넥터. MySQL·PG·Mongo를 Flink 소스로.
Iceberg REST Catalog👁 91
Iceberg 카탈로그 표준 API. Glue·Polaris·Tabular 호환.
Kafka Exactly-Once👁 91
프로듀서 idempotence + 트랜잭션으로 정확히 한 번 처리 보장.
ksqlDB👁 91
Kafka 스트림을 SQL로 처리. CREATE STREAM·CREATE TABLE.
Open Table Format👁 91
Iceberg·Delta·Hudi 비교. Lake에 ACID·Schema·Time Travel 추가.
Operational Analytics👁 91
분석 결과를 운영 시스템으로 되돌려 자동 행동 유도. Activation 철학.
Pulsar Functions👁 91
Pulsar 내장 스트림 처리. 메시지→함수→토픽.
Schema Change Management👁 91
DB·Warehouse 스키마 변경 안전 배포. Liquibase·Flyway·schemachange.
Thoughtspot👁 91
검색·자연어 BI. "Search-driven Analytics".
Apache Doris👁 90
Real-time MPP DB. 중국에서 개발, 글로벌 확산.
BigQuery + Gemini👁 90
BigQuery의 Gemini AI 통합. 자연어 쿼리·데이터 준비 자동화.
ClickHouse MV👁 90
ClickHouse의 실시간 사전 집계. INSERT 시 자동 갱신.
Data App👁 90
Streamlit·Gradio·Retool·Hex로 데이터 기반 내부 앱 개발.