본문 바로가기
📊

Data 348개 용어

ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진

Late Chunking👁 146
긴 문서를 먼저 임베딩 후 청크 경계에서 자르기.
MTEB👁 146
Massive Text Embedding Benchmark
임베딩 모델 종합 벤치마크. Hugging Face 리더보드.
Redshift ML👁 146
AWS Redshift에서 SQL로 SageMaker 모델 학습·추론.
Snowflake Openflow👁 146
Apache NiFi 기반 Snowflake 공식 인제스트.
BigQuery Omni👁 145
AWS·Azure 데이터를 BigQuery에서 쿼리. 멀티 클라우드.
ClickStream👁 145
사용자의 웹·앱 클릭·탐색 이벤트 데이터. 제품 분석의 핵심 원료.
Dagster Pipes👁 145
외부 프로세스(Spark·Databricks·Kubernetes) 통합 프로토콜.
Data Product👁 145
데이터를 제품처럼 취급. SLA·문서·소유자·사용자 경험. Data Mesh 핵심.
Data Vault 2.0👁 145
감사·변경 추적·확장성에 최적화된 Warehouse 모델링. Hub-Link-Satellite.
dbt Semantic Layer👁 145
dbt의 메트릭 중앙 정의. MetricFlow.
dbt Sources👁 145
원본 raw 테이블을 dbt 프로젝트에서 명명·테스트.
DuckDB Extensions👁 145
DuckDB 확장 시스템. httpfs·parquet·vss·spatial·delta.
Inmon 방법론👁 145
Corporate Information Factory. 3NF 기반 중앙 Warehouse.
MongoDB Atlas Vector Search👁 145
Atlas의 벡터 검색. pgvector·Pinecone 대안.
OpenMetadata👁 145
통합 메타데이터 플랫폼. 카탈로그·lineage·품질·거버넌스 한 번에.
Ray👁 145
분산 Python 프레임워크. ML·강화학습·배치 병렬화. Anyscale 상용화.
Reinforcement Learning👁 145
RL
에이전트가 환경과 상호작용하며 보상을 최대화하는 방향으로 학습. AlphaGo·로봇 제어에 활용.
Snowflake Copilot👁 145
Snowflake의 AI 어시스턴트. Cortex 기반 자연어 SQL.
Spark DataFrame👁 145
Spark의 분산 DataFrame API. SQL처럼 편리·Catalyst 최적화.
Streamlit in Snowflake👁 145
Streamlit 앱을 Snowflake 데이터에 안전하게 배포.
Text-to-SQL (NL2SQL)👁 145
자연어 질문을 SQL로 변환. BI·분석의 민주화.
Apache Beam👁 144
배치·스트리밍 통합 프로그래밍 모델. Dataflow·Flink·Spark 러너.
Apache Spark👁 144
분산 빅데이터 처리 엔진. Hadoop MapReduce 대체. Python·Scala·SQL 지원.
Data Mesh Governance👁 144
분산 소유 + 연방 거버넌스. 공통 표준·상호 운용성.
dbt Model 유형👁 144
View·Table·Incremental·Ephemeral 등 dbt materialization.
dbt Seeds👁 144
CSV 파일을 Warehouse 테이블로 로드. 기준 데이터용.
Lightdash👁 144
dbt 기반 OSS BI. dbt 메트릭을 대시보드로.
MLflow Tracking·Registry👁 144
실험 추적·모델 버전 관리. Databricks 오픈 표준.
OpenMetadata👁 144
오픈소스 데이터 카탈로그·거버넌스. DataHub 경쟁.
Semantic Layer + AI👁 144
LLM이 의미 레이어를 기반으로 정확한 쿼리 생성.
Windowing👁 144
무한 스트림을 유한 창으로 분할. Tumbling·Sliding·Session.
Airflow TaskFlow API👁 143
@task 데코레이터로 함수 기반 DAG. XCom 자동.
Apache Polaris👁 143
Snowflake가 오픈소스화한 Iceberg 카탈로그.
Data Activation👁 143
분석 인사이트를 실제 운영에 반영. Hightouch·Census의 핵심 메시지.
Data Contracts with Protobuf👁 143
Protobuf·Buf로 스키마 강제. 업스트림·다운스트림 계약.
Delta Live Tables👁 143
Databricks의 선언적 파이프라인. 의존성·품질·모니터링 자동.
Modern ETL/ELT 선택👁 143
Warehouse 내 SQL 변환이 강력해져 ELT가 주류.
OLAP 엔진 비교👁 143
OLAP 엔진 종류: ROLAP·MOLAP·HOLAP. 현대는 대부분 ROLAP(Snowflake·BigQuery).
데이터 Product Thinking👁 143
데이터를 제품처럼. SLA·소비자·버저닝·문서.
Arrow Flight👁 142
Arrow 기반 고성능 데이터 전송 프로토콜. ODBC/JDBC 대체.
Databricks Serverless SQL👁 142
SQL Warehouse의 서버리스 옵션. 기동 없이 즉시 쿼리.
dbt Packages👁 142
dbt-utils·dbt-expectations 등 공식·커뮤니티 패키지.
lakeFS👁 142
데이터 레이크의 Git. 브랜치·커밋·머지로 데이터 관리.
Polaris Catalog👁 142
Snowflake가 Apache Foundation에 기증한 Iceberg REST 카탈로그.
Auto Loader👁 141
Databricks의 점진적 파일 인제스트. 스키마 추론·진화.
dbt Macros👁 141
Jinja 기반 재사용 SQL 함수. 복잡 로직 캡슐화.
Grafana Mimir👁 141
Prometheus 대규모 확장. Cortex 후속.
ksqlDB👁 141
Kafka 스트림을 SQL로 처리. CREATE STREAM·CREATE TABLE.
Arrow Flight SQL👁 140
Arrow Flight 위의 SQL 프로토콜. JDBC/ODBC를 대체.
Databricks LakeFlow👁 140
2024 발표 통합 데이터 엔지니어링. ingest·transform·orchestrate.