본문 바로가기
📊

Data 348개 용어

ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진

Kubeflow👁 176
Kubernetes 기반 ML 플랫폼. 학습·튜닝·서빙을 K8s 네이티브로.
PyTorch👁 176
Meta(Facebook)의 딥러닝 프레임워크. 연구 커뮤니티 주류. 동적 그래프.
SQLMesh👁 176
dbt 대안 프레임워크. 가상 데이터 환경·시간 모델링.
Delta Lake👁 175
Databricks가 주도하는 Lake 테이블 포맷. ACID, Time Travel, Spark 최적화.
Analytics Engineer👁 173
dbt로 Warehouse 내 데이터 모델링을 담당하는 신생 역할. 2020년 이후 부상.
Databricks SQL👁 173
Databricks의 Warehouse 엔드포인트. Photon 엔진·Unity Catalog.
ETL Pipeline Design👁 173
ETL/ELT 설계 원칙. 멱등성·재실행·체크포인트·모니터링.
Hugging Face👁 173
ML 모델·데이터셋·앱의 허브. "ML계의 GitHub". Transformers 라이브러리 포함.
BigQuery👁 172
Google Cloud의 서버리스 Data Warehouse. Petabyte급 SQL 분석.
Parquet👁 172
컬럼 지향 파일 포맷. Lake·Warehouse 표준. 압축·쿼리 효율 탁월.
PostHog👁 172
오픈소스 제품 분석 플랫폼. 이벤트·퍼널·리텐션·Feature Flag 통합.
Headless BI👁 171
BI의 지표 정의 계층을 UI와 분리. 여러 프런트(대시보드·앱·AI)가 공통 지표 사용.
OLTP👁 171
Online Transaction Processing
실시간 트랜잭션 처리 DB 워크로드. 작은 CRUD가 많은 운영 DB.
Pandas👁 171
Python의 데이터프레임 라이브러리. 분석·전처리의 사실상 표준.
Tecton👁 171
Feature Store SaaS. Feast 창시자들이 창업.
Airflow 2+👁 170
Airflow 2.x 메이저 개편. TaskFlow API·Deferrable·Dynamic DAG. 3.0에서 더 현대화.
Data Observability👁 170
데이터 파이프라인의 신선도·양·스키마·품질을 모니터링하는 분야.
Looker👁 170
Google이 인수한 엔터프라이즈 BI. LookML로 데이터 모델링. Semantic Layer 선구자.
Metabase👁 170
오픈소스 BI. 비기술자도 쉽게 쿼리·대시보드 제작. 설치 10분.
Monte Carlo Data👁 170
데이터 관측성 SaaS 선두. 이상 감지·알림·lineage.
Thanos👁 170
Prometheus를 글로벌·장기 저장으로 확장. S3 기반.
Weights & Biases👁 170
W&B
ML 실험 추적·시각화 SaaS. 대시보드·보고서·하이퍼파라미터 스윕 강력.
Power BI👁 169
Microsoft의 BI 도구. Office 365 통합. 엔터프라이즈·Tableau 대안.
WarpStream👁 169
컴퓨트·스토리지 분리한 Kafka 호환. S3만으로 운영.
Data Catalog👁 168
조직의 모든 데이터 자산을 카탈로그화해 검색·이해·거버넌스를 돕는 도구.
Data Governance👁 168
데이터의 품질·보안·접근 권한·소유권을 관리하는 체계.
HTAP👁 168
Hybrid Transactional/Analytical Processing
OLTP와 OLAP를 같은 DB에서 처리하는 하이브리드 모델. TiDB·SingleStore·CockroachDB.
Soda👁 168
SQL 기반 데이터 품질 검사 도구. SodaCL DSL로 선언적 체크.
Watermark👁 168
스트리밍에서 시점 T까지 이벤트 수신 완료 마커.
Data Observability 지표👁 167
신선도·양·스키마·품질·분포·Lineage 5대 축으로 데이터 건강 측정.
Redshift👁 167
AWS의 Data Warehouse. PostgreSQL 포크 기반. Snowflake·BigQuery와 경쟁.
BM25👁 166
전통 키워드 검색 점수 알고리즘. Elasticsearch·OpenSearch 기본.
Kafka Connect👁 166
Kafka와 외부 시스템 연결을 위한 프레임워크. Source·Sink 커넥터.
Mode👁 166
SQL + Python 분석 협업 플랫폼. ThoughtSpot 인수.
OLAP👁 166
Online Analytical Processing
분석·집계 최적화 DB 워크로드. OLTP(트랜잭션)와 대비. 컬럼 저장이 특징.
Reverse ETL👁 166
Warehouse의 정제된 데이터를 다시 SaaS(Salesforce·Mailchimp)로 동기화.
Unsupervised Learning👁 166
레이블 없이 데이터의 구조·패턴을 학습. 클러스터링·차원 축소가 대표.
A/B 유의성👁 165
통계적 유의성·검정력·샘플 크기 계산. p-value·신뢰구간·효과 크기.
AWS MWAA / GCP Composer👁 165
관리형 Airflow. AWS·GCP 클라우드 오퍼링.
dbt Cloud👁 165
dbt의 매니지드 SaaS. 스케줄링·IDE·CI 통합. 대기업 사용.
Fact Table👁 165
비즈니스 이벤트(매출·주문·방문)를 기록하는 Warehouse 중심 테이블.
NumPy👁 165
Python 수치 계산의 기반 라이브러리. 배열·행렬·벡터 연산.
Snowflake Cortex👁 165
Snowflake의 AI·LLM 기능. Cortex Search·Cortex Analyst.
Starburst / Trino Galaxy👁 165
Trino 상용 매니지드. 연합 쿼리 플랫폼.
Tabular👁 165
Iceberg 창시자들이 창업. 2024년 Databricks가 인수.
Apache Flink👁 164
저지연 실시간 스트림 처리 엔진. Kafka와 함께 이벤트 스트리밍 스택의 양대 축.
DAU / MAU / Ratio👁 164
Daily·Monthly Active Users. DAU/MAU 비율이 제품 참여도 지표.
SQLMesh👁 164
dbt 대안. 가상 데이터 환경·자동 증분·플랜 기반.
Streaming ETL👁 163
실시간 스트림에서 ETL. Kafka·Flink·Materialize로 구현.
Train/Val/Test Split👁 163
데이터를 학습·검증·테스트로 나눔. 보통 70/15/15. Data leakage 주의.