📊
Data — 348개 용어
ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진
NDCG👁 162
Normalized Discounted Cumulative Gain
검색·추천의 순위 품질 지표. 상위 순위 가중치.
CUPED👁 161
실험 분산을 줄여 검정력을 높이는 기법. Microsoft가 A/B에 적용.
NATS JetStream👁 161
NATS의 영속성·재시도·스트림. Kafka 경량 대안.
Star Schema👁 161
Warehouse의 고전적 설계. 중앙 팩트 테이블 + 여러 디멘션 테이블.
Time-Series Database👁 161
시계열 특화 DB. InfluxDB·TimescaleDB·VictoriaMetrics.
Unity Catalog Open Source👁 161
Databricks가 2024년 오픈소스화. 카탈로그·거버넌스.
Unstructured Data👁 161
정형 스키마 없는 데이터. 텍스트·이미지·음성·비디오. 전체 기업 데이터의 80%+.
Cohort Analysis👁 160
공통 속성의 사용자 그룹을 시간에 따라 추적하는 분석. 리텐션·LTV에 필수.
Databricks👁 160
Apache Spark 창시자들이 만든 통합 데이터·AI 플랫폼. Lakehouse 개념 주도.
Redpanda👁 160
Kafka 호환 스트리밍 엔진. C++·thread-per-core.
scikit-learn👁 160
Python의 전통 ML 라이브러리. 분류·회귀·클러스터링·전처리 포괄.
Tinybird👁 160
ClickHouse 기반 서버리스 실시간 분석 API.
VictoriaMetrics👁 160
Prometheus 호환 TSDB. 장기 저장·메모리 효율.
Chroma👁 158
개발자 친화 OSS 벡터 DB. Python 우선.
Materialize👁 158
실시간 스트리밍 SQL 엔진. Kafka 이벤트를 SQL view로 계속 갱신.
Mixpanel👁 158
제품 분석 SaaS의 대표. 이벤트 기반 퍼널·리텐션·코호트.
Unity Catalog👁 158
Databricks의 데이터 거버넌스 계층. 2024년 OSS.
Unity vs Polaris👁 158
Databricks Unity Catalog와 Snowflake Polaris 대결.
Feature Engineering👁 157
원본 데이터에서 모델 성능에 도움되는 특성을 설계·추출하는 작업. 전통 ML의 핵심.
Spark RDD👁 157
Spark의 저수준 분산 컬렉션. DataFrame 이전 세대.
Spark Structured Streaming👁 157
Spark의 스트리밍 API. 배치처럼 작성·실시간 실행.
Tabular Data👁 157
행·열로 구성된 구조화 데이터. DB 테이블·CSV·Excel. 전통 ML의 주 대상.
Windmill👁 157
오픈소스 개발자 플랫폼. 스크립트·워크플로·UI 통합.
Data Profiling👁 156
데이터의 분포·결측·품질을 자동 분석하는 과정. pandas-profiling·ydata-profiling.
Heap Analytics👁 156
자동 이벤트 추적 분석 도구. SDK 심으면 모든 UI 이벤트 자동 수집.
Kafka Streams👁 156
Kafka 내장 스트림 처리 라이브러리. JVM 앱에 포함해 사용.
Neural Network👁 156
인간 뇌의 뉴런을 모방한 연산 모델. 층 구조로 입력→출력 매핑을 학습.
Tecton👁 156
상용 Feature Platform. 실시간 feature pipeline·서빙.
MLOps👁 155
ML 모델의 개발·배포·모니터링을 DevOps처럼 체계화한 실천. CI/CD + 데이터·모델 버전 관리.
Pinecone Serverless👁 155
Pinecone 서버리스 벡터 DB. 사용량 과금.
Ray Data👁 155
Ray의 데이터 처리 라이브러리. Spark 대안, Python 네이티브 경험.
Real-time Analytics👁 155
초·분 단위 실시간 분석. Druid·ClickHouse·Pinot.
Change Data Capture👁 154
CDC
DB의 INSERT/UPDATE/DELETE를 실시간으로 캡처해 다른 시스템에 전파하는 기법.
Data Warehouse👁 154
분석용 대규모 구조화 데이터 저장소. OLAP 최적화. Snowflake, BigQuery, Redshift.
Sigma Computing👁 154
Warehouse 네이티브 BI. 스프레드시트 UX + SQL 파워.
Synthetic Data👁 154
실제 데이터 통계 속성을 유지하며 인공 생성한 데이터. 프라이버시·편향 문제 대응.
Weaviate👁 154
모듈형 OSS 벡터 DB. Hybrid 검색·임베딩 자동 생성.
Apache Hudi👁 153
Lakehouse 테이블 포맷. Upsert·Delete·Time Travel. Iceberg·Delta 경쟁.
CDP👁 153
Customer Data Platform
여러 소스의 고객 데이터를 통합·세분화·활성화. Segment·mParticle·Rudderstack.
Churn Rate👁 153
이탈률. 일정 기간 동안 서비스를 떠난 사용자 비율. SaaS의 핵심 지표.
Data Quality👁 153
데이터의 정확성·완전성·일관성·적시성을 측정·관리.
DuckDB UI👁 153
DuckDB 내장 웹 UI. 2024년 출시, 로컬 분석 편의.
Feature Attribution👁 153
어떤 기능이 전환·리텐션에 기여했는지 분석. 인과 추론과 연관.
Materialize👁 153
스트리밍 재료화 뷰 DB. PG 호환 + 실시간.
Metaflow👁 153
Netflix가 만든 ML 파이프라인 프레임워크. Python 클래스 기반, AWS 통합.
Redpanda👁 153
C++로 작성된 Kafka API 호환 스트리밍 플랫폼. JVM 없음, 10배 빠름.
Reverse ETL Platforms👁 153
Hightouch·Census·Rudderstack Profiles 비교.
Streaming-first Architecture👁 153
배치 대신 스트림을 기본으로. Kappa Architecture.
Streamlit 대시보드👁 153
Python 스크립트로 인터랙티브 웹 앱. 데이터 팀 프로토타입.
Text-to-SQL👁 153
자연어를 SQL로 변환. LLM 기반. BI 민주화의 핵심.