주목받는 GitHub 프로젝트.
topic:databricks 태그가 붙은 저장소입니다. Databricks 기반으로, 또는 그 주변에서 만들어진 오픈소스 도구, 연동, 액셀러레이터를 다룹니다. Releases에서 이미 소개한 공식 저장소는 제외합니다.
dbeaver
무료 범용 데이터베이스 도구 및 SQL 클라이언트
redash
회사를 데이터 기반으로 만드세요. 모든 데이터 소스에 연결하고 데이터를 쉽게 시각화, 대시보드화 및 공유하세요.
cube
📊 Cube Core는 AI, BI 및 임베디드 분석을 위한 오픈소스 시맨틱 레이어입니다
APIJSON
🏆 실시간 노코드, 강력하고 안전한 ORM 🚀 백엔드에서 코딩 없이 API 및 문서 제공, 프런트엔드(클라이언트)에서 응답 JSON 사용자 정의 🏆 实时 零代码、全功能、强安全 ORM 库 🚀 后端接口和文档零代码,前端(客户端) 定制返回 JSON 的数据和结构
WrenAI
AI 에이전트를 위한 GenBI(Generative BI): BigQuery, Snowflake, Databricks 등 20개 이상의 데이터 소스 전반에서 자연어 질문을 신뢰할 수 있는 대시보드, 차트, SQL로 변환하는 개방형 컨텍스트 레이어 기반의 오픈소스 거버넌스 지원 텍스트 투 SQL 솔루션
sqlglot
Python SQL Parser 및 Transpiler
growthbook
오픈소스 기능 플래그, 실험 및 제품 분석
SynapseML
간단하고 분산된 머신러닝
spark
.NET for Apache Spark, .NET 개발자에게 Apache Spark를 쉽게 제공
ai-dev-kit
Databricks 필드 엔지니어링에서 제공하는 코딩 에이전트용 툴킷
multiwoven
🔥🔥🔥 오픈 소스 리버스 ETL — Hightouch 및 Census의 대안
nao
👾 nao는 오픈 소스 분석 에이전트입니다. (1) nao-core CLI로 컨텍스트를 생성하고, (2) 모든 사용자를 위한 nao 채팅 인터페이스를 배포하세요.
zingg
ML을 활용한 확장 가능한 마스터 데이터 관리, ID 해결, 엔티티 해결 및 중복 제거
datacontract-cli
데이터 계약 적용
altimate-code
dbt, SQL, 클라우드 웨어하우스를 위한 오픈소스 agentic 데이터 엔지니어링 하네스. 100개 이상의 도구, 10개 웨어하우스, AI 기반.
mlops-stacks
이 저장소는 Databricks에서 프로덕션 모범 사례를 따르는 새로운 ML 프로젝트를 즉시 시작할 수 있는 맞춤형 스택을 제공합니다.
drawio-ai-kit
AI에게 정확하고 아름다운 draw.io 다이어그램을 그리도록 가르치기 — 선언적 레이아웃 엔진, 공식 스텐실, 구조 검증기, 비전 자체 체크. AWS, Azure, GCP, Databricks, BPMN 지원. 의존성 없음.
dataflare
간단하고 사용하기 쉬운 데이터베이스 관리자
Lynkr
Claude Code CLI를 사용하여 효율적인 코드 상호작용을 위한 HTTP 프록시 역할을 하는 CLI 도구 Lynkr로 워크플로 간소화
sqlkit
40개 이상의 데이터베이스를 지원하는 에이전틱 SQL 데이터베이스 관리 도구 — PostgreSQL, MySQL, SQL Server, SQLite, DuckDB, ClickHouse, Oracle 등. 경량, 프라이버시 우선, AI 기반, 크로스플랫폼. Tauri(Rust)로 제작.
dbldatagen
프로젝트를 위한 관련성 높은 합성 데이터를 신속하게 생성하세요
spark
Apache Spark UI를 위한 드롭인 대체품
dbx
🧱 Databricks CLI eXtensions (dbx) – Databricks 개발 및 고급 워크플로 관리를 위한 CLI 도구
dqx
Databricks, pySpark DataFrame 및 테이블의 데이터 품질 검증 프레임워크 공개
databricks_bootcamp_2026
Databricks 기반의 엔드투엔드 Data Lakehouse 프로젝트: Medallion 아키텍처(Bronze, Silver, Gold)를 따릅니다. Spark, PySpark, SQL, Delta Lake, Unity Catalog를 활용한 실제 데이터 엔지니어링 및 분석 워크플로우를 다룹니다. 학습, 포트폴리오 구축 및 취업 면접용으로 설계되었습니다.
Dataflare
빠르고, 간단한 데이터베이스 관리자
terraform-databricks-examples
Terraform을 사용하여 Databricks 리소스를 배포하는 방법
lakehouse-engine
Lakehouse Engine은 데이터 제품을 위한 Lakehouse 알고리즘, 데이터 흐름 및 유틸리티를 위한 확장 가능하고 분산된 엔진 역할을 하는 Python으로 작성된 구성 기반 Spark 프레임워크입니다.
rocky
전체 파이프라인을 타입 체크하고 실행 전에 파괴적 변경을 감지하는 SQL 변환 엔진 — 브랜치, 리플레이, 열 수준 lineage, 컴파일 타임 계약, 모델별 비용. 어댑터: Databricks, Snowflake, BigQuery, DuckDB. 단일 정적 Rust 바이너리. Apache 2.0.
dlt-meta
메타데이터 기반 Spark 선언적 파이프라인 프레임워크를 활용한 bronze/silver 파이프라인
databricks-code-practice
실습으로 Databricks 코딩 스킬을 연습하세요. Databricks Free Edition으로 가져와 코드를 작성하고, 어설션을 실행하며, 통과/실패를 확인하세요. Delta Lake, Spark SQL, PySpark, Auto Loader, 메달리온 아키텍처, 윈도우 함수 등을 다룹니다.
databricks-sql-python
Databricks SQL Connector for Python
owox-data-marts
오픈소스 셀프 서비스 분석 플랫폼
analytics-toolbox-core
BigQuery, Snowflake, Redshift, Postgres, Databricks를 공간 분석 기능으로 확장하는 UDF 및 프로시저 세트
universql
자체 인프라에서 실행되는 DuckDB로 Snowflake 컴퓨팅 푸시다운
stowage
불필요한 기능 없는 클라우드 스토리지 SDK
databricks-apps-cookbook
대화형 Databricks 앱 구축을 위한 즉시 사용 가능한 코드 스니펫
scalable-data-science
Databricks에서 Apache Spark를 활용한 확장 가능한 데이터 과학 과정 및 SageMath를 이용한 수학적, 통계적, 계산적 기초
lakebridge
주요 마이그레이션 활동 자동화를 통해 Databricks로의 마이그레이션 가속화
VariantSpark
유전체 변이 분석을 위한 머신러닝
