| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 카프카
- docker
- dbt_project
- 쿠버네티스
- 동적 차트
- proerty
- 파이썬
- Materializations
- k9s
- numpartitions
- bar cahrt
- mysql
- DBT
- 도커
- 모바일
- 크롤링
- freshness
- spark
- query history
- Python
- spring boot
- airflow
- CDC
- UI for kafka
- polars
- 윈도우
- KubernetesPodOperator
- ksql
- Java
- kafka
- Today
- Total
목록전체 글 (219)
데이터 엔지니어 이것저것
참고사항 : 윈도우 환경에서 실행. 추후, 쿠버네티스환경을 넘어가기전에 빠른 테스트를 위해 공식문서에서 제공하는 docker 기반으로 테스트 진행iceberg도 필요함으로, iceberg가 포함된 starrocks 실행. ( starrocks 3.2.0 이상의 경우 iceberg 포함 ) FE메타데이터관리, 클라이언트 연결관리, 쿼리 계획 및 쿼리 스케줄링 담당메타데이터 전체 복사본을 메모리에 저장하고 유지 관리하며 FE간 차별없는 서비스를 보장 BE데이터 저장과 쿼리 실행 계획 수립 모두 담당 docker-compose.yaml ( https://docs.starrocks.io/docs/quick_start/iceberg/#docker-compose )services: starrocks-fe: ..
starrocks실시간, 다차원, 고 동시성 데이터 분석을 지원하는 고성능 분석 데이터 웨어하우스MPP 아키텍처를 기반으로 하며, 완 전 벡터화 엔진, 실시간 업데이트를 지원하며 컬럼형 스토리이 엔진을 탑재다양한 데이터 소스에서 실시간 및 배치 데이터 수집을 지원하며, 데이터 레이크에 저장된 데이터를 마이그레이션없이 직저 분석 OLAP 다차원 분석, 실시간 분석, 고동시성 분석, 통합 분석 지원 추후 도입 시나리오프로모션 분석라이브 스트리밍 분석광고주 보고서 분석 ┌────────────────────┐ │ RDBMS │ │ (MySQL / Postgres) │ └─────────┬──────────┘ ..
Apache Flink란분산 스트리밍 데이터 처리 프레임워크로, 실시간 데이터 스트리밍을 정확하고 안정적으로 처리할수 있도록 설계특징데이터를 수신하자마자 처리상태 기반 처리 : 복잡한 이벤트 처리 가능중복 없는 처리 보장데이터의 발생 시점 기준으로 처리 가능윈도우, 프로세스 함수등 다양한 연산 지원 왜 플링크를 쓰는가실시간 데이터 분석상태 기반 스트림 처리정확한 처리 보장복잡한 이벤트 처리워터마크 기반 지연 이벤트 처리 Flink vs Spark 정확성, 복잡성, 지연 민감도가 높을수록 Flink단순 스트림 처리 및 Spark 환경 통합에는 Spark Streaming 환경 세팅version: "3.7"services: jobmanager: image: flink:latest ports:..
오픈소스 git GUI 클라이언트 비교 대상 및 순위깃 크라켄소스깃깃허브 데스크탑1등은 깃 크라켄 이지만, 유료 (1년에 약 15만원, 계정 당), 가격 부담이 있어 무료 툴을 사용 소스깃이 것허브 데스크탑보다 순위가 높은 이유는, 깃허브 데스크탑에는 그래프 기능을 미지원.( 약 5년째 미반영 ) 링크 : https://github.com/sourcegit-scm/sourcegit?tab=readme-ov-file#screenshots 설치법 ( 윈도우 ) winget install SourceGit 이후 win + R 을 통해 SrouceGit 실행 화면
Airflow 에서 SparkSubmitOperator 을 하기 위한 jar 파일 생성법 DIR 안에 여러개의 스칼라 코드가 존재하고, 여러개의 main 클래스가 존재하여 이를 한번에 jar 파일로 생성했을때실행이 안되고 에러가 발생하는 문제가 존재하여 이를 해결하는 방법 작성. project 폴더에 plugin.sbt 파일 생성build.sbt 작성 plugin.sbt 파일 생성project 하위 폴더에 plugin.sbt 파일 생성 addSbtPlugin( "com.eed3si9n" % "sbt-assembly" % "2.3.0")jar 파일 생성을 위한 플러그인 추가 build.sbt 작성기존 sbt에 설정 추가 libraryDependencies ++= Seq( "org.apache.spark..
목표 : 로컬환경에서 airflow 와 spark를 연동하여 사용 로컬에서 airflow와 spark를 연동해서 사용하기 위해서는 java가 필요하기 떄문에 base 이미지 부터 수정이 필요. DockerfileFROM apache/airflow:2.10.4-python3.12USER rootRUN apt-get update && \ apt-get install -y openjdk-17-jdk && \ apt-get install -y ant && \ apt-get clean;# Set JAVA_HOME environment variableENV JAVA_HOME /usr/lib/jvm/java-17-openjdk-amd64ENV PATH $JAVA_HOME/bin:$PATHUSER ai..
시간 복잡도란?계산 복잡도 이론에서 시간 복잡도는 문제를 해결하는데 걸리는 시간과 입력의 함수 관계를 가리킨다 시간 복잡도를 이용하여, 프로그램의 시간이 얼마나 걸릴지 대략적으로 예상이 가능표기법은 대문자 O 를 사용한다 ( Big-O 표기법 )최악의 경우에 시간이 얼마나 걸릴지 알 수 있다 Big-O 표기법 O(1): 상수 시간 복잡도, 입력 크기에 상관없이 항상 같은 시간이 걸림.O(log n): 로그 시간 복잡도, 입력 크기가 커질수록 로그에 비례하여 시간이 증가함.O(n): 선형 시간 복잡도, 입력 크기에 비례하여 시간이 증가함.O(n log n): 선형 로그 시간 복잡도, 정렬 알고리즘에서 주로 발생함.O(n^2): 이차 시간 복잡도, 중첩 반복문을 사용하는 경우.O(2^n): 지수 시간 복잡도..
PolarsPandas와 같은 기존의 데이터 처리 라이브러리가 가진 성능적 한계를 극복하기 위해 탄생Rust 기반으로, 멀티스레딩과 병렬 처리를 지원, 대규모 데이터셋을 보다 빠르고 효율적으로 처리할 수 있도록 설계 요약 : Spark를 사용하기엔 데이터가 작고, Pandas로 돌리기엔 데이터가 많을때 좋다 속도 배경기존 Pandas를 대체하기 위한 도구 탐색 평소에는 문제 없이 동작을 잘하지만, 대용량 업데이트 시, OOM이 발생.이를 해결하기 위해 Spark를 도입하기에는 비용문제와, 기본 로직을 많이 바꿔야하는 이슈 발생Spark를 사용해본적이 없어 도입 및 이슈 발생시 대처하는데 시간이 오래걸림. 특징Rust 기반으로, 외부 종속성이 없다I/O : 일반적인 데이터 저장 계층에 대한 최고 수준의 지..