MMIX Blog

게으르고 명석하지 못한 개발자 블로그


  • 홈

  • 카테고리

  • 태그

  • 소개

데이터 엔지니어 인터뷰 — GCP

작성일 2026-08-12 | 분류 인터뷰 |
GCS 스토리지 클래스, Dataflow와 Dataproc, Pub/Sub, Composer, Datastream, IAM 계층과 서비스 계정, 네트워크와 비용 관리를 데이터 엔지니어 관점에서 정리합니다.
더 읽어보기 »

데이터 엔지니어 인터뷰 — Flink

작성일 2026-08-12 | 분류 인터뷰 |
Flink의 스트림 우선 모델, 이벤트 시간과 워터마크, 체크포인트와 정확히 한 번 처리, 상태 관리와 백프레셔를 질문과 핵심 답변으로 정리합니다.
더 읽어보기 »

데이터 엔지니어 인터뷰 — BigQuery

작성일 2026-08-12 | 분류 인터뷰 |
BigQuery의 아키텍처와 슬롯, 파티셔닝과 클러스터링, 비용 모델과 최적화, 스트리밍 적재와 Storage Write API, MERGE와 CDC 처리를 정리합니다.
더 읽어보기 »

데이터 엔지니어 인터뷰 — Airflow

작성일 2026-08-12 | 분류 인터뷰 |
DAG와 스케줄링 모델, execution_date와 백필, 태스크 간 데이터 전달, 실행자 선택, 멱등성과 재시도, 센서와 동시성 제어를 질문과 핵심 답변으로 정리합니다.
더 읽어보기 »

데이터 엔지니어 인터뷰 — AWS

작성일 2026-08-12 | 분류 인터뷰 |
S3 스토리지 클래스와 성능, Glue와 EMR, Redshift 분산 설계, Kinesis와 MSK, IAM 권한 모델, 비용 최적화를 데이터 엔지니어 관점에서 정리합니다.
더 읽어보기 »

Claude Code 통합 가이드

작성일 2026-08-12 | 분류 기타 |
하나의 Mac에서 2개의 Claude Code 인스턴스를 독립적으로 운영하면서, 각 계정별로 MCP 서버와 Telegram 봇을 연결하는 방법을 정리합니다.
더 읽어보기 »

Spark Core · mapPartitions · coalesce

작성일 2026-08-11 | 분류 데이터엔지니어링 , 스파크 |
Spark의 병렬도는 Core 수가 아니라 파티션 수가 결정합니다. Core와 파티션의 관계, mapPartitions가 실제로 유리한 지점, coalesce가 설정한 대로 동작하지 않는 이유를 정리합니다.
더 읽어보기 »

MSK 커넥터 vs Spark Streaming 비교

작성일 2026-08-11 | 분류 데이터엔지니어링 , 스파크 |
Kafka(MSK)에서 BigQuery로 데이터를 흘려보내는 두 가지 방식을 POC로 비교했습니다. 완전관리형 커넥터의 편의성과 Spark Structured Streaming의 변환 유연성 사이에서 무엇을 기준으로 골라야 하는지 정리합니다.
더 읽어보기 »

Apache Spark 4.2 / 4.3 신규 기능 정리

작성일 2026-08-11 | 분류 데이터엔지니어링 , 스파크 |
4.2.0은 플랫폼 레벨 릴리스(Java 25, Pandas 3, K8s, GEOSPATIAL, CDC CHANGES, QUALIFY, Real-Time Mode), 4.3.0은 SQL 엔진 내부 중심(압축 아카이브 읽기, UNNEST/JSON_TABLE, AQE 스큐 최적화)입니다. 실무 적용 관점에서 정리했습니다.
더 읽어보기 »

Series 란?

작성일 2026-02-06 | 분류 데이터엔지니어링 , 판다스 |
Pandas의 Series는 1차원 데이터 구조로, 하나의 값 배열에 인덱스(라벨)가 결합된 형태입니다. 엑셀의 한 열(column)이나, 파이썬 리스트에 이름표를 붙여둔 구조로 생각하면 이해하기 쉽습니다. Seri
더 읽어보기 »
1 2 3 … 14
MMIX

MMIX

JVM 기반 백엔드와 데이터 플랫폼을 느리게 파고드는 개발자

139 포스트
20 카테고리
59 태그
RSS
GitHub E-Mail
© 2026 MMIX
Jekyll 기반
테마 - NexT.Pisces