18 czerwca 2026
Google MCP Toolbox i Data Agent Kit — Claude Code jako partner analityka w BigQuery i dbt
- BigQuery
- dbt
- MCP
- Claude Code
- GCP
Każda sesja w Claude nad projektem dbt wygląda podobnie — pierwsze kilkanaście minut na tłumaczenie architektury od zera. Jakie masz datasety, jaka jest struktura modeli, medallion czy monolityczna, które tabele są punktem wejścia. Zanim agent zacznie generować cokolwiek użytecznego, musisz go najpierw wprowadzić w swój kontekst.
Google wypuścił dwa narzędzia, które to zmieniają. Mają różny poziom dojrzałości i ważne jest, żeby nie traktować ich tak samo.
Dwie warstwy — nie jeden produkt
Najczęstszy błąd przy opisywaniu tego ekosystemu: traktowanie MCP Toolbox i Data Agent Kit Starter Pack jako jednego bytu. To dwie osobne rzeczy, które ze sobą współdziałają.
MCP Toolbox for Databases (googleapis/genai-toolbox) to oficjalny projekt Google — repozytorium w organizacji googleapis, v1.4.0, 15,6k gwiazdek, Apache 2.0, semantic versioning. Produkuje serwery MCP dające agentowi bezpośredni dostęp do API GCP: BigQuery, Spanner, AlloyDB, Cloud SQL, Dataproc, Spark. Istnieje od końca 2024, v1.0.0 wyszło w kwietniu 2026. Ryzyko porzucenia: niskie.
Data Agent Kit Starter Pack (gemini-cli-extensions/data-agent-kit-starter-pack) to eksperymentalny starter pack — inne konto GitHub (nie googleapis), 111 gwiazdek, pre-v1.0, bez auto-update. Zawiera 19 plików Markdown z instrukcjami dla agenta (skille) plus konfigurację .claude-mcp.json podpinającą MCP Toolbox pod Claude Code. Google ma historię porzucania projektów — Stadia, Inbox, Google Feed, Google Glass. Warto używać, ale nie budować na tym produkcyjnych workflow z założeniem wiecznego wsparcia.
| MCP Toolbox | Data Agent Kit Skills | |
|---|---|---|
| Co to jest | Serwery MCP z dostępem do GCP API | Pliki Markdown z instrukcjami dla agenta |
| Jak działa | Osobny proces, Claude woła przez MCP protocol | Ładowane jako kontekst do sesji |
| Wymaga auth GCP | Tak — ADC + zmienne środowiskowe | Nie |
| Dojrzałość | Produkcyjna (v1.4.0, 15,6k ★, oficjalny Google) | Beta (pre-v1.0, 111 ★) |
| Upgrade | Semantic versioning, Homebrew lub binarka | Ręczna reinstalacja z numerem wersji |
Co daje MCP Toolbox — konkretnie dla BigQuery
Serwer bigquery eksponuje 11 narzędzi. W codziennej pracy analitycznej wchodzą w grę przede wszystkim:
bigquery_execute_sql— wykonuje SQL bezpośrednio (SELECT lub DML), obsługujedry_run=truedo walidacji bez faktycznego zapytaniabigquery_get_table_info— pobiera schemat tabeli: kolumny, typy, czas utworzeniabigquery_list_dataset_ids/bigquery_list_table_ids— inwentaryzacja zasobów bez wychodzenia z Claudebigquery_search_catalog— szukanie tabel i widoków po słowach kluczowych przez Dataplex Catalogbigquery_conversational_analytics— zapytania naturalnym językiem (Gemini Data Analytics pod spodem)
Efekt praktyczny: Claude w ramach sesji odpytuje BigQuery, widzi aktualny schemat i generuje kod oparty na rzeczywistej strukturze — nie na tym, co mu powiedziałeś pół godziny temu.
Oprócz BigQuery dostępne są serwery dla Spannera, AlloyDB, Cloud SQL, Dataplex, Dataproc i Serverless Spark. Każdy konfigurowany przez zmienne środowiskowe GCP_PROJECT_ID, GCP_REGION i ADC credentials.
Co dodają skille — domenowy kontekst bez tłumaczenia
Skille to pliki Markdown, które mówią Claude jak myśleć o danym temacie i w jakiej kolejności działać. Nie wykonują żadnego kodu — to kontekst ładowany przy starcie sesji. Dla analityka pracującego z GCP najistotniejsze z 19 dostępnych:
gcp-data-pipelines — punkt wejścia dla każdego pytania o pipeline na GCP. Claude najpierw skanuje projekt (szuka dbt_project.yml, workflow_settings.yaml, importów Beam), żeby ustalić, co już masz. Jeśli projekt jest nowy, pokazuje tabelę porównawczą narzędzi — DTS, dbt, Dataflow, Dataform, Spark, Composer — i czeka na Twój wybór. Skill działa jako router: nie decyduje za Ciebie, przekazuje dalej dopiero po Twojej decyzji.
dbt-bigquery — ekspert od pipeline’ów dbt na BigQuery. Wie jak zbudować model, jaka jest poprawna struktura projektu, jak pisać transformacje inkrementalne, gdzie leżą pułapki SQL (m.in. zamiana IN na EXISTS dla wydajności). Wymaga jawnej zgody przed każdym dbt run — nie pali danych bez pytania.
dataform-bigquery — analogiczny kontekst dla Dataform: składnia SQLX, operacje inkrementalne (append, upsert), walidacja przez dataform compile. Wybór gdy pracujesz natywnie z GCP i chcesz mieć harmonogram bez zewnętrznego orchestratora.
gcp-pipeline-orchestration — generuje i deployuje DAG-i Cloud Composera (zarządzany Apache Airflow). Tworzy pliki YAML z taskami (dbt run, Spark job, Dataform workflow, BQ SQL) i deployuje przez gcloud. MCP tu nie uczestniczy — agent pisze pliki i wysyła przez terminal.
dbt + Composer vs Dataform — różnica, która ma znaczenie
Tu leży praktyczna decyzja architektoniczna, którą warto rozumieć przed konfiguracją.
dbt Core nie ma wbudowanego schedulera. Transformacje piszesz i uruchamiasz ręcznie lub przez własny skrypt, ale jeśli chcesz odpalać pipeline codziennie o 3:00 — potrzebujesz zewnętrznego orchestratora. Na GCP naturalnym wyborem jest Cloud Composer (zarządzany Apache Airflow). Skill gcp-pipeline-orchestration generuje DAG w YAML z taskami dbt i deployuje przez gcloud. dbt Cloud ma własny scheduler, ale to płatna usługa — na GCP z dbt Core zawsze dokładasz Composera.
Dataform jest natywnie zintegrowany z BigQuery i ma wbudowane harmonogramowanie z poziomu interfejsu GCP — bez Airflow, bez Composera, bez osobnego klastra orchestracyjnego. Płacisz za wykonanie zapytań BQ, nie za dodatkową infrastrukturę. Kompromis: mniejsza elastyczność (tylko BigQuery), ale mniej do zarządzania.
Praktyczna heurystyka:
- Masz już dbt i chcesz zachować stack — dodajesz Composer przez skill
gcp-pipeline-orchestration - Zaczynasz od zera na GCP i zależy Ci na prostocie — Dataform ze skill
dataform-bigquery - Potrzebujesz orchestrować heterogeniczny pipeline (dbt + Spark + własny Python) — Composer i tak jest potrzebny niezależnie od wyboru narzędzia transformacji
Jak to wygląda w Claude Code — przykład z dbt i Composerem
Zakładam: projekt BigQuery my-analytics-prod, dataset raw_events, chcę zbudować model silver deduplikujący sesje GA4 i uruchamiać go codziennie automatycznie.
Krok 1: pobierz repozytorium
/plugin install to komenda Gemini CLI — nie Claude Code. W Gemini CLI wystarczy:
gemini extensions install https://github.com/gemini-cli-extensions/data-agent-kit-starter-pack
W Claude Code instalacja jest ręczna:
git clone https://github.com/gemini-cli-extensions/data-agent-kit-starter-pack
cd data-agent-kit-starter-pack
Skille z katalogu skills/ kopiujesz do .claude/commands/ w swoim projekcie — Claude Code załaduje je jako kontekst przy starcie sesji.
Krok 2: autentykacja do GCP
gcloud auth login
gcloud auth application-default login
Pierwsze polecenie daje dostęp dla komend CLI. Drugie — dla bibliotek i serwerów MCP. Bez ADC serwer BigQuery nie zadziała.
Krok 3: konfiguracja MCP
W sklonowanym repo znajdziesz plik .claude-mcp.json. Skopiuj go lub scal z plikiem .claude/mcp.json swojego projektu. Podmień wartości środowiskowe:
"env": {
"GCP_PROJECT_ID": "my-analytics-prod",
"GCP_REGION": "europe-central2"
}
Otwórz nową sesję Claude Code i wpisz /mcp — serwer bigquery powinien być widoczny na liście.
Krok 4: generowanie modelu dbt z aktualnym schematem
Sprawdź schemat tabeli raw_events.ga4_events i napisz dbt model
silver_sessions — deduplikacja po user_pseudo_id, partycjonowanie
po event_date, inkrementalny z merge na user_pseudo_id + event_date.
Claude przez MCP pobiera aktualny schemat z BigQuery, skill dbt-bigquery pilnuje poprawnej struktury modelu i generuje SQL, schema.yml i wpis w dbt_project.yml. Schemat nie jest wklejony ręcznie — agent go widzi bezpośrednio.
Krok 5: orchestracja przez Cloud Composer
Stwórz DAG Composera, który codziennie o 3:00 UTC odpala
dbt run --select silver_sessions i po sukcesie uruchamia
model gold_user_lifetime_value.
Skill gcp-pipeline-orchestration generuje YAML z taskami i deployuje przez gcloud. Nie wchodzisz do GUI Airflow — agent pisze plik i wysyła.
Aktualizacja — brak auto-update, pinuj wersję
Skille nie aktualizują się automatycznie. Żeby pobrać nową wersję:
cd data-agent-kit-starter-pack
git pull
Przed upgradem sprawdź CHANGELOG.md — projekt jest w becie, breaking changes przed v1.0 są możliwe. Jeśli edytowałeś .claude-mcp.json, po git pull porównaj ze zaktualizowanym oryginałem i scal ręcznie.
MCP Toolbox (genai-toolbox) upgraduje się niezależnie — przez Homebrew lub pobranie nowej binarki. Warto śledzić release’y osobno, bo to stabilniejsza warstwa z własnym cyklem wydań.
Ryzyka
| Ryzyko | Ocena |
|---|---|
| Skills pre-v1.0, mało gwiazdek, nieznane konto GitHub | Realne, lecz z naturalnymi zabezpieczeniami: pliki Markdown łatwo forkować i utrzymywać przez społeczność. Sundar Pichai podczas wyników Q3 2024 podał, że ponad 25% nowego kodu w Google powstaje z pomocą AI — skille wpisują się w ten trend od środka, nie jako projekt poboczny |
| MCP Toolbox — zewnętrzna binarka | Niska — oficjalny projekt googleapis, produkcyjna dojrzałość |
| Brak auto-update skilli | Wymagane ręczne śledzenie CHANGELOG i reinstalacja |
MCP Toolbox warto wdrożyć niezależnie od decyzji o skillach — to oficjalne, stabilne narzędzie, które eliminuje kopiowanie schematów i wyników zapytań między oknem BQ a sesją Claude. Skille traktuję jako przydatny kontekst domenowy, który skraca onboarding agenta do projektu, ale nie jako fundament infrastruktury.
Jeśli pracujesz też po stronie trackingowej, serię o wzbogacaniu zdarzeń w server-side GTM zaczynam od wzbogacania page_view e-mailem przez Stape Store.