Cotygodniowa dawka linków, czyli archiwum newslettera Dane i Analizy
W tym wydaniu powraca temat architektury danych i platformy lakehouse – Apache Iceberg, Databricks, Microsoft Fabric – ale tym razem z wyraźnie różnymi kątami. Jeden artykuł tłumaczy, czym Databricks w ogóle jest i jak działa. Drugi mówi wprost, dlaczego migracja na tę platformę często idzie nie tak. Trzeci pokazuje, jak zorganizować porządny proces wdrożeniowy – ale w Microsoft Fabric. Razem tworzą niezły przegląd tego, co czeka Cię przy pracy z nowoczesnymi platformami danych:
Databricks od podstaw – architektura, warstwy danych, ekosystem, pułapki migracji enterprise do Databricks – czyli co zwykle idzie nie tak, DEV-to-PROD w Microsoft Fabric – jak to zorganizować procesowo.
Dużo materiałów dotyczy też jakości danych i wiarygodności wyników – od problemu zduplikowanych identyfikatorów w systemach IoT, przez SQL odporne na zmiany słowników biznesowych, aż po artykuł o tym, że każda liczba w raporcie niesie za sobą ukryte założenia autora. To tematy ważne nie tylko dla inżynierów, ale dla każdego, kto korzysta z raportów i podejmuje na ich podstawie decyzje.
Dla miłośników narzędzi i dobrego rzemiosła: artykuł o tym, jak pisać porządne logi w systemach produkcyjnych (rzadko omawiane, a robi ogromną różnicę przy debugowaniu), materiał o budowaniu grafów wiedzy z surowych danych sieciowych, oraz praktyczny wzorzec pracy z AI przy pisaniu infrastruktury jako kodu. Do tego kilka materiałów o AI agentach – od trackerów wydatków po integrację Power BI z protokołem MCP.
Dobrego czytania – i udanego startu nowego tygodnia!
ai_agent
Build an AI Agent Expense Tracker with Streamlit, FastAPI, Function Calling & Google Sheets
Zamiast klikać pola formularza, piszesz po prostu „wydałem 120 zł na lunch z klientem” – i agent sam wyciąga kwotę, kategorię i datę, po czym zapisuje to do arkusza Google. Artykuł pokazuje, jak zbudować taki system od zera w Pythonie: interfejs użytkownika, backend obsługujący zapytania i logikę AI wydobywającą dane ze swobodnego tekstu. To kompletny projekt do nauki – łączy kilka popularnych narzędzi i dobrze ilustruje, jak wygląda budowanie aplikacji z agentami AI w praktyce, a nie tylko w teorii.
Claude Code CLI Commands I Wish I Had Known Sooner
Claude Code to narzędzie AI do kodowania działające z terminala – i jak większość narzędzi CLI, kryje sporo możliwości, o których nie przeczytasz w oficjalnym quick-start. Artykuł zbiera te mniej oczywiste: jak wznowić poprzednią sesję z zachowanym kontekstem zamiast zaczynać od zera, jak puścić zadanie w tle i wrócić do niego później, jak ustawić twardy limit kosztów żeby nie dostać niespodziewanego rachunku, czy jak zdiagnozować, dlaczego coś nagle przestało działać. Przydatna lektura nawet jeśli używasz Claude Code od jakiegoś czasu.
analiza_danych_projekty
Data is always biased: Creating metrics from event data
Czy ta sama metryka może dawać zupełnie inne wyniki w zależności od tego, kto ją liczy? Tak – i artykuł udowadnia to na danych z piłkarskiej Eredivisie. Różne firmy analityczne stosują inne definicje tego, czym jest podanie progresywne czy drybling, przez co statystyki tych samych zawodników różnią się znacząco w zależności od dostawcy. To świetna lektura dla każdego, kto pracuje z danymi biznesowymi – bo dokładnie ta sama zasada działa w każdym raporcie sprzedażowym, marketingowym czy operacyjnym: liczba zawsze niesie za sobą zestaw założeń jej twórcy.
architektura
What a Small Retail Platform Can Teach You About Big-System Design
Co mały system sklepowy może nauczyć o projektowaniu dużych systemów? Okazuje się – całkiem sporo. Ten projekt to celowo mały system kasowy i zarządzania magazynem, zbudowany tak, żeby przetestować wzorce niezawodności, które potem pojawiają się w systemach enterprise. Artykuł wyjaśnia, jak zapewnić, że wiadomość między serwisami nie zginie ani nie zostanie przetworzona dwa razy – nawet gdy coś po drodze się wysypie. Dobry materiał dla osób, które słyszały o architekturze zdarzeniowej, ale chcą zobaczyć, jak to wygląda w praktyce na konkretnym, niezbyt skomplikowanym przykładzie.
Fixing bugs in Event Sourcing is hard, for real?
Naprawa błędu w produkcyjnej bazie danych to jedno z najbardziej stresujących doświadczeń w pracy inżyniera – szczególnie gdy trzeba coś nadpisać i nie wiadomo, co jeszcze przypadkowo zmieniono. Event Sourcing rozwiązuje ten problem przez zmianę filozofii: zamiast trzymać aktualny stan, system przechowuje historię wszystkich zdarzeń. Błąd naprawia się, dopisując zdarzenie korygujące – bez dotykania poprzednich wpisów. Artykuł rozprawia się z mitem, że naprawa błędów w takich systemach jest trudna, i pokazuje krok po kroku, jak to wygląda w praktyce.
EventCatalog – SKUTECZNA dokumentacja architektury Twojego systemu
Dokumentacja architektury systemu zazwyczaj żyje własnym życiem – ktoś coś narysował rok temu na Confluence i od tamtej pory diagram ma niewiele wspólnego z rzeczywistością. EventCatalog to narzędzie, które przechowuje dokumentację razem z kodem, w repozytorium Git, i generuje z niej interaktywną stronę z mapą serwisów, zdarzeń i przepływów. Artykuł to uczciwa recenzja z opisem realnych zalet i ograniczeń – w tym kosztów utrzymania przy większej liczbie projektów. Dobrym bonusem jest wskazówka, jak używać asystentów AI do aktualizowania dokumentacji zamiast robić to ręcznie.
22 Google Cloud Reference Architectures to Start Your GCP Architect Journey (2026 Edition)
Jeśli projektujesz systemy w Google Cloud lub dopiero zaczynasz na tej platformie, ten artykuł zbiera 22 gotowe wzorce do skopiowania i zaadaptowania – od podstawowej infrastruktury sieciowej, przez potoki danych w BigQuery, aż po systemy agentów AI zintegrowanych z Gemini. Co wyróżnia wydanie z 2026 roku: pojawiają się zupełnie nowe tematy jak zabezpieczenia przed manipulacją modelami AI i zarządzanie kosztami drogich zasobów obliczeniowych. Dobry punkt wyjścia i lista referencyjna dla architektów chmury.
bazy_danych
AWS CLI v2 by Examples: Mastering CRUD Operations in DynamoDB
DynamoDB to baza danych Amazon popularna w projektach chmurowych, ale zarządzanie nią z linii komend potrafi być nieintuicyjne – szczególnie gdy chcesz bezpiecznie nadpisać rekord (z CLI!) bez ryzyka, że ktoś inny zrobił to chwilę wcześniej. Artykuł zbiera praktyczne przykłady: jak dodawać, aktualizować i usuwać dane z warunkami sprawdzającymi aktualny stan, jak efektywnie czytać rekordy i jak to skryptować do automatyzacji. Przydatna lektura dla inżynierów, którzy wolą terminal od klikania w konsolę AWS.
big_data
Databricks Platform Architecture Explained: An End-to-End Guide with Enterprise Use Cases
Czym właściwie jest Databricks i jak jest zorganizowany od środka? Ten artykuł odpowiada na to pytanie przekrojowo – tłumaczy, że dane i obliczenia są tu od siebie oddzielone (płacisz tylko za czas przetwarzania, dane leżą w chmurze), opisuje warstwy przechowywania danych (surowe → oczyszczone → gotowe do raportowania) i pokazuje, jak platforma łączy analitykę z uczeniem maszynowym. Dobry punkt startowy jeśli słyszałeś o Databricks i chcesz zrozumieć, zanim zaczniesz cokolwiek konfigurować.
Why Moving Enterprise Data to Databricks Is Harder Than Most Teams Expect
Migracja danych do Databricks brzmi jak projekt techniczny – wystarczy przenieść pliki i skrypty, a platforma zajmie się resztą. W praktyce większość takich projektów potyka się o coś zupełnie innego: historyczny dług w danych, nieudokumentowane transformacje, stare reguły biznesowe zakopane w legacy systemach. Przeniesienie nieuporządkowanych danych na nową platformę nie porządkuje danych – tylko przyspiesza wykonywanie błędów. Artykuł dobrze artykułuje, dlaczego sukces migracji zależy bardziej od jakości danych i zarządzania nimi niż od wyboru technologii.
7 Managed Iceberg Lakehouse Solutions You Should Know
Apache Iceberg to dziś popularny format przechowywania danych analitycznych – trochę jak standard pliku, który rozumieją różne narzędzia. Problem polega na tym, że samo wybranie formatu to dopiero początek: z czasem dane się fragmentują, rosną stosy niepotrzebnych plików i wszystko zaczyna działać wolniej. Artykuł przegląda siedem podejść do zarządzania tym problemem – od gotowych platform all-in-one, przez dedykowane narzędzia operacyjne, aż po rozwiązania wbudowane w chmurę AWS. Dobry punkt startowy, jeśli zastanawiasz się, która strategia pasuje do Twojego środowiska.
data_engineering
Avoiding Entity Key Drift in a Data Lake: Step 1, Normalization
Wyobraź sobie, że ta sama stacja pogodowa trafia do bazy danych jako trzy różne encje – bo raz ma spację, raz literówkę, a raz trochę inny zapis nazwy. Twoje raporty liczą ją trzykrotnie, ale nikt tego nie widzi. Artykuł pokazuje dokładnie ten problem na danych z 719 stacji IoT i tłumaczy, dlaczego warto dbać o czystość identyfikatorów już na etapie przyjmowania danych do systemu – a nie próbować naprawiać je później, głębiej w pipeline’ie, gdy błędy zdążyły się już utrwalić.
A Data Engineer’s Guide to DEV-to-PROD in Microsoft Fabric
Jeśli Databricks to odpowiedź na pytanie „co to jest i jak działa”, to ten artykuł odpowiada na pytanie „jak zorganizować pracę, żeby nie chaotycznie klikać w produkcji”. Skupia się na Microsoft Fabric i pokazuje konkretny przepływ: oddzielne środowisko do pisania kodu i osobne do produkcji, automatyczne przepływy danych przez trzy warstwy, testy jakości jako obowiązkowy checkpoint przed każdym wdrożeniem. Dobry wzorzec do zaadaptowania niezależnie od tego, czy pracujesz w Fabric czy innym narzędziu – bo problem „jak nie narobić bałaganu przy wdrażaniu” jest universalny.
A Billion Events a Day: How We Built Ads Analytics That Actually Works
Jak wygląda platforma analityczna, gdy musi obsłużyć miliard zdarzeń każdego dnia – i przy tym działać w czasie rzeczywistym na potrzeby targetowania reklam? Zepto opisuje drogę od naiwnego podejścia, które przestało działać przy skali, do architektury opartej na zapisywaniu surowych danych i liczeniu agregacji dopiero podczas odczytu. Ciekawym wątkiem jest rozdzielenie dwóch zadań: ciężkiej analizy wielowymiarowej (uruchamianej co godzinę) i lekkiej kontroli budżetów kampanii (co 3 minuty). To case study warte uwagi niezależnie od skali – bo problemy, które opisują, pojawiają się wcześniej, niż myślisz.
devops
Spec-Driven Infrastructure: How I Use AI to Go from Requirements to Terraform
Największy problem z pisaniem infrastruktury przy pomocy AI polega na tym, że model nie zna kontekstu Twojego projektu i generuje generyczny kod, który potem trzeba długo poprawiać. Artykuł opisuje sposób na rozwiązanie tego: zanim poprosisz AI o kod, przygotowujesz trzy pliki tekstowe – z wymaganiami, decyzjami projektowymi i listą zadań. Dopiero mając ten kontekst, model generuje kod znacznie bliższy temu, czego naprawdę chcesz. Wzorzec działa z dowolnym narzędziem AI i nie wymaga niczego poza edytorem tekstu.
How to structure a log
Logi to pierwsze miejsce, do którego zaglądamy, gdy coś się psuje na produkcji. Problem polega na tym, że większość logów jest bezużyteczna w trybie kryzysowym – pełno w nich długich komunikatów tekstowych, których nie da się przeszukać ani zestawić ze sobą. Artykuł z Sentry pokazuje konkretne zasady pisania logów, które faktycznie pomagają: stałe, krótkie nazwy zdarzeń, szczegóły w osobnych polach, brak zmiennych wartości w treści komunikatu. Niby proste – ale wdrożenie tego podejścia radykalnie zmienia jakość debugowania.
management
Developer Experience as a Measurable Outcome
Jak mierzyć, czy inwestycja w narzędzia i platformy deweloperskie przynosi efekty? Artykuł proponuje konkretne podejście: zamiast ograniczać się do wskaźników szybkości deploymentów, warto mierzyć takie rzeczy jak czas od zatrudnienia nowego inżyniera do jego pierwszego samodzielnego wdrożenia czy odsetek zadań możliwych do zrobienia bez proszenia kogoś o pomoc. Kluczowy wniosek jest praktyczny: te liczby trzeba umieć przetłumaczyć na język finansowy – bo to jedyny sposób, żeby uzasadnić budżet na platformę wewnętrzną przed zarządem.
powerbi
Power BI Modeling MCP Server – AI agents dla semantycznych modeli Power BI
Microsoft opublikował projekt, który pozwala agentom AI bezpośrednio pracować z modelami danych w Power BI Desktop i Fabric – zamiast klikać w interfejsie, agent może sam tworzyć miary, walidować zapytania i generować dokumentację. Komunikacja odbywa się przez standardowy protokół MCP, więc integracja z istniejącym środowiskiem pracy jest prosta. Bezpieczeństwo opiera się na firmowym logowaniu przez Microsoft – tokeny nie są przechowywane lokalnie. Warto pamiętać, że agent działający z uprawnieniami do zapisu może zmienić więcej, niż się spodziewasz – dobrze zanim to się stanie przemyśleć zakres jego uprawnień.
python
Apache Iceberg Explained for Python Developers
Apache Iceberg to coraz częściej spotykany format w projektach danych, a ten artykuł tłumaczy go od podstaw z perspektywy Pythona – bez zakładania, że znasz ekosystem Javy czy Sparki. Dowiesz się, dlaczego proste pliki danych na chmurowym dysku zaczynają sprawiać problemy przy większej skali (nadpisania, brak historii zmian, trudność z modyfikacją struktury) i jak Iceberg je rozwiązuje. Przykłady kodu sprawiają, że materiał jest łatwy do odtworzenia nawet bez dostępu do pełnego środowiska chmurowego. Dobrze czytać w parze z przeglądowym artykułem o 7 rozwiązaniach Iceberg z sekcji #BIG_DATA.
LLM Wikis Are Over-Engineered – I Replaced Mine With a Pure Python Compiler
Czy naprawdę potrzebujesz agenta AI, żeby zarządzać swoimi notatkami? Autor twierdzi, że nie – i zastąpił cały agentowy system prostym skryptem w Pythonie, który zawsze daje ten sam wynik, nie wymaga dostępu do internetu i nie kosztuje ani jednego tokena. Artykuł to ciekawa kontrpropozycja wobec trendu „AI do wszystkiego” – i dobry przykład tego, że zanim sięgnie się po model językowy, warto sprawdzić, czy zwykły program nie zrobi tej samej roboty taniej i pewniej.
sql
Handle Slowly Changing ONTOLOGY Mappings
Biznes zmienia nazwy kategorii, segmentów i statusów – i w tym samym momencie raporty zaczynają dawać błędne wyniki, bo zapytania SQL szukają starej nazwy, której już nie ma. Artykuł pokazuje eleganckie rozwiązanie tego problemu: zamiast wpisywać na sztywno nazwy do kodu, łączymy dane z osobną tabelą mapowań, która pamięta, co jak się nazywało i od kiedy. Podejście działa w każdej bazie SQL, nie wymaga specjalnych narzędzi i – co ważne – pozwala zachować historyczne dane w stanie sprzed zmiany.
wizualizacja_danych
What do we (really) know about data visualization?
Większość z nas projektuje wykresy, wybierając spośród opcji dostępnych w Excelu lub Power BI. Problem polega na tym, że te narzędzia celowo ograniczają możliwości do kilkunastu najpopularniejszych typów – a poza tym menu istnieje cały świat wykresów, które byłyby znacznie lepszym wyborem do wielu analiz biznesowych. Artykuł stawia mocną tezę: nie wiemy o wizualizacji tak wiele, jak nam się wydaje, bo nasza wiedza jest kształtowana przez to, co producenci oprogramowania zdecydowali się wdrożyć. Warto przeczytać, żeby zrozumieć, gdzie szukać inspiracji poza domyślnymi panelami.
How to Turn Any Network Into an Interactive Knowledge Graph To Discover Hidden Insights.
Dane relacyjne – kto z kim, co z czym, które elementy są ze sobą powiązane – ciężko zrozumieć, patrząc na tabelę. Artykuł pokazuje, jak zamienić dowolny zbiór powiązań w interaktywny graf wiedzy, który można klikać, filtrować i eksplorować w przeglądarce. Narzędzia to biblioteki oparte na D3.js, a efekt przypomina interfejsy znane z Obsidiana. Ciekawym wątkiem jest też zastosowanie grafowej reprezentacji do lepszego kontekstu dla modeli LLM – gdy relacje między pojęciami są wprost zakodowane w strukturze, model ma z czego wnioskować.