Przejdź do treści

LLM zwraca poprawny JSON i się myli. Plus: pathlib, benchmarki i marka osobista w IT

Cotygodniowa dawka linków, czyli archiwum newslettera Dane i Analizy

W tym wydaniu dużo o narzędziach, które już pewnie masz w stosie, ale rzadko trafia się dobry materiał tłumaczący ich działanie od środka. Są tu teksty o Airflow 3, dbt, Marquezie i formatach serializacji, a każdy z nich ma konkretną tezę, nie tylko opis funkcji.

jak migracja z legacy ETL do dbt wygląda krok po kroku, dlaczego Parquet eliminuje do 80% narzutu I/O w porównaniu z CSV, co Marquez robi z Twoim data lineage i jak integruje się z OpenLineage.

Python pojawia się w tym numerze w trzech odsłonach: pathlib jako zamienik os.path, niskopoziomowe wizualizacje publikacyjne w matplotlib i zestaw bibliotek, o których rzadziej się słyszy, w tym PyScript uruchamiający kod Pythona bezpośrednio w przeglądarce przez WebAssembly.

Po stronie AI: co się naprawdę dzieje, kiedy LLM zwraca poprawny JSON, ale wypełnia brakujące pola halucynacją; jak Claude Code działa lepiej po 6 miesiącach złego użycia; i co BenchMIRT odkrywa w powszechnie cytowanych benchmarkach po analizie 100 modeli i 34 tysięcy pytań.

Na koniec trzy tematy spoza kodu: wyciek klucza API do Gita z konkretnym schematem reakcji, marka osobista w IT bez zakładania kanału YouTube i jak ćwiczyć data storytelling bez rozwijania wszystkiego naraz. Miłej lektury.


ai_agent

I used Claude Code wrong for months – these commands finally made it click
Traktowanie Claude Code jak czatu albo autocompletera szybko degraduje okno kontekstowe i precyzję generowanych zmian. Artykuł opisuje, czego brakuje w typowym użyciu: tryb plan mode, trwały plik pamięci, audyt tokenów i komendy sesyjne z bezpiecznym rollbackiem. Różnica jest odczuwalna przy długich zadaniach inżynierskich, gdzie bez tych mechanizmów instrukcje rozmywają się po kilkunastu krokach.

ai_ml

Your LLM Can Return Perfect JSON and Still Be Wrong
Structured Outputs gwarantuje poprawną składnię JSON, ale nie gwarantuje poprawnych danych. Gdy wejście jest niekompletne, model wypełnia wymagane pola halucynacją zamiast je pominąć. Rozwiązanie: pola nullable w Pydantic, pola provenance z cytatem źródłowym przed wartością i deterministyczna walidacja reguł biznesowych w kodzie, nie w prompcie.

airflow

Apache Airflow: The Complete Guide for Developers
Airflow 3.3.1 wprowadza zmiany, które unieważniają część procedur znanych z gałęzi 2, w tym polecenie airflow webserver. Artykuł opisuje podstawy orkiestracji zadań wsadowych w Pythonie: egzekwowanie zależności, harmonogramowanie, polityki retry i wizualizację stanu potoków. Dobry punkt startu do weryfikacji, czy Twój setup jest aktualny.

analiza_danych_koncepcje

how do I get better at data storytelling?
Dane same w sobie nie przekonują interesariuszy do działania. Artykuł rozkłada data storytelling na pięć filarów: podstawy wizualne, budowanie narracji, selekcja strategiczna, wywieranie wpływu i technika prezentacji. Kluczowa obserwacja: rozwijanie wszystkich naraz nie działa, lepiej zidentyfikować jedno wąskie gardło i pracować nad nim przez co najmniej rok.

bazy_danych

Postgres Job Queue, pg_cron, and Full-Text Search
PostgreSQL od wersji 14 potrafi zastąpić dedykowaną kolejkę (SKIP LOCKED), harmonogram (pg_cron) i wyszukiwarkę pełnotekstową (tsvector, pg_trgm). Artykuł pokazuje też twarde ograniczenie: pg_notify wewnątrz triggera może zablokować procesy na etapie commitu i lawinowo zwiększyć liczbę aktywnych sesji. Dobra lektura przed decyzją, czy potrzebujesz Kafki.

big_data

20 Free Data Sources and Where to Find Them
Lista 20 darmowych źródeł danych to nie tylko linki. Artykuł omawia warunki licencyjne (ODbL, share-alike), metody dostępu (API, S3, SPARQL) i realne koszty po stronie infrastruktury. Kaggle, Hugging Face, AWS Open Data i portale rządowe różnią się pod kątem licencji komercyjnych, co warto sprawdzić przed fazą projektową.

ciekawostki

Siedzisz po uszy w kodzie i nie masz pojęcia co wrzucić na LinkedIn. Marka osobista w IT
Kiedy AI generuje treści techniczne na masową skalę, sama wiedza przestaje wystarczyć jako wyróżnik. Odcinek podcastu Porozmawiajmy o IT pokazuje, jak inżynierowie mogą budować widoczność bez zakładania kanału YouTube: przez techniczne artykuły, LinkedIn lub wystąpienia konferencyjne. Kluczowe: zacznij od wewnętrznych prelekcji, wybierz jeden format i daj sobie rok.

data_engineering

Data Pipeline Best Practices: Architecture, Modern Pipelines, and Deployment
Artykuł z bloga Databricks zbiera w jednym miejscu aktualne wzorce: ELT zamiast ETL, architektura Kappa zamiast Lambda, CDC z schema registry, przyrostowe ładowanie danych z MERGE zamiast pełnych przeładowań. Dobre źródło do audytu własnej architektury.

Migrating Legacy ETL Tools to dbt: A Practical Guide for Modern Data Teams
Zamknięte środowiska graficzne legacy ETL generują dług technologiczny: brak Git, droga infrastruktura serwerowa, logika ukryta w workflow builderach. Artykuł pokazuje migrację na dbt krok po kroku: staging, intermediate, marts, makra, testy jakości i CI/CD. Kluczowe: iteracyjne przepisywanie zamiast big bang, z równoległym przetwarzaniem i walidacją metryk biznesowych.

dbt Project Portfolio Ideas
Dobre portfolio dbt to nie zestaw skryptów transformujących CSV. Artykuł opisuje, jak zbudować kompletny projekt: warstwy staging, intermediate i marts, modele inkrementalne, snapshoty do SCD, makra i warstwę semantyczną z metrykami MRR, ARR i churn. Każdy projekt powinien mieć testy jakości, CI/CD i połączenie z narzędziem BI.

10 Data Engineering Techniques for Optimizing Serialization Formats for Faster Analytics Workloads
Zamiana CSV na kolumnowy format Parquet lub ORC eliminuje do 80% narzutu I/O przy odczycie zbędnych kolumn. Artykuł pokazuje 10 technik optymalizacji serializacji: od wyboru formatu po kompresję i partycjonowanie. Silniki analityczne oparte na Pythonie osiągają nawet pięciokrotne skrócenie czasu zapytań po zamianie formatu wierszowego na kolumnowy.

Marquez Project
Śledzenie data lineage w złożonych pipeline’ach wymaga czegoś więcej niż logi z Airflowa. Marquez to referencyjna implementacja standardu OpenLineage: bezstanowe Metadata API, repozytorium historii uruchomień i UI do eksploracji grafu zależności. Datasety i definicje zadań są wersjonowane i niezmienne, każda wersja powiązana jest z kodem źródłowym.

devops

How to Fix a Leaked API Key: A Developer’s Guide to Git Security
Jeśli klucz API trafił do repozytorium Git, usunięcie go w kolejnym commicie nic nie zmienia – historia jest publiczna i skanowana. Artykuł opisuje schemat reakcji: unieważnij klucz, zbadaj logi, wyczyść historię narzędziem git filter-repo i wdróż zastępczy sekret z zasadą least privilege. Osobny wątek to prewencja: pre-commit hooks, Gitleaks, TruffleHog i separacja środowisk.

front_end

5 CSS Properties You Should Know for Better Text Designs
Poza color i text-align CSS oferuje właściwości, które rzadziej trafiają do codziennej pracy. Artykuł omawia pięć z nich: background-clip:text do masek graficznych na tekście, box-decoration-break:clone dla spójnych obramowań na łamanych liniach, text-combine-upright do poziomego tekstu w układach pionowych i letter-spacing w animacjach reveal. Dobre źródło, jeśli projektujesz interfejsy z niestandardową typografią.

llm_&_chatgpt

BenchMIRT: What are LLM benchmarks actually measuring?
Uśrednione wyniki benchmarków LLM zamazują to, co naprawdę mierzą poszczególne pytania. BenchMIRT używa psychometrii (Multidimensional Item Response Theory) na 100 modelach i 34 tysiącach pytań, żeby rozłożyć wyniki na wymiary. Efekt: benchmark BBQ mierzący stronniczość zależy głównie od zdolności wnioskowania, a WMDP premiuje odmowy odpowiedzi. Narzędzie pozwala też redukować benchmarki o 90% bez utraty dokładności profilu.

Structuring 40 Million Documents into an Agentic Knowledge Graph
Budowa grafu wiedzy dla 40 milionów dokumentów metodą GraphRAG kosztuje ok. 33 tys. dolarów. Alternatywa opisana w artykule: deterministyczne parsowanie relacji z XML-a do tabel kolumnowych, bez dedykowanej bazy grafowej i bez zapytań do LLM podczas budowy. System 46 modułów w Pythonie zbudował graf 930 milionów krawędzi w niespełna 11 minut, osiągając 83% dokładności na zestawie ewaluacyjnym.

powerbi

Microsoft Fabric: Direct Lake Is Fast. Good Data Architecture Is Faster
Wydajność raportowania analitycznego w środowisku Microsoft Fabric zależy przede wszystkim od właściwego podziału obciążeń architektonicznych między warstwę inżynierii danych a silnik analityczny, co determinuje wybór pomiędzy trybami Direct Lake oraz DirectQuery. Direct Lake czyta tabele bez kosztownych odświeżeń modelu, ale wymaga wcześniejszych nakładów inżynieryjnych w warstwie Bronze/Silver/Gold. DirectQuery przekazuje każde kliknięcie jako zapytanie do zewnętrznego silnika, co przy złożonym DAX generuje wąskie gardła. Artykuł wyjaśnia, kiedy DirectQuery ma uzasadnienie architektoniczne: dane w czasie rzeczywistym, restrykcje regulacyjne lub wczesny POC.

python

Python’s pathlib — All You Need To Know
Operowanie na ścieżkach przez os.path traktuje je jak zwykłe stringi, co sprzyja błędom konkatenacji i problemom między systemami operacyjnymi. Pathlib enkapsuluje ścieżki w obiektach Path z metodami read_text, write_text, glob, rglob i mkdir z flagami parents i exist_ok. Artykuł omawia też wzorzec wykrywania katalogu głównego projektu na podstawie znaczników repozytorium.

14 Underrated Python Libraries I Wish I Knew 5 Years Ago
Ekosystem Pythona wykracza dziś daleko poza NumPy i Pandas. Artykuł omawia 14 bibliotek, które rzadziej trafiają do tutoriali, w tym PyScript uruchamiający logikę Pythona bezpośrednio w przeglądarce przez WebAssembly. Dla projektów webowych oznacza to możliwość rezygnacji z dedykowanego backendu przy prostych zastosowaniach.

Plotting a Composite Correlation Network Heatmap with Python
Tworzenie wizualizacji spełniających wymogi wydawnictw naukowych wymaga niskopoziomowej konfiguracji matplotlib, której nie znajdziesz w podstawowych tutorialach. Artykuł pokazuje, jak połączyć macierz korelacji z siecią powiązań w jednym wykresie, z wymuszonym osadzaniem fontów Type 42, właściwym mapowaniem osi i rozbieżnymi paletami barwnymi. Backend obliczeniowy to pandas i scipy.stats, warstwa renderowania operuje bezpośrednio na matplotlib.patches i Line2D.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *