<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>DuckDB on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/duckdb/</link><description>Recent content in DuckDB on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Tue, 22 Sep 2026 11:42:48 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/duckdb/index.xml" rel="self" type="application/rss+xml"/><item><title>DuckDB 250x szybszy od Postgresa, 14 indeksów pod lupą i architektura MCP na produkcji</title><link>https://blog.prokulski.science/2026/09/22/duckdb-250x-szybszy-od-postgresa-14-indeksow-pod-lupa-i-architektura-mcp-na-produkcji/</link><pubDate>Tue, 22 Sep 2026 11:42:48 +0000</pubDate><guid>https://blog.prokulski.science/2026/09/22/duckdb-250x-szybszy-od-postgresa-14-indeksow-pod-lupa-i-architektura-mcp-na-produkcji/</guid><description>&lt;p&gt;W tym tygodniu (znowu) dużo konkretów: pomiary, decyzje architektoniczne i rzeczy, które wyglądają na dobre praktyki, dopóki ktoś nie zmierzy, co naprawdę robią. Jak indeks w Postgresie, który spowalnia 4-krotnie zamiast przyspieszać.&lt;/p&gt;&#10;&lt;p&gt;Tematy rozłożone między:&lt;/p&gt;&#10;&lt;p&gt;inżynierię danych (bazy, pipeline, data lake, migracje), systemy agentów AI i ich bezpieczeństwo, inżynierię oprogramowania (design doc, code review, monorepo), praktyczny Python i DevOps.&lt;/p&gt;&#10;&lt;p&gt;Przy okazji — tym razem pokusiłem się o polskie tytuły artykułów. Daj znać, czy to działa, czy jednak wolisz oryginalne angielskie. Odpowiedź na tego maila wystarczy.&lt;/p&gt;</description></item><item><title>Agenty piszą CV, Atlassian zmienia Jirę, a Polars i DuckDB łączą siły</title><link>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</link><pubDate>Mon, 20 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</guid><description>&lt;p&gt;Cześć! Za nami finał piłkarskich mistrzostw świata, gdzie Argentyna mierzyła się z Hiszpanią. Niezależnie od wyniku i wczorajszych emocji, poniedziałkowy poranek w IT przynosi powrót do naszej technologicznej rzeczywistości. Oby Twój tydzień zaczął się bez pożarów na produkcji!&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu styk AI oraz codziennych procesów deweloperskich.&lt;/p&gt;&#10;&lt;p&gt;Coraz więcej narzędzi, na czele z odświeżoną Jirą od Atlassiana, stawia na głęboką integrację z agentami AI, Pojawiają się innowacyjne frameworki, które potrafią napisać CV, analizować ogłoszenia o pracę i przejść przez rekrutacyjne sito, Obok rosnącej roli modeli LLM, dużo mówi się o sztuce sprawnego kierowania zapytaniami do odpowiednich silników językowych.&lt;/p&gt;</description></item><item><title>Lokalni agenci, schema evolution i najgorsze błędy XGBoost</title><link>https://blog.prokulski.science/2026/07/06/lokalni-agenci-schema-evolution-i-najgorsze-bledy-xgboost/</link><pubDate>Mon, 06 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/06/lokalni-agenci-schema-evolution-i-najgorsze-bledy-xgboost/</guid><description>&lt;p&gt;To wydanie zadaje dwa pytania, które wielu z nas ma gdzieś z tyłu głowy: czy narzędzia, których używam na co dzień, to nadal dobry wybór - i czy warto rozejrzeć się za czymś nowym? Na tapecie znalazły się dbt Core 2.0, DuckDB jako zamiennik Pandas, lokalne agenty AI do pisania kodu oraz nowe modele uczenia maszynowego, które chcą wypchnąć XGBoost z piedestału. Jeśli masz wrażenie, że świat danych zmienia się szybciej niż jesteś w stanie za nim nadążyć - ten numer to potwierdza.&lt;/p&gt;</description></item><item><title>AI agenci, nudny backend i polskie głosy o architekturze hexagonalnej</title><link>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</link><pubDate>Mon, 18 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz powrotu do sprawdzonych, &amp;ldquo;nudnych&amp;rdquo; technologii.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenci AI i modele LLM (Claude, ChatGPT) ewoluują w stronę praktycznych narzędzi do budowania skillów i automatycznego naprawiania testów, pokazujemy, dlaczego architekci coraz częściej rezygnują ze złożonych baz grafowych na rzecz sprawdzonych ontologii SQL, i tłumaczymy, dlaczego w backendzie prostota i standaryzacja wygrywają z niepotrzebną innowacyjnością.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu skupiamy się na hybrydowym podejściu do analityki i optymalizacji kosztów.&lt;/p&gt;</description></item><item><title>Agenty w produkcji, DuckDB na sterydach i kłamstwa Kubernetesowi</title><link>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</link><pubDate>Mon, 11 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na profesjonalizacji narzędzi AI w codziennej pracy inżynierskiej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak Databricks i Shopify wbudowują agentów AI bezpośrednio w swoje platformy, pokazujemy, dlaczego AI przestaje być dodatkiem, a staje się integralną warstwą systemów, i tłumaczymy zmianę podejścia: od prompt engineeringu do context engineeringu i pracy na głębszych warstwach modeli LLM.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu wracają do gry lekkie, lokalne silniki analityczne.&lt;/p&gt;&#10;&lt;p&gt;Przyglądamy się, jak DuckDB i Polars redefiniują wydajność pracy z danymi na pojedynczej maszynie, pokazujemy, kiedy lokalne przetwarzanie wygrywa z klasycznym podejściem cloud-first, a także wracamy do fundamentów: Kafka i Spark wciąż żyją, ale wymagają konkretnych checklist optymalizacyjnych przy skali produkcyjnej.&lt;/p&gt;</description></item><item><title>Lany Poniedziałek bez lania wody</title><link>https://blog.prokulski.science/2026/04/06/lany-poniedzialek-bez-lania-wody/</link><pubDate>Mon, 06 Apr 2026 11:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/06/lany-poniedzialek-bez-lania-wody/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się dynamicznym zmianom w ekosystemie narzędzi AI oraz ewolucji architektury danych. Dominującym trendem staje się odejście od prostych chatbotów na rzecz złożonych systemów agentowych, co wymusza rewizję dotychczasowych podejść do jakości kodu i automatyzacji. Jednocześnie obserwujemy renesans wydajnych, osadzonych baz danych, takich jak DuckDB, które redefiniują sposób, w jaki myślimy o analityce &amp;ldquo;lokalnej&amp;rdquo; i przygotowaniu danych pod ML.&#10;Druga część zestawienia skupia się na inżynierii systemów o dużej skali. Analizujemy lekcje płynące z zarządzania tysiącami podów GPU w klastrach Kubernetes oraz wyzwania, jakie stawia przed inżynierami projektowanie globalnych usług o najwyższej dostępności. Nie zapominamy o &amp;ldquo;miękkich&amp;rdquo; aspektach pracy – odświeżamy spojrzenie na proces Code Review i wizualizację techniczną, szukając sposobów na zwiększenie efektywności zespołów deweloperskich w świecie zdominowanym przez automatyzację.&#10;Mamy nadzieję, że to poniedziałkowe zestawienie dostarczy Wam solidnej dawki inspiracji do nadchodzących projektów. Miłej lektury!&lt;/p&gt;</description></item><item><title>Agenty piszą kod, ale nie projektują systemów. Plus ponad 20 innych materiałów</title><link>https://blog.prokulski.science/2026/03/23/agenty-pisza-kod-ale-nie-projektuja-systemow-plus-ponad-20-innych-materialow/</link><pubDate>Mon, 23 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/23/agenty-pisza-kod-ale-nie-projektuja-systemow-plus-ponad-20-innych-materialow/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują dwa tematy: agenty AI i granice tego, co faktycznie potrafią, oraz architektura systemów na konkretnych przykładach z produkcji.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu też case study Slacka (przebudowa powiadomień), Twittera (500 tys. tweetów na minutę) i Stripe&amp;rsquo;a (1300 PR-ów tygodniowo), a obok nich – praktyczne materiały o DuckDB, dbt, LangGraph i ClickHouse.&lt;/p&gt;&#10;&lt;p&gt;Osobny wątek to praca z modelami językowymi: od kursów Anthropic, przez projektowanie system promptów, po refleksję o tym, dlaczego zaczynamy przepraszać chatboty.&lt;/p&gt;</description></item><item><title>Czy Power BI umiera? A GitHub Actions zabija zespoły?</title><link>https://blog.prokulski.science/2026/02/23/czy-power-bi-umiera-a-github-actions-zabija-zespoly/</link><pubDate>Mon, 23 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/23/czy-power-bi-umiera-a-github-actions-zabija-zespoly/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy związane z inżynierią danych i automatyzacją: od debaty o przyszłości Power BI i praktycznych zastosowań DuckDB w pipeline&amp;rsquo;ach ETL, przez kontrakty danych w produkcji, aż po wzorce projektowe w PySparku.&lt;/p&gt;&#10;&lt;p&gt;W sekcji AI i agentów przyjrzymy się ograniczeniom vibe codingu i propozycjom nowej warstwy abstrakcji dla systemów agentowych.&lt;/p&gt;&#10;&lt;p&gt;Nie zabraknie także materiałów o architekturze (case study migracji Airbnb z monolitu), DevOps (optymalizacja GitHub Actions), MLOps (metryki predykcyjne incydentów) oraz praktycznych poradników – od konfiguracji tmux dla pracy zdalnej po budowę dashboardów AI w kilka minut.&lt;/p&gt;</description></item><item><title>Zero ETL i hackathon z Bielikiem</title><link>https://blog.prokulski.science/2026/02/09/zero-etl-i-hackathon-z-bielikiem/</link><pubDate>Mon, 09 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/09/zero-etl-i-hackathon-z-bielikiem/</guid><description>&lt;p&gt;W dzisiejszym wydaniu: architektura Zero ETL jako nowy standard w inżynierii danych (albo kolejny buzz word - różnie to bywa z nowościami), praktyczne zastosowania AI w zespołach data science, oraz ewolucja DuckDB w kierunku pełnoprawnego lakehouse.&lt;br&gt;&#10;Znalazłem też przegląd antywzorców w architekturach mikroserwisowych, strategie cache&amp;rsquo;owania w REST API i przewodnik po zarządzaniu ewolucją schematów w pipeline&amp;rsquo;ach strumieniowych (to potrafi być ból!).&lt;br&gt;&#10;Znajdziesz dzisiaj również frameworki analityczne dla e-commerce, techniki feature engineering w SQL dla szeregów czasowych oraz narzędzia do observability systemów ML w produkcji.&lt;/p&gt;</description></item><item><title>Kiedy AI zaczyna tworzyć własną kulturę... i jak ją wdrażać w produkcji</title><link>https://blog.prokulski.science/2026/02/02/kiedy-ai-zaczyna-tworzyc-wlasna-kulture-i-jak-ja-wdrazac-w-produkcji/</link><pubDate>Mon, 02 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/02/kiedy-ai-zaczyna-tworzyc-wlasna-kulture-i-jak-ja-wdrazac-w-produkcji/</guid><description>&lt;p&gt;Hit minionego tygodnia - &lt;a href="https://www.moltbook.com/"&gt;Moltbook&lt;/a&gt;. Jest to eksperymentalna sieć społecznościowa w stylu Reddita, zbudowana dla agentów AI, gdzie ludzie mogą tylko podglądać, a nie brać udziału.&lt;/p&gt;&#10;&lt;p&gt;Tekst &lt;a href="https://www.astralcodexten.com/p/best-of-moltbook"&gt;Best Of Moltbook&lt;/a&gt; traktuje Moltbook jako dziwny, ale fascynujący eksperyment: obserwatorium tego, jak zachowują się LLM‑owe agenty, gdy zostawi się je samym sobie z własną przestrzenią społecznościową. Autor waha się między interpretacją &lt;em&gt;to tylko sprytna konfabulacja i echo ludzkich promptów&lt;/em&gt; a podejrzeniem, że dzieje się tu coś ciekawszego - rodzaj zalążkowej kultury agentów, z własnymi memami, lękami, duchowością i polityką.&lt;/p&gt;</description></item><item><title>Rób produkcyjnie agentów AI, platformy danych i automatyzacje, które naprawdę dowożą</title><link>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</link><pubDate>Mon, 26 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</guid><description>&lt;p&gt;To wydanie to mocny pakiet o tym, jak przestać bawić się w „demka” i zacząć budować produkcyjne systemy danych, AI i automatyzacji – od architektury agentów, przez hurtownie, po niskopoziomowe optymalizacje.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu blok tekstów o agentach AI (platformy, orkiestracja, pamięć, narzędzia, realne case’y typu monitoring w Slacku), który pokazuje, co trzeba dostarczyć, żeby agenci nie wybuchli przy pierwszym większym ruchu. Do tego zestaw materiałów o analityce i data engineeringu: dobre EDA, przetwarzanie danych geograficznych z DuckDB + GeoPandas, kontrakty danych, wzorce ETL/ELT (Snowflake + dbt + Airflow, migracja z Airflow do Databricks), patterny pod &lt;em&gt;AI‑ready pipelines&lt;/em&gt; i benchmark DuckDB vs Spark.&lt;/p&gt;</description></item><item><title>Agenci AI, skalowanie pipeline'ów i ewolucja Pythona</title><link>https://blog.prokulski.science/2026/01/19/agenci-ai-skalowanie-pipelineow-i-ewolucja-pythona/</link><pubDate>Mon, 19 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/19/agenci-ai-skalowanie-pipelineow-i-ewolucja-pythona/</guid><description>&lt;p&gt;W dzisiejszym wydaniu głęboko zanurzamy się w świat &lt;strong&gt;agentów AI i agentic AI&lt;/strong&gt;: od fundamentalnych rozróżnień między generatywną AI, agentami i podejściem agentycznym, przez praktyczne wyzwania bezpieczeństwa w postaci mapowania API, aż po optymalizację zarządzania kontekstem w Model Context Protocol. Nie zabraknie również solidnych podstaw machine learningu: kodowanie danych kategorycznych, Support Vector Machines oraz kompleksowy przegląd metod detekcji anomalii w Pythonie.&lt;/p&gt;&#10;&lt;p&gt;Na froncie &lt;strong&gt;inżynierii danych&lt;/strong&gt; pokazujemy, jak ewoluować od prostych crontabów do systemów obsługujących miliardy zdarzeń, jak wykorzystać DuckDB do szybkich analiz bez ciężkiej infrastruktury oraz dlaczego dokumentacja jako kod w dbt-checkpoint staje się silnikiem jakości danych. Praktyczny przewodnik end-to-end z darmowymi narzędziami oraz refleksje nad zawodem data engineera dopełniają obrazu codziennych wyzwań w tej dziedzinie.&lt;/p&gt;</description></item><item><title>Zrób sobie lakehouse na laptopie</title><link>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</link><pubDate>Mon, 12 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy z pogranicza AI, data engineeringu i praktyk inżynierskich. Szczególną uwagę poświęcamy agentom AI - od pisania skutecznych CLAUDE.md i budowy prostych agentów kodujących w 200 liniach, po zaawansowany monitoring autonomicznych systemów i wzorce projektowe dla inteligentnych aplikacji.&lt;/p&gt;&#10;&lt;p&gt;W sekcji data engineering znajdziesz konkretne rozwiązania: od wzorców partycjonowania przyspieszających zapytania, przez budowę lokalnego pipeline&amp;rsquo;u ELT z DuckDB i dbt (bez kosztów chmury), aż po kompletny przewodnik tworzenia lakehouse&amp;rsquo;a z Apache Iceberg, Trino i MinIO. Nie zabrakło też materiałów przygotowujących do rozmów rekrutacyjnych - 10 kluczowych tematów system design dla data engineerów w 2026 roku.&lt;/p&gt;</description></item><item><title>AI: "jednocześnie dużo mądrzejsze i dużo głupsze, niż się spodziewałem"</title><link>https://blog.prokulski.science/2026/01/05/ai-jednoczesnie-duzo-madrzejsze-i-duzo-glupsze-niz-sie-spodziewalem/</link><pubDate>Mon, 05 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/05/ai-jednoczesnie-duzo-madrzejsze-i-duzo-glupsze-niz-sie-spodziewalem/</guid><description>&lt;p&gt;W dzisiejszym wydaniu szeroki przegląd tego, co dzieje się na styku AI, danych i infrastruktury. Zajrzymy pod maskę architektur agentowych, gdzie bazy danych przejmują rolę pamięci długoterminowej i koordynują działanie systemów wieloagentowych. Zobaczymy, jak w praktyce działają autonomiczne pipeline&amp;rsquo;y AI — od generatora pomysłów biznesowych po systemy RAG obsługujące tysiące zapytań na sekundę.&lt;/p&gt;&#10;&lt;p&gt;Nie zabraknie konkretów z obszaru data engineeringu: hybrydowe tabele BigQuery z sekundową świeżością danych, otwarte formaty tabelaryczne (Delta Lake, Iceberg) i nowe możliwości DuckDB — od notebooków w przeglądarce po przetwarzanie terabajtów lokalnie. PostgreSQL również dostaje swoje pięć minut: od wewnętrznych mechanizmów recovery po niedoceniane funkcje, które warto znać.&lt;/p&gt;</description></item><item><title>Ostatni raz w tym roku</title><link>https://blog.prokulski.science/2025/12/22/ostatni-raz-w-tym-roku/</link><pubDate>Mon, 22 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/22/ostatni-raz-w-tym-roku/</guid><description>&lt;p&gt;W dzisiejszym wydaniu koncentrujemy się na praktycznych aspektach pracy z danymi i modelami AI. Z obszaru Data Engineering znajdziecie rozwiązania eliminujące nocne przetwarzanie batchowe przy pomocy DuckDB i dbt, przewodnik po strategiach obsługi danych wrażliwych oraz techniki checkpointingu w systemach event-driven. O DuckDB aż trzy materiały - bo to świetne narzędzie. Podobnie PostgreSQL to świetne narzędzie, &amp;ldquo;zamiatające&amp;rdquo; inne typy baz - tutaj na przykładzie baz wektorowych i indeksowania 100 milionów wektorów w 20 minut.&lt;/p&gt;</description></item><item><title>Jak ludzie korzystają z AI w pracy?</title><link>https://blog.prokulski.science/2025/12/15/jak-ludzie-korzystaja-z-ai-w-pracy/</link><pubDate>Mon, 15 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/15/jak-ludzie-korzystaja-z-ai-w-pracy/</guid><description>&lt;p&gt;Ten tydzień - ostatni pełny przed świętami - to raczej czas porządków, niż wielkich premier. Choć niektórzy testują, jak naprawdę radzi sobie &lt;a href="https://openai.com/pl-PL/index/introducing-gpt-5-2/"&gt;GTP-5.2&lt;/a&gt; - najnowsze dziecko OpenAI.&lt;br&gt;&#10;Na dziś wystarczy tej dolinokratycznej magii. Przejdźmy do rzeczy, które mają większy sens: praktyka, konkret, zero ściemy (bo po to tu jesteś, nie?).&lt;/p&gt;&#10;&lt;p&gt;W tym numerze skupiamy się na tym, co daje realny efekt. Optymalizacja. Wydajność. Sprytne podejścia do codziennej roboty z danymi. Mamy PostgreSQL i DuckDB w akcji, Parquet na sterydach oraz garść sztuczek w Apache Spark i SQLAlchemy. Dorzucamy integrację DuckDB z Amazon S3 i pomysł na streamingowy ETL bez klasycznych hurtowni - lekko, elastycznie i bez ton konfiguracji.&lt;/p&gt;</description></item><item><title>Kryzys pracowniczy w branży + konferencja AI Dev 25</title><link>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</link><pubDate>Mon, 08 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się transformacji współczesnych architektur IT – od rosnącej konkurencji dla RESTa i mikroserwisów, przez natywną obsługę wektorów w Postgresie, aż po praktyczne wzorce partycjonowania Parquet. W sekcji AI i ML znajdziecie przewodnik po PyTorch dla chcących zacząć z sieciami neuronowymi i budowaniem własnych modeli AI. Znajdziecie też tekst o metodach interpretacji predykcji XGBoost z wykorzystaniem SHAP.&lt;/p&gt;&#10;&lt;p&gt;Dla programistów Pythona przygotowaliśmy materiały o walidacji outputów LLM z Pydantic, monitoringu FastAPI, zaawansowanych technikach pandas oraz nowym narzędziu &amp;ldquo;ty&amp;rdquo; do automatyzacji przepływów w chmurze. DevOpsi mogą sprawdzić tutorial wdrażania Spring Boot na Kubernetes, rozwiązanie problemu rozbieżności między środowiskami lokalnym a produkcyjnym oraz master class z tcpdump i Wireshark.&lt;/p&gt;</description></item><item><title>Sporo "przydasiów" do Linuxa oraz LLMów</title><link>https://blog.prokulski.science/2025/12/01/sporo-przydasiow-do-linuxa-oraz-llmow/</link><pubDate>Mon, 01 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/01/sporo-przydasiow-do-linuxa-oraz-llmow/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach zarządzania danymi i sztuczną inteligencją w środowiskach produkcyjnych. Przedstawiamy kompleksowe podejścia do integracji modeli językowych: orkiestrację wielu LLM za pomocą Spring AI oraz budowę niestandardowych pipeline&amp;rsquo;ów z LangGraph. Znajdziecie również porównanie platform MLOps (MLFlow, Metaflow, Kubeflow).&lt;/p&gt;&#10;&lt;p&gt;W obszarze Big Data i data engineeringu omawiamy kluczowe technologie i wzorce architektoniczne. Delta Lake jako warstwa transakcyjna dla Apache Spark, praktyczne wzorce współpracy zespołowej z DuckDB, dyskusja o przyszłości koncepcji data mesh oraz kompleksowe spojrzenie na ekosystem Big Data – od kolejek wiadomości po HDFS, czyli standardowy stack big data (nota bene - możesz mieć big data w domu - zapraszam do &lt;a href="https://github.com/dane-analizy/big-data-stack"&gt;repo&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Jak wygląda "przerzucanie liczb z worka do worka" w ubezpieczeniach i przemyśle?</title><link>https://blog.prokulski.science/2025/11/24/jak-wyglada-przerzucanie-liczb-z-worka-do-worka-w-ubezpieczeniach-i-przemysle/</link><pubDate>Mon, 24 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/24/jak-wyglada-przerzucanie-liczb-z-worka-do-worka-w-ubezpieczeniach-i-przemysle/</guid><description>&lt;p&gt;W dzisiejszym wydaniu znajdziesz solidną dawkę praktycznej wiedzy – od optymalizacji agentów AI w GitHub Copilot i dyskusji o tym, czy serwer MCP rzeczywiście jest Ci potrzebny, przez zaawansowane techniki pracy z DuckDB i porównanie narzędzi do przetwarzania 650 GB danych, aż po konkretne konfiguracje Nginx, Terraform i Kubernetes.&lt;/p&gt;&#10;&lt;p&gt;Często tutaj trafiają teksty związane/zachwalające DuckDB (dzisiaj też będą). Alibaba tymczasem opublikowała trzyczęściowy cykl, w którym dogłębnie analizuje wewnętrzne mechanizmy DuckDB. Na blogu znajduje się analiza kodu DuckDB pod kątem formatu plików, formatu przechowywania tabel oraz warstwy wykonawczej. &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-1-file-format-overview_602511"&gt;Część pierwsza&lt;/a&gt;, &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-2-table-storage-format_602657"&gt;druga&lt;/a&gt; i &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-3-execution-layer-overview_602660"&gt;trzecia&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Agenci AI, data engineering i fine-tuning LLM</title><link>https://blog.prokulski.science/2025/11/17/agenci-ai-data-engineering-i-fine-tuning-llm/</link><pubDate>Mon, 17 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/17/agenci-ai-data-engineering-i-fine-tuning-llm/</guid><description>&lt;p&gt;W dzisiejszym wydaniu koncentrujemy się na praktycznych aspektach pracy z danymi i sztuczną inteligencją (co nie jest niczym nowym dla stałych czytelników newslettera; a nowych - serdecznie witam!).&lt;br&gt;&#10;Znajdziesz tu kompleksowe tutoriale budowy agentów AI z LangChain, przewodniki po fine-tuningu modeli językowych metodą QLoRA oraz zaawansowane techniki pracy z PostgreSQL i jego rozszerzeniami.&lt;/p&gt;&#10;&lt;p&gt;Szczególną uwagę poświęcamy inżynierii danych: od strategii inkrementalnego ładowania i projektowania idempotentnych pipeline&amp;rsquo;ów, przez real-time CDC z Debezium i Kafką, aż po nowoczesne podejście lakehouse z DuckDB.&lt;br&gt;&#10;Nie zabrakło również głębokiej analizy matematyki stojącej za zero-shot learning, przeglądu metryk klasyfikacyjnych oraz praktycznych rozwiązań dla systemów rozproszonych, jak predykcyjne autoskalowanie Apache Flink.&lt;/p&gt;</description></item><item><title>System design, bazy danych i praktyczny Python</title><link>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</link><pubDate>Mon, 10 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach projektowania i optymalizacji systemów danych.&lt;br&gt;&#10;Zaczynamy od architektury: poznasz sprawdzone metody nauki projektowania systemów oraz zajrzysz pod maskę infrastruktury OpenAI opartej na Kubernetes i Apache Kafka.&lt;br&gt;&#10;W sekcji baz danych znajdziesz spojrzenie na BigQuery z perspektywy programistów Pythona oraz dwanaście realnych przypadków migracji do DuckDB z konkretnymi oszczędnościami.&lt;/p&gt;&#10;&lt;p&gt;Miłośnicy Pythona znajdą też kilka wartościowych materiałów: od elegancji dekoratorów, przez biblioteki przewyższające Excela, po praktyczną migrację z PostgreSQL do MongoDB. Warto zerknąć na porównanie HTTPX z Requests (nie tylko w kontekście projektów LLM, ale po prostu na httpx jako nowocześniejszy pakiet) oraz omówienie narzędzia UV Toolchain do stabilizacji środowisk CI/CD.&lt;/p&gt;</description></item><item><title>Język polski najlepszy do promptowania?</title><link>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</link><pubDate>Mon, 27 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy związane z infrastrukturą danych i narzędziami AI. Szczególnie polecam artykuł o benchmarku ONERULER – okazuje się, że język polski najlepiej radzi sobie z analizą długich kontekstów w modelach językowych!&lt;/p&gt;&#10;&lt;p&gt;Jeśli budujesz pipeline&amp;rsquo;y danych, znajdziesz praktyczne przewodniki po open table formats (Iceberg, Delta Lake), kompletnej konfiguracji Docker+Airflow+dbt+Postgres oraz wzorcach SQL w DuckDB. Dla zainteresowanych Kafką – materiały o wysokiej dostępności na GKE Autopilot i alternatywie w postaci BufStream z silniejszymi gwarancjami spójności.&lt;/p&gt;</description></item><item><title>Konkretne projekty z analizy danych (jak zawsze :)</title><link>https://blog.prokulski.science/2025/10/20/konkretne-projekty-z-analizy-danych-jak-zawsze/</link><pubDate>Mon, 20 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/20/konkretne-projekty-z-analizy-danych-jak-zawsze/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych rozwiązaniach dla każdego etapu pracy z danymi - od modelowania i inżynierii cech przez optymalizację baz danych, aż po wdrażanie w produkcji.&lt;/p&gt;&#10;&lt;p&gt;Czeka Cię porównanie modeli predykcyjnych (typowe zadanie dla juniorów - wytłumaczone krok po kroku) i nowe możliwości DuckDB, które zastępują całe pipeline&amp;rsquo;y w Pandas. Znajdziesz też wyzwania związane z architekturą: jak budować skalowalne systemy danych od podstaw oraz gdzie naprawdę powinny znaleźć się kontrakty danych. Dla miłośników LLMów jest przewodnik po LangChain oraz LangGraph, praktyczną instrukcję budowy lokalnego systemu RAG oraz analizę gotowości &lt;em&gt;foundation models&lt;/em&gt; do pracy z danymi tabelarycznymi.&lt;/p&gt;</description></item><item><title>Nie tylko obraz tego, co się dzieje, ale jak to wykorzystać w praktyce</title><link>https://blog.prokulski.science/2025/09/29/nie-tylko-obraz-tego-co-sie-dzieje-ale-jak-to-wykorzystac-w-praktyce/</link><pubDate>Mon, 29 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/29/nie-tylko-obraz-tego-co-sie-dzieje-ale-jak-to-wykorzystac-w-praktyce/</guid><description>&lt;p&gt;Czy kiedykolwiek marzyłeś o tym, żeby skrócić generowanie raportu z 6 godzin do 15 minut? A może zastąpić tradycyjne procesy ETL jednym narzędziem, które działa nawet 100 razy szybciej niż Spark?&lt;/p&gt;&#10;&lt;p&gt;To nie science fiction – to rzeczywistość dzisiejszego numeru!&lt;/p&gt;&#10;&lt;p&gt;Od &lt;strong&gt;agentic AI&lt;/strong&gt;, które rewolucjonizuje kariery specjalistów IT, po konkretne implementacje MCP w firmach CRM – jak zwykle w tym newsletterze nie tylko obraz tego, co się dzieje, ale przede wszystkim &lt;strong&gt;jak to wykorzystać w praktyce&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-09</title><link>https://blog.prokulski.science/2025/06/09/newsletter-dane-i-analizy-2025-06-09/</link><pubDate>Mon, 09 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/09/newsletter-dane-i-analizy-2025-06-09/</guid><description>&lt;p&gt;Dzisiaj momentami jest grubo - na przykład matematyczna elegancja B-spline&amp;rsquo;ów. Ale jest też trochę praktyki w DuckDB. Jeśli myślisz, że świat danych to tylko nudne CSVki i niekończące się ETLe, ten numer (mam nadzieję) przekona Cię, że to naprawdę fascynująca dziedzina pełna niespodzianek.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie polecam zwrócić uwagę na historię firmya Tencent Music, która oszczędziła 80% kosztów przenosząc się z Elasticsearch na Apache Doris - to jeden z tych przypadków, gdy zmiana architektury naprawdę się opłaca. Z kolei dla miłośników optymalizacji opowieść o tym, jak Python API można przyspieszyć 10x bez przepisywania na Go czy Rust - czasem wystarczy po prostu dobrze pomyśleć!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-17</title><link>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</link><pubDate>Mon, 17 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</guid><description>&lt;p&gt;Sztuczna inteligencja w praktyce: Zajrzyj do repozytorium z technikami Retrieval-Augmented Generation (RAG), gdzie krok po kroku poznasz ich implementację, lub dowiedz się, jak AI może usprawnić procesy rejestracji użytkowników i przegląd kodu. Nie zabrakło też przeglądu narzędzi AI, które mogą znacząco zwiększyć Twoją produktywność.&lt;/p&gt;&#10;&lt;p&gt;Praca z danymi: Od modelowania danych w SQL dla sektora detalicznego po przetwarzanie danych w Microsoft Fabric z wykorzystaniem bibliotek takich jak pandas czy duckdb – znajdziesz tu konkretne przykłady i wskazówki, jak efektywnie zarządzać danymi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-06</title><link>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</link><pubDate>Mon, 06 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</guid><description>&lt;p&gt;W dniu, gdy tradycyjnie Trzej Mędrcy dotarli do celu swojej podróży kierując się gwiazdą, ja przybywam z kolekcją wartościowych znalezisk ze świata Pythona i analizy danych. Mędrcy przynieśli złoto, kadzidło i mirrę - dzisiejsze wydanie niesie pakiet różnorodnych artykułów, które (mam nadzieję) okażą się równie cennymi darami dla Twojego rozwoju zawodowego.&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu znajdziesz standardowo kilka praktycznych materiałów z zakresu data science: od budowania systemu tradingowego opartego na średniej kroczącej, przez analizę szeregów czasowych, aż po wykorzystanie biblioteki statsmodels.&lt;br&gt;&#10;Dla osób zainteresowanych automatyzacją wdrożeń (i nie tylko) mamy podstawową dawkę wiedzy o GitHub Actions i skryptach bashowych, a na koniec dość klasyczna integracja FastAPI z Reactem.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-11</title><link>https://blog.prokulski.science/2024/11/11/newsletter-dane-i-analizy-2024-11-11/</link><pubDate>Mon, 11 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/11/newsletter-dane-i-analizy-2024-11-11/</guid><description>&lt;p&gt;Święto lasu słuchajcie! I to nie chodzi wcale o to, że dzisiaj mamy Narodowe Święto Niepodległości, ale o to, że w newsletterze mało o Pythonie! Więcej mamy w działce &amp;ldquo;DevOps&amp;rdquo; (która nie tylko o procesach CI/CD jest, ale też o tym jak pisać - i w tym numerze też debuggować - skrypty w Bashu) niż programowania przepływów danych czy innych finezyjnych (mniej lub bardziej) sztuczek w Pandas albo DuckDB&amp;hellip;&lt;/p&gt;&#10;&lt;p&gt;Za to dowozi dzisiaj sekcja opisująca nieco bardziej teoretycznie zagadnienia ML-owe. Chyba dobrze, co?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-04</title><link>https://blog.prokulski.science/2024/11/04/newsletter-dane-i-analizy-2024-11-04/</link><pubDate>Mon, 04 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/04/newsletter-dane-i-analizy-2024-11-04/</guid><description>&lt;p&gt;Odkrycie tego tygodnia: &lt;a href="https://bolt.new/"&gt;Bolt.new&lt;/a&gt;. Serwis, który korzystając modeli językowych przygotuje całą aplikację i - o ile jest ona frontendowa - pozwoli jednym guzikiem ją wdrożyć.&lt;br&gt;&#10;Testując to chwilę udało się po kilku dopytaniach przygotować kod, który daje GUI (dostępny przez WWW) do edycji obserwowanych kanałów na YouTube. Obserwowanie polega na tym, że jeśli pojawi się nowy film na kanale to wysyłana ma być informacja poprzez komunikator Signal (specjalnie, bo Signal nie ma API, trzeba wywoływać polecenie w konsoli). Powstały kod wzbogacony został o Dockerfile (razem z pobraniem odpowiedniej wersji Signala oraz potrzebnej mu Javy) i deployment na Kubernetesa. Kiedy wiemy co robimy i czego oczekujemy oraz potrafimy wyłapać błędy - na pewno ułatwia to pracę. I jeszcze jedno: zapytania pisałem po polsku (w ramach eksperymentu) i zostałem w pełni zrozumiany, chociaż odpowiedzi były po angielsku. Wynik działania &lt;a href="https://bolt.new/~/sb1-om42lv"&gt;tutaj&lt;/a&gt; &lt;em&gt;(mam nadzieję, że link zadziała)&lt;/em&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-21</title><link>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</link><pubDate>Mon, 21 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</guid><description>&lt;p&gt;OpenAI ze swoim modelem w wersji o1 wróciło na szczyt listy przebojów w kategorii LLM. Garść firm zajmujących się GenAI zaczyna generować poważne przychody. Co jeszcze dzieje się na rynku AI w 2024 roku? Jaki jest &amp;ldquo;Stan AI w 2024&amp;rdquo;? O tym dowiecie się z raportu, do którego link poniżej, w sekcji AI/ML.&lt;/p&gt;&#10;&lt;p&gt;Sporo w tym wydaniu o bazach danych (co najmniej dwa razy pojawia się Postgres i Redis, ale są też inne rozwiązania: wektorowa &lt;a href="https://milvus.io/"&gt;Milvus&lt;/a&gt;, &lt;a href="https://www.influxdata.com/"&gt;InfluxDB&lt;/a&gt; do szeregów czasowych, grafowa &lt;a href="https://neo4j.com/"&gt;Neo4j&lt;/a&gt;, dobrze znany stałym czytelnikom &lt;a href="https://duckdb.org/"&gt;DuckDB&lt;/a&gt;oraz &lt;a href="https://tile38.com/"&gt;Tile38&lt;/a&gt; do zadań geo).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-20</title><link>https://blog.prokulski.science/2024/05/20/newsletter-dane-i-analizy-2024-05-20/</link><pubDate>Mon, 20 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/20/newsletter-dane-i-analizy-2024-05-20/</guid><description>&lt;p&gt;Dzisiaj w sekcji poświęconej językowi R mamy tekst, w którym w atrakcyjny, animowany sposób pokazano kilka podstawowych operacji na ramkach danych (albo jak kto woli - tabelkach, np. w bazie danych). Jeśli nie wiesz jak działają operacje grupowania, agregacji czy łączenia danych - po tych przykładach nie powinno być z tym problemu.&lt;/p&gt;&#10;&lt;p&gt;Jeśli już przy bazach danych jesteśmy - powraca DuckDB, bo to jest cudo. Tym razem m.in. porównanie ze Sparkiem.&lt;br&gt;&#10;Od Sparka niedaleko zaś do ogólnie pojętego big data - w tej sekcji kompletny przewodnik jak zbudować cały zestaw do strumieniowego przetwarzania danych: czyli pełne środowisko zawierające Kafkę, Schema Registry, Kafka Connect, ksql i co tam jeszcze wokoło potrzebne.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-06</title><link>https://blog.prokulski.science/2024/05/06/newsletter-dane-i-analizy-2024-05-06/</link><pubDate>Mon, 06 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/06/newsletter-dane-i-analizy-2024-05-06/</guid><description>&lt;p&gt;Witamy po majówce. Akumulatory naładowane? Głowy przewietrzone? Karkóweczka zjedzona? :)&lt;br&gt;&#10;Zatem czas na kolejną porcję rozwijających treści.&lt;/p&gt;&#10;&lt;p&gt;Jakoś tak wyszło, że w tym tygodniu mamy kilka zagadnień związanych z Kubernetesem, ale nie odpuszczamy programowania jako takiego (z przewagą Pythona, wiadomo). Poza tym - chyba masz zaległości z poprzedniego numer, prawda?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://kai-waehner.medium.com/genai-demo-with-kafka-flink-langchain-and-openai-8c9b7263770a"&gt;&lt;strong&gt;GenAI Demo with Kafka, Flink, LangChain and OpenAI&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Architektura i demo procesu przesyłania danych Kafką i użycia modeli LLM na tychże danych. W treści tekstu znajdziesz też link do nagrania na YT&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-04-29</title><link>https://blog.prokulski.science/2024/04/29/newsletter-dane-i-analizy-2024-04-29/</link><pubDate>Mon, 29 Apr 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/04/29/newsletter-dane-i-analizy-2024-04-29/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2024/04/how-to-run-llama-3-locally/"&gt;&lt;strong&gt;How to Run Llama 3 Locally?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;W zeszłym tygodniu nie było nic o Llama 3, zatem dzisiaj instrukcja jak ten najnowszy model językowy od Facebooka uruchomić lokalnie.&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://nobledynamic.com/posts/fabric-madness-4/"&gt;&lt;strong&gt;Fabric Madness: Experiments&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Eksperymenty z MLFlow spięte z MS Fabric&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.openriskmanagement.com/representing-matrices-as-json-objects-part-1/"&gt;&lt;strong&gt;Representing Matrices as JSON Objects&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy macierz można zapisać w JSONie? Pierwszy z serii artykułów na temat kompromisów pomiędzy macierzami a tym formatem plików&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/public-transport-accessibility-in-python-dbdeee99f36f"&gt;&lt;strong&gt;Public Transport Accessibility in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza danych geograficznych w Pythonie - dostępność komunikacji miejskiej w Budapeszcie. Ale może to być dostępność do restauracji, aptek czy paczkomatów&amp;hellip;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-03-11</title><link>https://blog.prokulski.science/2024/03/11/newsletter-dane-i-analizy-2024-03-11/</link><pubDate>Mon, 11 Mar 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/03/11/newsletter-dane-i-analizy-2024-03-11/</guid><description>&lt;p&gt;Chłodzenie procesora - jak robi to inżynier? Jeden pójdzie do sklepu czy serwisu i po prostu kupi &amp;ldquo;mocne&amp;rdquo; chłodzenie, a drugi - poświęci &amp;ldquo;nieco&amp;rdquo; czasu na napisanie kodu zbierającego dane z różnych czujników, zbuduje dashboard w Grafanie i na podstawie tego co jest na wykresach odpowiednio &amp;ldquo;pokręci śrubkami&amp;rdquo;. Mamy o tym tekst dzisiaj, znajdziesz go w &lt;strong&gt;Ciekawostkach&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;W sekcji o bazach danych znajdziesz coś o DuckdB (znowu&amp;hellip; pewien Maciej podejrzewa że mam jakiś procent od DuckDB&amp;hellip; ale to serio świetne narzędzie!) czytającym dane z Open Street Map, przy okazji o samym formacie danych OSM. DuckDB za darmo, OSM za darmo, czego chcieć więcej? Zerkaj w sekcję &lt;strong&gt;Bazy danych&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-02-26</title><link>https://blog.prokulski.science/2024/02/26/newsletter-dane-i-analizy-2024-02-26/</link><pubDate>Mon, 26 Feb 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/02/26/newsletter-dane-i-analizy-2024-02-26/</guid><description>&lt;p&gt;Skupiamy się w tym tygodniu na zagadnieniach związanych z budowaniem rozwiązań skonteneryzowanych. Mamy więc coś o Dockerze i pakowaniu do niego naszych aplikacji (napisanych w różnych językach, żeby było &amp;ldquo;dla każdego coś miłego&amp;rdquo;), coś (może nieco więcej niż &amp;ldquo;coś&amp;rdquo;) o Kubernetesie - bo to kolejny krok, a wydaje się to być nieco zakręcone. Do tego garść tricków i porad związanych z tymi zagadnieniami, chociażby o nieznanych (albo raczej: nie używanych) opcjach Gita. Ale to dla prawdziwych wyjadaczy.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-29</title><link>https://blog.prokulski.science/2024/01/29/newsletter-dane-i-analizy-2024-01-29/</link><pubDate>Mon, 29 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/29/newsletter-dane-i-analizy-2024-01-29/</guid><description>&lt;p&gt;Ostatnio we wstępie pisałem o tym, że do #devops wpadają wszystkie rzeczy związane z dokeryzacją, drobnymi programami i usprawnieniami używanymi w konsoli. Dzisiaj wprowadzam sekcję &lt;strong&gt;#DataEngineering&lt;/strong&gt;. Powód jest dość prosty: najciekawsze są takie projekty, gdzie dane pobieramy, przetwarzamy, przesyłamy, gromadzimy, potem znowu przetwarzamy i pokazujemy użytkownikowi końcowemu. Prawie każdy taki projekt obecnie wykorzystuje AirFlow, Pythona, Kafkę, jakieś narzędzia BI, jakiś storage w postaci bazy danych albo na przykład Hadoopa. I do czego przypiąć taki tekst? Właśnie do &amp;ldquo;inżynierii danych&amp;rdquo;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-22</title><link>https://blog.prokulski.science/2024/01/22/newsletter-dane-i-analizy-2024-01-22/</link><pubDate>Mon, 22 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/22/newsletter-dane-i-analizy-2024-01-22/</guid><description>&lt;p&gt;YOLO. Nie tylko &amp;ldquo;you only live once&amp;rdquo; ale - w kontekście ML/AI i computer vision - przede wszystkim modele do rozpoznawania obiektów na zdjęciach.&lt;br&gt;&#10;Doczekaliśmy się już kilku wersji algorytmu YOLO, każda kolejna jest szybsza, sprawniejsza, rozpoznająca więcej i lepiej. Na to właśnie idzie klikanie w światła drogowe albo autobusy w obrazkowych captcha ;-)&lt;br&gt;&#10;Więcej o kolejnych wersjach YOLO i ich architekturach dowiesz się z &lt;a href="https://learnopencv.com/mastering-all-yolo-models/"&gt;&lt;strong&gt;tekstu&lt;/strong&gt;&lt;/a&gt;, w którym dodatkowo znajdziesz linki do tego jak trenować i używać tych modeli.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-11</title><link>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</link><pubDate>Mon, 11 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</guid><description>&lt;p&gt;Miniony tydzień to uruchomienie nowej wersji asysstenta AI od Google, czyli Gemini (w miejsce Barda). Sam model mówi o sobie, że &lt;em&gt;&amp;ldquo;jestem zarówno Bardem, jak i Gemini. Bard to nazwa użytkownika, którą wykorzystuję do interakcji z użytkownikami, podczas gdy Gemini to nazwa platformy AI, na której jestem oparty&amp;rdquo;&lt;/em&gt;.&lt;br&gt;&#10;&lt;a href="https://deepmind.google/technologies/gemini/#introduction"&gt;Przedstawienie projektu&lt;/a&gt; (przez twórców) mówi o lepszych wynikach od ChataGPT v4 w prawie każdym mierniku., ale niby ma to dostęp do najnowszej wiedzy, ale jednak &lt;a href="https://g.co/bard/share/c0633f7cd6ac"&gt;taki sobie&lt;/a&gt;. Z literaturą nieco starszą radzi sobie&amp;hellip; &lt;a href="https://g.co/bard/share/21dc6e2f9212"&gt;sami zobaczcie&lt;/a&gt;. Słowacki i &amp;ldquo;Wesele&amp;rdquo;? to mogłoby być ciekawe, ale wolę wersję Wyspiańskiego (a filmową od Wajdy stawiam tuż za wajdowską &amp;ldquo;Ziemią obiecaną&amp;rdquo;). Czyli też zmyśla.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-04</title><link>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</link><pubDate>Mon, 04 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</guid><description>&lt;p&gt;W poprzednim tygodniu przeczytać mogliście króciutkie podsumowanie Data Science Summit, a tam stwierdzenie, że dużo się mówi o Streamlit jako sposobie na &lt;em&gt;PoC-owanie&lt;/em&gt; prezentacji danych. Świat obecnie idzie również w stronę streamingu i obsługi tak przesyłanych danych - głównie Flinkiem. I na Flinku skupia się dzisiejszy numer naszego newslettera.&lt;/p&gt;&#10;&lt;p&gt;Ciekawy jest też niespełna półgodzinne nagranie prezentujące możliwości DuckDB w kontekście danych przestrzennych pozyskanych z Open Street Maps. Chwilę bawiłem się DuckDB ale w połączeniu ze sporymi zbiorami geo (zapisanymi w ShapeFile&amp;rsquo;ach) i śmiga to wspaniale. Jedyny minus - to baza plikowa, więc średnio do użycia w przypadku dostępu przez wiele aplikacji na raz. Ale jako element w procesie &lt;em&gt;data engineeringu&lt;/em&gt; może się bardzo przydać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-23</title><link>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</link><pubDate>Mon, 23 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</guid><description>&lt;p&gt;Lubię DuckDB i lubię AirFlow. Kafka jest naturalnym sposobem na przesyłanie danych między systemami czy też mikroserwisami. Stąd też dzisiaj kilka tekstów zahaczających o te wszystkie technologie.&lt;/p&gt;&#10;&lt;p&gt;Dodatkowo trochę z obszaru zarządzania - zarówno opis typowego projektu data science jak i metryka opisująca stabilność kolejki prac.&lt;/p&gt;&#10;&lt;p&gt;No i trochę o mapkach, bo mapki są fajne.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-softmax-regression-for-multi-class-label-with-python-782a34283894"&gt;&lt;strong&gt;Fully Explained Softmax Regression for Multi-Class Label with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Klasyfikacja do wielu klas - o co tutaj chodzi? Przewodnik dla początkujących&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-25</title><link>https://blog.prokulski.science/2023/09/25/newsletter-dane-i-analizy-2023-09-25/</link><pubDate>Mon, 25 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/25/newsletter-dane-i-analizy-2023-09-25/</guid><description>&lt;p&gt;W tym tygodniu stawiam na potoki przetwarzające dane i pokazujące je finalnie w jakimś dashboardzie. To najczęstsza robota w korporacjach, szczególnie w zespołach &amp;ldquo;raportowych&amp;rdquo;. Dlatego gorąco polecam dzisiejszy dział &amp;ldquo;Analiza danych - projekty&amp;rdquo;.&lt;/p&gt;&#10;&lt;p&gt;Przy przetwarzaniu danych częstym krokiem jest analiza tego co przychodzi. Można użyć narzędzi BI, można ręcznie rzeźbić kod, a można skorzystać z Data Wranglera - dodatku do VSCode, w którym poszczególne kroki pochodzą z takiego niby wizarda, a w efekcie dostajemy gotowy kod. No trzeba to &lt;a href="https://www.youtube.com/watch?v=KrzcV1c1W1U"&gt;zobaczyć&lt;/a&gt; (10 minut filmu z dość specyficznym akcentem, ale nie takim jak myślicie), a potem można &lt;a href="https://marketplace.visualstudio.com/items?itemName=ms-toolsai.datawrangler"&gt;zainstalować&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-27</title><link>https://blog.prokulski.science/2023/03/27/newsletter-dane-i-analizy-2023-03-27/</link><pubDate>Mon, 27 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/27/newsletter-dane-i-analizy-2023-03-27/</guid><description>&lt;p&gt;Być może przeczytaliście wszystko co było do przeczytania z poprzedniego wydania newslettera, a może coś jeszcze Wam zostało? Dlatego dzisiaj nieco mniej (właściwie - tyle co zwykle) nowości, ale nie oznacza to wcale że jakoś gorzej.&lt;/p&gt;&#10;&lt;p&gt;Sporo materiałów dotyczy Sparka i różnych z nim kombinacji - do nauki i szukania kierunków poszerzania wiedzy znakomite punkty wyjścia. Można też nauczyć się czegoś joinach w SQL.&lt;/p&gt;&#10;&lt;p&gt;Z nieco bardziej zaawansowanych tekstów polecam ten o Apache Hudi w Uberze oraz o tym jak właściwie działa ChatGPT. A skoro już przy nim jesteśmy - wiele w minionym czasie pojawia się tekstów o tym jak to ChatGPT zabierze pracę różnym ludziom, w tym programistom. Czy zabierze? Przekonamy się. Ale już teraz przeczytajcie jak może być pomocny przy tworzeniu kodu (na przykładzie aplikacji w Streamlit).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-13</title><link>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</link><pubDate>Mon, 13 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</guid><description>&lt;p&gt;Wielokrotnie na łamach niniejszego newslettera poruszane były tematy związane z Apache Kafka. A to podejście architektoniczne z grubsza mówiące dlaczego Kafka jest fajna i przydatna, a to podejście developerskie - o tym jak wysyłać i konsumować wiadomości z Kafki. Często też trafiają się bardziej zaawansowane przykłady - traktujące Kafkę jako bazę danych (z ktable czy ksql), czasem uzupełnione o Spark Streaming czy inne dodatkowe narzędzia typu Trino.&lt;/p&gt;&#10;&lt;p&gt;Ale najczęściej chyba Kafka wykorzystywana jest do przesyłania komunikatów w podejściu &lt;em&gt;publish &amp;amp; subscribe&lt;/em&gt;. Są jednak przecież inne rozwiązania kolejkowe - Rabbit, czy na przykład MQTT popularne w rozwiązaniach Internet of Things. &lt;a href="https://emqx.medium.com/mqtt-and-kafka-f20d79d9dea4"&gt;Przeczytajcie o podobieństwach i różnicach Kafki z MQTT&lt;/a&gt; (tekst &lt;a href="https://medium.com/techieahead/kafka-vs-rabbitmq-comparison-61d7a7b425d7"&gt;Kafka vs Rabbit&lt;/a&gt; też oczywiście jest).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-27</title><link>https://blog.prokulski.science/2023/02/27/newsletter-dane-i-analizy-2023-02-27/</link><pubDate>Mon, 27 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/27/newsletter-dane-i-analizy-2023-02-27/</guid><description>&lt;p&gt;W dzisiejszym wydaniu najwięcej miejsca poświęcam wizualizacji danych i okolicach.&lt;/p&gt;&#10;&lt;p&gt;Kalibracja obrazu jest okolicą (bardzo odległą - w sumie oba tematy łączy tylko to, że mamy do czynienia z obrazem), jest też więc coś o tym. Kalibracja jest potrzebna przy problemach natury &lt;em&gt;computer vision&lt;/em&gt;, a takowy - w postaci maskowania obiektów na obrazie - też dzisiaj poruszamy.&lt;/p&gt;&#10;&lt;p&gt;W poprzednim tygodniu dużym powodzeniem cieszył się tekst o MLOps (jeśli boisz się, że umknęło - zerknij do &lt;a href="../../category/newsletter/"&gt;archiwum&lt;/a&gt;), więc dzisiaj kontynuacja, niejako na fali z poprzedniego tygodnia.&lt;/p&gt;</description></item></channel></rss>