<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>BigData on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/categories/bigdata/</link><description>Recent content in BigData on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Tue, 22 Sep 2026 11:42:48 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/categories/bigdata/index.xml" rel="self" type="application/rss+xml"/><item><title>DuckDB 250x szybszy od Postgresa, 14 indeksów pod lupą i architektura MCP na produkcji</title><link>https://blog.prokulski.science/2026/09/22/duckdb-250x-szybszy-od-postgresa-14-indeksow-pod-lupa-i-architektura-mcp-na-produkcji/</link><pubDate>Tue, 22 Sep 2026 11:42:48 +0000</pubDate><guid>https://blog.prokulski.science/2026/09/22/duckdb-250x-szybszy-od-postgresa-14-indeksow-pod-lupa-i-architektura-mcp-na-produkcji/</guid><description>&lt;p&gt;W tym tygodniu (znowu) dużo konkretów: pomiary, decyzje architektoniczne i rzeczy, które wyglądają na dobre praktyki, dopóki ktoś nie zmierzy, co naprawdę robią. Jak indeks w Postgresie, który spowalnia 4-krotnie zamiast przyspieszać.&lt;/p&gt;&#10;&lt;p&gt;Tematy rozłożone między:&lt;/p&gt;&#10;&lt;p&gt;inżynierię danych (bazy, pipeline, data lake, migracje), systemy agentów AI i ich bezpieczeństwo, inżynierię oprogramowania (design doc, code review, monorepo), praktyczny Python i DevOps.&lt;/p&gt;&#10;&lt;p&gt;Przy okazji — tym razem pokusiłem się o polskie tytuły artykułów. Daj znać, czy to działa, czy jednak wolisz oryginalne angielskie. Odpowiedź na tego maila wystarczy.&lt;/p&gt;</description></item><item><title>LLM zwraca poprawny JSON i się myli. Plus: pathlib, benchmarki i marka osobista w IT</title><link>https://blog.prokulski.science/2026/09/07/llm-zwraca-poprawny-json-i-sie-myli-plus-pathlib-benchmarki-i-marka-osobista-w-it/</link><pubDate>Mon, 07 Sep 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/09/07/llm-zwraca-poprawny-json-i-sie-myli-plus-pathlib-benchmarki-i-marka-osobista-w-it/</guid><description>&lt;p&gt;W tym wydaniu dużo o narzędziach, które już pewnie masz w stosie, ale rzadko trafia się dobry materiał tłumaczący ich działanie od środka. Są tu teksty o Airflow 3, dbt, Marquezie i formatach serializacji, a każdy z nich ma konkretną tezę, nie tylko opis funkcji.&lt;/p&gt;&#10;&lt;p&gt;jak migracja z legacy ETL do dbt wygląda krok po kroku, dlaczego Parquet eliminuje do 80% narzutu I/O w porównaniu z CSV, co Marquez robi z Twoim data lineage i jak integruje się z OpenLineage.&lt;/p&gt;</description></item><item><title>Agenty kodują same przez 16 dni, a Ty projektujesz architekturę na lata</title><link>https://blog.prokulski.science/2026/08/10/agenty-koduja-same-przez-16-dni-a-ty-projektujesz-architekture-na-lata/</link><pubDate>Mon, 10 Aug 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/08/10/agenty-koduja-same-przez-16-dni-a-ty-projektujesz-architekture-na-lata/</guid><description>&lt;p&gt;W tym tygodniu trudno przeoczyć jeden wątek: autonomiczne agenty kodujące przestają być eksperymentem. Alibaba opublikowało wyniki 16-dniowego autonomicznego sprintu modelu Qwen, a równolegle pojawiło się kilka solidnych materiałów o tym, jak praktycznie skonfigurować środowisko do pracy z Claude Code czy Codex CLI. Jeśli jeszcze nie myślisz o agentic coding jako o codziennym narzędziu, ten numer powinien zmienić Twoje podejście.&lt;br&gt;&#10;No i AI uciekła i zaczęła rozrabiać. Ale o tym pisały mainstreamowe media &lt;a href="https://tvn24.pl/biznes/tech/ai-wymknela-sie-spod-kontroli-nowy-incydent-st9174296?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt;, &lt;a href="https://www.bankier.pl/wiadomosc/AI-zanim-uciekla-z-laboratorium-to-potajemnie-spiskowala-miesiacami-Narzedzia-polubily-oszukiwanie-9178576.html?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt; oraz &lt;a href="https://spidersweb.pl/2026/07/openai-model-uciekl-ze-srodowiska-testowego.html?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Dlaczego migracja do Databricks jest trudna i co z tym zrobić?</title><link>https://blog.prokulski.science/2026/08/03/dlaczego-migracja-do-databricks-jest-trudna-i-co-z-tym-zrobic/</link><pubDate>Mon, 03 Aug 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/08/03/dlaczego-migracja-do-databricks-jest-trudna-i-co-z-tym-zrobic/</guid><description>&lt;p&gt;W tym wydaniu powraca temat architektury danych i platformy lakehouse - Apache Iceberg, Databricks, Microsoft Fabric - ale tym razem z wyraźnie różnymi kątami. Jeden artykuł tłumaczy, czym Databricks w ogóle jest i jak działa. Drugi mówi wprost, dlaczego migracja na tę platformę często idzie nie tak. Trzeci pokazuje, jak zorganizować porządny proces wdrożeniowy - ale w Microsoft Fabric. Razem tworzą niezły przegląd tego, co czeka Cię przy pracy z nowoczesnymi platformami danych:&lt;/p&gt;</description></item><item><title>Medallion pęka w szwach, agenci tracą kontekst... co z tym zrobić?</title><link>https://blog.prokulski.science/2026/07/27/medallion-peka-w-szwach-agenci-traca-kontekst-co-z-tym-zrobic/</link><pubDate>Mon, 27 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/27/medallion-peka-w-szwach-agenci-traca-kontekst-co-z-tym-zrobic/</guid><description>&lt;p&gt;Ten numer ma wyraźny środek ciężkości: agenci AI i to, co z nimi robić, kiedy wychodzisz poza pierwsze eksperymenty. Teksty o LangGraph - od &amp;ldquo;jak zbudować pierwszego agenta&amp;rdquo; po &amp;ldquo;co psuje się po kilku miesiącach&amp;rdquo; - tworzą razem coś w rodzaju mini-ścieżki, którą można przejść od razu albo wracać do poszczególnych etapów w miarę potrzeb. Uzupełnia je tekst o tym, jak zmienia się rola programisty, kiedy AI przejmuje pisanie kodu - i dlaczego to jest trudniejsze niż się wydaje.&lt;/p&gt;</description></item><item><title>Agenty piszą CV, Atlassian zmienia Jirę, a Polars i DuckDB łączą siły</title><link>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</link><pubDate>Mon, 20 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</guid><description>&lt;p&gt;Cześć! Za nami finał piłkarskich mistrzostw świata, gdzie Argentyna mierzyła się z Hiszpanią. Niezależnie od wyniku i wczorajszych emocji, poniedziałkowy poranek w IT przynosi powrót do naszej technologicznej rzeczywistości. Oby Twój tydzień zaczął się bez pożarów na produkcji!&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu styk AI oraz codziennych procesów deweloperskich.&lt;/p&gt;&#10;&lt;p&gt;Coraz więcej narzędzi, na czele z odświeżoną Jirą od Atlassiana, stawia na głęboką integrację z agentami AI, Pojawiają się innowacyjne frameworki, które potrafią napisać CV, analizować ogłoszenia o pracę i przejść przez rekrutacyjne sito, Obok rosnącej roli modeli LLM, dużo mówi się o sztuce sprawnego kierowania zapytaniami do odpowiednich silników językowych.&lt;/p&gt;</description></item><item><title>ATS ocenia CV losowo, tmux ratuje deploy, VLM czyta wideo</title><link>https://blog.prokulski.science/2026/07/13/ats-ocenia-cv-losowo-tmux-ratuje-deploy-vlm-czyta-wideo/</link><pubDate>Mon, 13 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/13/ats-ocenia-cv-losowo-tmux-ratuje-deploy-vlm-czyta-wideo/</guid><description>&lt;p&gt;W tym wydaniu dużo o tym, jak AI wchodzi głębiej w infrastrukturę - i co z tego faktycznie wynika w praktyce. Mamy zarówno materiały pokazujące granice modeli językowych (ocena CV, rozumienie sarkazmu), jak i te, które pokazują, jak je sensownie wkomponować w działające systemy (logi, inference stack, MCP nad Postgresem).&lt;/p&gt;&#10;&lt;p&gt;Architektura i skalowanie: od powiadomień push przy milionie odbiorców, przez inference stack złożony z vLLM, KServe i llm-d, po zaawansowane materializacje w DWH, Data Engineering i semantic layer: dbt + Looker w pełnym cyklu, pięć paradygmatów modelowania danych i nowości z frontu LookML, Computer vision: OpenCV 5 bez PyTorcha, detekcja sylwetek z 0,16 ms latencją i scene graphy budowane przez VLM.&lt;/p&gt;</description></item><item><title>Lokalni agenci, schema evolution i najgorsze błędy XGBoost</title><link>https://blog.prokulski.science/2026/07/06/lokalni-agenci-schema-evolution-i-najgorsze-bledy-xgboost/</link><pubDate>Mon, 06 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/06/lokalni-agenci-schema-evolution-i-najgorsze-bledy-xgboost/</guid><description>&lt;p&gt;To wydanie zadaje dwa pytania, które wielu z nas ma gdzieś z tyłu głowy: czy narzędzia, których używam na co dzień, to nadal dobry wybór - i czy warto rozejrzeć się za czymś nowym? Na tapecie znalazły się dbt Core 2.0, DuckDB jako zamiennik Pandas, lokalne agenty AI do pisania kodu oraz nowe modele uczenia maszynowego, które chcą wypchnąć XGBoost z piedestału. Jeśli masz wrażenie, że świat danych zmienia się szybciej niż jesteś w stanie za nim nadążyć - ten numer to potwierdza.&lt;/p&gt;</description></item><item><title>Osiem wzorców potoków danych, Snowflake od środka i przedwakacyjny DevOps</title><link>https://blog.prokulski.science/2026/06/22/osiem-wzorcow-potokow-danych-snowflake-od-srodka-i-przedwakacyjny-devops/</link><pubDate>Mon, 22 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/22/osiem-wzorcow-potokow-danych-snowflake-od-srodka-i-przedwakacyjny-devops/</guid><description>&lt;p&gt;Rozpoczynamy ostatni tydzień roku szkolnego, co dla wielu oznacza początek letnich urlopów i chwilowe zwolnienie tempa w projektach. To idealny moment na uporządkowanie technicznego długu oraz wdrożenie usprawnień, które pozwolą Twoim systemom bezawaryjnie przetrwać czas wakacyjnej flauty. Warto skupić się na:&lt;/p&gt;&#10;&lt;p&gt;automatyzacji powtarzalnych zadań operacyjnych, przeglądzie konfiguracji bezpieczeństwa i zarządzania kluczami, refaktoryzacji krytycznych fragmentów kodu przed masowymi urlopami w zespole.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych i architektury przyglądamy się sprawdzonym wzorcom projektowym oraz zaawansowanym metodom skalowania przepływów. Zrozumienie relacji między różnymi modelami przetwarzania pozwala na budowanie systemów odpornych na nagłe skoki ruchu. W tym tygodniu dowiesz się więcej o:&lt;/p&gt;</description></item><item><title>Więcej niż podstawy: dbt w startupach, HTAP i inteligentne oszczędzanie tokenów</title><link>https://blog.prokulski.science/2026/06/15/wiecej-niz-podstawy-dbt-w-startupach-htap-i-inteligentne-oszczedzanie-tokenow/</link><pubDate>Mon, 15 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/15/wiecej-niz-podstawy-dbt-w-startupach-htap-i-inteligentne-oszczedzanie-tokenow/</guid><description>&lt;p&gt;Połowa czerwca to tradycyjnie czas stabilizacji przed wakacyjnym sezonem ogórkowym, ale patrząc na tempo publikacji technicznych – nikt nie planuje zwalniać obrotów.&lt;br&gt;&#10;Zanim jednak uciekniesz na zasłużony urlop, trzymaj solidną dawkę inżynierskiej wiedzy, która idealnie sprawdzi się do czytania przy poniedziałkowej porannej kawie (w końcu nic tak nie relaksuje jak lektura o optymalizacji partycji w Cassandrze przez inżynierów z Netfliksa!).&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu newslettera skupiam się na dynamicznie rozwijających się systemach agentowych oraz wyzwaniach architektury danych w czasie rzeczywistym.&lt;/p&gt;</description></item><item><title>Ponad połowa kodu z AI? Raport 2026 i symulatory Kubernetes</title><link>https://blog.prokulski.science/2026/06/08/ponad-polowa-kodu-z-ai-raport-2026-i-symulatory-kubernetes/</link><pubDate>Mon, 08 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/08/ponad-polowa-kodu-z-ai-raport-2026-i-symulatory-kubernetes/</guid><description>&lt;p&gt;W tym numerze przyglądamy się gwałtownej profesjonalizacji świata AI, gdzie agenty przestają być tylko ciekawostką, a właściwie są fundamentem codziennej pracy programistycznej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy najważniejszy raport roku (&lt;a href="https://2026.stateofai.dev/en-US"&gt;State of AI 2026&lt;/a&gt;), z którego wynika, że już ponad połowa kodu produkcyjnego pochodzi z systemów AI, pokazujemy protokół MCP jako kluczowy standard łączący modele z infrastrukturą oraz zalety natywnych agentów głosowych, i sprawdzamy, jak pliki SKILL.md pomagają skalować wsparcie AI w wielorepozytorialnych środowiskach Enterprise.&lt;/p&gt;</description></item><item><title>Czy AI Slop zaleje sieć? Plus Spark, Kafka i SQL</title><link>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</link><pubDate>Mon, 25 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz ich głębokiej integracji z codziennym workflow inżynierskim.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenty Playwright i protokół MCP automatyzują cykl życia błędu, od wykrycia po zgłoszenie w Jirze, pokazujemy, jak Claude Code i lokalne modele Qwen2.5 zmieniają zasady gry w analizie danych i budowaniu dashboardów, i sprawdzamy, ile &amp;ldquo;śmieciowego&amp;rdquo; AI (slop) faktycznie krąży w sieci i jak to wpływa na jakość informacji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych skupiamy się na wydajności, optymalizacji kosztów i mądrym wyborze silników bazodanowych.&lt;/p&gt;</description></item><item><title>AI agenci, nudny backend i polskie głosy o architekturze hexagonalnej</title><link>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</link><pubDate>Mon, 18 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz powrotu do sprawdzonych, &amp;ldquo;nudnych&amp;rdquo; technologii.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenci AI i modele LLM (Claude, ChatGPT) ewoluują w stronę praktycznych narzędzi do budowania skillów i automatycznego naprawiania testów, pokazujemy, dlaczego architekci coraz częściej rezygnują ze złożonych baz grafowych na rzecz sprawdzonych ontologii SQL, i tłumaczymy, dlaczego w backendzie prostota i standaryzacja wygrywają z niepotrzebną innowacyjnością.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu skupiamy się na hybrydowym podejściu do analityki i optymalizacji kosztów.&lt;/p&gt;</description></item><item><title>Agenty w produkcji, DuckDB na sterydach i kłamstwa Kubernetesowi</title><link>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</link><pubDate>Mon, 11 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na profesjonalizacji narzędzi AI w codziennej pracy inżynierskiej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak Databricks i Shopify wbudowują agentów AI bezpośrednio w swoje platformy, pokazujemy, dlaczego AI przestaje być dodatkiem, a staje się integralną warstwą systemów, i tłumaczymy zmianę podejścia: od prompt engineeringu do context engineeringu i pracy na głębszych warstwach modeli LLM.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu wracają do gry lekkie, lokalne silniki analityczne.&lt;/p&gt;&#10;&lt;p&gt;Przyglądamy się, jak DuckDB i Polars redefiniują wydajność pracy z danymi na pojedynczej maszynie, pokazujemy, kiedy lokalne przetwarzanie wygrywa z klasycznym podejściem cloud-first, a także wracamy do fundamentów: Kafka i Spark wciąż żyją, ale wymagają konkretnych checklist optymalizacyjnych przy skali produkcyjnej.&lt;/p&gt;</description></item><item><title>Od potoków danych w YAML po automatyzację SharePoint API</title><link>https://blog.prokulski.science/2026/05/04/od-potokow-danych-w-yaml-po-automatyzacje-sharepoint-api/</link><pubDate>Mon, 04 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/04/od-potokow-danych-w-yaml-po-automatyzacje-sharepoint-api/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na przełomowych zmianach w sposobie, w jaki systemy AI wchodzą w interakcję z naszym otoczeniem technologicznym.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy Model Context Protocol (MCP) – otwarty standard, który kończy erę pisania dedykowanych integracji, sprawdzamy, jak agenty AI płynnie komunikują się z bazami danych w modelu „plug-and-play”, i pokazujemy praktyczne wdrożenia budujące skalowalne ekosystemy sztucznej inteligencji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze Data Engineeringu i analityki dbt pozostaje centralnym punktem, ale jego rola ewoluuje w stronę pełnej automatyzacji.&lt;/p&gt;</description></item><item><title>Czy AI naprawi Twoje błędy na produkcji? Plus 25 materiałów o Data &amp; AI</title><link>https://blog.prokulski.science/2026/04/27/czy-ai-naprawi-twoje-bledy-na-produkcji-plus-25-materialow-o-data-ai/</link><pubDate>Mon, 27 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/27/czy-ai-naprawi-twoje-bledy-na-produkcji-plus-25-materialow-o-data-ai/</guid><description>&lt;p&gt;Dzisiejsze wydanie zdominowała dojrzałość systemów AI i ich przejście od prostego generowania kodu do pełnej orkiestracji procesów.&lt;/p&gt;&#10;&lt;p&gt;Mamy fascynujące studium przypadku AI, która samodzielnie diagnozuje i naprawia błędy na produkcji, sprawdzamy, jak autonomiczne agenty przejmują kontrolę nad cyklem życia eksperymentów ML, a także analizujemy model sub-agentów wspierających rolę Senior Staff Engineera w zarządzaniu złożonymi projektami.&lt;/p&gt;&#10;&lt;p&gt;W obszarze Data Engineeringu i analityki widać wyraźny trend w stronę profesjonalizacji i &lt;em&gt;utwardzania&lt;/em&gt; pipeline’ów (na przykład korzystając z Data Build Tool).&lt;/p&gt;</description></item><item><title>Semantic layer, czarne skrzynki i 30 lat Postgresa kontra cały Twój stack</title><link>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</link><pubDate>Mon, 20 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</guid><description>&lt;p&gt;Tym razem data engineering trzyma środek ciężkości całego wydania — i robi to z rozmachem.&lt;/p&gt;&#10;&lt;p&gt;DuckLake osiąga wersję 1.0 jako pełnoprawna platforma lakehouse oparta na Apache Iceberg, dbt publikuje świeży benchmark semantic layer kontra text-to-SQL, a Meta dzieli się case study o tym, jak użyła NLP do mapowania wiedzy w pipeline&amp;rsquo;ach danych.&lt;/p&gt;&#10;&lt;p&gt;Do kompletu:&lt;/p&gt;&#10;&lt;p&gt;architektura medallion z warstwą semantyczną, 20 reguł walidacji, które powinny być standardem w każdym pipeline, i konkretny materiał Airbnb o wysokowydajnym pipeline metryk na OpenTelemetry.&lt;/p&gt;</description></item><item><title>Multi-agent AI, Medallion Architecture i 40 pytań rekrutacyjnych GenAI</title><link>https://blog.prokulski.science/2026/04/13/multi-agent-ai-medallion-architecture-i-40-pytan-rekrutacyjnych-genai/</link><pubDate>Mon, 13 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/13/multi-agent-ai-medallion-architecture-i-40-pytan-rekrutacyjnych-genai/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się ewolucji systemów autonomicznych, które coraz śmielej wychodzą poza ramy prostych asystentów. Architektura oparta na wielu agentach (Multi-agent AI) zaczyna być postrzegana jako nowa iteracja mikroserwisów, oferując niespotykaną dotąd elastyczność w projektowaniu złożonych systemów rozproszonych. To zmiana paradygmatu, która wymaga od nas nie tylko nowych narzędzi integracji, jak protokół MCP, ale przede wszystkim świeżego spojrzenia na inżynierię kontekstu i orkiestrację procesów.&lt;/p&gt;&#10;&lt;p&gt;Równolegle do rewolucji agentowej, świat inżynierii danych przechodzi brutalną weryfikację &amp;ldquo;cargo cultu&amp;rdquo;. Coraz głośniej mówi się o tym, że bez solidnej warstwy semantycznej nawet najnowocześniejszy stos technologiczny nie przyniesie wartości biznesowej. Analizujemy, dlaczego kopiowanie architektury gigantów takich jak Uber może być zgubne dla mniejszych organizacji i jak zamiast tego budować skalowalne platformy oparte na sprawdzonych wzorcach, takich jak Medallion Architecture czy Delta Lake.&lt;/p&gt;</description></item><item><title>Lany Poniedziałek bez lania wody</title><link>https://blog.prokulski.science/2026/04/06/lany-poniedzialek-bez-lania-wody/</link><pubDate>Mon, 06 Apr 2026 11:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/06/lany-poniedzialek-bez-lania-wody/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się dynamicznym zmianom w ekosystemie narzędzi AI oraz ewolucji architektury danych. Dominującym trendem staje się odejście od prostych chatbotów na rzecz złożonych systemów agentowych, co wymusza rewizję dotychczasowych podejść do jakości kodu i automatyzacji. Jednocześnie obserwujemy renesans wydajnych, osadzonych baz danych, takich jak DuckDB, które redefiniują sposób, w jaki myślimy o analityce &amp;ldquo;lokalnej&amp;rdquo; i przygotowaniu danych pod ML.&#10;Druga część zestawienia skupia się na inżynierii systemów o dużej skali. Analizujemy lekcje płynące z zarządzania tysiącami podów GPU w klastrach Kubernetes oraz wyzwania, jakie stawia przed inżynierami projektowanie globalnych usług o najwyższej dostępności. Nie zapominamy o &amp;ldquo;miękkich&amp;rdquo; aspektach pracy – odświeżamy spojrzenie na proces Code Review i wizualizację techniczną, szukając sposobów na zwiększenie efektywności zespołów deweloperskich w świecie zdominowanym przez automatyzację.&#10;Mamy nadzieję, że to poniedziałkowe zestawienie dostarczy Wam solidnej dawki inspiracji do nadchodzących projektów. Miłej lektury!&lt;/p&gt;</description></item><item><title>Agenty, jajka i 10 TB dziennie</title><link>https://blog.prokulski.science/2026/03/30/agenty-jajka-i-10-tb-dziennie/</link><pubDate>Mon, 30 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/30/agenty-jajka-i-10-tb-dziennie/</guid><description>&lt;p&gt;W dzisiejszym wydaniu znajdziesz ponad dwadzieścia pozycji z obszarów, które w tym tygodniu dominowały w branżowym obiegu: agenty AI w środowiskach produkcyjnych, ewolucja narzędzi data engineeringu (dbt + Flink, Databricks Agent Bricks), alternatywy dla UUID w bazach danych, budowanie baz bezpośrednio na S3 oraz kilka solidnych tekstów o Pythonie i MLOps.&lt;/p&gt;&#10;&lt;p&gt;Jutro Prima Aprilis – jeśli Twój model językowy powie Ci coś nieprawdopodobnego, najpierw sprawdź datę, potem halucynacje. A w niedzielę Wielkanoc, więc czas na życzenia: niech Twoje pipeline&amp;rsquo;y nie pękają częściej niż pisanki, a dane wejściowe zawsze przychodzą świeże – jak jajka z wolnego wybiegu. 🐣&lt;/p&gt;</description></item><item><title>Agenty piszą kod, ale nie projektują systemów. Plus ponad 20 innych materiałów</title><link>https://blog.prokulski.science/2026/03/23/agenty-pisza-kod-ale-nie-projektuja-systemow-plus-ponad-20-innych-materialow/</link><pubDate>Mon, 23 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/23/agenty-pisza-kod-ale-nie-projektuja-systemow-plus-ponad-20-innych-materialow/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują dwa tematy: agenty AI i granice tego, co faktycznie potrafią, oraz architektura systemów na konkretnych przykładach z produkcji.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu też case study Slacka (przebudowa powiadomień), Twittera (500 tys. tweetów na minutę) i Stripe&amp;rsquo;a (1300 PR-ów tygodniowo), a obok nich – praktyczne materiały o DuckDB, dbt, LangGraph i ClickHouse.&lt;/p&gt;&#10;&lt;p&gt;Osobny wątek to praca z modelami językowymi: od kursów Anthropic, przez projektowanie system promptów, po refleksję o tym, dlaczego zaczynamy przepraszać chatboty.&lt;/p&gt;</description></item><item><title>DE w baseballu, stress-test OpenClaw oraz event-driven agents</title><link>https://blog.prokulski.science/2026/03/16/de-w-baseballu-stress-test-openclaw-oraz-event-driven-agents/</link><pubDate>Mon, 16 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/16/de-w-baseballu-stress-test-openclaw-oraz-event-driven-agents/</guid><description>&lt;p&gt;W tym wydaniu agenci AI w praktyce: równoległe workflow developerskie, agenty głosowe z niską latencją i szersze spojrzenie na rynek pracy.&lt;/p&gt;&#10;&lt;p&gt;Solidna porcja inżynierii danych — case study z BlaBlaCar i Zalando, pipeline&amp;rsquo;y na Kafce i Airflow, porównanie Databricks z Microsoft Fabric. Są też dwa teksty o dbt: jeśli wolisz polski i gotowiec do uruchomienia, przygotowałem &lt;a href="https://github.com/dane-analizy/dbt-tutorial"&gt;szybki start jako repo na GitHubie&lt;/a&gt; — wrzuć, odpal, działa (przynajmniej u mnie ;-).&lt;/p&gt;&#10;&lt;p&gt;Dla lubiących konkrety: analiza modeli cenowych pięciu cloud data warehouse&amp;rsquo;ów, omówienie pułapki „iluzji prototypu&amp;quot; w wdrożeniach AI i kilka tekstów o semantic layer — w tym &lt;a href="../../2025/12/19/semantic-layer/"&gt;mój wpis z końca zeszłego roku&lt;/a&gt;, jeśli chcesz szerszy kontekst przed lekturą.&lt;/p&gt;</description></item><item><title>dbt i semantic layer? a może po raz kolejny agenci ai?</title><link>https://blog.prokulski.science/2026/03/09/dbt-i-semantic-layer-a-moze-po-raz-kolejny-agenci-ai/</link><pubDate>Mon, 09 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/09/dbt-i-semantic-layer-a-moze-po-raz-kolejny-agenci-ai/</guid><description>&lt;p&gt;W tym wydaniu agenci AI w praktyce: równoległe workflow developerskie, agenty głosowe z niską latencją i szersze spojrzenie na rynek pracy.&lt;/p&gt;&#10;&lt;p&gt;Solidna porcja inżynierii danych — case study z BlaBlaCar i Zalando, pipeline&amp;rsquo;y na Kafce i Airflow, porównanie Databricks z Microsoft Fabric. Są też dwa teksty o dbt: jeśli wolisz polski i gotowiec do uruchomienia, przygotowałem &lt;a href="https://github.com/dane-analizy/dbt-tutorial"&gt;szybki start jako repo na GitHubie&lt;/a&gt; — wrzuć, odpal, działa (przynajmniej u mnie ;-).&lt;/p&gt;&#10;&lt;p&gt;Dla lubiących konkrety: analiza modeli cenowych pięciu cloud data warehouse&amp;rsquo;ów, omówienie pułapki „iluzji prototypu&amp;quot; w wdrożeniach AI i kilka tekstów o semantic layer — w tym &lt;a href="../../2025/12/19/semantic-layer/"&gt;mój wpis z końca zeszłego roku&lt;/a&gt;, jeśli chcesz szerszy kontekst przed lekturą.&lt;/p&gt;</description></item><item><title>Więcej niż podstawy: AI, lakehouse, zaawansowany SQL</title><link>https://blog.prokulski.science/2026/03/02/wiecej-niz-podstawy-ai-lakehouse-zaawansowany-sql/</link><pubDate>Mon, 02 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/02/wiecej-niz-podstawy-ai-lakehouse-zaawansowany-sql/</guid><description>&lt;p&gt;W dzisiejszym wydaniu eksplorujemy najnowsze trendy w świecie danych i AI – od inteligentnych agentów wspomagających pracę z kodem i platformami analitycznymi, przez zaawansowane techniki machine learning i tokenizacji, aż po praktyczne podejścia do architektury systemów i inżynierii danych.&lt;/p&gt;&#10;&lt;p&gt;Poznaj narzędzia, które realnie skracają czas developmentu, dowiedz się, jak wykorzystać embeddings w prognozowaniu szeregów czasowych, a także sprawdź, dlaczego PostgreSQL oferuje znacznie więcej niż podstawowe zapytania SQL. Nie zabraknie również praktycznych projektów z wykorzystaniem H3 do analiz geoprzestrzennych, przewodnika po architekturze lakehouse oraz wskazówek, jak unikać krytycznych błędów w API Pythona i pipeline&amp;rsquo;ach danych. Dla dla entuzjastów wizualizacji – profesjonalne wykresy w R oraz zasady projektowania efektywnych dashboardów.&lt;/p&gt;</description></item><item><title>Czy Power BI umiera? A GitHub Actions zabija zespoły?</title><link>https://blog.prokulski.science/2026/02/23/czy-power-bi-umiera-a-github-actions-zabija-zespoly/</link><pubDate>Mon, 23 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/23/czy-power-bi-umiera-a-github-actions-zabija-zespoly/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy związane z inżynierią danych i automatyzacją: od debaty o przyszłości Power BI i praktycznych zastosowań DuckDB w pipeline&amp;rsquo;ach ETL, przez kontrakty danych w produkcji, aż po wzorce projektowe w PySparku.&lt;/p&gt;&#10;&lt;p&gt;W sekcji AI i agentów przyjrzymy się ograniczeniom vibe codingu i propozycjom nowej warstwy abstrakcji dla systemów agentowych.&lt;/p&gt;&#10;&lt;p&gt;Nie zabraknie także materiałów o architekturze (case study migracji Airbnb z monolitu), DevOps (optymalizacja GitHub Actions), MLOps (metryki predykcyjne incydentów) oraz praktycznych poradników – od konfiguracji tmux dla pracy zdalnej po budowę dashboardów AI w kilka minut.&lt;/p&gt;</description></item><item><title>Lokalne AI, optymalizacja Kafki i analiza 50 tysięcy profili randkowych</title><link>https://blog.prokulski.science/2026/02/16/lokalne-ai-optymalizacja-kafki-i-analiza-50-tysiecy-profili-randkowych/</link><pubDate>Mon, 16 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/16/lokalne-ai-optymalizacja-kafki-i-analiza-50-tysiecy-profili-randkowych/</guid><description>&lt;p&gt;W dzisiejszym wydaniu łączymy praktyczne podejście do AI z fundamentami inżynierii danych. Zaczynamy od narzędzi agentowych – customizacji Claude Code dla Pythona (gdzie język jest przykładem - to samo można zrobić chociażby dla Javy) i OpenClaw jako lokalnego asystenta AI z pełną kontrolą nad danymi.&lt;/p&gt;&#10;&lt;p&gt;W sekcji ML znajdziecie automatyzację audytu katalogów z użyciem XGBoost, wprowadzenie do PyCaret (taka biblioteka auto-ml dla Pythona) oraz semantyczne wyszukiwanie obrazów łączące Gemini z Elasticsearch.&lt;/p&gt;</description></item><item><title>Zero ETL i hackathon z Bielikiem</title><link>https://blog.prokulski.science/2026/02/09/zero-etl-i-hackathon-z-bielikiem/</link><pubDate>Mon, 09 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/09/zero-etl-i-hackathon-z-bielikiem/</guid><description>&lt;p&gt;W dzisiejszym wydaniu: architektura Zero ETL jako nowy standard w inżynierii danych (albo kolejny buzz word - różnie to bywa z nowościami), praktyczne zastosowania AI w zespołach data science, oraz ewolucja DuckDB w kierunku pełnoprawnego lakehouse.&lt;br&gt;&#10;Znalazłem też przegląd antywzorców w architekturach mikroserwisowych, strategie cache&amp;rsquo;owania w REST API i przewodnik po zarządzaniu ewolucją schematów w pipeline&amp;rsquo;ach strumieniowych (to potrafi być ból!).&lt;br&gt;&#10;Znajdziesz dzisiaj również frameworki analityczne dla e-commerce, techniki feature engineering w SQL dla szeregów czasowych oraz narzędzia do observability systemów ML w produkcji.&lt;/p&gt;</description></item><item><title>Kiedy AI zaczyna tworzyć własną kulturę... i jak ją wdrażać w produkcji</title><link>https://blog.prokulski.science/2026/02/02/kiedy-ai-zaczyna-tworzyc-wlasna-kulture-i-jak-ja-wdrazac-w-produkcji/</link><pubDate>Mon, 02 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/02/kiedy-ai-zaczyna-tworzyc-wlasna-kulture-i-jak-ja-wdrazac-w-produkcji/</guid><description>&lt;p&gt;Hit minionego tygodnia - &lt;a href="https://www.moltbook.com/"&gt;Moltbook&lt;/a&gt;. Jest to eksperymentalna sieć społecznościowa w stylu Reddita, zbudowana dla agentów AI, gdzie ludzie mogą tylko podglądać, a nie brać udziału.&lt;/p&gt;&#10;&lt;p&gt;Tekst &lt;a href="https://www.astralcodexten.com/p/best-of-moltbook"&gt;Best Of Moltbook&lt;/a&gt; traktuje Moltbook jako dziwny, ale fascynujący eksperyment: obserwatorium tego, jak zachowują się LLM‑owe agenty, gdy zostawi się je samym sobie z własną przestrzenią społecznościową. Autor waha się między interpretacją &lt;em&gt;to tylko sprytna konfabulacja i echo ludzkich promptów&lt;/em&gt; a podejrzeniem, że dzieje się tu coś ciekawszego - rodzaj zalążkowej kultury agentów, z własnymi memami, lękami, duchowością i polityką.&lt;/p&gt;</description></item><item><title>Rób produkcyjnie agentów AI, platformy danych i automatyzacje, które naprawdę dowożą</title><link>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</link><pubDate>Mon, 26 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</guid><description>&lt;p&gt;To wydanie to mocny pakiet o tym, jak przestać bawić się w „demka” i zacząć budować produkcyjne systemy danych, AI i automatyzacji – od architektury agentów, przez hurtownie, po niskopoziomowe optymalizacje.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu blok tekstów o agentach AI (platformy, orkiestracja, pamięć, narzędzia, realne case’y typu monitoring w Slacku), który pokazuje, co trzeba dostarczyć, żeby agenci nie wybuchli przy pierwszym większym ruchu. Do tego zestaw materiałów o analityce i data engineeringu: dobre EDA, przetwarzanie danych geograficznych z DuckDB + GeoPandas, kontrakty danych, wzorce ETL/ELT (Snowflake + dbt + Airflow, migracja z Airflow do Databricks), patterny pod &lt;em&gt;AI‑ready pipelines&lt;/em&gt; i benchmark DuckDB vs Spark.&lt;/p&gt;</description></item><item><title>Agenci AI, skalowanie pipeline'ów i ewolucja Pythona</title><link>https://blog.prokulski.science/2026/01/19/agenci-ai-skalowanie-pipelineow-i-ewolucja-pythona/</link><pubDate>Mon, 19 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/19/agenci-ai-skalowanie-pipelineow-i-ewolucja-pythona/</guid><description>&lt;p&gt;W dzisiejszym wydaniu głęboko zanurzamy się w świat &lt;strong&gt;agentów AI i agentic AI&lt;/strong&gt;: od fundamentalnych rozróżnień między generatywną AI, agentami i podejściem agentycznym, przez praktyczne wyzwania bezpieczeństwa w postaci mapowania API, aż po optymalizację zarządzania kontekstem w Model Context Protocol. Nie zabraknie również solidnych podstaw machine learningu: kodowanie danych kategorycznych, Support Vector Machines oraz kompleksowy przegląd metod detekcji anomalii w Pythonie.&lt;/p&gt;&#10;&lt;p&gt;Na froncie &lt;strong&gt;inżynierii danych&lt;/strong&gt; pokazujemy, jak ewoluować od prostych crontabów do systemów obsługujących miliardy zdarzeń, jak wykorzystać DuckDB do szybkich analiz bez ciężkiej infrastruktury oraz dlaczego dokumentacja jako kod w dbt-checkpoint staje się silnikiem jakości danych. Praktyczny przewodnik end-to-end z darmowymi narzędziami oraz refleksje nad zawodem data engineera dopełniają obrazu codziennych wyzwań w tej dziedzinie.&lt;/p&gt;</description></item><item><title>Zrób sobie lakehouse na laptopie</title><link>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</link><pubDate>Mon, 12 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy z pogranicza AI, data engineeringu i praktyk inżynierskich. Szczególną uwagę poświęcamy agentom AI - od pisania skutecznych CLAUDE.md i budowy prostych agentów kodujących w 200 liniach, po zaawansowany monitoring autonomicznych systemów i wzorce projektowe dla inteligentnych aplikacji.&lt;/p&gt;&#10;&lt;p&gt;W sekcji data engineering znajdziesz konkretne rozwiązania: od wzorców partycjonowania przyspieszających zapytania, przez budowę lokalnego pipeline&amp;rsquo;u ELT z DuckDB i dbt (bez kosztów chmury), aż po kompletny przewodnik tworzenia lakehouse&amp;rsquo;a z Apache Iceberg, Trino i MinIO. Nie zabrakło też materiałów przygotowujących do rozmów rekrutacyjnych - 10 kluczowych tematów system design dla data engineerów w 2026 roku.&lt;/p&gt;</description></item><item><title>AI: "jednocześnie dużo mądrzejsze i dużo głupsze, niż się spodziewałem"</title><link>https://blog.prokulski.science/2026/01/05/ai-jednoczesnie-duzo-madrzejsze-i-duzo-glupsze-niz-sie-spodziewalem/</link><pubDate>Mon, 05 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/05/ai-jednoczesnie-duzo-madrzejsze-i-duzo-glupsze-niz-sie-spodziewalem/</guid><description>&lt;p&gt;W dzisiejszym wydaniu szeroki przegląd tego, co dzieje się na styku AI, danych i infrastruktury. Zajrzymy pod maskę architektur agentowych, gdzie bazy danych przejmują rolę pamięci długoterminowej i koordynują działanie systemów wieloagentowych. Zobaczymy, jak w praktyce działają autonomiczne pipeline&amp;rsquo;y AI — od generatora pomysłów biznesowych po systemy RAG obsługujące tysiące zapytań na sekundę.&lt;/p&gt;&#10;&lt;p&gt;Nie zabraknie konkretów z obszaru data engineeringu: hybrydowe tabele BigQuery z sekundową świeżością danych, otwarte formaty tabelaryczne (Delta Lake, Iceberg) i nowe możliwości DuckDB — od notebooków w przeglądarce po przetwarzanie terabajtów lokalnie. PostgreSQL również dostaje swoje pięć minut: od wewnętrznych mechanizmów recovery po niedoceniane funkcje, które warto znać.&lt;/p&gt;</description></item><item><title>Ostatni raz w tym roku</title><link>https://blog.prokulski.science/2025/12/22/ostatni-raz-w-tym-roku/</link><pubDate>Mon, 22 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/22/ostatni-raz-w-tym-roku/</guid><description>&lt;p&gt;W dzisiejszym wydaniu koncentrujemy się na praktycznych aspektach pracy z danymi i modelami AI. Z obszaru Data Engineering znajdziecie rozwiązania eliminujące nocne przetwarzanie batchowe przy pomocy DuckDB i dbt, przewodnik po strategiach obsługi danych wrażliwych oraz techniki checkpointingu w systemach event-driven. O DuckDB aż trzy materiały - bo to świetne narzędzie. Podobnie PostgreSQL to świetne narzędzie, &amp;ldquo;zamiatające&amp;rdquo; inne typy baz - tutaj na przykładzie baz wektorowych i indeksowania 100 milionów wektorów w 20 minut.&lt;/p&gt;</description></item><item><title>Jak ludzie korzystają z AI w pracy?</title><link>https://blog.prokulski.science/2025/12/15/jak-ludzie-korzystaja-z-ai-w-pracy/</link><pubDate>Mon, 15 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/15/jak-ludzie-korzystaja-z-ai-w-pracy/</guid><description>&lt;p&gt;Ten tydzień - ostatni pełny przed świętami - to raczej czas porządków, niż wielkich premier. Choć niektórzy testują, jak naprawdę radzi sobie &lt;a href="https://openai.com/pl-PL/index/introducing-gpt-5-2/"&gt;GTP-5.2&lt;/a&gt; - najnowsze dziecko OpenAI.&lt;br&gt;&#10;Na dziś wystarczy tej dolinokratycznej magii. Przejdźmy do rzeczy, które mają większy sens: praktyka, konkret, zero ściemy (bo po to tu jesteś, nie?).&lt;/p&gt;&#10;&lt;p&gt;W tym numerze skupiamy się na tym, co daje realny efekt. Optymalizacja. Wydajność. Sprytne podejścia do codziennej roboty z danymi. Mamy PostgreSQL i DuckDB w akcji, Parquet na sterydach oraz garść sztuczek w Apache Spark i SQLAlchemy. Dorzucamy integrację DuckDB z Amazon S3 i pomysł na streamingowy ETL bez klasycznych hurtowni - lekko, elastycznie i bez ton konfiguracji.&lt;/p&gt;</description></item><item><title>Kryzys pracowniczy w branży + konferencja AI Dev 25</title><link>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</link><pubDate>Mon, 08 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się transformacji współczesnych architektur IT – od rosnącej konkurencji dla RESTa i mikroserwisów, przez natywną obsługę wektorów w Postgresie, aż po praktyczne wzorce partycjonowania Parquet. W sekcji AI i ML znajdziecie przewodnik po PyTorch dla chcących zacząć z sieciami neuronowymi i budowaniem własnych modeli AI. Znajdziecie też tekst o metodach interpretacji predykcji XGBoost z wykorzystaniem SHAP.&lt;/p&gt;&#10;&lt;p&gt;Dla programistów Pythona przygotowaliśmy materiały o walidacji outputów LLM z Pydantic, monitoringu FastAPI, zaawansowanych technikach pandas oraz nowym narzędziu &amp;ldquo;ty&amp;rdquo; do automatyzacji przepływów w chmurze. DevOpsi mogą sprawdzić tutorial wdrażania Spring Boot na Kubernetes, rozwiązanie problemu rozbieżności między środowiskami lokalnym a produkcyjnym oraz master class z tcpdump i Wireshark.&lt;/p&gt;</description></item><item><title>Sporo "przydasiów" do Linuxa oraz LLMów</title><link>https://blog.prokulski.science/2025/12/01/sporo-przydasiow-do-linuxa-oraz-llmow/</link><pubDate>Mon, 01 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/01/sporo-przydasiow-do-linuxa-oraz-llmow/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach zarządzania danymi i sztuczną inteligencją w środowiskach produkcyjnych. Przedstawiamy kompleksowe podejścia do integracji modeli językowych: orkiestrację wielu LLM za pomocą Spring AI oraz budowę niestandardowych pipeline&amp;rsquo;ów z LangGraph. Znajdziecie również porównanie platform MLOps (MLFlow, Metaflow, Kubeflow).&lt;/p&gt;&#10;&lt;p&gt;W obszarze Big Data i data engineeringu omawiamy kluczowe technologie i wzorce architektoniczne. Delta Lake jako warstwa transakcyjna dla Apache Spark, praktyczne wzorce współpracy zespołowej z DuckDB, dyskusja o przyszłości koncepcji data mesh oraz kompleksowe spojrzenie na ekosystem Big Data – od kolejek wiadomości po HDFS, czyli standardowy stack big data (nota bene - możesz mieć big data w domu - zapraszam do &lt;a href="https://github.com/dane-analizy/big-data-stack"&gt;repo&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Jak wygląda "przerzucanie liczb z worka do worka" w ubezpieczeniach i przemyśle?</title><link>https://blog.prokulski.science/2025/11/24/jak-wyglada-przerzucanie-liczb-z-worka-do-worka-w-ubezpieczeniach-i-przemysle/</link><pubDate>Mon, 24 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/24/jak-wyglada-przerzucanie-liczb-z-worka-do-worka-w-ubezpieczeniach-i-przemysle/</guid><description>&lt;p&gt;W dzisiejszym wydaniu znajdziesz solidną dawkę praktycznej wiedzy – od optymalizacji agentów AI w GitHub Copilot i dyskusji o tym, czy serwer MCP rzeczywiście jest Ci potrzebny, przez zaawansowane techniki pracy z DuckDB i porównanie narzędzi do przetwarzania 650 GB danych, aż po konkretne konfiguracje Nginx, Terraform i Kubernetes.&lt;/p&gt;&#10;&lt;p&gt;Często tutaj trafiają teksty związane/zachwalające DuckDB (dzisiaj też będą). Alibaba tymczasem opublikowała trzyczęściowy cykl, w którym dogłębnie analizuje wewnętrzne mechanizmy DuckDB. Na blogu znajduje się analiza kodu DuckDB pod kątem formatu plików, formatu przechowywania tabel oraz warstwy wykonawczej. &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-1-file-format-overview_602511"&gt;Część pierwsza&lt;/a&gt;, &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-2-table-storage-format_602657"&gt;druga&lt;/a&gt; i &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-3-execution-layer-overview_602660"&gt;trzecia&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Przerzucanie liczb z worka do worka - podcast</title><link>https://blog.prokulski.science/2025/11/23/przerzucanie-danych/</link><pubDate>Sun, 23 Nov 2025 17:47:32 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/23/przerzucanie-danych/</guid><description>&lt;p&gt;W podcaście &amp;ldquo;Dane Są Wszędzie&amp;rdquo; opowiadam o mojej roli analityka i architekta w zespole big data, a także omawiam, jak wygląda &amp;ldquo;przerzucanie liczb z worka do worka&amp;rdquo; w dużej skali.&#10;W najnowszym odcinku podcastu Dominika Szcześniaka &amp;ldquo;Dane Są Wszędzie&amp;rdquo; rozmawiamy o mojej roli u jednego z ubezpieczycieli, ale też skupiamy się na back endzie i Big Data, między innymi:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;opowiadam czym jest Kafka&lt;/li&gt;&#10;&lt;li&gt;mówię o tym, jak computer vision i modele AI są wykorzystywane w ubezpieczeniach&lt;/li&gt;&#10;&lt;li&gt;dzielę się moim spojrzeniem na uniwersalność danych i swoją fascynacją jak to, nomen omen, &amp;ldquo;dane są wszędzie&amp;rdquo;&lt;/li&gt;&#10;&lt;li&gt;rozmawiamy też o rolach w dużej organizacji IT (gdzie samo IT ma ponad 1000 osób), od analityków systemowych, po Data Scientistów, Data Engineerów i Product Ownerów&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Całej rozmowy (trwa około godziny) możesz posłuchać na kilku platformach:&lt;/p&gt;</description></item><item><title>Agenci AI, data engineering i fine-tuning LLM</title><link>https://blog.prokulski.science/2025/11/17/agenci-ai-data-engineering-i-fine-tuning-llm/</link><pubDate>Mon, 17 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/17/agenci-ai-data-engineering-i-fine-tuning-llm/</guid><description>&lt;p&gt;W dzisiejszym wydaniu koncentrujemy się na praktycznych aspektach pracy z danymi i sztuczną inteligencją (co nie jest niczym nowym dla stałych czytelników newslettera; a nowych - serdecznie witam!).&lt;br&gt;&#10;Znajdziesz tu kompleksowe tutoriale budowy agentów AI z LangChain, przewodniki po fine-tuningu modeli językowych metodą QLoRA oraz zaawansowane techniki pracy z PostgreSQL i jego rozszerzeniami.&lt;/p&gt;&#10;&lt;p&gt;Szczególną uwagę poświęcamy inżynierii danych: od strategii inkrementalnego ładowania i projektowania idempotentnych pipeline&amp;rsquo;ów, przez real-time CDC z Debezium i Kafką, aż po nowoczesne podejście lakehouse z DuckDB.&lt;br&gt;&#10;Nie zabrakło również głębokiej analizy matematyki stojącej za zero-shot learning, przeglądu metryk klasyfikacyjnych oraz praktycznych rozwiązań dla systemów rozproszonych, jak predykcyjne autoskalowanie Apache Flink.&lt;/p&gt;</description></item><item><title>System design, bazy danych i praktyczny Python</title><link>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</link><pubDate>Mon, 10 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach projektowania i optymalizacji systemów danych.&lt;br&gt;&#10;Zaczynamy od architektury: poznasz sprawdzone metody nauki projektowania systemów oraz zajrzysz pod maskę infrastruktury OpenAI opartej na Kubernetes i Apache Kafka.&lt;br&gt;&#10;W sekcji baz danych znajdziesz spojrzenie na BigQuery z perspektywy programistów Pythona oraz dwanaście realnych przypadków migracji do DuckDB z konkretnymi oszczędnościami.&lt;/p&gt;&#10;&lt;p&gt;Miłośnicy Pythona znajdą też kilka wartościowych materiałów: od elegancji dekoratorów, przez biblioteki przewyższające Excela, po praktyczną migrację z PostgreSQL do MongoDB. Warto zerknąć na porównanie HTTPX z Requests (nie tylko w kontekście projektów LLM, ale po prostu na httpx jako nowocześniejszy pakiet) oraz omówienie narzędzia UV Toolchain do stabilizacji środowisk CI/CD.&lt;/p&gt;</description></item><item><title>Kafka jest szybka, ale użyję Postgres</title><link>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</link><pubDate>Mon, 03 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się rozwiązaniom praktycznym z kilku kluczowych obszarów analizy i przetwarzania danych. Zaczynamy od fuzzy string matching i technik dopasowywania niedoskonałych tekstów, przechodzimy przez architekturę pipeline&amp;rsquo;ów ETL opartych na open source, aż po szczegóły integracji Kafka, Flink i Spark w systemach streamingowych.&lt;/p&gt;&#10;&lt;p&gt;W sekcji Python znajdziesz porównanie nowości w wersjach 3.13 i 3.14, kompleksowy przewodnik (a nawet dwa, aby niejako dopełnić wiedzę) po Pydantic oraz praktyczne wzorce projektowe dla FastAPI. Nie zabraknie też tematów związanych z optymalizacją PostgreSQL w aplikacjach czasu rzeczywistego, zarządzaniem kosztami w chmurze AWS oraz głęboko partycjonowanymi danymi w Apache Spark.&lt;/p&gt;</description></item><item><title>Język polski najlepszy do promptowania?</title><link>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</link><pubDate>Mon, 27 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy związane z infrastrukturą danych i narzędziami AI. Szczególnie polecam artykuł o benchmarku ONERULER – okazuje się, że język polski najlepiej radzi sobie z analizą długich kontekstów w modelach językowych!&lt;/p&gt;&#10;&lt;p&gt;Jeśli budujesz pipeline&amp;rsquo;y danych, znajdziesz praktyczne przewodniki po open table formats (Iceberg, Delta Lake), kompletnej konfiguracji Docker+Airflow+dbt+Postgres oraz wzorcach SQL w DuckDB. Dla zainteresowanych Kafką – materiały o wysokiej dostępności na GKE Autopilot i alternatywie w postaci BufStream z silniejszymi gwarancjami spójności.&lt;/p&gt;</description></item><item><title>Nowy dział low code</title><link>https://blog.prokulski.science/2025/10/06/nowy-dzial-low-code/</link><pubDate>Mon, 06 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/06/nowy-dzial-low-code/</guid><description>&lt;p&gt;Kolejny tydzień, kolejna porcja wiedzy z szerokiego świata danych i AI. Jak zwasze przed Tobą materiały, które sprawdzą się zarówno w codziennej pracy, jak i przy zgłębianiu nowych technologii.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zajmujesz się infrastrukturą i &lt;strong&gt;DevOps&lt;/strong&gt;, czekają na Ciebie praktyczne wzorce Dockerfile dla Pythona, które zredukują czas buildów do sekund, oraz dziewięć sprawdzonych technik autoskalowania w Kubernetes, które przetrwają piki ruchu. A dla fanów baz danych – przegląd rozszerzeń PostgreSQL, które działają jak supermoc, oraz porównanie architektur Snowflake, Oracle i PostgreSQL.&lt;/p&gt;</description></item><item><title>Nie tylko obraz tego, co się dzieje, ale jak to wykorzystać w praktyce</title><link>https://blog.prokulski.science/2025/09/29/nie-tylko-obraz-tego-co-sie-dzieje-ale-jak-to-wykorzystac-w-praktyce/</link><pubDate>Mon, 29 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/29/nie-tylko-obraz-tego-co-sie-dzieje-ale-jak-to-wykorzystac-w-praktyce/</guid><description>&lt;p&gt;Czy kiedykolwiek marzyłeś o tym, żeby skrócić generowanie raportu z 6 godzin do 15 minut? A może zastąpić tradycyjne procesy ETL jednym narzędziem, które działa nawet 100 razy szybciej niż Spark?&lt;/p&gt;&#10;&lt;p&gt;To nie science fiction – to rzeczywistość dzisiejszego numeru!&lt;/p&gt;&#10;&lt;p&gt;Od &lt;strong&gt;agentic AI&lt;/strong&gt;, które rewolucjonizuje kariery specjalistów IT, po konkretne implementacje MCP w firmach CRM – jak zwykle w tym newsletterze nie tylko obraz tego, co się dzieje, ale przede wszystkim &lt;strong&gt;jak to wykorzystać w praktyce&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Firmy uciekają od AI - czas na prawdziwą wiedzę! Praktyczne rozwiązania dla prawdziwych ludzi</title><link>https://blog.prokulski.science/2025/09/15/firmy-uciekaja-od-ai-czas-na-prawdziwa-wiedze-praktyczne-rozwiazania-dla-prawdziwych-ludzi/</link><pubDate>Mon, 15 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/15/firmy-uciekaja-od-ai-czas-na-prawdziwa-wiedze-praktyczne-rozwiazania-dla-prawdziwych-ludzi/</guid><description>&lt;p&gt;Dzisiejszy numer newslettera przynosi zwyczajowy mix technologii i trendów, które kształtują obecny krajobraz danych i AI. Zaczynamy od zaskakującego zwrotu w podejściu do sztucznej inteligencji: coraz więcej firm odwraca się od kosztownych wdrożeń AI, stawiając ponownie na kompetencje ludzkie. To doskonały moment na refleksję nad tym, gdzie AI rzeczywiście przynosi wartość.&lt;/p&gt;&#10;&lt;p&gt;W tym numerze znajdziesz praktyczne rozwiązania, które możesz wdrożyć już dziś. Dowiesz się, jak zespół obniżył koszty bazy danych z 10 tysięcy do 500 dolarów miesięcznie, poznasz siedem trików przyspieszających walidację Pydantic dwukrotnie, a także odkryjesz ukryte możliwości context managerów w Pythonie, które wykraczają daleko poza klasyczne &amp;ldquo;with open()&amp;rdquo;.&lt;/p&gt;</description></item><item><title>Sporo Streamlit i tutoriali budowania Agnetów AI</title><link>https://blog.prokulski.science/2025/09/08/sporo-streamlit-i-tutoriali-budowania-agnetow-ai-newsletter-dane-i-analizy--y-m-d/</link><pubDate>Mon, 08 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/08/sporo-streamlit-i-tutoriali-budowania-agnetow-ai-newsletter-dane-i-analizy--y-m-d/</guid><description>&lt;p&gt;Gdy jedni wciąż zastanawiają się, czy warto eksperymentować z agentami AI, inni już budują kompletne systemy analityczne z Pydantic-AI i Streamlit. Gdy niektóre zespoły mierzą się z podstawową konfiguracją Kafki, inne optymalizują przepustowość na poziomie miliona wiadomości na sekundę. Między innymi o tym dzisiaj.&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Rewolucja agentów AI&lt;/strong&gt; - od zera do działającego agenta z LangGraph, plus praktyczne połączenie Streamlit z Pydantic-AI do analizy danych. To nie są już tylko proof-of-concept, to konkretne narzędzia robocze.&lt;/p&gt;</description></item><item><title>Sklep rozproszony</title><link>https://blog.prokulski.science/2022/04/26/sklep-rozproszony/</link><pubDate>Tue, 26 Apr 2022 12:52:17 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/26/sklep-rozproszony/</guid><description>&lt;p&gt;Od kilku lat zajmuję się przede wszystkim wymyślaniem &lt;em&gt;jak coś ma działać&lt;/em&gt;, opisywaniem tego i oddawaniem do zespołu developerskiego. Głównie są to rzeczy związane z real-time’owym działaniem systemów wszelakich. I dzisiaj przykład takiego działania. Dodatkowo - próbowałem napisać kod tak, żeby był łatwy do rozbudowy.&lt;/p&gt;&#10;&lt;h2 id="o-co-chodzi"&gt;O co chodzi?&lt;/h2&gt;&#10;&lt;p&gt;Zbudujemy coś na kształt prostego sklepu internetowego. Całość będzie zbudowana w nowoczesny (a przynajmniej tak się mówi na konferencjach, a jest to właściwie &lt;em&gt;jedyny słuszny&lt;/em&gt;) sposób, komponenty będą od siebie niezależne, a kod w zamyśle ma wspierać taką niezależność.&lt;/p&gt;</description></item><item><title>Data Science Summit 2020</title><link>https://blog.prokulski.science/2020/09/18/dssconf-2020/</link><pubDate>Fri, 18 Sep 2020 11:48:55 +0000</pubDate><guid>https://blog.prokulski.science/2020/09/18/dssconf-2020/</guid><description>&lt;p&gt;16 października (piątek), odbędzie się IV edycja konferencji Data Science Summit&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://DSSconf.pl"&gt;&lt;img src="../../downloads/2020/09/DSS20_1200x628-1024x536.png" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;em&gt;Post to informacja prasowa, a niniejszy blog oraz fanpage &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;Dane i Analizy&lt;/a&gt; to patroni medialni konferencji.&lt;/em&gt;&lt;/p&gt;&#10;&lt;p&gt;DSS to największe w Polsce wydarzenie o tematyce data science adresowane do wszystkich osób związanych lub zainteresowanych szybko rozwijającym się obszarem przetwarzania, analizy i wizualizacji danych oraz uczelnia maszynowego.&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Data Science Summit 2020&lt;/strong&gt; to przede wszystkim ponad 12 równoległych ścieżek tematycznych i ponad 100 prezentacji prowadzonych przez najbardziej pożądanych ekspertów z Polski i zagranicy.&lt;/p&gt;</description></item><item><title>AI &amp; NLP Day 2020</title><link>https://blog.prokulski.science/2020/08/21/ai-nlp-day-2020/</link><pubDate>Fri, 21 Aug 2020 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2020/08/21/ai-nlp-day-2020/</guid><description>&lt;p&gt;Do 2025 r. Polska będzie potrzebować ok. 200 tys. specjalistów zajmujących się sztuczną inteligencją - wynika z danych ostatniej, siódmej edycji raportu &lt;em&gt;Monitoring trendów w innowacyjności&lt;/em&gt; Polskiej Agencji Rozwoju Przedsiębiorczości.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://nlpday.pl"&gt;&lt;img src="../../downloads/2020/08/NLPDAY_b.png" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;em&gt;Post to informacja prasowa, a niniejszy blog oraz fanpage &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;Dane i Analizy&lt;/a&gt; to patroni medialni konferencji.&lt;/em&gt;&lt;/p&gt;&#10;&lt;p&gt;W obliczu rosnącego zapotrzebowania na ekspertów AI i dynamicznie postępującej cyfryzacji, edukacja nowych i obecnych kadr IT w obszarze Big Data będzie miała znaczący wpływ na rozwój gospodarczy w najbliższych latach.&lt;/p&gt;</description></item><item><title>Promocja na książki</title><link>https://blog.prokulski.science/2020/07/11/promocja-na-ksiazki/</link><pubDate>Sat, 11 Jul 2020 10:03:15 +0000</pubDate><guid>https://blog.prokulski.science/2020/07/11/promocja-na-ksiazki/</guid><description>&lt;p&gt;Jeszcze tylko do poniedziałku 13.07 &lt;strong&gt;&lt;a href="https://helion.pl/page/14029A/promocja/8850"&gt;promka wakacyjna&lt;/a&gt;&lt;/strong&gt; w Helionie, łapcie póki są porządne rabaty!&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Deep learning z Kerasem w Pythonie, a konkretnie pozycja &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/delepy.htm"&gt;Deep Learning. Praca z językiem Python i biblioteką Keras&lt;/a&gt;&lt;/strong&gt; i wersja dla R: &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/delerk.htm"&gt;Deep Learning. Praca z językiem R i biblioteką Keras&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Ponoć najlepsza książka do nauki Pythona &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/autopy.htm"&gt;Automatyzacja nudnych zadań z Pythonem. Nauka programowania&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Oraz dla równowagi - najlepsza książka do nauki R: &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/jezrkv.htm"&gt;Język R. Kompletny zestaw narzędzi dla analityków danych&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Analiza danych to też SQL, zatem &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/pksql3.htm"&gt;Praktyczny kurs SQL&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Najlepszym środowiskiem do pracy jest mimo wszystko Linux - podstawy złapiesz dzięki &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/linkp5.htm"&gt;Linux. Komendy i polecenia&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Ale nie wszystko musisz mieć zainstalowane na jakimś serwerze - są rozwiązania kontenerowe, więc &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/docke2.htm"&gt;Docker. Praktyczne zastosowania&lt;/a&gt;&lt;/strong&gt; może okazać się dobrym pomysłem.&lt;/li&gt;&#10;&lt;li&gt;Chyba, że wolisz pozostać w świecie Excela, wówczas przyda Ci się &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/e19bib.htm"&gt;Biblia Excela&lt;/a&gt;&lt;/strong&gt;. Sposobem na przejście do bardziej zaawansowanych technik jest Power Query, w korporacjach przyda się więc &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/poquex.htm"&gt;Power Query w Excelu i Power BI. Zbieranie i przekształcanie danych&lt;/a&gt;&lt;/strong&gt;.&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Więcej książek w ramach promocji znajdziecie &lt;a href="https://helion.pl/page/14029A/promocja/8850"&gt;na stronie&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>(py)Spark, Hadoop i HDFS - podstawy</title><link>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</link><pubDate>Thu, 09 Apr 2020 19:06:13 +0000</pubDate><guid>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</guid><description>&lt;p&gt;Dzisiaj zajmiemy się wykorzystaniem Sparka i Hadoopa do przetwarzania większej ilości danych. Oraz do budowania prostego modelu (regresji liniowej). Może jeszcze nie jest to big data, ale mechanizmy są identyczne jak w przypadku większej liczby danych. Wystarczy tylko tych danych więcej zgromadzić, zbudować większe środowisko (dużo serwerów) i… też będzie działało.&lt;/p&gt;&#10;&lt;p&gt;A w dodatku poznamy pakiet &lt;em&gt;faker&lt;/em&gt; który pozwoli nam na wygenerowanie sztucznych danych.&lt;/p&gt;&#10;&lt;h3 id="spark-i-hadoop"&gt;Spark i Hadoop&lt;/h3&gt;&#10;&lt;p&gt;&lt;strong&gt;Apache Spark&lt;/strong&gt; to rozwijana na zasadach open source platforma klastrowego przetwarzania danych, która ma interfejsy API dla takich języków programowania jak Scala, Python, Java i R.&lt;/p&gt;</description></item><item><title>Spark, czyli opóźnienia pociągów</title><link>https://blog.prokulski.science/2018/12/21/spark-czyli-opoznienia-pociagow/</link><pubDate>Fri, 21 Dec 2018 14:52:21 +0000</pubDate><guid>https://blog.prokulski.science/2018/12/21/spark-czyli-opoznienia-pociagow/</guid><description>&lt;p&gt;Czy polskie pociągi są punktualne? To pytanie, na które poszukamy odpowiedzi, ale jest ono tylko przyczynkiem do dzisiejszego wpisu.&lt;/p&gt;&#10;&lt;p&gt;Chciałbym pokazać dzisiaj sposób znalezienia odpowiedzi, nawet nie samą odpowiedź. Skąd wziąć dane? Jak sobie z nimi poradzić? Czym je uzupełnić?&lt;/p&gt;&#10;&lt;h3 id="pozyskanie-danych"&gt;Pozyskanie danych&lt;/h3&gt;&#10;&lt;p&gt;W pierwszym odruchu pomyślałem o stronach PKP i webscrappingu. Ale na Twitterze mojego bota &lt;a href="https://twitter.com/rstatspl"&gt;@rstatspl&lt;/a&gt; obserwuje inny bot - &lt;a href="https://twitter.com/OpPociagow"&gt;@OpPociagow&lt;/a&gt;, który prezentuje ciekawe dane. Skoro prezentuje to je ma. Skoro ma, to gdzieś są. Chwila rozmowy z twórcą i uzyskujemy adres &lt;a href="http://ipa.lovethosetrains.com/"&gt;InfoPasażer Archiver - archiwum opóźnień pociągów&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Jak nauczyć się R? Co czytać?</title><link>https://blog.prokulski.science/2017/08/30/jak-nauczyc-sie-r-co-czytac/</link><pubDate>Wed, 30 Aug 2017 14:09:36 +0000</pubDate><guid>https://blog.prokulski.science/2017/08/30/jak-nauczyc-sie-r-co-czytac/</guid><description>&lt;p&gt;W listach pytacie o źródła wiedzy dotyczącej R. Dzisiaj kilka linków.&#10;Na początek agregaty, które mogą okazać się wystarczające:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;a href="https://www.r-bloggers.com/"&gt;R Bloggers&lt;/a&gt; - platforma zbierająca treści z wielu blogów&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://blog.revolutionanalytics.com/"&gt;Revolution Analytics&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://www.datasciencecentral.com/profiles/blog/list"&gt;Data Science Central&lt;/a&gt; - platforma blogowa dla dłubiących w BigData&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Warto śledzić też blogi poszczególnych osób:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;a href="https://juliasilge.com/"&gt;Julia Silge&lt;/a&gt; to współautorka pakietu &lt;em&gt;tidytext&lt;/em&gt; (i jednocześnie data scientist w Stack Overflow)&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://varianceexplained.org/"&gt;Variance Explained&lt;/a&gt; - blog drugiego współautora &lt;em&gt;tidytext&lt;/em&gt;&lt;/li&gt;&#10;&lt;li&gt;blog &lt;a href="http://www.masalmon.eu/"&gt;Maëlle Salmon&lt;/a&gt;, który kiedyś dodałem do RSSów (trafiłem pewnie w poszukiwaniach czegoś konkretnego albo z r-bloggers)&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Jednym z lepszych miejsc jest cała domena związana z RStudio i poszczególne jej subdomeny, przede wszystkim &lt;a href="https://blog.rstudio.com/"&gt;blog RStudio&lt;/a&gt; oraz &lt;a href="https://rviews.rstudio.com/"&gt;RViews&lt;/a&gt;. W ramach RStudio znajdziecie też dużo informacji o poszczególnych pakietach - strona zbiorcza jest &lt;a href="https://www.rstudio.com/products/rpackages/"&gt;tutaj&lt;/a&gt;.&#10;Z polskich blogów szczególnie polecam dwa:&lt;/p&gt;</description></item><item><title>Rowery Veturilo - część pierwsza</title><link>https://blog.prokulski.science/2017/05/08/rowery-veturilo-i/</link><pubDate>Mon, 08 May 2017 15:54:27 +0000</pubDate><guid>https://blog.prokulski.science/2017/05/08/rowery-veturilo-i/</guid><description>&lt;p&gt;Czy popularność rowerów Veturilo w Warszawie od czegoś zależy?&#10;Dzisiaj, po majowej przerwie (spędzonej między innymi na rowerze) zajmiemy się nieco większymi zbiorami danych.&#10;Na początek kilka słów o przygotowaniu danych.&lt;/p&gt;&#10;&lt;h3 id="rowery-veturilo"&gt;Rowery Veturilo&lt;/h3&gt;&#10;&lt;p&gt;Od początku marca (od bodaj 11) zbierałem dane wystawione przez NextBike (operatora rowerów m.in. Veturilo) dla kilkudziesięciu miast. Ograniczyłem się tylko do Warszawy, dane były pobierane co 5 minut. Jak wyglądają te dane możecie sprawdzić sami - to &lt;a href="http://nextbike.net/maps/nextbike-official.xml?city=210"&gt;dostępny online plik XML&lt;/a&gt;. W pliku znaleźć można wszystkie potrzebne nam informacje:&lt;/p&gt;</description></item></channel></rss>