<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Databricks on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/databricks/</link><description>Recent content in Databricks on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 03 Aug 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/databricks/index.xml" rel="self" type="application/rss+xml"/><item><title>Dlaczego migracja do Databricks jest trudna i co z tym zrobić?</title><link>https://blog.prokulski.science/2026/08/03/dlaczego-migracja-do-databricks-jest-trudna-i-co-z-tym-zrobic/</link><pubDate>Mon, 03 Aug 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/08/03/dlaczego-migracja-do-databricks-jest-trudna-i-co-z-tym-zrobic/</guid><description>&lt;p&gt;W tym wydaniu powraca temat architektury danych i platformy lakehouse - Apache Iceberg, Databricks, Microsoft Fabric - ale tym razem z wyraźnie różnymi kątami. Jeden artykuł tłumaczy, czym Databricks w ogóle jest i jak działa. Drugi mówi wprost, dlaczego migracja na tę platformę często idzie nie tak. Trzeci pokazuje, jak zorganizować porządny proces wdrożeniowy - ale w Microsoft Fabric. Razem tworzą niezły przegląd tego, co czeka Cię przy pracy z nowoczesnymi platformami danych:&lt;/p&gt;</description></item><item><title>Czy AI Slop zaleje sieć? Plus Spark, Kafka i SQL</title><link>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</link><pubDate>Mon, 25 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz ich głębokiej integracji z codziennym workflow inżynierskim.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenty Playwright i protokół MCP automatyzują cykl życia błędu, od wykrycia po zgłoszenie w Jirze, pokazujemy, jak Claude Code i lokalne modele Qwen2.5 zmieniają zasady gry w analizie danych i budowaniu dashboardów, i sprawdzamy, ile &amp;ldquo;śmieciowego&amp;rdquo; AI (slop) faktycznie krąży w sieci i jak to wpływa na jakość informacji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych skupiamy się na wydajności, optymalizacji kosztów i mądrym wyborze silników bazodanowych.&lt;/p&gt;</description></item><item><title>Agenty w produkcji, DuckDB na sterydach i kłamstwa Kubernetesowi</title><link>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</link><pubDate>Mon, 11 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na profesjonalizacji narzędzi AI w codziennej pracy inżynierskiej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak Databricks i Shopify wbudowują agentów AI bezpośrednio w swoje platformy, pokazujemy, dlaczego AI przestaje być dodatkiem, a staje się integralną warstwą systemów, i tłumaczymy zmianę podejścia: od prompt engineeringu do context engineeringu i pracy na głębszych warstwach modeli LLM.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu wracają do gry lekkie, lokalne silniki analityczne.&lt;/p&gt;&#10;&lt;p&gt;Przyglądamy się, jak DuckDB i Polars redefiniują wydajność pracy z danymi na pojedynczej maszynie, pokazujemy, kiedy lokalne przetwarzanie wygrywa z klasycznym podejściem cloud-first, a także wracamy do fundamentów: Kafka i Spark wciąż żyją, ale wymagają konkretnych checklist optymalizacyjnych przy skali produkcyjnej.&lt;/p&gt;</description></item><item><title>Semantic layer, czarne skrzynki i 30 lat Postgresa kontra cały Twój stack</title><link>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</link><pubDate>Mon, 20 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</guid><description>&lt;p&gt;Tym razem data engineering trzyma środek ciężkości całego wydania — i robi to z rozmachem.&lt;/p&gt;&#10;&lt;p&gt;DuckLake osiąga wersję 1.0 jako pełnoprawna platforma lakehouse oparta na Apache Iceberg, dbt publikuje świeży benchmark semantic layer kontra text-to-SQL, a Meta dzieli się case study o tym, jak użyła NLP do mapowania wiedzy w pipeline&amp;rsquo;ach danych.&lt;/p&gt;&#10;&lt;p&gt;Do kompletu:&lt;/p&gt;&#10;&lt;p&gt;architektura medallion z warstwą semantyczną, 20 reguł walidacji, które powinny być standardem w każdym pipeline, i konkretny materiał Airbnb o wysokowydajnym pipeline metryk na OpenTelemetry.&lt;/p&gt;</description></item><item><title>Agenty, jajka i 10 TB dziennie</title><link>https://blog.prokulski.science/2026/03/30/agenty-jajka-i-10-tb-dziennie/</link><pubDate>Mon, 30 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/30/agenty-jajka-i-10-tb-dziennie/</guid><description>&lt;p&gt;W dzisiejszym wydaniu znajdziesz ponad dwadzieścia pozycji z obszarów, które w tym tygodniu dominowały w branżowym obiegu: agenty AI w środowiskach produkcyjnych, ewolucja narzędzi data engineeringu (dbt + Flink, Databricks Agent Bricks), alternatywy dla UUID w bazach danych, budowanie baz bezpośrednio na S3 oraz kilka solidnych tekstów o Pythonie i MLOps.&lt;/p&gt;&#10;&lt;p&gt;Jutro Prima Aprilis – jeśli Twój model językowy powie Ci coś nieprawdopodobnego, najpierw sprawdź datę, potem halucynacje. A w niedzielę Wielkanoc, więc czas na życzenia: niech Twoje pipeline&amp;rsquo;y nie pękają częściej niż pisanki, a dane wejściowe zawsze przychodzą świeże – jak jajka z wolnego wybiegu. 🐣&lt;/p&gt;</description></item><item><title>DE w baseballu, stress-test OpenClaw oraz event-driven agents</title><link>https://blog.prokulski.science/2026/03/16/de-w-baseballu-stress-test-openclaw-oraz-event-driven-agents/</link><pubDate>Mon, 16 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/16/de-w-baseballu-stress-test-openclaw-oraz-event-driven-agents/</guid><description>&lt;p&gt;W tym wydaniu agenci AI w praktyce: równoległe workflow developerskie, agenty głosowe z niską latencją i szersze spojrzenie na rynek pracy.&lt;/p&gt;&#10;&lt;p&gt;Solidna porcja inżynierii danych — case study z BlaBlaCar i Zalando, pipeline&amp;rsquo;y na Kafce i Airflow, porównanie Databricks z Microsoft Fabric. Są też dwa teksty o dbt: jeśli wolisz polski i gotowiec do uruchomienia, przygotowałem &lt;a href="https://github.com/dane-analizy/dbt-tutorial"&gt;szybki start jako repo na GitHubie&lt;/a&gt; — wrzuć, odpal, działa (przynajmniej u mnie ;-).&lt;/p&gt;&#10;&lt;p&gt;Dla lubiących konkrety: analiza modeli cenowych pięciu cloud data warehouse&amp;rsquo;ów, omówienie pułapki „iluzji prototypu&amp;quot; w wdrożeniach AI i kilka tekstów o semantic layer — w tym &lt;a href="../../2025/12/19/semantic-layer/"&gt;mój wpis z końca zeszłego roku&lt;/a&gt;, jeśli chcesz szerszy kontekst przed lekturą.&lt;/p&gt;</description></item><item><title>dbt i semantic layer? a może po raz kolejny agenci ai?</title><link>https://blog.prokulski.science/2026/03/09/dbt-i-semantic-layer-a-moze-po-raz-kolejny-agenci-ai/</link><pubDate>Mon, 09 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/09/dbt-i-semantic-layer-a-moze-po-raz-kolejny-agenci-ai/</guid><description>&lt;p&gt;W tym wydaniu agenci AI w praktyce: równoległe workflow developerskie, agenty głosowe z niską latencją i szersze spojrzenie na rynek pracy.&lt;/p&gt;&#10;&lt;p&gt;Solidna porcja inżynierii danych — case study z BlaBlaCar i Zalando, pipeline&amp;rsquo;y na Kafce i Airflow, porównanie Databricks z Microsoft Fabric. Są też dwa teksty o dbt: jeśli wolisz polski i gotowiec do uruchomienia, przygotowałem &lt;a href="https://github.com/dane-analizy/dbt-tutorial"&gt;szybki start jako repo na GitHubie&lt;/a&gt; — wrzuć, odpal, działa (przynajmniej u mnie ;-).&lt;/p&gt;&#10;&lt;p&gt;Dla lubiących konkrety: analiza modeli cenowych pięciu cloud data warehouse&amp;rsquo;ów, omówienie pułapki „iluzji prototypu&amp;quot; w wdrożeniach AI i kilka tekstów o semantic layer — w tym &lt;a href="../../2025/12/19/semantic-layer/"&gt;mój wpis z końca zeszłego roku&lt;/a&gt;, jeśli chcesz szerszy kontekst przed lekturą.&lt;/p&gt;</description></item><item><title>Więcej niż podstawy: AI, lakehouse, zaawansowany SQL</title><link>https://blog.prokulski.science/2026/03/02/wiecej-niz-podstawy-ai-lakehouse-zaawansowany-sql/</link><pubDate>Mon, 02 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/02/wiecej-niz-podstawy-ai-lakehouse-zaawansowany-sql/</guid><description>&lt;p&gt;W dzisiejszym wydaniu eksplorujemy najnowsze trendy w świecie danych i AI – od inteligentnych agentów wspomagających pracę z kodem i platformami analitycznymi, przez zaawansowane techniki machine learning i tokenizacji, aż po praktyczne podejścia do architektury systemów i inżynierii danych.&lt;/p&gt;&#10;&lt;p&gt;Poznaj narzędzia, które realnie skracają czas developmentu, dowiedz się, jak wykorzystać embeddings w prognozowaniu szeregów czasowych, a także sprawdź, dlaczego PostgreSQL oferuje znacznie więcej niż podstawowe zapytania SQL. Nie zabraknie również praktycznych projektów z wykorzystaniem H3 do analiz geoprzestrzennych, przewodnika po architekturze lakehouse oraz wskazówek, jak unikać krytycznych błędów w API Pythona i pipeline&amp;rsquo;ach danych. Dla dla entuzjastów wizualizacji – profesjonalne wykresy w R oraz zasady projektowania efektywnych dashboardów.&lt;/p&gt;</description></item><item><title>Rób produkcyjnie agentów AI, platformy danych i automatyzacje, które naprawdę dowożą</title><link>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</link><pubDate>Mon, 26 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</guid><description>&lt;p&gt;To wydanie to mocny pakiet o tym, jak przestać bawić się w „demka” i zacząć budować produkcyjne systemy danych, AI i automatyzacji – od architektury agentów, przez hurtownie, po niskopoziomowe optymalizacje.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu blok tekstów o agentach AI (platformy, orkiestracja, pamięć, narzędzia, realne case’y typu monitoring w Slacku), który pokazuje, co trzeba dostarczyć, żeby agenci nie wybuchli przy pierwszym większym ruchu. Do tego zestaw materiałów o analityce i data engineeringu: dobre EDA, przetwarzanie danych geograficznych z DuckDB + GeoPandas, kontrakty danych, wzorce ETL/ELT (Snowflake + dbt + Airflow, migracja z Airflow do Databricks), patterny pod &lt;em&gt;AI‑ready pipelines&lt;/em&gt; i benchmark DuckDB vs Spark.&lt;/p&gt;</description></item><item><title>System design, bazy danych i praktyczny Python</title><link>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</link><pubDate>Mon, 10 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach projektowania i optymalizacji systemów danych.&lt;br&gt;&#10;Zaczynamy od architektury: poznasz sprawdzone metody nauki projektowania systemów oraz zajrzysz pod maskę infrastruktury OpenAI opartej na Kubernetes i Apache Kafka.&lt;br&gt;&#10;W sekcji baz danych znajdziesz spojrzenie na BigQuery z perspektywy programistów Pythona oraz dwanaście realnych przypadków migracji do DuckDB z konkretnymi oszczędnościami.&lt;/p&gt;&#10;&lt;p&gt;Miłośnicy Pythona znajdą też kilka wartościowych materiałów: od elegancji dekoratorów, przez biblioteki przewyższające Excela, po praktyczną migrację z PostgreSQL do MongoDB. Warto zerknąć na porównanie HTTPX z Requests (nie tylko w kontekście projektów LLM, ale po prostu na httpx jako nowocześniejszy pakiet) oraz omówienie narzędzia UV Toolchain do stabilizacji środowisk CI/CD.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-16</title><link>https://blog.prokulski.science/2024/12/16/newsletter-dane-i-analizy-2024-12-16/</link><pubDate>Mon, 16 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/16/newsletter-dane-i-analizy-2024-12-16/</guid><description>&lt;p&gt;Czego szukali ludzie w Google w mijającym roku? Google dostarcza podsumowanie dla całego świata i większości krajów z osobna (&lt;a href="https://trends.withgoogle.com/year-in-search/2024/pl/"&gt;tutaj Polska&lt;/a&gt;, tutaj &lt;a href="https://trends.withgoogle.com/year-in-search/2024/"&gt;&lt;em&gt;global&lt;/em&gt;&lt;/a&gt;). Podsumowania te są o tyle interesujące, że stanowią pewnego rodzaju obraz naszego społeczeństwa i jego zainteresowań.&lt;/p&gt;&#10;&lt;p&gt;Wiecie, że w Afryce w większości państw ruch w internecie z komórki przeważa ruch z komputerów? W przykładowym Sudanie ponad 77% to komórki. Tego typu rzeczy można dowiedzieć się z corocznego raport &lt;a href="https://radar.cloudflare.com/year-in-review/2024"&gt;Cloudflare Radar&lt;/a&gt;. Raport mówi nie tylko o dominacji Google, ale też zawiera statystyki dotyczące szyfrowania ruchu, popularności różnych technologii sieciowych czy kwestii bezpieczeństwa.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-17</title><link>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</link><pubDate>Mon, 17 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</guid><description>&lt;p&gt;Gorąco polecam tekst &lt;a href="https://towardsdev.com/data-engineering-project-imdb-movie-analysis-3f79de2f4ce7"&gt;Data Engineering Project: IMDB Movie Analysis&lt;/a&gt; - przykład świetnego projektu pozyskiwania i przetwarzania danych.&lt;/p&gt;&#10;&lt;p&gt;A kiedy dane są już przetworzone - można je pokazać. Wspomniany tekst analizujący dane z IMDB też zawiera ten element, ale dzisiejsze wydanie pokazuje więcej takich przykładów czy też tutoriali. Mamy coś o rysowaniu wykresów (super jest &lt;a href="https://towardsdatascience.com/plotly-and-pandas-combining-forces-for-effective-data-visualization-2e2caad52de9"&gt;Plotly and Pandas: Combining Forces for Effective Data Visualization&lt;/a&gt;) ale też &lt;a href="https://nightingaledvs.com/data-journalism-colour-accessibility/"&gt;o kolorach i ich doborze&lt;/a&gt; do wykresów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://python.plainenglish.io/the-complete-guide-to-keras-loss-functions-776d319e729d"&gt;&lt;strong&gt;The Complete Guide to Keras Loss Functions&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy model uczy się tak, aby dopasować się do metryki, która weryfikuje czy działa on dobrze czy źle. Trzeba więc wiedzieć jak te metryki działają, aby osiągnąć to, czego chcemy. Tutaj znajdziesz informacje o metrykach dostępnych w TF&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-15</title><link>https://blog.prokulski.science/2023/05/15/newsletter-dane-i-analizy-2023-05-15/</link><pubDate>Mon, 15 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/15/newsletter-dane-i-analizy-2023-05-15/</guid><description>&lt;p&gt;Wielokrotnie w newsletterze znalazły się teksty mówiące o wykorzystaniu Snowflake, BigQuery czy Databricks. Dzisiaj przyszedł jednak czas na szybkie wprowadzenie do tych narzędzi - jak zacząć z nich korzystać? Jak stworzyć konto, jak załadować pierwsze dane?&lt;/p&gt;&#10;&lt;p&gt;A wiecie, że narzędzia Microsoftu - na przykład Excel (poprzez VBA) czy też PowerBI potrafią współpracować z zewnętrznymi skryptami napisanymi w Pythonie albo R? Jeśli nie, to poniżej znajdziecie przykłady takiej współpracy. Swoją drogą - pewnie już ze dwa lata mija od plotek o wprowadzeniu Pythona do Excela&amp;hellip; ale coś nie widać zmiany.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-04</title><link>https://blog.prokulski.science/2021/10/04/newsletter-dane-i-analizy-2021-10-04/</link><pubDate>Mon, 04 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/04/newsletter-dane-i-analizy-2021-10-04/</guid><description>&lt;p&gt;&lt;a href="https://gist.github.com/Adricarpin/a004fe0edd5b72eab193c7904dbdae8c"&gt;&lt;strong&gt;MLOps with Docker and Jenkins: Automating Machine Learning Pipelines&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to containerize your ML models with Docker and automate a Pipeline with Jenkins&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/performing-deduplication-with-record-linkage-and-supervised-learning-b01a66cc6882"&gt;&lt;strong&gt;Performing Deduplication with Record Linkage and Supervised Learning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Identifying duplicate records with a machine-learning approach Introduction Most data are recorded manually by humans and most often is not reviewed, not synchronized, and simply because there were mistakes made such as typos. Think for a second, have you ever filled out the same form twice before but with a slight difference in your address? For example, you submitted a form like this (&amp;hellip;)&lt;/p&gt;</description></item></channel></rss>