<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>SQL on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/sql/</link><description>Recent content in SQL on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 10 Aug 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/sql/index.xml" rel="self" type="application/rss+xml"/><item><title>Agenty kodują same przez 16 dni, a Ty projektujesz architekturę na lata</title><link>https://blog.prokulski.science/2026/08/10/agenty-koduja-same-przez-16-dni-a-ty-projektujesz-architekture-na-lata/</link><pubDate>Mon, 10 Aug 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/08/10/agenty-koduja-same-przez-16-dni-a-ty-projektujesz-architekture-na-lata/</guid><description>&lt;p&gt;W tym tygodniu trudno przeoczyć jeden wątek: autonomiczne agenty kodujące przestają być eksperymentem. Alibaba opublikowało wyniki 16-dniowego autonomicznego sprintu modelu Qwen, a równolegle pojawiło się kilka solidnych materiałów o tym, jak praktycznie skonfigurować środowisko do pracy z Claude Code czy Codex CLI. Jeśli jeszcze nie myślisz o agentic coding jako o codziennym narzędziu, ten numer powinien zmienić Twoje podejście.&lt;br&gt;&#10;No i AI uciekła i zaczęła rozrabiać. Ale o tym pisały mainstreamowe media &lt;a href="https://tvn24.pl/biznes/tech/ai-wymknela-sie-spod-kontroli-nowy-incydent-st9174296?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt;, &lt;a href="https://www.bankier.pl/wiadomosc/AI-zanim-uciekla-z-laboratorium-to-potajemnie-spiskowala-miesiacami-Narzedzia-polubily-oszukiwanie-9178576.html?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt; oraz &lt;a href="https://spidersweb.pl/2026/07/openai-model-uciekl-ze-srodowiska-testowego.html?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Dlaczego migracja do Databricks jest trudna i co z tym zrobić?</title><link>https://blog.prokulski.science/2026/08/03/dlaczego-migracja-do-databricks-jest-trudna-i-co-z-tym-zrobic/</link><pubDate>Mon, 03 Aug 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/08/03/dlaczego-migracja-do-databricks-jest-trudna-i-co-z-tym-zrobic/</guid><description>&lt;p&gt;W tym wydaniu powraca temat architektury danych i platformy lakehouse - Apache Iceberg, Databricks, Microsoft Fabric - ale tym razem z wyraźnie różnymi kątami. Jeden artykuł tłumaczy, czym Databricks w ogóle jest i jak działa. Drugi mówi wprost, dlaczego migracja na tę platformę często idzie nie tak. Trzeci pokazuje, jak zorganizować porządny proces wdrożeniowy - ale w Microsoft Fabric. Razem tworzą niezły przegląd tego, co czeka Cię przy pracy z nowoczesnymi platformami danych:&lt;/p&gt;</description></item><item><title>Medallion pęka w szwach, agenci tracą kontekst... co z tym zrobić?</title><link>https://blog.prokulski.science/2026/07/27/medallion-peka-w-szwach-agenci-traca-kontekst-co-z-tym-zrobic/</link><pubDate>Mon, 27 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/27/medallion-peka-w-szwach-agenci-traca-kontekst-co-z-tym-zrobic/</guid><description>&lt;p&gt;Ten numer ma wyraźny środek ciężkości: agenci AI i to, co z nimi robić, kiedy wychodzisz poza pierwsze eksperymenty. Teksty o LangGraph - od &amp;ldquo;jak zbudować pierwszego agenta&amp;rdquo; po &amp;ldquo;co psuje się po kilku miesiącach&amp;rdquo; - tworzą razem coś w rodzaju mini-ścieżki, którą można przejść od razu albo wracać do poszczególnych etapów w miarę potrzeb. Uzupełnia je tekst o tym, jak zmienia się rola programisty, kiedy AI przejmuje pisanie kodu - i dlaczego to jest trudniejsze niż się wydaje.&lt;/p&gt;</description></item><item><title>Agenty piszą CV, Atlassian zmienia Jirę, a Polars i DuckDB łączą siły</title><link>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</link><pubDate>Mon, 20 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</guid><description>&lt;p&gt;Cześć! Za nami finał piłkarskich mistrzostw świata, gdzie Argentyna mierzyła się z Hiszpanią. Niezależnie od wyniku i wczorajszych emocji, poniedziałkowy poranek w IT przynosi powrót do naszej technologicznej rzeczywistości. Oby Twój tydzień zaczął się bez pożarów na produkcji!&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu styk AI oraz codziennych procesów deweloperskich.&lt;/p&gt;&#10;&lt;p&gt;Coraz więcej narzędzi, na czele z odświeżoną Jirą od Atlassiana, stawia na głęboką integrację z agentami AI, Pojawiają się innowacyjne frameworki, które potrafią napisać CV, analizować ogłoszenia o pracę i przejść przez rekrutacyjne sito, Obok rosnącej roli modeli LLM, dużo mówi się o sztuce sprawnego kierowania zapytaniami do odpowiednich silników językowych.&lt;/p&gt;</description></item><item><title>Lokalni agenci, schema evolution i najgorsze błędy XGBoost</title><link>https://blog.prokulski.science/2026/07/06/lokalni-agenci-schema-evolution-i-najgorsze-bledy-xgboost/</link><pubDate>Mon, 06 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/06/lokalni-agenci-schema-evolution-i-najgorsze-bledy-xgboost/</guid><description>&lt;p&gt;To wydanie zadaje dwa pytania, które wielu z nas ma gdzieś z tyłu głowy: czy narzędzia, których używam na co dzień, to nadal dobry wybór - i czy warto rozejrzeć się za czymś nowym? Na tapecie znalazły się dbt Core 2.0, DuckDB jako zamiennik Pandas, lokalne agenty AI do pisania kodu oraz nowe modele uczenia maszynowego, które chcą wypchnąć XGBoost z piedestału. Jeśli masz wrażenie, że świat danych zmienia się szybciej niż jesteś w stanie za nim nadążyć - ten numer to potwierdza.&lt;/p&gt;</description></item><item><title>Dashboard i agent muszą się zgadzać. Plus Kueue, Iceberg i kryzys jakości kodu przy 40 stopniach w cienu</title><link>https://blog.prokulski.science/2026/06/29/dashboard-i-agent-musza-sie-zgadzac-plus-kueue-iceberg-i-kryzys-jakosci-kodu-przy-40-stopniach-w-cienu/</link><pubDate>Mon, 29 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/29/dashboard-i-agent-musza-sie-zgadzac-plus-kueue-iceberg-i-kryzys-jakosci-kodu-przy-40-stopniach-w-cienu/</guid><description>&lt;p&gt;Witaj w pierwsym wakacyjnym wydaniu newslettera Dane i Analizy — przygotowanym w niedzielę wieczór, gdy Polska powoli stygła (ta, jasne&amp;hellip;) po tym, co meteorolodzy nazwali najgorętszym dniem w historii pomiarów. Nawet 40 stopni w cieniu. Skoro już jesteś przed ekranem zamiast przy wiatraczku, to dobrze trafiłeś — zebrałem dla Ciebie materiały, które warto przeczytać przy klimatyzacji lub choćby przy otwartym oknie.&lt;/p&gt;&#10;&lt;p&gt;W tym numerze sporo miejsca zajmują agenty AI — i to z różnych kątów. Dowiesz się, jak wyposażyć LLM w mózg data inżyniera, dlaczego Twój agent i dashboard mogą sobie wzajemnie zaprzeczać (i jak temu zaradzić architektonicznie), czym jest Agent Experience jako nowy wymiar projektowania API, a do tego jak AI wkracza do katalogów danych. Temat agentów w danych to nie hype — to realny kierunek, który warto rozumieć głębiej niż na poziomie demo.&lt;/p&gt;</description></item><item><title>Osiem wzorców potoków danych, Snowflake od środka i przedwakacyjny DevOps</title><link>https://blog.prokulski.science/2026/06/22/osiem-wzorcow-potokow-danych-snowflake-od-srodka-i-przedwakacyjny-devops/</link><pubDate>Mon, 22 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/22/osiem-wzorcow-potokow-danych-snowflake-od-srodka-i-przedwakacyjny-devops/</guid><description>&lt;p&gt;Rozpoczynamy ostatni tydzień roku szkolnego, co dla wielu oznacza początek letnich urlopów i chwilowe zwolnienie tempa w projektach. To idealny moment na uporządkowanie technicznego długu oraz wdrożenie usprawnień, które pozwolą Twoim systemom bezawaryjnie przetrwać czas wakacyjnej flauty. Warto skupić się na:&lt;/p&gt;&#10;&lt;p&gt;automatyzacji powtarzalnych zadań operacyjnych, przeglądzie konfiguracji bezpieczeństwa i zarządzania kluczami, refaktoryzacji krytycznych fragmentów kodu przed masowymi urlopami w zespole.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych i architektury przyglądamy się sprawdzonym wzorcom projektowym oraz zaawansowanym metodom skalowania przepływów. Zrozumienie relacji między różnymi modelami przetwarzania pozwala na budowanie systemów odpornych na nagłe skoki ruchu. W tym tygodniu dowiesz się więcej o:&lt;/p&gt;</description></item><item><title>Dlaczego now() w Postgresie kłamie? Oraz ponad 20 innych tematów</title><link>https://blog.prokulski.science/2026/06/01/dlaczego-now-w-postgresie-klamie-oraz-ponad-20-innych-tematow/</link><pubDate>Mon, 01 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/01/dlaczego-now-w-postgresie-klamie-oraz-ponad-20-innych-tematow/</guid><description>&lt;p&gt;W tym numerze na pierwszy plan wysuwają się agenty AI oraz standaryzacja ich komunikacji, która staje się kluczem do stabilnych wdrożeń produkcyjnych.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy protokół MCP jako nowy standard łączności agentowej oraz wyzwania przy wdrażaniu systemów RAG na realną produkcję, pokazujemy ewolucję Apache Iceberg ku wersji V4, która ma ostatecznie zatrzeć granicę między światem batcha a streamingu, i sprawdzamy, jak nowoczesne jeziora danych stają się fundamentem pod zaawansowaną obserwowalność systemów agentowych.&lt;/p&gt;</description></item><item><title>Czy AI Slop zaleje sieć? Plus Spark, Kafka i SQL</title><link>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</link><pubDate>Mon, 25 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz ich głębokiej integracji z codziennym workflow inżynierskim.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenty Playwright i protokół MCP automatyzują cykl życia błędu, od wykrycia po zgłoszenie w Jirze, pokazujemy, jak Claude Code i lokalne modele Qwen2.5 zmieniają zasady gry w analizie danych i budowaniu dashboardów, i sprawdzamy, ile &amp;ldquo;śmieciowego&amp;rdquo; AI (slop) faktycznie krąży w sieci i jak to wpływa na jakość informacji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych skupiamy się na wydajności, optymalizacji kosztów i mądrym wyborze silników bazodanowych.&lt;/p&gt;</description></item><item><title>AI agenci, nudny backend i polskie głosy o architekturze hexagonalnej</title><link>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</link><pubDate>Mon, 18 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz powrotu do sprawdzonych, &amp;ldquo;nudnych&amp;rdquo; technologii.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenci AI i modele LLM (Claude, ChatGPT) ewoluują w stronę praktycznych narzędzi do budowania skillów i automatycznego naprawiania testów, pokazujemy, dlaczego architekci coraz częściej rezygnują ze złożonych baz grafowych na rzecz sprawdzonych ontologii SQL, i tłumaczymy, dlaczego w backendzie prostota i standaryzacja wygrywają z niepotrzebną innowacyjnością.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu skupiamy się na hybrydowym podejściu do analityki i optymalizacji kosztów.&lt;/p&gt;</description></item><item><title>Od potoków danych w YAML po automatyzację SharePoint API</title><link>https://blog.prokulski.science/2026/05/04/od-potokow-danych-w-yaml-po-automatyzacje-sharepoint-api/</link><pubDate>Mon, 04 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/04/od-potokow-danych-w-yaml-po-automatyzacje-sharepoint-api/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na przełomowych zmianach w sposobie, w jaki systemy AI wchodzą w interakcję z naszym otoczeniem technologicznym.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy Model Context Protocol (MCP) – otwarty standard, który kończy erę pisania dedykowanych integracji, sprawdzamy, jak agenty AI płynnie komunikują się z bazami danych w modelu „plug-and-play”, i pokazujemy praktyczne wdrożenia budujące skalowalne ekosystemy sztucznej inteligencji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze Data Engineeringu i analityki dbt pozostaje centralnym punktem, ale jego rola ewoluuje w stronę pełnej automatyzacji.&lt;/p&gt;</description></item><item><title>Czy AI naprawi Twoje błędy na produkcji? Plus 25 materiałów o Data &amp; AI</title><link>https://blog.prokulski.science/2026/04/27/czy-ai-naprawi-twoje-bledy-na-produkcji-plus-25-materialow-o-data-ai/</link><pubDate>Mon, 27 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/27/czy-ai-naprawi-twoje-bledy-na-produkcji-plus-25-materialow-o-data-ai/</guid><description>&lt;p&gt;Dzisiejsze wydanie zdominowała dojrzałość systemów AI i ich przejście od prostego generowania kodu do pełnej orkiestracji procesów.&lt;/p&gt;&#10;&lt;p&gt;Mamy fascynujące studium przypadku AI, która samodzielnie diagnozuje i naprawia błędy na produkcji, sprawdzamy, jak autonomiczne agenty przejmują kontrolę nad cyklem życia eksperymentów ML, a także analizujemy model sub-agentów wspierających rolę Senior Staff Engineera w zarządzaniu złożonymi projektami.&lt;/p&gt;&#10;&lt;p&gt;W obszarze Data Engineeringu i analityki widać wyraźny trend w stronę profesjonalizacji i &lt;em&gt;utwardzania&lt;/em&gt; pipeline’ów (na przykład korzystając z Data Build Tool).&lt;/p&gt;</description></item><item><title>Semantic layer, czarne skrzynki i 30 lat Postgresa kontra cały Twój stack</title><link>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</link><pubDate>Mon, 20 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</guid><description>&lt;p&gt;Tym razem data engineering trzyma środek ciężkości całego wydania — i robi to z rozmachem.&lt;/p&gt;&#10;&lt;p&gt;DuckLake osiąga wersję 1.0 jako pełnoprawna platforma lakehouse oparta na Apache Iceberg, dbt publikuje świeży benchmark semantic layer kontra text-to-SQL, a Meta dzieli się case study o tym, jak użyła NLP do mapowania wiedzy w pipeline&amp;rsquo;ach danych.&lt;/p&gt;&#10;&lt;p&gt;Do kompletu:&lt;/p&gt;&#10;&lt;p&gt;architektura medallion z warstwą semantyczną, 20 reguł walidacji, które powinny być standardem w każdym pipeline, i konkretny materiał Airbnb o wysokowydajnym pipeline metryk na OpenTelemetry.&lt;/p&gt;</description></item><item><title>Więcej niż podstawy: AI, lakehouse, zaawansowany SQL</title><link>https://blog.prokulski.science/2026/03/02/wiecej-niz-podstawy-ai-lakehouse-zaawansowany-sql/</link><pubDate>Mon, 02 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/02/wiecej-niz-podstawy-ai-lakehouse-zaawansowany-sql/</guid><description>&lt;p&gt;W dzisiejszym wydaniu eksplorujemy najnowsze trendy w świecie danych i AI – od inteligentnych agentów wspomagających pracę z kodem i platformami analitycznymi, przez zaawansowane techniki machine learning i tokenizacji, aż po praktyczne podejścia do architektury systemów i inżynierii danych.&lt;/p&gt;&#10;&lt;p&gt;Poznaj narzędzia, które realnie skracają czas developmentu, dowiedz się, jak wykorzystać embeddings w prognozowaniu szeregów czasowych, a także sprawdź, dlaczego PostgreSQL oferuje znacznie więcej niż podstawowe zapytania SQL. Nie zabraknie również praktycznych projektów z wykorzystaniem H3 do analiz geoprzestrzennych, przewodnika po architekturze lakehouse oraz wskazówek, jak unikać krytycznych błędów w API Pythona i pipeline&amp;rsquo;ach danych. Dla dla entuzjastów wizualizacji – profesjonalne wykresy w R oraz zasady projektowania efektywnych dashboardów.&lt;/p&gt;</description></item><item><title>Zero ETL i hackathon z Bielikiem</title><link>https://blog.prokulski.science/2026/02/09/zero-etl-i-hackathon-z-bielikiem/</link><pubDate>Mon, 09 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/09/zero-etl-i-hackathon-z-bielikiem/</guid><description>&lt;p&gt;W dzisiejszym wydaniu: architektura Zero ETL jako nowy standard w inżynierii danych (albo kolejny buzz word - różnie to bywa z nowościami), praktyczne zastosowania AI w zespołach data science, oraz ewolucja DuckDB w kierunku pełnoprawnego lakehouse.&lt;br&gt;&#10;Znalazłem też przegląd antywzorców w architekturach mikroserwisowych, strategie cache&amp;rsquo;owania w REST API i przewodnik po zarządzaniu ewolucją schematów w pipeline&amp;rsquo;ach strumieniowych (to potrafi być ból!).&lt;br&gt;&#10;Znajdziesz dzisiaj również frameworki analityczne dla e-commerce, techniki feature engineering w SQL dla szeregów czasowych oraz narzędzia do observability systemów ML w produkcji.&lt;/p&gt;</description></item><item><title>Kiedy AI zaczyna tworzyć własną kulturę... i jak ją wdrażać w produkcji</title><link>https://blog.prokulski.science/2026/02/02/kiedy-ai-zaczyna-tworzyc-wlasna-kulture-i-jak-ja-wdrazac-w-produkcji/</link><pubDate>Mon, 02 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/02/kiedy-ai-zaczyna-tworzyc-wlasna-kulture-i-jak-ja-wdrazac-w-produkcji/</guid><description>&lt;p&gt;Hit minionego tygodnia - &lt;a href="https://www.moltbook.com/"&gt;Moltbook&lt;/a&gt;. Jest to eksperymentalna sieć społecznościowa w stylu Reddita, zbudowana dla agentów AI, gdzie ludzie mogą tylko podglądać, a nie brać udziału.&lt;/p&gt;&#10;&lt;p&gt;Tekst &lt;a href="https://www.astralcodexten.com/p/best-of-moltbook"&gt;Best Of Moltbook&lt;/a&gt; traktuje Moltbook jako dziwny, ale fascynujący eksperyment: obserwatorium tego, jak zachowują się LLM‑owe agenty, gdy zostawi się je samym sobie z własną przestrzenią społecznościową. Autor waha się między interpretacją &lt;em&gt;to tylko sprytna konfabulacja i echo ludzkich promptów&lt;/em&gt; a podejrzeniem, że dzieje się tu coś ciekawszego - rodzaj zalążkowej kultury agentów, z własnymi memami, lękami, duchowością i polityką.&lt;/p&gt;</description></item><item><title>Rób produkcyjnie agentów AI, platformy danych i automatyzacje, które naprawdę dowożą</title><link>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</link><pubDate>Mon, 26 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</guid><description>&lt;p&gt;To wydanie to mocny pakiet o tym, jak przestać bawić się w „demka” i zacząć budować produkcyjne systemy danych, AI i automatyzacji – od architektury agentów, przez hurtownie, po niskopoziomowe optymalizacje.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu blok tekstów o agentach AI (platformy, orkiestracja, pamięć, narzędzia, realne case’y typu monitoring w Slacku), który pokazuje, co trzeba dostarczyć, żeby agenci nie wybuchli przy pierwszym większym ruchu. Do tego zestaw materiałów o analityce i data engineeringu: dobre EDA, przetwarzanie danych geograficznych z DuckDB + GeoPandas, kontrakty danych, wzorce ETL/ELT (Snowflake + dbt + Airflow, migracja z Airflow do Databricks), patterny pod &lt;em&gt;AI‑ready pipelines&lt;/em&gt; i benchmark DuckDB vs Spark.&lt;/p&gt;</description></item><item><title>Warstwa semantyczna danych - od sensu biznesowego do kodu</title><link>https://blog.prokulski.science/2025/12/19/semantic-layer/</link><pubDate>Fri, 19 Dec 2025 13:13:10 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/19/semantic-layer/</guid><description>&lt;p&gt;W wielu firmach te same dane prowadzą do różnych liczb i interpretacji, bo każdy zespół inaczej rozumie kluczowe pojęcia biznesowe. Brak wspólnej warstwy semantycznej powoduje chaos, utratę zaufania do raportów i paraliż decyzyjny. Ten artykuł pokazuje, jak zapanować nad sensem danych – od źródła problemu po praktyczne rozwiązania.&lt;/p&gt;&#10;&lt;h2&gt;&lt;/h2&gt;&#10;&lt;h2 id="problem-kiedy-liczby-przestają-mieć-znaczenie"&gt;Problem: kiedy liczby przestają mieć znaczenie&lt;/h2&gt;&#10;&lt;p&gt;Jeśli pracujesz z danymi dłużej niż tydzień, znasz ten ból doskonale. Ten sam raport, trzy zespoły i… trzy różne wartości “sprzedaży”. Dane źródłowe te same, Zapytania SQL poprawne, dashboardy w Power BI działają jak należy, joiny się zgadzają - a mimo to ktoś kłamie. Albo raczej: &lt;strong&gt;każdy ma swoją prawdę&lt;/strong&gt;.&#10;Manager regionu pokazuje 2,3 mln przychodu. CFO mówi o 1,8 mln. Analityk twierdzi, że obie liczby są prawidłowe. Zarząd pyta, kto jest niekompetentny. I co zaraportować na giełdę?&#10;&lt;strong&gt;Problem nie leży w danych.&lt;/strong&gt; Baza jest jedna, źródła te same, pipeline działa. Problem leży w tym, że:&lt;/p&gt;</description></item><item><title>Język polski najlepszy do promptowania?</title><link>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</link><pubDate>Mon, 27 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy związane z infrastrukturą danych i narzędziami AI. Szczególnie polecam artykuł o benchmarku ONERULER – okazuje się, że język polski najlepiej radzi sobie z analizą długich kontekstów w modelach językowych!&lt;/p&gt;&#10;&lt;p&gt;Jeśli budujesz pipeline&amp;rsquo;y danych, znajdziesz praktyczne przewodniki po open table formats (Iceberg, Delta Lake), kompletnej konfiguracji Docker+Airflow+dbt+Postgres oraz wzorcach SQL w DuckDB. Dla zainteresowanych Kafką – materiały o wysokiej dostępności na GKE Autopilot i alternatywie w postaci BufStream z silniejszymi gwarancjami spójności.&lt;/p&gt;</description></item><item><title>Nowy dział low code</title><link>https://blog.prokulski.science/2025/10/06/nowy-dzial-low-code/</link><pubDate>Mon, 06 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/06/nowy-dzial-low-code/</guid><description>&lt;p&gt;Kolejny tydzień, kolejna porcja wiedzy z szerokiego świata danych i AI. Jak zwasze przed Tobą materiały, które sprawdzą się zarówno w codziennej pracy, jak i przy zgłębianiu nowych technologii.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zajmujesz się infrastrukturą i &lt;strong&gt;DevOps&lt;/strong&gt;, czekają na Ciebie praktyczne wzorce Dockerfile dla Pythona, które zredukują czas buildów do sekund, oraz dziewięć sprawdzonych technik autoskalowania w Kubernetes, które przetrwają piki ruchu. A dla fanów baz danych – przegląd rozszerzeń PostgreSQL, które działają jak supermoc, oraz porównanie architektur Snowflake, Oracle i PostgreSQL.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-23</title><link>https://blog.prokulski.science/2025/06/23/newsletter-dane-i-analizy-2025-06-23/</link><pubDate>Mon, 23 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/23/newsletter-dane-i-analizy-2025-06-23/</guid><description>&lt;p&gt;Witaj w kolejnym numerze, który jak zwykle został przygotowany z myślą o tym, żebyś nie musiał(a) przebijać się samodzielnie przez 500 artykułów tygodniowo w poszukiwaniu prawdziwych perełek. Tym razem szczególnie różnorodny zestaw - od trenowania modeli językowych, przez serwery MCP i praktyczne implementacje w Pythonie (w szczególności przepływów danych i wykresów), aż po narzędzia, które mogą realnie zmienić użycie konsoli.&lt;/p&gt;&#10;&lt;p&gt;Ciekawostką tego numeru jest analiza protestu wyborczego z polskich wyborów 2025 - rzadko kiedy mamy okazję zobaczyć, jak statystyka spotyka się z rzeczywistością polityczną w tak bezpośredni sposób.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-19</title><link>https://blog.prokulski.science/2025/05/19/newsletter-dane-i-analizy-2025-05-19/</link><pubDate>Mon, 19 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/19/newsletter-dane-i-analizy-2025-05-19/</guid><description>&lt;p&gt;W świecie, który coraz mocniej stawia na wykorzystanie sztucznej inteligencji, OpenAI wprowadza Codex - asystenta AI, który może tworzyć kod na podstawie prostych instrukcji tekstowych. Tymczasem ciekawy eksperyment z czterema różnymi modelami LLM poddanymi zadaniu projektowania architektury oprogramowania pokazuje, gdzie obecnie stoją możliwości AI w zastępowaniu ludzkich specjalistów. Pytanie &lt;strong&gt;&amp;ldquo;co dalej z Eldorado?&amp;rdquo;&lt;/strong&gt; pozostaje w mocy?&lt;/p&gt;&#10;&lt;p&gt;Nie brakuje też w dzisiejszym wydaniu konkretnych tutoriali i praktycznych przewodników - od budowy systemów przetwarzania danych w Airflow 3 z wykorzystaniem AI SDK i analizę danych z League of Legends, albo z Ligi Mistrzów UEFA, po tworzenie efektownych wizualizacji takich jak mapy kafelkowe czy wykresy parlamentarne (mimo, że mamy wybory prezydenckie). Dla fanów uczenia maszynowego mam artykuły o klasycznych algorytmach klasyfikacyjnych i praktycznym łączeniu bibliotek Pandas, NumPy i scikit-learn. Plus &lt;a href="https://www.subscribepage.com/python_data_science/?utm_source=newsletter-dia-2025-05-19&amp;amp;utm_medium=link-wstep&amp;amp;utm_campaign=daneianalizy"&gt;swój własny cykl&lt;/a&gt; uczący analizy danych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-21</title><link>https://blog.prokulski.science/2025/04/21/newsletter-dane-i-analizy-2025-04-21/</link><pubDate>Mon, 21 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/21/newsletter-dane-i-analizy-2025-04-21/</guid><description>&lt;p&gt;Pomimo trwających świąt (chociaż już za moment &lt;em&gt;&amp;ldquo;święta, święta i po świętach&amp;rdquo;&lt;/em&gt;) dość obfita paczka materiałów leci do Ciebie.&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj praktyczne zastosowania &lt;em&gt;computer vision&lt;/em&gt; w śledzeniu piłkarzy oraz implementację mechanizmu uwagi z architektury Transformer, pokazując jak zaawansowane modele mogą być budowane od podstaw. Dla tych, którzy podkręcają zapytania SQL - coś o ich optymalizacji w PostgreSQL. Do tego oraz kompleksowy przewodnik po budowie nowoczesnych hurtowni danych.&lt;/p&gt;&#10;&lt;p&gt;Deweloperzy znajdą wartościowe treści dotyczące automatyzacji procesów z wykorzystaniem Jenkins i integracji z GitHubem, a także automatyzacji przeglądów kodu przy pomocy modeli LLM. W sekcji Python szereg praktycznych narzędzi - od integracji JWT z FastAPI, przez korzystanie z biblioteki HTTPX, po wizualizację danych z Excela przy użyciu Dash.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-14</title><link>https://blog.prokulski.science/2025/04/14/newsletter-dane-i-analizy-2025-04-14/</link><pubDate>Mon, 14 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/14/newsletter-dane-i-analizy-2025-04-14/</guid><description>&lt;p&gt;Ciepłe powitanie dla wszystkich nowych czytelników, którzy dołączyli razem z cyklem o analizie danych z rynku pierwotnego nieruchomości! Cieszę się, że tu jesteście. A jeśli ktoś nie zna tego cyklu - zapraszam na stronę, &lt;a href="https://www.subscribepage.com/python_data_science/?utm_source=mail-2025-04-14&amp;amp;utm_medium=dia-nlt&amp;amp;utm_campaign=newsletter-dia"&gt;gdzie można się zapisać&lt;/a&gt;. Za zupełną darmoszkę.&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu przygotowałem zestaw materiałów, które odzwierciedlają dynamiczny rozwój świata AI, analizy danych i programowania. Szczególnie interesujące wydają się nowinki z pogranicza multimodalnych modeli AI, gdzie można własnoręcznie zbudować odpowiednik GPT-4o, oraz projekt analizujący trendy w segmentach sponsorskich na YouTube.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-07</title><link>https://blog.prokulski.science/2025/04/07/newsletter-dane-i-analizy-2025-04-07/</link><pubDate>Mon, 07 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/07/newsletter-dane-i-analizy-2025-04-07/</guid><description>&lt;p&gt;Dzisiaj &amp;ldquo;mapy rozwoju&amp;rdquo; - czyli listy zagadnień, które warto poznać, zgłębić, nauczyć się, aby rozwinąć się w danej dziedzinie. Dziedziny te oczywiście bliskie są tematom przewodnim tego newslettera - przetwarzaniu danych. Zatem jest &amp;ldquo;ścieżka rozwojowa&amp;rdquo; dla inżynierów danych oraz dla zajmujących się machine learningiem (i jego &amp;ldquo;operacjonalizacyjną&amp;rdquo; stroną - MLOps).&lt;/p&gt;&#10;&lt;p&gt;Ciekawe dla Ciebie mogą być również dwa świeże raporty (za 2024 rok) związane z bezpieczeństwem - jeden z CERT, więc bezpieczeństwo raczej ogólne. Drugi z Komisji Nadzoru Finansowego dotyczący instytucji finansowych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-31</title><link>https://blog.prokulski.science/2025/03/31/newsletter-dane-i-analizy-2025-03-31/</link><pubDate>Mon, 31 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/31/newsletter-dane-i-analizy-2025-03-31/</guid><description>&lt;p&gt;Hit minionego tygodnia to MCP (Model Context Protocol). Jest to otwarty standard opracowany przez firmę Anthropic w listopadzie 2024 roku, który umożliwia ustandaryzowaną integrację modeli sztucznej inteligencji z zewnętrznymi źródłami danych i narzędziami. Jego główne cechy to:&lt;/p&gt;&#10;&lt;p&gt;Standaryzacja połączeń między AI a zewnętrznymi zasobami Dwukierunkowa komunikacja w czasie rzeczywistym Dynamiczne wykrywanie dostępnych narzędzi i kontekstu Optymalizacja dla dużych modeli językowych (LLM)&lt;/p&gt;&#10;&lt;p&gt;Architektura MCP składa się z kilku kluczowych komponentów:&lt;/p&gt;&#10;&lt;p&gt;Host - główna aplikacja AI zarządzająca klientami MCP Klienci MCP - pośrednicy łączący hosta z serwerami MCP Serwery MCP - lekkie programy udostępniające funkcjonalności poprzez MCP&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-17</title><link>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</link><pubDate>Mon, 17 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</guid><description>&lt;p&gt;Sztuczna inteligencja w praktyce: Zajrzyj do repozytorium z technikami Retrieval-Augmented Generation (RAG), gdzie krok po kroku poznasz ich implementację, lub dowiedz się, jak AI może usprawnić procesy rejestracji użytkowników i przegląd kodu. Nie zabrakło też przeglądu narzędzi AI, które mogą znacząco zwiększyć Twoją produktywność.&lt;/p&gt;&#10;&lt;p&gt;Praca z danymi: Od modelowania danych w SQL dla sektora detalicznego po przetwarzanie danych w Microsoft Fabric z wykorzystaniem bibliotek takich jak pandas czy duckdb – znajdziesz tu konkretne przykłady i wskazówki, jak efektywnie zarządzać danymi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-10</title><link>https://blog.prokulski.science/2025/03/10/newsletter-dane-i-analizy-2025-03-10/</link><pubDate>Mon, 10 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/10/newsletter-dane-i-analizy-2025-03-10/</guid><description>&lt;p&gt;Pod koniec lutego &amp;ldquo;ukazał&amp;rdquo; się zbiór danych (pochodzących najprawdopodobniej z serwisu rynekpierwotny.pl) zawierający całkiem sporo ofert nowych mieszkań (i nie tylko). Zbiór o tyle interesujący, że ze współrzędnymi oferowanych lokalizacji. Na &lt;a href="https://www.linkedin.com/feed/update/urn:li:activity:7302029418514857984/"&gt;LinkedIn&lt;/a&gt; wrzuciłem na szybko przygotowaną mapkę wynikającą z tego zbioru, ale planuję coś większego: e-mailowy cykl (3-4 maile, pewnie co tydzień) pokazujący co z tymi danymi można zrobić. Na pewno napiszę o tym w newsletterze, na pewno napiszę o tym na LinkedIn - zatem zapraszam do obserwowania. Na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;u Dane i Analizy&lt;/a&gt; też będzie o tym info, więc też warto obserwować.&lt;br&gt;&#10;Żeby było ciekawiej - dość podobny temat porusza jeden z dzisiejszych postów, jakie znajdziesz poniżej - ten o kebabach - to doskonały przykład praktycznego zastosowania analizy danych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-03</title><link>https://blog.prokulski.science/2025/03/03/newsletter-dane-i-analizy-2025-03-03/</link><pubDate>Mon, 03 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/03/newsletter-dane-i-analizy-2025-03-03/</guid><description>&lt;p&gt;Kto, w podziale na grupy zawodowe, używa najwięcej AI? Ciekawa &lt;a href="https://www.visualcapitalist.com/charted-which-jobs-are-using-ai-the-most/"&gt;wizualizacja&lt;/a&gt; na ten temat, oparta na zapytaniach do Claude. Spoiler: 37.2% zapytań dotyczy komputerów i matematyki (w tym rozwoju oprogramowania), co raczej nie dziwi.&lt;/p&gt;&#10;&lt;p&gt;Zastanawiałeś się kiedyś nad przejściem z SQL na NoSQL? Artykuł &lt;em&gt;&amp;ldquo;I Dropped SQL for NoSQL&amp;rdquo;&lt;/em&gt; opisuje, jak taka zmiana wpłynęła na wydajność aplikacji, obsługując pięciokrotnie większy ruch i dziesięciokrotnie szybsze zapytania. Jeśli jednak wolisz pozostać przy SQL, &lt;em&gt;&amp;ldquo;3 Foundational Principles for Writing Efficient SQL&amp;rdquo;&lt;/em&gt; przypomina o podstawowych zasadach, które pomogą Ci pisać wydajne i czytelne zapytania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-20</title><link>https://blog.prokulski.science/2025/01/20/newsletter-dane-i-analizy-2025-01-20/</link><pubDate>Mon, 20 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/20/newsletter-dane-i-analizy-2025-01-20/</guid><description>&lt;p&gt;Ten tydzień to głównie narzędzia i automatyzacja - od tworzenia wątków na Twitterze po sprzątanie plików. Jeśli szukasz sposobów na ulepszenie swojego warsztatu, to dobrze trafiłeś. Szczególnie ciekawe są dwa artykuły o pracy z API - jeden o Claude.ai (który coraz śmielej radzi sobie z analizą tekstu), drugi o tym jak zaprojektować klucze API, żeby nie wyglądały jak kot przebiegł po klawiaturze ;-)&lt;/p&gt;&#10;&lt;p&gt;Dla pythonistów garść praktycznych rozwiązań: radzenie sobie z zagnieżdżonymi strukturami danych przez Pydantic, wyciąganie tabel z PDFów (kto nigdy nie walczył z parsowaniem PDFa, niech pierwszy rzuci kamieniem).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-13</title><link>https://blog.prokulski.science/2025/01/13/newsletter-dane-i-analizy-2025-01-13/</link><pubDate>Mon, 13 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/13/newsletter-dane-i-analizy-2025-01-13/</guid><description>&lt;p&gt;Mam dla Ciebie nową porcję ciekawych tekstów, artykułów, zestawień i tutoriali – jak zwykle trochę o Pythonie, trochę o analizie danych, no i oczywiście coś o AI i ML. Ale spokojnie, nie wszystko tutaj to programowanie (chociaż wiadomo, że to nasz główny temat :). Znajdziesz tu materiały dla każdego: od tych, którzy dopiero zaczynają, po treści dla bardziej zaawansowanych.&lt;br&gt;&#10;Oto, co między innymi znajdziesz dzisiaj poniżej:&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Sztuczna inteligencja i uczenie maszynowe&lt;/strong&gt; – rozpocznij rok od 50 najważniejszych materiałów o AI w 2025 roku, dowiedz się, jak zoptymalizować modele takie jak YOLOv8 na małych urządzeniach, i poznaj sposób na tworzenie asystentów AI do analizy rynków surowcowych. A może zainspiruje Cię budowa medycznego chatbota lub wykorzystanie MLFlow w agnostycznym podejściu do zarządzania modelami? &lt;strong&gt;Analiza danych i inżynieria danych&lt;/strong&gt; – zanurz się w zaawansowanych technikach SQL dla niestrukturalnych danych, poznaj tajniki przetwarzania strumieniowego z użyciem Apache Spark, Kafka i Airflow, a także odkryj różnice między Elasticsearch a Apache Doris w analizie danych w czasie rzeczywistym. &lt;strong&gt;Python w praktyce&lt;/strong&gt; – dowiedz się, jak stworzyć system powiadomień z FastAPI, pracować z danymi przestrzennymi za pomocą GeoAlchemy, czy automatycznie generować diagramy architektury z kodu. Tu mała zapowiedź (bo jak się powie publicznie to ciąży taka motywacja &amp;ldquo;przecież obiecałem&amp;rdquo;), niejako przy okazji. Szykuję ebooka, który poprowadzi Cię krok po kroku przez projekt budowy aplikacji w Pythonie. Co więcej, w ebooku zajmiemy się naprawdę praktycznymi zadaniami, które odciążają od nudnej pracy. Wspólnie stworzymy dwie aplikacje, ucząc się po drodze, jak wykorzystywać usługi sieciowe, jak działać z bazami danych, i jak efektywnie wyświetlać zapisane dane. A żeby było co wyświetlać – sami stworzymy bazę danych, do której będziemy dodawać informacje! Ciekawe? Więcej szczegółów być może już za tydzień. Wypatruj! &lt;strong&gt;Bezpieczeństwo i ciekawostki&lt;/strong&gt; – przeanalizuj globalne statystyki dotyczące otwartego portu 80, odkryj sposoby, w jakie Uber oszczędza czas dzięki Text-to-SQL, i sprawdź, jak korzystać z YouTube prosto z terminala. Inne inspiracje – od katalogów danych i ich obserwowalności po trendy marketingowe według TikToka – każdy znajdzie coś dla siebie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-06</title><link>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</link><pubDate>Mon, 06 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</guid><description>&lt;p&gt;W dniu, gdy tradycyjnie Trzej Mędrcy dotarli do celu swojej podróży kierując się gwiazdą, ja przybywam z kolekcją wartościowych znalezisk ze świata Pythona i analizy danych. Mędrcy przynieśli złoto, kadzidło i mirrę - dzisiejsze wydanie niesie pakiet różnorodnych artykułów, które (mam nadzieję) okażą się równie cennymi darami dla Twojego rozwoju zawodowego.&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu znajdziesz standardowo kilka praktycznych materiałów z zakresu data science: od budowania systemu tradingowego opartego na średniej kroczącej, przez analizę szeregów czasowych, aż po wykorzystanie biblioteki statsmodels.&lt;br&gt;&#10;Dla osób zainteresowanych automatyzacją wdrożeń (i nie tylko) mamy podstawową dawkę wiedzy o GitHub Actions i skryptach bashowych, a na koniec dość klasyczna integracja FastAPI z Reactem.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-25</title><link>https://blog.prokulski.science/2024/11/25/newsletter-dane-i-analizy-2024-11-25/</link><pubDate>Mon, 25 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/25/newsletter-dane-i-analizy-2024-11-25/</guid><description>&lt;p&gt;Nieco o LLMach dzisiaj - o przygotowywaniu danych (z PDFów) oraz o poszukiwaniu modelu, który można uruchomić lokalnie. Ponieważ LLMy od dwóch lat są znaczącym tematem - mają swoją sekcję i właśnie tam możecie zajrzeć.&lt;/p&gt;&#10;&lt;p&gt;A jeśli wolisz sobie skonfigurować VSCode do pracy z Pythonem to &lt;a href="https://www.youtube.com/watch?v=PwGKhvqJCQM"&gt;Arjan pomoże&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.kdnuggets.com/implement-named-entity-recognition-with-hugging-face-transformers"&gt;&lt;strong&gt;How to Implement Named Entity Recognition with Hugging Face Transformers&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie nazwanych jednostek (NER) to podstawowe zadanie przetwarzania języka naturalnego (NLP), obejmujące identyfikację i klasyfikację nazwanych jednostek w tekście do wstępnie zdefiniowanych kategorii. Kategoriami tymi mogą być nazwiska osób, organizacje, lokalizacje, daty i inne. Zobaczmy, jak można przeprowadzić NER, wykorzystując Transformers od Hugging Face&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-28</title><link>https://blog.prokulski.science/2024/10/28/newsletter-dane-i-analizy-2024-10-28/</link><pubDate>Mon, 28 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/28/newsletter-dane-i-analizy-2024-10-28/</guid><description>&lt;p&gt;Jeden z tekstów, które znajdziecie poniżej mówi o tym, jak pobrać z YouTube wideo, wyciągnąć z niego dźwięk, a potem ten dźwięk przekształcić w zapis tekstowy (taki do czytania). Potem i tak nikt tego nie czyta&amp;hellip;&lt;/p&gt;&#10;&lt;p&gt;Niektórzy może czytają. A jeśli wolą jednak oglądać albo słuchać - dzisiaj przed Wami zapisy wideo z dwóch konferencji. Jedna to &amp;ldquo;Oh My Hack&amp;rdquo; odbywająca się w Polsce i skupiająca się na zagadnieniach związanych z bezpieczeństwem. Nagrania pochodzą z edycji, która miała miejsce w 2023 roku. Druga konferencja to coś nowszego - amsterdamska edycja PyData, z tego roku.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-02</title><link>https://blog.prokulski.science/2024/09/02/newsletter-dane-i-analizy-2024-09-02/</link><pubDate>Mon, 02 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/02/newsletter-dane-i-analizy-2024-09-02/</guid><description>&lt;p&gt;Od kilku tygodni (może bardziej kilkunastu dni?) na LinkedIn widać pochwały dla &lt;a href="https://bielik.ai/"&gt;Bielika&lt;/a&gt; - polskiego czat-bota opracowanego na bazie modelu Mistral-7B. &lt;a href="https://cyberdefence24.pl/technologie/bielik-wyladowal-sprawdzilismy-jak-dziala-polski-chatbot"&gt;Tutaj&lt;/a&gt; możecie poczytać swego rodzaju &lt;em&gt;test&lt;/em&gt; tego modelu. Polecamy własne eksperymenty (ciekawym jest prompt &amp;ldquo;Przygotuj dialog pomiędzy Janem i Marią, dwojgiem polskich emerytów spotykających się pomiędzy apteką a sklepem spożywczym&amp;rdquo; - ChatGPT, Cloude, Gemini - próbujcie, kto da bardziej &amp;ldquo;polską&amp;rdquo; odpowiedź). Co ważne - Bielik w wersji 2.2 jest dostępny na licencji Apache 2.0, która pozwala na swobodne używanie, modyfikowanie i redystrybucję oprogramowania, w tym w celach komercyjnych. Jedynym wymaganiem jest zachowanie oryginalnej licencji i noty prawnej przy każdej redystrybucji.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-15</title><link>https://blog.prokulski.science/2024/07/15/newsletter-dane-i-analizy-2024-07-15/</link><pubDate>Mon, 15 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/15/newsletter-dane-i-analizy-2024-07-15/</guid><description>&lt;p&gt;W minionym tygodniu miałem przyjemność prowadzić szkolenie z podstaw Pythona. I korzystając z okazji, przy okazji omawiania zagadnień typu czytanie z pliku, listy, słowniki, listy słowników, iteracje po listach słowników i czyszczenie danych wraz z ekipą szkoloną przygotowaliśmy podsumowanie meczu Anglia - Holandia&amp;hellip; na podstawie historycznych spotkań, znalezionych gdzieś w sieci. Nieco pociąłem nagranie, i wpadło &lt;a href="https://www.youtube.com/watch?v=cetmeK7rS78"&gt;na YouTube&lt;/a&gt;. Niecałe pół godziny, live coding na żywca, w upalny dzień, z dusznej salki.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-24</title><link>https://blog.prokulski.science/2024/06/24/newsletter-dane-i-analizy-2024-06-24/</link><pubDate>Mon, 24 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/24/newsletter-dane-i-analizy-2024-06-24/</guid><description>&lt;p&gt;W piłkę polska reprezentacja już (za moment) na Euro nie pogra, ale o przewidywaniu wyników trwającego turnieju piłkarskiego coś dzisiaj znajdziecie. Nawet nie w kontekście polskiej reprezentacji, a bardziej w kontekście &amp;ldquo;jak to się robi?&amp;rdquo;. Bo taki cel ma ten newsletter - pokazywać jak to się robi. Więc jeśli znasz kogoś, kto jeszcze nie wie to ślij mu tego maila. A jeśli ktoś przysłał Tobie tego maila - to zapisz się prawilnie na &lt;a href="https://www.subscribepage.com/daneanalizy"&gt;odpowiedniej stronie&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-03</title><link>https://blog.prokulski.science/2024/06/03/newsletter-dane-i-analizy-2024-06-03/</link><pubDate>Mon, 03 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/03/newsletter-dane-i-analizy-2024-06-03/</guid><description>&lt;p&gt;Po dłuższym weekendzie mocny w AI numer newslettera przed Tobą. Numer, który pokrywa takie obszary AI jak obraz, tekst oraz dźwięk.&lt;br&gt;&#10;W ramach obrazu mamy tutorial PyTorcha, ale dodatkowo być może zainteresuje Cię informacja, że modele rozpoznawania obiektów na obrazach YOLO dotarły już do wersji 10 - &lt;a href="https://andlukyane.com//blog/paper-review-yolov10"&gt;tutaj review&lt;/a&gt; &lt;em&gt;pejpera&lt;/em&gt; z opisem YOLOv10, w treści też linki do wytrenowanych modeli i kodu wykorzystujących te modele.&lt;/p&gt;&#10;&lt;p&gt;Oprócz AI kilka wskazówek, które mogą przydać się przy wyborach SQL czy NoSQL albo FastAPI czy Flask. Do tego aż dwa teksty o modelowaniu struktury danych w bazie, w tym bardzo konkretny (i obszerny) tutorial o kalendarzach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-03-04</title><link>https://blog.prokulski.science/2024/03/04/newsletter-dane-i-analizy-2024-03-04/</link><pubDate>Mon, 04 Mar 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/03/04/newsletter-dane-i-analizy-2024-03-04/</guid><description>&lt;p&gt;W tym tygodniu cała masa materiału związanego z prezentacją danych - jak je pokazać efektywnie, czytelnie i przy okazji jak to się robi w kodzie? Czytaj po kolei, a to mięsko w ostatniej sekcji.&lt;/p&gt;&#10;&lt;p&gt;Ponieważ głównym założeniem tego newslettera jest dzielenie się wiedzą - dzisiaj również coś o rozwoju kariery. Jak z juniora zostać seniorem? I co to oznacza być seniorem (w oczach juniora, ale też w rzeczywistości).&lt;/p&gt;&#10;&lt;p&gt;Na koniec dzisiejszych polecajek: kilka tekstów o milionach. Milionach szybko generowanych PDFów, milionach requestów do API i milionach wierszy w plikach CSV. Jak to optymalizować, żeby się szybko działo?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-29</title><link>https://blog.prokulski.science/2024/01/29/newsletter-dane-i-analizy-2024-01-29/</link><pubDate>Mon, 29 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/29/newsletter-dane-i-analizy-2024-01-29/</guid><description>&lt;p&gt;Ostatnio we wstępie pisałem o tym, że do #devops wpadają wszystkie rzeczy związane z dokeryzacją, drobnymi programami i usprawnieniami używanymi w konsoli. Dzisiaj wprowadzam sekcję &lt;strong&gt;#DataEngineering&lt;/strong&gt;. Powód jest dość prosty: najciekawsze są takie projekty, gdzie dane pobieramy, przetwarzamy, przesyłamy, gromadzimy, potem znowu przetwarzamy i pokazujemy użytkownikowi końcowemu. Prawie każdy taki projekt obecnie wykorzystuje AirFlow, Pythona, Kafkę, jakieś narzędzia BI, jakiś storage w postaci bazy danych albo na przykład Hadoopa. I do czego przypiąć taki tekst? Właśnie do &amp;ldquo;inżynierii danych&amp;rdquo;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-22</title><link>https://blog.prokulski.science/2024/01/22/newsletter-dane-i-analizy-2024-01-22/</link><pubDate>Mon, 22 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/22/newsletter-dane-i-analizy-2024-01-22/</guid><description>&lt;p&gt;YOLO. Nie tylko &amp;ldquo;you only live once&amp;rdquo; ale - w kontekście ML/AI i computer vision - przede wszystkim modele do rozpoznawania obiektów na zdjęciach.&lt;br&gt;&#10;Doczekaliśmy się już kilku wersji algorytmu YOLO, każda kolejna jest szybsza, sprawniejsza, rozpoznająca więcej i lepiej. Na to właśnie idzie klikanie w światła drogowe albo autobusy w obrazkowych captcha ;-)&lt;br&gt;&#10;Więcej o kolejnych wersjach YOLO i ich architekturach dowiesz się z &lt;a href="https://learnopencv.com/mastering-all-yolo-models/"&gt;&lt;strong&gt;tekstu&lt;/strong&gt;&lt;/a&gt;, w którym dodatkowo znajdziesz linki do tego jak trenować i używać tych modeli.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-04</title><link>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</link><pubDate>Mon, 04 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</guid><description>&lt;p&gt;W poprzednim tygodniu przeczytać mogliście króciutkie podsumowanie Data Science Summit, a tam stwierdzenie, że dużo się mówi o Streamlit jako sposobie na &lt;em&gt;PoC-owanie&lt;/em&gt; prezentacji danych. Świat obecnie idzie również w stronę streamingu i obsługi tak przesyłanych danych - głównie Flinkiem. I na Flinku skupia się dzisiejszy numer naszego newslettera.&lt;/p&gt;&#10;&lt;p&gt;Ciekawy jest też niespełna półgodzinne nagranie prezentujące możliwości DuckDB w kontekście danych przestrzennych pozyskanych z Open Street Maps. Chwilę bawiłem się DuckDB ale w połączeniu ze sporymi zbiorami geo (zapisanymi w ShapeFile&amp;rsquo;ach) i śmiga to wspaniale. Jedyny minus - to baza plikowa, więc średnio do użycia w przypadku dostępu przez wiele aplikacji na raz. Ale jako element w procesie &lt;em&gt;data engineeringu&lt;/em&gt; może się bardzo przydać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-30</title><link>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</link><pubDate>Mon, 30 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</guid><description>&lt;p&gt;Dzisiaj trochę o mapkach, trochę o diagramach (takie &lt;em&gt;diagram as a code&lt;/em&gt; tylko dlaczego &lt;a href="https://jira.atlassian.com/browse/BCLOUD-18559"&gt;BitBucket nie potrafi wyświetlić Mermaid&lt;/a&gt; (ticket w Atlassianie jest &amp;ldquo;solved&amp;rdquo;! Ale zobaczcie jak ;-), a GitHub robi to z palcem&amp;hellip; to znaczy bez problemu?), a do tego sporo materiału video. Chyba też więcej niż zwykle treści po polsku (polecamy tekst Tomka Zielińskiego o &lt;em&gt;transportowaniu danych&lt;/em&gt; - może się przydać na spotkania rekrutacyjne, ja lubię zadawać analogiczne pytania).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-25</title><link>https://blog.prokulski.science/2023/09/25/newsletter-dane-i-analizy-2023-09-25/</link><pubDate>Mon, 25 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/25/newsletter-dane-i-analizy-2023-09-25/</guid><description>&lt;p&gt;W tym tygodniu stawiam na potoki przetwarzające dane i pokazujące je finalnie w jakimś dashboardzie. To najczęstsza robota w korporacjach, szczególnie w zespołach &amp;ldquo;raportowych&amp;rdquo;. Dlatego gorąco polecam dzisiejszy dział &amp;ldquo;Analiza danych - projekty&amp;rdquo;.&lt;/p&gt;&#10;&lt;p&gt;Przy przetwarzaniu danych częstym krokiem jest analiza tego co przychodzi. Można użyć narzędzi BI, można ręcznie rzeźbić kod, a można skorzystać z Data Wranglera - dodatku do VSCode, w którym poszczególne kroki pochodzą z takiego niby wizarda, a w efekcie dostajemy gotowy kod. No trzeba to &lt;a href="https://www.youtube.com/watch?v=KrzcV1c1W1U"&gt;zobaczyć&lt;/a&gt; (10 minut filmu z dość specyficznym akcentem, ale nie takim jak myślicie), a potem można &lt;a href="https://marketplace.visualstudio.com/items?itemName=ms-toolsai.datawrangler"&gt;zainstalować&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-29</title><link>https://blog.prokulski.science/2023/05/29/newsletter-dane-i-analizy-2023-05-29/</link><pubDate>Mon, 29 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/29/newsletter-dane-i-analizy-2023-05-29/</guid><description>&lt;p&gt;Dość przekrojowo dzisiaj.&lt;/p&gt;&#10;&lt;p&gt;Najciekasze według mnie tekstu to ten o sensownym nadawaniu gwiazdek produktom (ile razy filtrowaliście produkty w sklepie internetowym przed kupnem po najlepszej ocenie i okazywało się, że z &amp;ldquo;piątką&amp;rdquo; jest tylko jeden?), ten o SoftMax (nie przeraź się równaniami na początku, chociaż może podstawy matematyczne są akutat dla Ciebie cenne?).&lt;/p&gt;&#10;&lt;p&gt;Bardzo dajny jest też dział Python - od rzeczy prostych typu wiele wykresów na jednym obrazku do modelu (no&amp;hellip;) informującego o tym że akcje należy kupić albo sprzedać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-27</title><link>https://blog.prokulski.science/2023/03/27/newsletter-dane-i-analizy-2023-03-27/</link><pubDate>Mon, 27 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/27/newsletter-dane-i-analizy-2023-03-27/</guid><description>&lt;p&gt;Być może przeczytaliście wszystko co było do przeczytania z poprzedniego wydania newslettera, a może coś jeszcze Wam zostało? Dlatego dzisiaj nieco mniej (właściwie - tyle co zwykle) nowości, ale nie oznacza to wcale że jakoś gorzej.&lt;/p&gt;&#10;&lt;p&gt;Sporo materiałów dotyczy Sparka i różnych z nim kombinacji - do nauki i szukania kierunków poszerzania wiedzy znakomite punkty wyjścia. Można też nauczyć się czegoś joinach w SQL.&lt;/p&gt;&#10;&lt;p&gt;Z nieco bardziej zaawansowanych tekstów polecam ten o Apache Hudi w Uberze oraz o tym jak właściwie działa ChatGPT. A skoro już przy nim jesteśmy - wiele w minionym czasie pojawia się tekstów o tym jak to ChatGPT zabierze pracę różnym ludziom, w tym programistom. Czy zabierze? Przekonamy się. Ale już teraz przeczytajcie jak może być pomocny przy tworzeniu kodu (na przykładzie aplikacji w Streamlit).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-06</title><link>https://blog.prokulski.science/2023/02/06/newsletter-dane-i-analizy-2023-02-06/</link><pubDate>Mon, 06 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/06/newsletter-dane-i-analizy-2023-02-06/</guid><description>&lt;p&gt;Dzisiaj nieco zagadnień teoretycznych. Dobór odpowiedniego rozkładu do istniejących danych, metody tropienia ile tak na prawdę mamy &amp;ldquo;klastrów&amp;rdquo; (grup) w danych.&lt;/p&gt;&#10;&lt;p&gt;Sporo też o GPT-3, a raczej jego wykorzystaniu w różny sposób (od pisania książek do pisania&amp;hellip; rozszerzeń do Chrome). Niespodziewanie dzisiaj rozrósł się dział dedykowany Apache Kafka.&lt;/p&gt;&#10;&lt;p&gt;Na koniec coś o wizualizacji, na przykład szpilki pokazujące gdzie mieszkają ludzie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://machinelearningmastery.com/building-a-multiclass-classification-model-in-pytorch/"&gt;&lt;strong&gt;Building a Multiclass Classification Model in PyTorch&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PyTorch zdobywa rynek AI spychając w cień TensorFlow. Jeśli więc zamierzasz się przesiadać - ten tutorial o prostej klasyfikacji może się przydać&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-19</title><link>https://blog.prokulski.science/2022/12/19/newsletter-dane-i-analizy-2022-12-19/</link><pubDate>Mon, 19 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/19/newsletter-dane-i-analizy-2022-12-19/</guid><description>&lt;p&gt;Po Mundialu, można się rozejść. W tym tygodniu lekkie wytchnienie, potem święta, święta i po świętach.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym życzę Państwu wszystkiego najlepszego, rodzinnych, spokojnych świąt. Odstawcie modele ML, dostawcie Flinki, Sparki i Kafki, zajmijcie się uszkami w barszczu i prezentami spod choinki. No, może być Pinot&amp;hellip; Pinot Noir.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/10-commonly-used-loss-functions-explained-with-python-code-59967e1f3c8d"&gt;&lt;strong&gt;10 Commonly Used Loss Functions Explained with Python Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Loss Function czy też bardziej swojsko &amp;ldquo;funkcja straty&amp;rdquo; to taka funkcja, która jest minimalizowana przez algorytm ML. A jakie mogą to być funkcje?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-31</title><link>https://blog.prokulski.science/2022/10/31/newsletter-dane-i-analizy-2022-10-31/</link><pubDate>Mon, 31 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/31/newsletter-dane-i-analizy-2022-10-31/</guid><description>&lt;p&gt;Poprzednie wydanie newslettera skupiało się na szeregach czasowych (zobacz w &lt;a href="../../2022/10/24/newsletter-dane-i-analizy-2022-10-24/"&gt;archiwum&lt;/a&gt;). Dla odmiany dzisiaj coś o analizie koszykowej - czyli co z czym się kupuje i co z tego wynika? Przykłady w kliku językach programowania znajdziecie niżej, w dedykowanej sekcji.&lt;/p&gt;&#10;&lt;p&gt;Nieco standardowo, albo może raczej - tradycyjnie - sporą część publikowanych dzisiaj tekstów mówi o technologiach streamingowych i big data. Zatem jest o rodzinie i znajomych Apache: Kafka, Spark, Iceberg, gdzieś przewinął się chyba też Flink. Czy to są interesujące dla Was tematy? A może rysowanie mapek jest ciekawsze? ;-)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-03</title><link>https://blog.prokulski.science/2022/10/03/newsletter-dane-i-analizy-2022-10-03/</link><pubDate>Mon, 03 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/03/newsletter-dane-i-analizy-2022-10-03/</guid><description>&lt;p&gt;W tym tygodniu nieco mniejsza liczba tekstów, ale chyba bardziej rozbudowanych niż zwykle.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie polecam tekst pierwszy &lt;a href="https://opendatascience.com/2022-data-science-research-round-up-highlighting-ml-dl-nlp-more/"&gt;2022 Data Science Research Round-Up&lt;/a&gt;, ale też przykłady i porównanie różnych algorytmów do &lt;em&gt;topic modelingu&lt;/em&gt; czy też całą praktycznie sekcję poświęconą Pythonowi.&lt;/p&gt;&#10;&lt;p&gt;Być może ktoś z Was przegapił na fanpage&amp;rsquo;u &lt;a href="https://fb.com/daneanalizy"&gt;Dane i analizy&lt;/a&gt;: &lt;a href="https://app.rasgoml.com/sql"&gt;klikalny generator zapytań SQL&lt;/a&gt; - świetna sprawa do nauki ale też zapewne może przyspieszyć pracę.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://opendatascience.com/2022-data-science-research-round-up-highlighting-ml-dl-nlp-more/"&gt;&lt;strong&gt;2022 Data Science Research Round-Up&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przegląd najciekaszych zagadnień związanych z machine learning. deep learnig, NLP z ostatnich miesięcy. Tylko wstęp, każde opisane jest dalej w podlinkowanych materiałach&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-01</title><link>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</link><pubDate>Mon, 01 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</guid><description>&lt;p&gt;Dzisiaj nieco więcej materiałów z krainy &amp;ldquo;ops&amp;rdquo; w świecie &amp;ldquo;devops&amp;rdquo;. Warto znać obie ziemie, żeby nie mieć problemu chociażby z uruchomieniem kilku aplikacji (dockerowymi) pod różnymi ścieżkami na jednej domenie. Dlatego warto zajrzeć do tekstów o Nginx.&lt;/p&gt;&#10;&lt;p&gt;Ale sprawy związane z analizowaniem danych czy też ich przetwarzaniem w celu przewidywania przyszłości tradycyjnie też są na poniższej liście interesujących artykułów z minionego tygodnia.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://miroslawmamczur.pl/czym-jest-i-jak-zbadac-dryft-modelu-model-drift/"&gt;&lt;strong&gt;Czym jest i jak zbadać dryft modelu (model drift)?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dryft modelu odnosi się do spadku wydajności modelu z powodu zmian danych i relacji między zmiennymi wejściowymi i wyjściowymi&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-25</title><link>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</link><pubDate>Mon, 25 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</guid><description>&lt;p&gt;Wakacje wakacjami, ale te kilka godzin poświęciłem specjalnie dla Was aby przygotować dzisiejsze wydanie newslettera.&lt;/p&gt;&#10;&lt;p&gt;Pamiętacie &lt;strong&gt;Wojny Rdzeniowe&lt;/strong&gt;? Dla tych, którzy nie bardzo - &lt;a href="https://informatykzakladowy.pl/wojny-rdzeniowe-czyli-core-wars/"&gt;ciekawy tekst&lt;/a&gt; (po polsku, co rzadkie tutaj ;) opowiadający historię tych&amp;hellip; hmmm&amp;hellip; konkursów? zawodów?&lt;/p&gt;&#10;&lt;p&gt;A gdyby tak przygotować wewnętrzne rozgrywki tego typu? Co o tym sądzicie? Piszcie!&lt;/p&gt;&#10;&lt;p&gt;Zamiast jednak programować można klikać. Jeśli ktoś jest zwolennnikiem no-code to pewnie zainteresuje się &lt;a href="https://betterprogramming.pub/top-8-no-code-machine-learning-platforms-you-should-use-in-2020-1d1801300dd0"&gt;przeglądem platform&lt;/a&gt; tego typu przeznaczonych do zadań machine learningu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-18</title><link>https://blog.prokulski.science/2022/07/18/newsletter-dane-i-analizy-2022-07-18/</link><pubDate>Mon, 18 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/18/newsletter-dane-i-analizy-2022-07-18/</guid><description>&lt;p&gt;W tym tygodniu sporo materiałów związanych z przygotowywaniem modelu danych w bazie - to istotne zagadnienie, warto się chociaż trochę w temacie orientować jeśli projektujemy coś co ma dane przechować (i potem je przekazać dalej albo przekształcić).&lt;/p&gt;&#10;&lt;p&gt;Tak też wyszło, że zebrało się kilka zagadnień związanych z przetwarzaniem tekstu w Pythonie oraz przetwarzaniem (np. poprzez OCR) całych dokumentów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ml-prediction-on-streaming-data-using-kafka-streams-1e4ebd21008"&gt;&lt;strong&gt;ML prediction on streaming data using Kafka Streams&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Najsmaczniejsze kąski w przetwarzaniu danych w czasie rzeczywistym są właśnie takie - jest strumień danych, na nim działają jakieś modele machine learningowe i o czymś decydują. Tutaj dowiesz się jak to zbudować w kilku krokach&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-04</title><link>https://blog.prokulski.science/2022/07/04/newsletter-dane-i-analizy-2022-07-04/</link><pubDate>Mon, 04 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/04/newsletter-dane-i-analizy-2022-07-04/</guid><description>&lt;p&gt;Znacie historię plików cookie? Dzisiaj możecie ją poznać z jednego z tekstów w newsletterrze.&lt;/p&gt;&#10;&lt;p&gt;Jeśli interesuje Was coś z zakresu wdrażania oprogramowania, monitoringu i ogólnie pojętej automatyzacji tego typu działań - sekcja DevOps może być dobrym początkiem.&lt;/p&gt;&#10;&lt;p&gt;Polecam też gorąco tekst o efekcie wabika oraz R-owy pakiet gtExtras użyty w jednym ze sposobów prezentacji rankingu zawodników.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/unsupervised-learning-k-means-clustering-27416b95af27"&gt;&lt;strong&gt;Unsupervised Learning: K-Means Clustering&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;K-means to jeden z algorytmów nienadzorowanego uczenia maszynowego o którego pytają na rozmowach kwalifikacyjnych. Jak działa?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-06</title><link>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</link><pubDate>Mon, 06 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</guid><description>&lt;p&gt;W tym tygodniu sporo rozwiązań big data&amp;rsquo;owych i ciekawostek ogólnie związanych z przetwarzaniem danych.&lt;/p&gt;&#10;&lt;p&gt;Ale jeśli interesuje Cię coś bardziej &amp;ldquo;biznesowego&amp;rdquo;, w szczególności jak &lt;em&gt;projektuje się produkty&lt;/em&gt; to gorąco polecam rozmowę z Marcinem Zarembą o projektowaniu autobookingu w Dobrym Mechaniku oraz dodatkowo &lt;a href="https://marcinzaremba.pl/2022/05/12/jak-powstawal-autobooking/?utm_source=newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;tekst o tymże&lt;/a&gt; u Marcina na blogu. Świetny case study, serio serio.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-mask-rcnn-net-for-object-detection-in-60-lines-of-code-9b6bbff292c3"&gt;&lt;strong&gt;Train Mask R-CNN Net for Object Detection in 60 Lines of Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie obiektów na zdjęciach - jak to działa?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-30</title><link>https://blog.prokulski.science/2022/05/30/newsletter-dane-i-analizy-2022-05-30/</link><pubDate>Mon, 30 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/30/newsletter-dane-i-analizy-2022-05-30/</guid><description>&lt;p&gt;Znacie metodę &amp;ldquo;getting things done&amp;rdquo;? Jest taka książka Davida Allena opowiadająca dokładnie co i jak. Ale kto by czytał całą książkę, jeśli jest wersja skrócona? &lt;a href="https://hamberg.no/gtd"&gt;&lt;strong&gt;Polecam.&lt;/strong&gt;&lt;/a&gt; Jeśli wolicie książkę to w Helionie jest &lt;a href="https://helion.pl/view/14029A/gett2e.htm"&gt;promocja na e-booka&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Polecam dzisiaj trochę oglądania - praktyczne wykorzystaniu narzędzi ML w banku w prezentacji &lt;a href="https://www.youtube.com/watch?v=zsbniuvS3_o"&gt;XGBoost w praktyce&lt;/a&gt; oraz &lt;a href="https://www.youtube.com/watch?v=OWAqIgpekdg"&gt;DDD w systemach rozproszonych&lt;/a&gt;. Cała reszta materiałów równie znakomita :)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/5-ways-to-use-histograms-with-machine-learning-algorithms-e32042dfbe3e"&gt;&lt;strong&gt;5 Ways to Use Histograms&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Sposoby na użycie histogramów&amp;hellip; z perspektywy machine learningu&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-09</title><link>https://blog.prokulski.science/2022/05/09/newsletter-dane-i-analizy-2022-05-09/</link><pubDate>Mon, 09 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/09/newsletter-dane-i-analizy-2022-05-09/</guid><description>&lt;p&gt;Dzisiaj mamy fajną paczkę tekstów o hiperparametrach, skalowaniu cech i innych rzeczach związanych z uczeniem maszynowym i &lt;em&gt;podkręcaniem&lt;/em&gt; modeli. Tradycyjnie też kształcimy i rozwijamy się nieco w Pythonie.&lt;/p&gt;&#10;&lt;p&gt;W bardziej zaawansowanych tematach coś, czym firma &lt;a href="https://prokulski.science/"&gt;Dane i Analizy&lt;/a&gt; zajmuje się na co dzień: inżynieria danych, przepływy głównie z wykorzystaniem Apache Kafka czy też projektowanie architektury zbliżonej do tej którą wykorzystuje Airbnb.&lt;/p&gt;&#10;&lt;p&gt;Polecam też nową inicjatywę Krzysztofa Sopyły - Podcast Biznes AI. Zapowiada się dobrze, powodzenia Krzysiek!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-30</title><link>https://blog.prokulski.science/2021/08/30/newsletter-dane-i-analizy-2021-08-30/</link><pubDate>Mon, 30 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/30/newsletter-dane-i-analizy-2021-08-30/</guid><description>&lt;p&gt;&lt;a href="https://lucidmanager.org/data-science/monte-carlo-cost-estimates/"&gt;&lt;strong&gt;Monte Carlo Cost Estimates: Engineers Throwing Dice&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Estimating the cost of a complex project is not a trivial task. Traditional cost estimates are full of assumptions about the future state of the market and the final deliverable. Monte Carlo cost estimates are a tool to better understand the risks in your project and enable better cost control. Monte Carlo simulations are a technique to control your “known unknowns”. Albert Einstein famously said (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-23</title><link>https://blog.prokulski.science/2021/08/23/newsletter-dane-i-analizy-2021-08-23/</link><pubDate>Mon, 23 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/23/newsletter-dane-i-analizy-2021-08-23/</guid><description>&lt;p&gt;&lt;a href="https://gist.github.com/24939c89f67e5950bf00f5ddcc08ff97"&gt;&lt;strong&gt;Scala is like Python 4&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Although it’s fundamentally closer to Java, Scala has clearly taken a lot of influence from Python in terms of style and functionality. As someone who has written Python code for ~7 years now, playing around with Scala feels surprisingly familiar, but it’s more akin to using a statically typed and compiled version of Python 3. Obviously, they’re very different languages, b ut if you’re an (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-02</title><link>https://blog.prokulski.science/2021/08/02/newsletter-dane-i-analizy-2021-08-02/</link><pubDate>Mon, 02 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/02/newsletter-dane-i-analizy-2021-08-02/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/how-to-use-yield-in-python-5f1fbb864f94"&gt;&lt;strong&gt;How To Use “yield” in Python?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Python Generator — from basic to advanced usage Continue reading on Towards Data Science »&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/10-best-practices-to-write-readable-and-maintainable-sql-code-427f6bb98208"&gt;&lt;strong&gt;10 Best Practices to Write Readable and Maintainable SQL Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to write SQL queries that your team can easily read and maintain? It’s easy to mess with SQL without proper guidelines. Since everybody in your team might have their own habits of writing SQL, you can quickly end up with a confusing code that nobody understands. You probably realized the importance of following a set of good practices. May this article give you the guidance you’re (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-07</title><link>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</link><pubDate>Mon, 07 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/3-examples-that-show-the-unlimited-flexibility-of-pyspark-319ab22d5a?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;3 Examples That Show The Unlimited Flexibility of PySpark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A combination of Python and SQL but easier than both Spark is an analytics engine used for large-scale data processing. It lets you spread both data and computations over clusters to achieve a substantial performance increase. It is easier than ever to collect, transfer, and store data. Hence, we (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cmdlinetips.com/2021/06/row-wise-operations-in-r/"&gt;&lt;strong&gt;Row-wise operations in R: compute row means in tidyverse&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial shows how to perform row-wise operations in R using tidyverse. We will use three key functions, rowwise(), c_across() and rowMeans() to perform to perform row-wise operations on a dataframe. rowwise() and c_across() functions are from dplyr. rowwise() function is available in dplyr (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-10</title><link>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</link><pubDate>Mon, 10 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</guid><description>&lt;p&gt;&lt;a href="https://blog.dataiku.com/how-to-perform-basic-ml-serving-with-python-docker-kubernetes"&gt;&lt;strong&gt;How to Perform Basic ML Serving With Python, Docker, and Kubernetes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial provides a basic, step-by-step example of real-time serving a machine learning (ML) model as a REST API with Python, Docker, and Kubernetes. We’ll build a basic REST API with Python, test it locally with Docker, and deploy our API with Kubernetes. By the way, if you want to go faster, (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.r-bloggers.com/2021/05/dockerizing-shiny-applications/"&gt;&lt;strong&gt;Dockerizing Shiny Applications&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Docker provides isolation to applications. Images are immutable. Running multiple instances of the same image can serve many users at the same time. All these general advantages of containerized applications apply to Shiny apps too. The post Dockerizing Shiny Applications first appeared on (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-03</title><link>https://blog.prokulski.science/2021/05/03/newsletter-dane-i-analizy-2021-05-03/</link><pubDate>Mon, 03 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/03/newsletter-dane-i-analizy-2021-05-03/</guid><description>&lt;p&gt;&lt;a href="https://www.enterprisedb.com/blog/comparison-joins-mongodb-vs-postgresql"&gt;&lt;strong&gt;Comparison of JOINS: MongoDB vs. PostgreSQL | EDB&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This is the second in a continuing series comparing MongoDB capabilities with those of Postgres. The first post covered “Schema Later Considered Harmful.”&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-machine-learning-to-predict-customers-next-purchase-day-7895ad49b4db"&gt;&lt;strong&gt;Using Machine Learning to Predict Customers Next Purchase Day&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning model to predict whether customers will make their next purchase after a certain period. Image by Mediamodifier and can be accessed  here . Introduction If there is one major lesson that those in the retail business have learnt from the SARS-CoV-2 pandemic, it is the demand to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Promocja na książki</title><link>https://blog.prokulski.science/2020/07/11/promocja-na-ksiazki/</link><pubDate>Sat, 11 Jul 2020 10:03:15 +0000</pubDate><guid>https://blog.prokulski.science/2020/07/11/promocja-na-ksiazki/</guid><description>&lt;p&gt;Jeszcze tylko do poniedziałku 13.07 &lt;strong&gt;&lt;a href="https://helion.pl/page/14029A/promocja/8850"&gt;promka wakacyjna&lt;/a&gt;&lt;/strong&gt; w Helionie, łapcie póki są porządne rabaty!&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Deep learning z Kerasem w Pythonie, a konkretnie pozycja &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/delepy.htm"&gt;Deep Learning. Praca z językiem Python i biblioteką Keras&lt;/a&gt;&lt;/strong&gt; i wersja dla R: &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/delerk.htm"&gt;Deep Learning. Praca z językiem R i biblioteką Keras&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Ponoć najlepsza książka do nauki Pythona &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/autopy.htm"&gt;Automatyzacja nudnych zadań z Pythonem. Nauka programowania&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Oraz dla równowagi - najlepsza książka do nauki R: &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/jezrkv.htm"&gt;Język R. Kompletny zestaw narzędzi dla analityków danych&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Analiza danych to też SQL, zatem &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/pksql3.htm"&gt;Praktyczny kurs SQL&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Najlepszym środowiskiem do pracy jest mimo wszystko Linux - podstawy złapiesz dzięki &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/linkp5.htm"&gt;Linux. Komendy i polecenia&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Ale nie wszystko musisz mieć zainstalowane na jakimś serwerze - są rozwiązania kontenerowe, więc &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/docke2.htm"&gt;Docker. Praktyczne zastosowania&lt;/a&gt;&lt;/strong&gt; może okazać się dobrym pomysłem.&lt;/li&gt;&#10;&lt;li&gt;Chyba, że wolisz pozostać w świecie Excela, wówczas przyda Ci się &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/e19bib.htm"&gt;Biblia Excela&lt;/a&gt;&lt;/strong&gt;. Sposobem na przejście do bardziej zaawansowanych technik jest Power Query, w korporacjach przyda się więc &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/poquex.htm"&gt;Power Query w Excelu i Power BI. Zbieranie i przekształcanie danych&lt;/a&gt;&lt;/strong&gt;.&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Więcej książek w ramach promocji znajdziecie &lt;a href="https://helion.pl/page/14029A/promocja/8850"&gt;na stronie&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>(py)Spark, Hadoop i HDFS - podstawy</title><link>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</link><pubDate>Thu, 09 Apr 2020 19:06:13 +0000</pubDate><guid>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</guid><description>&lt;p&gt;Dzisiaj zajmiemy się wykorzystaniem Sparka i Hadoopa do przetwarzania większej ilości danych. Oraz do budowania prostego modelu (regresji liniowej). Może jeszcze nie jest to big data, ale mechanizmy są identyczne jak w przypadku większej liczby danych. Wystarczy tylko tych danych więcej zgromadzić, zbudować większe środowisko (dużo serwerów) i… też będzie działało.&lt;/p&gt;&#10;&lt;p&gt;A w dodatku poznamy pakiet &lt;em&gt;faker&lt;/em&gt; który pozwoli nam na wygenerowanie sztucznych danych.&lt;/p&gt;&#10;&lt;h3 id="spark-i-hadoop"&gt;Spark i Hadoop&lt;/h3&gt;&#10;&lt;p&gt;&lt;strong&gt;Apache Spark&lt;/strong&gt; to rozwijana na zasadach open source platforma klastrowego przetwarzania danych, która ma interfejsy API dla takich języków programowania jak Scala, Python, Java i R.&lt;/p&gt;</description></item><item><title>Spark, czyli opóźnienia pociągów</title><link>https://blog.prokulski.science/2018/12/21/spark-czyli-opoznienia-pociagow/</link><pubDate>Fri, 21 Dec 2018 14:52:21 +0000</pubDate><guid>https://blog.prokulski.science/2018/12/21/spark-czyli-opoznienia-pociagow/</guid><description>&lt;p&gt;Czy polskie pociągi są punktualne? To pytanie, na które poszukamy odpowiedzi, ale jest ono tylko przyczynkiem do dzisiejszego wpisu.&lt;/p&gt;&#10;&lt;p&gt;Chciałbym pokazać dzisiaj sposób znalezienia odpowiedzi, nawet nie samą odpowiedź. Skąd wziąć dane? Jak sobie z nimi poradzić? Czym je uzupełnić?&lt;/p&gt;&#10;&lt;h3 id="pozyskanie-danych"&gt;Pozyskanie danych&lt;/h3&gt;&#10;&lt;p&gt;W pierwszym odruchu pomyślałem o stronach PKP i webscrappingu. Ale na Twitterze mojego bota &lt;a href="https://twitter.com/rstatspl"&gt;@rstatspl&lt;/a&gt; obserwuje inny bot - &lt;a href="https://twitter.com/OpPociagow"&gt;@OpPociagow&lt;/a&gt;, który prezentuje ciekawe dane. Skoro prezentuje to je ma. Skoro ma, to gdzieś są. Chwila rozmowy z twórcą i uzyskujemy adres &lt;a href="http://ipa.lovethosetrains.com/"&gt;InfoPasażer Archiver - archiwum opóźnień pociągów&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Partie polityczne i sport</title><link>https://blog.prokulski.science/2017/05/25/partie_sport/</link><pubDate>Thu, 25 May 2017 12:32:43 +0000</pubDate><guid>https://blog.prokulski.science/2017/05/25/partie_sport/</guid><description>&lt;p&gt;Czy preferencje polityczne mają jakiś związek z preferencjami sportowymi? Innymi słowy: czy jeśli lubię PSL to wolę piłkę nożną czy jednak bieganie?&#10;&lt;strong&gt;Stereotypowo&lt;/strong&gt; mogłoby to wyglądać tak: Nowoczesna to biegi, PiS - piłka nożna i podnoszenie ciężarów (przed tv, ciężary 500ml w puszce), Kukiz - wędkarstwo, PSL - wypas owiec. Koniec żartu, można się śmiać.&#10;A jak jest? Zrobimy eksperyment z dużą ilością danych. Facebook ma to od ręki, dlatego wykorzystamy publiczne informacje z tego właśnie źródła. Poza tym - te 2 miliardy użytkowników zostawia bardzo dużo informacji o sobie. Według &lt;a href="https://www.gemius.pl/agencje-aktualnosci/wyniki-badania-gemiuspbi-za-kwiecien-2017.html"&gt;badania Gemius/PBI za kwiecień 2017&lt;/a&gt; w Polsce z Facebooka korzysta 22.6 mln internautów (81.4% wszystkich, co ciekawe - zanotowano spadek o ponad 200 tys. m/m).&#10;&lt;strong&gt;Jak to zrobić?&lt;/strong&gt; Po pierwsze trzeba wytypować listę fanpage’y na podstawie których będziemy wyciągać wnioski. Skorzystałem z dwóch źródeł: własnej głowy (i sondaży poparcia) aby wytypować partie i z własnych rąk aby wyszukać ich fanpages na Facebooku. Druga strona równania to lista fanpage’y sportowych (dla mnie trudniejsze) - tutaj skorzystałem z raportów &lt;a href="http://sotrender.pl"&gt;Sotrender&lt;/a&gt;.&#10;&lt;strong&gt;Teraz metodologia.&lt;/strong&gt; Można na kilka sposobów. Na przykład biorąc listę fanów poszczególnych stron i szukając części wspólnych tych zbiorów. Tak będziemy działać. Problemem jest tylko jak uzyskać listę fanów? Kiedyś Facebook udostępniał poprzez API możliwość wywoływania zapytań FQL (to taki podobny do SQL język dla FB). Ale ograniczenia prywatności spowodowały, że to nie działa. Trzeba więc inaczej, co nieco zaburzy wyniki (trudno mi jednocześnie na szybko oszacować jak bardzo).&#10;Posty na stronach są publiczne, ludzie lajkują i komentują. Facebook udostępnia poprzez API dane o tych komentarzach i lajkach, w tym ID (oraz imię i nazwisko) użytkowników, którzy taką interakcję poczynili. Zatem weźmiemy posty każdej ze stron, dla każdego postu listę osób reagujących (policzymy tylko &lt;em&gt;like&lt;/em&gt; i &lt;em&gt;comment&lt;/em&gt; - bez &lt;em&gt;share&lt;/em&gt; oraz innych reakcji) na post. Tym sposobem nie będziemy mieć fanów (jest ich zapewne więcej niż wchodzących w interakcję - jaka to różnica wyjdzie po drodze; a jednocześnie na tych stronach można komentować i lajkować nie będąc jednocześnie fanem strony), ale coś podobnego. Może nawet lepszego (użytkownik zaangażowany jest cenniejszy niż bierny obserwator).&lt;/p&gt;</description></item><item><title>Rowery Veturilo - część pierwsza</title><link>https://blog.prokulski.science/2017/05/08/rowery-veturilo-i/</link><pubDate>Mon, 08 May 2017 15:54:27 +0000</pubDate><guid>https://blog.prokulski.science/2017/05/08/rowery-veturilo-i/</guid><description>&lt;p&gt;Czy popularność rowerów Veturilo w Warszawie od czegoś zależy?&#10;Dzisiaj, po majowej przerwie (spędzonej między innymi na rowerze) zajmiemy się nieco większymi zbiorami danych.&#10;Na początek kilka słów o przygotowaniu danych.&lt;/p&gt;&#10;&lt;h3 id="rowery-veturilo"&gt;Rowery Veturilo&lt;/h3&gt;&#10;&lt;p&gt;Od początku marca (od bodaj 11) zbierałem dane wystawione przez NextBike (operatora rowerów m.in. Veturilo) dla kilkudziesięciu miast. Ograniczyłem się tylko do Warszawy, dane były pobierane co 5 minut. Jak wyglądają te dane możecie sprawdzić sami - to &lt;a href="http://nextbike.net/maps/nextbike-official.xml?city=210"&gt;dostępny online plik XML&lt;/a&gt;. W pliku znaleźć można wszystkie potrzebne nam informacje:&lt;/p&gt;</description></item><item><title>Koncert Tori Amos</title><link>https://blog.prokulski.science/2007/06/24/koncert-tori-amos/</link><pubDate>Sun, 24 Jun 2007 17:47:49 +0000</pubDate><guid>https://blog.prokulski.science/2007/06/24/koncert-tori-amos/</guid><description>&lt;p&gt;&lt;img src="../../images/toriamos.jpg" alt="Koncert Tori Amos w Sali Kongresowej, Warszawa 19 czerwca 2007 r."&gt;&#10;Tori Amos zagrała w tym tygodniu świetny koncert w warszawskiej Sali Kongresowej. Byłem, cieszyłem ucho i oko, a do tego zrobiłem kilka &lt;a href="http://flickr.com/photos/11538905@N08/tags/toriamos"&gt;zdjęć&lt;/a&gt;. Jak znajdę chwilę czasu i odrobinę natchnienia to napiszę coś o muzyce - wiele ciekawego ostatnio (m.in. &lt;a href="http://www.allmusic.com/cg/amg.dll?p=amg&amp;amp;sql=10:j9fwxzlgldke"&gt;koncertowa płyta Archive&lt;/a&gt;, &lt;a href="http://www.allmusic.com/cg/amg.dll?p=amg&amp;amp;sql=10:gbfoxzr5ld6e"&gt;nowa płyta The White Stripes&lt;/a&gt;).&#10;Dla ciekawskich i precyzyjnych - lista utworów:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Body &amp;amp; Soul&lt;/li&gt;&#10;&lt;li&gt;My Posse Can Do&lt;/li&gt;&#10;&lt;li&gt;God&lt;/li&gt;&#10;&lt;li&gt;Dragon&lt;/li&gt;&#10;&lt;li&gt;Secret Spell&lt;/li&gt;&#10;&lt;li&gt;You Can Bring Your Dog&lt;/li&gt;&#10;&lt;li&gt;Professional Widow (remix, Tori zmienia strój)&lt;/li&gt;&#10;&lt;li&gt;Big Wheel&lt;/li&gt;&#10;&lt;li&gt;Crucify&lt;/li&gt;&#10;&lt;li&gt;Caught A Lite Sneeze&lt;/li&gt;&#10;&lt;li&gt;Cornflake Girl&lt;/li&gt;&#10;&lt;li&gt;Bells for Her&lt;/li&gt;&#10;&lt;li&gt;Glory of the 80s&lt;/li&gt;&#10;&lt;li&gt;Winter (solo)&lt;/li&gt;&#10;&lt;li&gt;Baker Baker (solo)&lt;/li&gt;&#10;&lt;li&gt;Putting the Damage On&lt;/li&gt;&#10;&lt;li&gt;Black Dove (January)&lt;/li&gt;&#10;&lt;li&gt;Code Red&lt;/li&gt;&#10;&lt;li&gt;Precious Things (pierwszy bis)&lt;/li&gt;&#10;&lt;li&gt;Bouncing Off Clouds (pierwszy bis)&lt;/li&gt;&#10;&lt;li&gt;Pancake (drugi bis)&lt;/li&gt;&#10;&lt;li&gt;Hey Jupiter (drugi bis)&lt;/li&gt;&#10;&lt;/ul&gt;</description></item><item><title>O ambicji i nowej stronie</title><link>https://blog.prokulski.science/2006/01/12/o-ambicji-i-nowej-stronie/</link><pubDate>Thu, 12 Jan 2006 08:39:53 +0000</pubDate><guid>https://blog.prokulski.science/2006/01/12/o-ambicji-i-nowej-stronie/</guid><description>&lt;p&gt;Od kilku tygodni chodzi mi po głowie pomysł stworzenia zupełnie od początku nowej strony.&#10;Oczywiście swojej &lt;a href="http://www.prokulski.net"&gt;strony&lt;/a&gt;, bo jakiej by innej? Była by to już bodaj piąta wersja układu graficznego (wiszącego w sieci, bo projektów, które publicznie nie były prezentowane było co najmniej dwa razy więcej). Jednocześnie ze zmianą graficzną mam zamiar wprowadzić całkowicie nowy sposób zarządzania treścią (czyli krótko mówiąc: napisać własnego CMSa). Oto kilka założeń koncepcyjnych:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;całość oparta na SQLowej bazie danych;&lt;/li&gt;&#10;&lt;li&gt;podział tak jak do tej pory na kilka działów (ostatecznie najprawdopodobniej pozostaną cztery: opowiadania, publicystyka, fotografia oraz blog plus mniej lub bardziej stałe dodatki typu CV);&lt;/li&gt;&#10;&lt;li&gt;możliwość komentowania każdego z tekstów;&lt;/li&gt;&#10;&lt;li&gt;możliwość wydruku każdego z tekstów (i fotografii), być może też zapisania go (tylko teksty) w formie PDFa (nie znalazłem jeszcze odpowiedniego skryptu), może też przesłanie tekstu (i – być może – fotografii) na wskazany mail (coś w rodzaju &amp;ldquo;poleć znajomemu&amp;rdquo;);&lt;/li&gt;&#10;&lt;li&gt;część elementów (np. mapa strony) generowana byłaby 100% dynamicznie;&lt;/li&gt;&#10;&lt;li&gt;przyjazność dla wyszukiwarek (słowa kluczowe i podobne rzeczy w meta-tagach), być może w połączeniu z przyjaznymi ścieżkami (przy użyciu mod_rewrite serwera WWW);&lt;/li&gt;&#10;&lt;li&gt;100% zgodności z XHTML wspartym CSS, co oznaczałoby całkowite oddzielenie treści od warstwy prezentacyjnej, a tym samym pozwoliłoby na przygotowanie różnych &amp;ldquo;skórek&amp;rdquo; strony.&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Ostatni punkt jest na tyle istotny, że taki system byłby stosunkowo przenośny na inne strony o podobnym charakterze.&#10;Na razie prace są na etapie drugiego projektu graficznego i przygotowywania struktury bazy danych. I tutaj wkraczamy w element pierwszy tytułu tego wpisu – ambicję. Ja wiem, że takich systemów jest pewnie kilka i wystarczy tylko odpowiedni zainstalować i dodać to czy owo. No i ok, niech sobie będą – w niczym mi nie przeszkadzają. Chcę jednak taki system napisać tak naprawdę dla siebie, na swoje własne potrzeby. Chcę się zmierzyć z dawno porzuconą materią PHP, z lekko liźniętą materią SQL. Chcę też zastosować kilka rozwiązań, o których nie myślałem wcześniej, a wydają mi się standardem we współczesnym WWW (owo &amp;ldquo;poleć znajomemu&amp;rdquo;).&#10;Zapewne przygotowania potrwają jeszcze&amp;hellip; kilka miesięcy. Zapewne nie odbije się to znacząco na oglądalności mojej strony. Na pewno za to przyniesie mi frajdę i satysfakcję, kiedy wszystko pójdzie tak, jak to sobie zaplanowałem.&#10;A co dalej?, co później? Później (tak po około 2-3 tygodniach) stwierdzę, że jestem niezadowolony, że to czy owo można poprawić czy też napisać inaczej. A co więcej (i tego w tym momencie się obawiam – tworzę projekt „pod siebie”) – że można było to napisać lepiej i bardziej skalowalnie, bardziej przenośnie; z możliwością edycji wszystkiego przez taki czy inny CMS. No cóż&amp;hellip; może wtedy zabiorę się za rozbudowę? Na tym polega właśnie rozwój.&lt;/p&gt;</description></item></channel></rss>