<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Kafka on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/kafka/</link><description>Recent content in Kafka on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 20 Jul 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/kafka/index.xml" rel="self" type="application/rss+xml"/><item><title>Agenty piszą CV, Atlassian zmienia Jirę, a Polars i DuckDB łączą siły</title><link>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</link><pubDate>Mon, 20 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</guid><description>&lt;p&gt;Cześć! Za nami finał piłkarskich mistrzostw świata, gdzie Argentyna mierzyła się z Hiszpanią. Niezależnie od wyniku i wczorajszych emocji, poniedziałkowy poranek w IT przynosi powrót do naszej technologicznej rzeczywistości. Oby Twój tydzień zaczął się bez pożarów na produkcji!&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu styk AI oraz codziennych procesów deweloperskich.&lt;/p&gt;&#10;&lt;p&gt;Coraz więcej narzędzi, na czele z odświeżoną Jirą od Atlassiana, stawia na głęboką integrację z agentami AI, Pojawiają się innowacyjne frameworki, które potrafią napisać CV, analizować ogłoszenia o pracę i przejść przez rekrutacyjne sito, Obok rosnącej roli modeli LLM, dużo mówi się o sztuce sprawnego kierowania zapytaniami do odpowiednich silników językowych.&lt;/p&gt;</description></item><item><title>Czy AI Slop zaleje sieć? Plus Spark, Kafka i SQL</title><link>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</link><pubDate>Mon, 25 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz ich głębokiej integracji z codziennym workflow inżynierskim.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenty Playwright i protokół MCP automatyzują cykl życia błędu, od wykrycia po zgłoszenie w Jirze, pokazujemy, jak Claude Code i lokalne modele Qwen2.5 zmieniają zasady gry w analizie danych i budowaniu dashboardów, i sprawdzamy, ile &amp;ldquo;śmieciowego&amp;rdquo; AI (slop) faktycznie krąży w sieci i jak to wpływa na jakość informacji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych skupiamy się na wydajności, optymalizacji kosztów i mądrym wyborze silników bazodanowych.&lt;/p&gt;</description></item><item><title>Agenty w produkcji, DuckDB na sterydach i kłamstwa Kubernetesowi</title><link>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</link><pubDate>Mon, 11 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na profesjonalizacji narzędzi AI w codziennej pracy inżynierskiej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak Databricks i Shopify wbudowują agentów AI bezpośrednio w swoje platformy, pokazujemy, dlaczego AI przestaje być dodatkiem, a staje się integralną warstwą systemów, i tłumaczymy zmianę podejścia: od prompt engineeringu do context engineeringu i pracy na głębszych warstwach modeli LLM.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu wracają do gry lekkie, lokalne silniki analityczne.&lt;/p&gt;&#10;&lt;p&gt;Przyglądamy się, jak DuckDB i Polars redefiniują wydajność pracy z danymi na pojedynczej maszynie, pokazujemy, kiedy lokalne przetwarzanie wygrywa z klasycznym podejściem cloud-first, a także wracamy do fundamentów: Kafka i Spark wciąż żyją, ale wymagają konkretnych checklist optymalizacyjnych przy skali produkcyjnej.&lt;/p&gt;</description></item><item><title>Semantic layer, czarne skrzynki i 30 lat Postgresa kontra cały Twój stack</title><link>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</link><pubDate>Mon, 20 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</guid><description>&lt;p&gt;Tym razem data engineering trzyma środek ciężkości całego wydania — i robi to z rozmachem.&lt;/p&gt;&#10;&lt;p&gt;DuckLake osiąga wersję 1.0 jako pełnoprawna platforma lakehouse oparta na Apache Iceberg, dbt publikuje świeży benchmark semantic layer kontra text-to-SQL, a Meta dzieli się case study o tym, jak użyła NLP do mapowania wiedzy w pipeline&amp;rsquo;ach danych.&lt;/p&gt;&#10;&lt;p&gt;Do kompletu:&lt;/p&gt;&#10;&lt;p&gt;architektura medallion z warstwą semantyczną, 20 reguł walidacji, które powinny być standardem w każdym pipeline, i konkretny materiał Airbnb o wysokowydajnym pipeline metryk na OpenTelemetry.&lt;/p&gt;</description></item><item><title>Zrób sobie lakehouse na laptopie</title><link>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</link><pubDate>Mon, 12 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy z pogranicza AI, data engineeringu i praktyk inżynierskich. Szczególną uwagę poświęcamy agentom AI - od pisania skutecznych CLAUDE.md i budowy prostych agentów kodujących w 200 liniach, po zaawansowany monitoring autonomicznych systemów i wzorce projektowe dla inteligentnych aplikacji.&lt;/p&gt;&#10;&lt;p&gt;W sekcji data engineering znajdziesz konkretne rozwiązania: od wzorców partycjonowania przyspieszających zapytania, przez budowę lokalnego pipeline&amp;rsquo;u ELT z DuckDB i dbt (bez kosztów chmury), aż po kompletny przewodnik tworzenia lakehouse&amp;rsquo;a z Apache Iceberg, Trino i MinIO. Nie zabrakło też materiałów przygotowujących do rozmów rekrutacyjnych - 10 kluczowych tematów system design dla data engineerów w 2026 roku.&lt;/p&gt;</description></item><item><title>Jak ludzie korzystają z AI w pracy?</title><link>https://blog.prokulski.science/2025/12/15/jak-ludzie-korzystaja-z-ai-w-pracy/</link><pubDate>Mon, 15 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/15/jak-ludzie-korzystaja-z-ai-w-pracy/</guid><description>&lt;p&gt;Ten tydzień - ostatni pełny przed świętami - to raczej czas porządków, niż wielkich premier. Choć niektórzy testują, jak naprawdę radzi sobie &lt;a href="https://openai.com/pl-PL/index/introducing-gpt-5-2/"&gt;GTP-5.2&lt;/a&gt; - najnowsze dziecko OpenAI.&lt;br&gt;&#10;Na dziś wystarczy tej dolinokratycznej magii. Przejdźmy do rzeczy, które mają większy sens: praktyka, konkret, zero ściemy (bo po to tu jesteś, nie?).&lt;/p&gt;&#10;&lt;p&gt;W tym numerze skupiamy się na tym, co daje realny efekt. Optymalizacja. Wydajność. Sprytne podejścia do codziennej roboty z danymi. Mamy PostgreSQL i DuckDB w akcji, Parquet na sterydach oraz garść sztuczek w Apache Spark i SQLAlchemy. Dorzucamy integrację DuckDB z Amazon S3 i pomysł na streamingowy ETL bez klasycznych hurtowni - lekko, elastycznie i bez ton konfiguracji.&lt;/p&gt;</description></item><item><title>Przerzucanie liczb z worka do worka - podcast</title><link>https://blog.prokulski.science/2025/11/23/przerzucanie-danych/</link><pubDate>Sun, 23 Nov 2025 17:47:32 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/23/przerzucanie-danych/</guid><description>&lt;p&gt;W podcaście &amp;ldquo;Dane Są Wszędzie&amp;rdquo; opowiadam o mojej roli analityka i architekta w zespole big data, a także omawiam, jak wygląda &amp;ldquo;przerzucanie liczb z worka do worka&amp;rdquo; w dużej skali.&#10;W najnowszym odcinku podcastu Dominika Szcześniaka &amp;ldquo;Dane Są Wszędzie&amp;rdquo; rozmawiamy o mojej roli u jednego z ubezpieczycieli, ale też skupiamy się na back endzie i Big Data, między innymi:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;opowiadam czym jest Kafka&lt;/li&gt;&#10;&lt;li&gt;mówię o tym, jak computer vision i modele AI są wykorzystywane w ubezpieczeniach&lt;/li&gt;&#10;&lt;li&gt;dzielę się moim spojrzeniem na uniwersalność danych i swoją fascynacją jak to, nomen omen, &amp;ldquo;dane są wszędzie&amp;rdquo;&lt;/li&gt;&#10;&lt;li&gt;rozmawiamy też o rolach w dużej organizacji IT (gdzie samo IT ma ponad 1000 osób), od analityków systemowych, po Data Scientistów, Data Engineerów i Product Ownerów&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Całej rozmowy (trwa około godziny) możesz posłuchać na kilku platformach:&lt;/p&gt;</description></item><item><title>System design, bazy danych i praktyczny Python</title><link>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</link><pubDate>Mon, 10 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach projektowania i optymalizacji systemów danych.&lt;br&gt;&#10;Zaczynamy od architektury: poznasz sprawdzone metody nauki projektowania systemów oraz zajrzysz pod maskę infrastruktury OpenAI opartej na Kubernetes i Apache Kafka.&lt;br&gt;&#10;W sekcji baz danych znajdziesz spojrzenie na BigQuery z perspektywy programistów Pythona oraz dwanaście realnych przypadków migracji do DuckDB z konkretnymi oszczędnościami.&lt;/p&gt;&#10;&lt;p&gt;Miłośnicy Pythona znajdą też kilka wartościowych materiałów: od elegancji dekoratorów, przez biblioteki przewyższające Excela, po praktyczną migrację z PostgreSQL do MongoDB. Warto zerknąć na porównanie HTTPX z Requests (nie tylko w kontekście projektów LLM, ale po prostu na httpx jako nowocześniejszy pakiet) oraz omówienie narzędzia UV Toolchain do stabilizacji środowisk CI/CD.&lt;/p&gt;</description></item><item><title>Kafka jest szybka, ale użyję Postgres</title><link>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</link><pubDate>Mon, 03 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się rozwiązaniom praktycznym z kilku kluczowych obszarów analizy i przetwarzania danych. Zaczynamy od fuzzy string matching i technik dopasowywania niedoskonałych tekstów, przechodzimy przez architekturę pipeline&amp;rsquo;ów ETL opartych na open source, aż po szczegóły integracji Kafka, Flink i Spark w systemach streamingowych.&lt;/p&gt;&#10;&lt;p&gt;W sekcji Python znajdziesz porównanie nowości w wersjach 3.13 i 3.14, kompleksowy przewodnik (a nawet dwa, aby niejako dopełnić wiedzę) po Pydantic oraz praktyczne wzorce projektowe dla FastAPI. Nie zabraknie też tematów związanych z optymalizacją PostgreSQL w aplikacjach czasu rzeczywistego, zarządzaniem kosztami w chmurze AWS oraz głęboko partycjonowanymi danymi w Apache Spark.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-14</title><link>https://blog.prokulski.science/2025/04/14/newsletter-dane-i-analizy-2025-04-14/</link><pubDate>Mon, 14 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/14/newsletter-dane-i-analizy-2025-04-14/</guid><description>&lt;p&gt;Ciepłe powitanie dla wszystkich nowych czytelników, którzy dołączyli razem z cyklem o analizie danych z rynku pierwotnego nieruchomości! Cieszę się, że tu jesteście. A jeśli ktoś nie zna tego cyklu - zapraszam na stronę, &lt;a href="https://www.subscribepage.com/python_data_science/?utm_source=mail-2025-04-14&amp;amp;utm_medium=dia-nlt&amp;amp;utm_campaign=newsletter-dia"&gt;gdzie można się zapisać&lt;/a&gt;. Za zupełną darmoszkę.&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu przygotowałem zestaw materiałów, które odzwierciedlają dynamiczny rozwój świata AI, analizy danych i programowania. Szczególnie interesujące wydają się nowinki z pogranicza multimodalnych modeli AI, gdzie można własnoręcznie zbudować odpowiednik GPT-4o, oraz projekt analizujący trendy w segmentach sponsorskich na YouTube.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-10</title><link>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</link><pubDate>Mon, 10 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</guid><description>&lt;p&gt;Zanim przejdę do sedna, czyli bieżącego numeru, mam dla Ciebie informację. Otóż za moment będzie dostępny kompleksowy e-book typu &lt;strong&gt;&amp;ldquo;od juniora do mida&amp;rdquo;&lt;/strong&gt;. Książka to projekt, który kompleksowo przeprowadza przez budowę aplikacji - od komunikacji z API, przez bazę danych, aż po konteneryzację. Bez pierdół teoretycznych, za to z mocnym naciskiem na praktykę. Szczegóły już niedługo w oddzielnym mailu, więc trzymajcie się blisko skrzynki odbiorczej!&lt;/p&gt;&#10;&lt;p&gt;A co Cię czeka w tym numerze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-13</title><link>https://blog.prokulski.science/2025/01/13/newsletter-dane-i-analizy-2025-01-13/</link><pubDate>Mon, 13 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/13/newsletter-dane-i-analizy-2025-01-13/</guid><description>&lt;p&gt;Mam dla Ciebie nową porcję ciekawych tekstów, artykułów, zestawień i tutoriali – jak zwykle trochę o Pythonie, trochę o analizie danych, no i oczywiście coś o AI i ML. Ale spokojnie, nie wszystko tutaj to programowanie (chociaż wiadomo, że to nasz główny temat :). Znajdziesz tu materiały dla każdego: od tych, którzy dopiero zaczynają, po treści dla bardziej zaawansowanych.&lt;br&gt;&#10;Oto, co między innymi znajdziesz dzisiaj poniżej:&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Sztuczna inteligencja i uczenie maszynowe&lt;/strong&gt; – rozpocznij rok od 50 najważniejszych materiałów o AI w 2025 roku, dowiedz się, jak zoptymalizować modele takie jak YOLOv8 na małych urządzeniach, i poznaj sposób na tworzenie asystentów AI do analizy rynków surowcowych. A może zainspiruje Cię budowa medycznego chatbota lub wykorzystanie MLFlow w agnostycznym podejściu do zarządzania modelami? &lt;strong&gt;Analiza danych i inżynieria danych&lt;/strong&gt; – zanurz się w zaawansowanych technikach SQL dla niestrukturalnych danych, poznaj tajniki przetwarzania strumieniowego z użyciem Apache Spark, Kafka i Airflow, a także odkryj różnice między Elasticsearch a Apache Doris w analizie danych w czasie rzeczywistym. &lt;strong&gt;Python w praktyce&lt;/strong&gt; – dowiedz się, jak stworzyć system powiadomień z FastAPI, pracować z danymi przestrzennymi za pomocą GeoAlchemy, czy automatycznie generować diagramy architektury z kodu. Tu mała zapowiedź (bo jak się powie publicznie to ciąży taka motywacja &amp;ldquo;przecież obiecałem&amp;rdquo;), niejako przy okazji. Szykuję ebooka, który poprowadzi Cię krok po kroku przez projekt budowy aplikacji w Pythonie. Co więcej, w ebooku zajmiemy się naprawdę praktycznymi zadaniami, które odciążają od nudnej pracy. Wspólnie stworzymy dwie aplikacje, ucząc się po drodze, jak wykorzystywać usługi sieciowe, jak działać z bazami danych, i jak efektywnie wyświetlać zapisane dane. A żeby było co wyświetlać – sami stworzymy bazę danych, do której będziemy dodawać informacje! Ciekawe? Więcej szczegółów być może już za tydzień. Wypatruj! &lt;strong&gt;Bezpieczeństwo i ciekawostki&lt;/strong&gt; – przeanalizuj globalne statystyki dotyczące otwartego portu 80, odkryj sposoby, w jakie Uber oszczędza czas dzięki Text-to-SQL, i sprawdź, jak korzystać z YouTube prosto z terminala. Inne inspiracje – od katalogów danych i ich obserwowalności po trendy marketingowe według TikToka – każdy znajdzie coś dla siebie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-30</title><link>https://blog.prokulski.science/2024/12/30/newsletter-dane-i-analizy-2024-12-30/</link><pubDate>Mon, 30 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/30/newsletter-dane-i-analizy-2024-12-30/</guid><description>&lt;p&gt;&lt;em&gt;Wskazówki nieubłaganie odmierzają czas, do umownego końca stulecia i tysiąclecia pozostały niespełna trzy tygodnie&amp;hellip;&lt;/em&gt; - tak swoją ostatnią audycję rozpoczął Tomasz Beksiński, a w tym roku mija 25 lat od jego śmierci. Pewnie dlatego dużo na jego temat przewija się przez internet.&lt;/p&gt;&#10;&lt;p&gt;To pożegnanie Tomka cytowane tutaj to tylko zabieg literacki, więc nie należy się obawiać o redaktora naczelnego. W rzeczywistości kończymy 2024 rok – czas pełen przełomów w świecie danych, uczenia maszynowego i technologii. Przed Tobą ostatni w tym roku numer newsletter, z kolejnymi (mam nadzieję) inspiracjami, projektami i ciekawostkami, które pomogą zamknąć ten rok z przytupem i może rozbudzą pomysły na nadchodzący 2025.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-28</title><link>https://blog.prokulski.science/2024/10/28/newsletter-dane-i-analizy-2024-10-28/</link><pubDate>Mon, 28 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/28/newsletter-dane-i-analizy-2024-10-28/</guid><description>&lt;p&gt;Jeden z tekstów, które znajdziecie poniżej mówi o tym, jak pobrać z YouTube wideo, wyciągnąć z niego dźwięk, a potem ten dźwięk przekształcić w zapis tekstowy (taki do czytania). Potem i tak nikt tego nie czyta&amp;hellip;&lt;/p&gt;&#10;&lt;p&gt;Niektórzy może czytają. A jeśli wolą jednak oglądać albo słuchać - dzisiaj przed Wami zapisy wideo z dwóch konferencji. Jedna to &amp;ldquo;Oh My Hack&amp;rdquo; odbywająca się w Polsce i skupiająca się na zagadnieniach związanych z bezpieczeństwem. Nagrania pochodzą z edycji, która miała miejsce w 2023 roku. Druga konferencja to coś nowszego - amsterdamska edycja PyData, z tego roku.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-23</title><link>https://blog.prokulski.science/2024/09/23/newsletter-dane-i-analizy-2024-09-23/</link><pubDate>Mon, 23 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/23/newsletter-dane-i-analizy-2024-09-23/</guid><description>&lt;p&gt;Dzisiaj nieco później niż zwykle, nieco skromniej i bez zbędnego lania wody. Taki eksperyment.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.datadriveninvestor.com/50-handpicked-github-repositories-to-master-data-science-skills-pro-recommended-8231c661e731"&gt;&lt;strong&gt;50 Handpicked GitHub Repositories to Master Data Science Skills&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Najlepszym sposobem na naukę jest praktyka. Własna - pisanie kodu, albo cudza - czytanie kodu. Aby ułatwić to drugie - zbiór materiałów.&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://itnext.io/feature-engineering-in-xgboost-a-practical-guide-7fbafa7dbdbd"&gt;&lt;strong&gt;Feature Engineering in XGBoost&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Więcej tutaj operacji na danych w Pandasie niż samego XGBoosta, ale o inżynierii cech nigdy za wiele.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/football-and-geometry-passing-networks-6e201ceff6ef"&gt;&lt;strong&gt;Football and Geometry&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Wprowadzenie do grafów na podstawie siatki podań piłkarzy podczas meczy.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-01</title><link>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</link><pubDate>Mon, 01 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</guid><description>&lt;p&gt;Razem z początkiem lipca zwykle w mediach rozpoczyna się sezon ogórkowy. Upały dają się we znaki, &lt;em&gt;żar leje się z nieba&lt;/em&gt; (pozdrawiamy fanów &amp;ldquo;Hydrozagadki&amp;rdquo; oraz Asa!), jedyne o czym chce się myśleć to schłodzone napoje i leżenie w basenie.&lt;/p&gt;&#10;&lt;p&gt;Ale mimo tych przeciwności losu przed Wami kolejna porcja wiedzy w postaci ręcznie wybranych najlepszych tekstów o AI i ML plus okolicach związanych z przetwarzaniem danych jakie przewinęły się przez cały tydzień w różnych mediach czy też innych newsletterach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-27</title><link>https://blog.prokulski.science/2024/05/27/newsletter-dane-i-analizy-2024-05-27/</link><pubDate>Mon, 27 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/27/newsletter-dane-i-analizy-2024-05-27/</guid><description>&lt;p&gt;Dzisiaj krótko, bo tydzień krótszy i &amp;ldquo;nie ma czasu załadować taczek&amp;rdquo;. Może tak lepiej?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@busariajibola2001/customer-segmentation-rfm-analysis-de72f7385bf3"&gt;&lt;strong&gt;Customer Segmentation&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza RFM (Recency, Frequency and Monetary) wykorzystana do segmentacji klientów. Bardziej opis niż zajęcia praktyczne, a praktyka podana w excelu&lt;/p&gt;&#10;&lt;h3 id="architektura"&gt;#architektura&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@vutrinh274/how-twitter-processes-4-billion-events-in-real-time-daily-942db8f7d7b5"&gt;&lt;strong&gt;How Twitter processes 4 billion events in real-time daily&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Od architektury Lambda do Kappa&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pathtosenior.substack.com/p/3-reasons-why-you-might-want-to-use?sd=pf"&gt;&lt;strong&gt;3 Reasons Why You Might Want to Use Monolith Instead of Microservice&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czyżby odwrót od podejścia mikroserwisowego? A może tylko kilka szczególnych przypadków?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-20</title><link>https://blog.prokulski.science/2024/05/20/newsletter-dane-i-analizy-2024-05-20/</link><pubDate>Mon, 20 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/20/newsletter-dane-i-analizy-2024-05-20/</guid><description>&lt;p&gt;Dzisiaj w sekcji poświęconej językowi R mamy tekst, w którym w atrakcyjny, animowany sposób pokazano kilka podstawowych operacji na ramkach danych (albo jak kto woli - tabelkach, np. w bazie danych). Jeśli nie wiesz jak działają operacje grupowania, agregacji czy łączenia danych - po tych przykładach nie powinno być z tym problemu.&lt;/p&gt;&#10;&lt;p&gt;Jeśli już przy bazach danych jesteśmy - powraca DuckDB, bo to jest cudo. Tym razem m.in. porównanie ze Sparkiem.&lt;br&gt;&#10;Od Sparka niedaleko zaś do ogólnie pojętego big data - w tej sekcji kompletny przewodnik jak zbudować cały zestaw do strumieniowego przetwarzania danych: czyli pełne środowisko zawierające Kafkę, Schema Registry, Kafka Connect, ksql i co tam jeszcze wokoło potrzebne.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-06</title><link>https://blog.prokulski.science/2024/05/06/newsletter-dane-i-analizy-2024-05-06/</link><pubDate>Mon, 06 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/06/newsletter-dane-i-analizy-2024-05-06/</guid><description>&lt;p&gt;Witamy po majówce. Akumulatory naładowane? Głowy przewietrzone? Karkóweczka zjedzona? :)&lt;br&gt;&#10;Zatem czas na kolejną porcję rozwijających treści.&lt;/p&gt;&#10;&lt;p&gt;Jakoś tak wyszło, że w tym tygodniu mamy kilka zagadnień związanych z Kubernetesem, ale nie odpuszczamy programowania jako takiego (z przewagą Pythona, wiadomo). Poza tym - chyba masz zaległości z poprzedniego numer, prawda?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://kai-waehner.medium.com/genai-demo-with-kafka-flink-langchain-and-openai-8c9b7263770a"&gt;&lt;strong&gt;GenAI Demo with Kafka, Flink, LangChain and OpenAI&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Architektura i demo procesu przesyłania danych Kafką i użycia modeli LLM na tychże danych. W treści tekstu znajdziesz też link do nagrania na YT&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-04-15</title><link>https://blog.prokulski.science/2024/04/15/newsletter-dane-i-analizy-2024-04-15/</link><pubDate>Mon, 15 Apr 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/04/15/newsletter-dane-i-analizy-2024-04-15/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/data-and-beyond/mastering-exploratory-data-analysis-eda-everything-you-need-to-know-7e3b48d63a95"&gt;&lt;strong&gt;Mastering Exploratory Data Analysis (EDA)&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Usystematyzowane podejście do analizy danych, której celem jest odkrycie istotnych dla przyszłych modeli cech. Za każdym razem robi się to podobnie, więc - warto znać zasady.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/improving-generalization-in-survival-models-bb7bc045bfc6"&gt;&lt;strong&gt;Improving Generalization in Survival Models&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza przeżycia jako sposób na predykcję odejść pracowników.&lt;/p&gt;&#10;&lt;h3 id="architektura"&gt;#architektura&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.youtube.com/watch?v=qcJASFx-F5g"&gt;&lt;strong&gt;So You Want to Build An Event Driven System?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak zbudować system sterowany zdarzeniami? Jakie są korzyści z przyjęcia tego stylu architektury, jakie są wyzwania i niektóre kompromisy? Nagranie z konferencji [YouTube, 52 minuty, po angielsku]&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-02</title><link>https://blog.prokulski.science/2024/01/02/newsletter-dane-i-analizy-2024-01-02/</link><pubDate>Tue, 02 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/02/newsletter-dane-i-analizy-2024-01-02/</guid><description>&lt;p&gt;Nowy Rok to dramatyczny okres&amp;hellip;&lt;br&gt;&#10;Dla siłowni i klubów fitness - bo kolejki, bo tłumy, bo góry pieniędzy od klientów.&lt;br&gt;&#10;Dla wystawców kart abonamentowych do tychże siłowni (typu multisport) - bo najniższe zyski w ciągu roku.&lt;br&gt;&#10;A dla większej części społeczeństwa (tej andrzejowej większej połowy Adamczychy) to czas postanowień noworocznych. I jeśli macie jakieś postanowienia, to być może tekst &lt;a href="https://kozyrkov.medium.com/how-to-design-resolutions-that-work-according-to-a-decision-scientist-extended-version-47c38bbb7198"&gt;The Advanced Manual of Self-Improvement&lt;/a&gt; Wam się przyda w ich dotrzymaniu?&lt;br&gt;&#10;Medium.com twierdzi, że to &lt;em&gt;48 min read&lt;/em&gt;, więc wersja nieco krótsza &lt;a href="https://bit.ly/quaesita_badreso"&gt;tutaj&lt;/a&gt;. Tak, to Medium.com, więc 5 dolarów za miesiąc, majątek cały. Ale w tym roku jeszcze nie było że &amp;ldquo;eldorado w IT się skończyło&amp;rdquo;, więc się (zapewne) nie skończyło ;-)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-04</title><link>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</link><pubDate>Mon, 04 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</guid><description>&lt;p&gt;W poprzednim tygodniu przeczytać mogliście króciutkie podsumowanie Data Science Summit, a tam stwierdzenie, że dużo się mówi o Streamlit jako sposobie na &lt;em&gt;PoC-owanie&lt;/em&gt; prezentacji danych. Świat obecnie idzie również w stronę streamingu i obsługi tak przesyłanych danych - głównie Flinkiem. I na Flinku skupia się dzisiejszy numer naszego newslettera.&lt;/p&gt;&#10;&lt;p&gt;Ciekawy jest też niespełna półgodzinne nagranie prezentujące możliwości DuckDB w kontekście danych przestrzennych pozyskanych z Open Street Maps. Chwilę bawiłem się DuckDB ale w połączeniu ze sporymi zbiorami geo (zapisanymi w ShapeFile&amp;rsquo;ach) i śmiga to wspaniale. Jedyny minus - to baza plikowa, więc średnio do użycia w przypadku dostępu przez wiele aplikacji na raz. Ale jako element w procesie &lt;em&gt;data engineeringu&lt;/em&gt; może się bardzo przydać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-19</title><link>https://blog.prokulski.science/2023/11/19/newsletter-dane-i-analizy-2023-11-19/</link><pubDate>Sun, 19 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/19/newsletter-dane-i-analizy-2023-11-19/</guid><description>&lt;p&gt;Ci, którzy śledzą newsletter i fanpage&amp;rsquo;a &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;Dane i Analizy&lt;/a&gt;, profil na &lt;a href="https://www.linkedin.com/company/daneianalizy/"&gt;LinkedIn&lt;/a&gt; (oraz moje prywatne profile, np. na &lt;a href="https://www.linkedin.com/in/lukaszprokulski/"&gt;LI&lt;/a&gt;) wiedzą zapewne, że w ramach kampanii PZU &lt;em&gt;silni w IT&lt;/em&gt; przygotowaliśmy serię podcastów o sztucznej inteligencji.&lt;/p&gt;&#10;&lt;p&gt;W pierwszym odcinku rozmawiamy raczej filozoficznie, o tym czym jest AI i czy potrzebujemy dla niej jakichś regulacji (słuchaj na &lt;a href="https://www.youtube.com/watch?v=ZmDAWVjK6ds"&gt;YouTube&lt;/a&gt; lub &lt;a href="https://open.spotify.com/episode/5fLSczI7mHzGFtRMmLFAQ4"&gt;Spotify&lt;/a&gt;).&lt;br&gt;&#10;W drugim skupiamy się na zagadnieniach HRowych - kim jest data scientist, co robi i - to chyba najważniejsze - jakich kompetencji się oczekuje od takiej osoby? (&lt;a href="https://open.spotify.com/episode/6BTwToPD0yaX6l2N40Jf36"&gt;Spotify&lt;/a&gt; / &lt;a href="https://www.youtube.com/watch?v=YXTfZ9wzHw0"&gt;YouTube&lt;/a&gt;).&lt;br&gt;&#10;W tym tygodniu powinny pojawić się dwa kolejne odcinki, w kolejnym jeszcze dwa. Poruszamy w nich zagadnienia związane z big data i dostarczaniem danych do nauki AI, rozmawiamy o computer vision, modelach językowych, a na koniec bezpieczeństwie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-13</title><link>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</link><pubDate>Mon, 13 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</guid><description>&lt;p&gt;Za chwilę w świat pójdą pierwsze odcinki nowego podcastu przygotowanego przez zespół Big Data &amp;amp; AI PZU: &lt;strong&gt;#SilniwIT o technologiach&lt;/strong&gt;. To seria, w ramach której rozmawiam (wspólnie z Tomkiem z zespołu Fabryki Sztucznej Inteligencji) z gośćmi o szeroko pojętej sztucznej inteligencji. Wypatrujcie postów na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;FB&lt;/a&gt;, &lt;a href="https://www.linkedin.com/company/daneianalizy/"&gt;LinkedIn&lt;/a&gt; i pewnie w przyszłym newsletterze - mam nadzieję, że jak na amatorów - daliśmy radę. Staraliśmy się ucinać korpo-gadkę, powinno być interesująco ;-)&lt;/p&gt;&#10;&lt;p&gt;Wcześniej możecie posłuchać podsumowania z pierwszej konferencji OpenAI (firmy, która stworzyła ChatGPT) dla developerów w podcaście &lt;a href="https://podcasters.spotify.com/pod/show/artur-kurasinski/episodes/Podsumowanie-OpenAI-DevDay-2023-e2bles4"&gt;Technofobia&lt;/a&gt; Artura Kurasińskiego.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-06</title><link>https://blog.prokulski.science/2023/11/06/newsletter-dane-i-analizy-2023-11-06/</link><pubDate>Mon, 06 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/06/newsletter-dane-i-analizy-2023-11-06/</guid><description>&lt;p&gt;Odcinek przeprowadzkowy, gdyż miniony tydzień (a nawet dwa) to jedno wielkie urwanie głowy. Cały tydzień minął mi pod hasłem &amp;ldquo;przeprowadzka&amp;rdquo;, a to jak pewnie możecie się domyślać czas spędzony na pakowaniu, na rozpakowywaniu i (co najgorsze dla &lt;em&gt;pracownika umysłowego&lt;/em&gt; ;-) noszeniu paczek. Szczerze mówiąc jakieś 20, może 30 procent rzeczy trafiło do utylizacji. A niby człowiek sprząta i pozbywa się na bieżąco.&lt;/p&gt;&#10;&lt;p&gt;Ale nie poddajemy się i życie trwa, newsletter wychodzi, a żona dała radę też nagrać &lt;a href="https://youtu.be/xNxulbY0xk8?si=K5Dd276tVY1URzMC"&gt;odcinek swojego programu o książkach&lt;/a&gt; (już z pustego mieszkania). Jeśli interesuje Was literatura to serdecznie polecam &lt;a href="https://www.youtube.com/@ZnalezionePrzeczytane"&gt;&lt;strong&gt;Znalezione przeczytane&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-23</title><link>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</link><pubDate>Mon, 23 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</guid><description>&lt;p&gt;Lubię DuckDB i lubię AirFlow. Kafka jest naturalnym sposobem na przesyłanie danych między systemami czy też mikroserwisami. Stąd też dzisiaj kilka tekstów zahaczających o te wszystkie technologie.&lt;/p&gt;&#10;&lt;p&gt;Dodatkowo trochę z obszaru zarządzania - zarówno opis typowego projektu data science jak i metryka opisująca stabilność kolejki prac.&lt;/p&gt;&#10;&lt;p&gt;No i trochę o mapkach, bo mapki są fajne.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-softmax-regression-for-multi-class-label-with-python-782a34283894"&gt;&lt;strong&gt;Fully Explained Softmax Regression for Multi-Class Label with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Klasyfikacja do wielu klas - o co tutaj chodzi? Przewodnik dla początkujących&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-16</title><link>https://blog.prokulski.science/2023/10/16/newsletter-dane-i-analizy-2023-10-16/</link><pubDate>Mon, 16 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/16/newsletter-dane-i-analizy-2023-10-16/</guid><description>&lt;p&gt;Dzisiaj dwa raporty o AI. Pierwszy to bardziej zbiór krótkich esejów&amp;hellip; gdzie prawie każdy prowadzi do rozbudowanego notebooka z szerszym komentarzem, wykresami i - jak to w Kaggle bywa - kodem. W Kaggle, bo to &lt;a href="https://www.kaggle.com/AI-Report-2023"&gt;&lt;strong&gt;AI Report 2023&lt;/strong&gt;&lt;/a&gt; od Kaggle właśnie.&lt;/p&gt;&#10;&lt;p&gt;Drugi raport to State of &lt;a href="https://www.stateof.ai/"&gt;&lt;strong&gt;AI Report 2023&lt;/strong&gt;&lt;/a&gt; od Air Street Capital. To opublikowany już szósty raz roczny raport o stanie sztucznej inteligencji. Ponad 160 stron, obejmujących:&lt;/p&gt;&#10;&lt;p&gt;Badania: Przełomy technologiczne i ich możliwości Przemysł: Obszary komercyjnego zastosowania sztucznej inteligencji i jej wpływ na biznes Polityka: regulacje dotyczące sztucznej inteligencji, jej implikacje gospodarcze i ewoluująca geopolityka sztucznej inteligencji Bezpieczeństwo: identyfikacja i łagodzenie katastrofalnych zagrożeń, jakie mogą dla nas stanowić przyszłe wysoce wydajne systemy sztucznej inteligencji Prognozy: to, w co wierzymy, że się wydarzy, oraz przegląd wyników, aby zachować uczciwość&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-18</title><link>https://blog.prokulski.science/2023/09/18/newsletter-dane-i-analizy-2023-09-18/</link><pubDate>Mon, 18 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/18/newsletter-dane-i-analizy-2023-09-18/</guid><description>&lt;p&gt;Dziś polecam gorąco dwa teksty, dość obszerne.&lt;/p&gt;&#10;&lt;p&gt;Pierwszy to świetny i darmowy kurs &lt;strong&gt;spaCy&lt;/strong&gt; - chyba najlepszej obecnie biblioteki służącej do przetwarzania tekstu w Pythonie (z bogatą biblioteką słowników w różnych językach)&lt;/p&gt;&#10;&lt;p&gt;Drugi to cykl (link prowadzi do jego środka) opowiadający o budowaniu aplikacji do zamawiania usług: zaczyna się od FastAPI przyjmującego zamówienia, Kafka jako potok na dane, Apache Pinot jako hurtownia danych i aplikacja-dashboard napisany za pomocą Dash.&lt;/p&gt;&#10;&lt;p&gt;A żeby nie było za łatwo - musisz samodzielnie przeczytać całą poniższą listę, aby te dwa teksty odkryć. Dzięki temu może znajdziesz jeszcze coś ciekawego?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-12</title><link>https://blog.prokulski.science/2023/06/12/newsletter-dane-i-analizy-2023-06-12/</link><pubDate>Mon, 12 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/12/newsletter-dane-i-analizy-2023-06-12/</guid><description>&lt;p&gt;Piękna, słoneczna (przynajmniej ma Mazurach i w Warszawie) pogoda w &amp;ldquo;długi weekend&amp;rdquo; pozwoliła (mam nadzięję) na trochę wytchnienia od komputerów, programowania, budowania modeli i tworzenia sztucznych inteligencji. Po odpoczynku można do tego wrócić :)&lt;/p&gt;&#10;&lt;p&gt;A właśnie - budowanie większości modeli ML/AI sprowadza się do kilku podstawowych i powtarzalnych etapów:&lt;br&gt;&#10;gromadzenie danych przegląd danych i ich wzajemnych zależności czyszczenie i uzupełnianie braków dobór hiperparametrów do modelu trenowanie modelu ocena jego jakości użycie modelu na nowych danych&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-08</title><link>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</link><pubDate>Mon, 08 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</guid><description>&lt;p&gt;Majówka, majówka i po majówce. Wypoczęci? Ja zwiedziłem z rodziną Trójmiasto, jestem zadowolony i o to właściwie w wypoczynku chodzi. Tylko dlaczego tak wieje nad morzem?&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym odcinku zaś szczególnie polecam książkę Françoisa Fleureta &lt;a href="https://fleuret.org/francois/"&gt;&lt;strong&gt;The Little Book of Deep Learning&lt;/strong&gt;&lt;/a&gt; - sporo teorii o tym jak działa głębokie uczenie, różne typy warstw i w ogóle na czym ta cała sztuczna inteligencja polega. Książka wygląda na przyciętą formatem do ekranu telefonu - przyznam, że to interesujący pomysł (ale już go znamy z chociażby [reklama] &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;Kart Data Science&lt;/strong&gt;&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-20</title><link>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</link><pubDate>Mon, 20 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</guid><description>&lt;p&gt;Wiecie kto generuje najwięcej ruchu w internecie? Kiedyś to było porno i torrenty (albo inne sposoby wymiany plików peer-to-peer). Teraz układ wygląda jak na poniższym obrazku, przynajmniej według danych &lt;a href="https://www.statista.com/chart/15692/distribution-of-global-downstream-traffic/"&gt;opublikowanych&lt;/a&gt; przez serwis Statista.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://prokulski.science/temp/static/nlt/global_internet_traffic.jpeg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj bardzo dużo treści - oraz eksperyment - polskie tytuły (ale przeważnie angielskie teksty). Wśród tych tekstów sporo o Apache Spark i konkretnych wykorzystaniach albo rozwiązaniach konkretnych problemów.&lt;br&gt;&#10;Znajdziecie też kilka fajnych tekstów o różnego typu problemach rozwiązywanych przez analizę czy modele danych (rekomendacje w Netflixie, OHE i Pandas), gorąco polecam tekst o Apache Arrow.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-13</title><link>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</link><pubDate>Mon, 13 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</guid><description>&lt;p&gt;Wielokrotnie na łamach niniejszego newslettera poruszane były tematy związane z Apache Kafka. A to podejście architektoniczne z grubsza mówiące dlaczego Kafka jest fajna i przydatna, a to podejście developerskie - o tym jak wysyłać i konsumować wiadomości z Kafki. Często też trafiają się bardziej zaawansowane przykłady - traktujące Kafkę jako bazę danych (z ktable czy ksql), czasem uzupełnione o Spark Streaming czy inne dodatkowe narzędzia typu Trino.&lt;/p&gt;&#10;&lt;p&gt;Ale najczęściej chyba Kafka wykorzystywana jest do przesyłania komunikatów w podejściu &lt;em&gt;publish &amp;amp; subscribe&lt;/em&gt;. Są jednak przecież inne rozwiązania kolejkowe - Rabbit, czy na przykład MQTT popularne w rozwiązaniach Internet of Things. &lt;a href="https://emqx.medium.com/mqtt-and-kafka-f20d79d9dea4"&gt;Przeczytajcie o podobieństwach i różnicach Kafki z MQTT&lt;/a&gt; (tekst &lt;a href="https://medium.com/techieahead/kafka-vs-rabbitmq-comparison-61d7a7b425d7"&gt;Kafka vs Rabbit&lt;/a&gt; też oczywiście jest).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-27</title><link>https://blog.prokulski.science/2023/02/27/newsletter-dane-i-analizy-2023-02-27/</link><pubDate>Mon, 27 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/27/newsletter-dane-i-analizy-2023-02-27/</guid><description>&lt;p&gt;W dzisiejszym wydaniu najwięcej miejsca poświęcam wizualizacji danych i okolicach.&lt;/p&gt;&#10;&lt;p&gt;Kalibracja obrazu jest okolicą (bardzo odległą - w sumie oba tematy łączy tylko to, że mamy do czynienia z obrazem), jest też więc coś o tym. Kalibracja jest potrzebna przy problemach natury &lt;em&gt;computer vision&lt;/em&gt;, a takowy - w postaci maskowania obiektów na obrazie - też dzisiaj poruszamy.&lt;/p&gt;&#10;&lt;p&gt;W poprzednim tygodniu dużym powodzeniem cieszył się tekst o MLOps (jeśli boisz się, że umknęło - zerknij do &lt;a href="../../category/newsletter/"&gt;archiwum&lt;/a&gt;), więc dzisiaj kontynuacja, niejako na fali z poprzedniego tygodnia.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-20</title><link>https://blog.prokulski.science/2023/02/20/newsletter-dane-i-analizy-2023-02-20/</link><pubDate>Mon, 20 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/20/newsletter-dane-i-analizy-2023-02-20/</guid><description>&lt;p&gt;Jak wyglądać będzie świat kiedy GPT-3 będzie pisać teksty? Mniej więcej tak jak wygląda Medium.com. Clickbaitowe tytuły, mało merytorycznej treści. Jeśli brać pod uwagę teksty mówiące ogólnie rzecz biorąc o IT to dodatkowo długie wprowadzenia (zawsze mniej więcej o tym samym: czym jest Kafka, czym jest AirFlow, czym jest Docker), potem dwa akapity o banalnym do rozwiązania problemie i to wszystko.&lt;/p&gt;&#10;&lt;p&gt;Może to przeziębienie trwające już za długo, może kryzys wieku średniego ;-) albo za dużo zajęć i rzeczy do zrobienia tu i teraz, ale szczerze mówiąc jestem zmęczony, głównie internetem - wszędzie to samo, wszystko miałkie, wszystko wtórne. Dlatego, żeby tego wszystkiego Wam oszczędzić do dzisiejszego newslettera wstępnie wybrałem około 50 artykułów. Ile przeszło selekcję? Widzicie poniżej. Ile z nich jest godnych uwagi i na prawdę coś ciekawego wnosi? To musicie ocenić sami.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-06</title><link>https://blog.prokulski.science/2023/02/06/newsletter-dane-i-analizy-2023-02-06/</link><pubDate>Mon, 06 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/06/newsletter-dane-i-analizy-2023-02-06/</guid><description>&lt;p&gt;Dzisiaj nieco zagadnień teoretycznych. Dobór odpowiedniego rozkładu do istniejących danych, metody tropienia ile tak na prawdę mamy &amp;ldquo;klastrów&amp;rdquo; (grup) w danych.&lt;/p&gt;&#10;&lt;p&gt;Sporo też o GPT-3, a raczej jego wykorzystaniu w różny sposób (od pisania książek do pisania&amp;hellip; rozszerzeń do Chrome). Niespodziewanie dzisiaj rozrósł się dział dedykowany Apache Kafka.&lt;/p&gt;&#10;&lt;p&gt;Na koniec coś o wizualizacji, na przykład szpilki pokazujące gdzie mieszkają ludzie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://machinelearningmastery.com/building-a-multiclass-classification-model-in-pytorch/"&gt;&lt;strong&gt;Building a Multiclass Classification Model in PyTorch&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PyTorch zdobywa rynek AI spychając w cień TensorFlow. Jeśli więc zamierzasz się przesiadać - ten tutorial o prostej klasyfikacji może się przydać&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-19</title><link>https://blog.prokulski.science/2022/12/19/newsletter-dane-i-analizy-2022-12-19/</link><pubDate>Mon, 19 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/19/newsletter-dane-i-analizy-2022-12-19/</guid><description>&lt;p&gt;Po Mundialu, można się rozejść. W tym tygodniu lekkie wytchnienie, potem święta, święta i po świętach.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym życzę Państwu wszystkiego najlepszego, rodzinnych, spokojnych świąt. Odstawcie modele ML, dostawcie Flinki, Sparki i Kafki, zajmijcie się uszkami w barszczu i prezentami spod choinki. No, może być Pinot&amp;hellip; Pinot Noir.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/10-commonly-used-loss-functions-explained-with-python-code-59967e1f3c8d"&gt;&lt;strong&gt;10 Commonly Used Loss Functions Explained with Python Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Loss Function czy też bardziej swojsko &amp;ldquo;funkcja straty&amp;rdquo; to taka funkcja, która jest minimalizowana przez algorytm ML. A jakie mogą to być funkcje?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-31</title><link>https://blog.prokulski.science/2022/10/31/newsletter-dane-i-analizy-2022-10-31/</link><pubDate>Mon, 31 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/31/newsletter-dane-i-analizy-2022-10-31/</guid><description>&lt;p&gt;Poprzednie wydanie newslettera skupiało się na szeregach czasowych (zobacz w &lt;a href="../../2022/10/24/newsletter-dane-i-analizy-2022-10-24/"&gt;archiwum&lt;/a&gt;). Dla odmiany dzisiaj coś o analizie koszykowej - czyli co z czym się kupuje i co z tego wynika? Przykłady w kliku językach programowania znajdziecie niżej, w dedykowanej sekcji.&lt;/p&gt;&#10;&lt;p&gt;Nieco standardowo, albo może raczej - tradycyjnie - sporą część publikowanych dzisiaj tekstów mówi o technologiach streamingowych i big data. Zatem jest o rodzinie i znajomych Apache: Kafka, Spark, Iceberg, gdzieś przewinął się chyba też Flink. Czy to są interesujące dla Was tematy? A może rysowanie mapek jest ciekawsze? ;-)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-10</title><link>https://blog.prokulski.science/2022/10/10/newsletter-dane-i-analizy-2022-10-10/</link><pubDate>Mon, 10 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/10/newsletter-dane-i-analizy-2022-10-10/</guid><description>&lt;p&gt;Dzisiaj prawdziwa bomba na początek - szczegółowy esej na temat wykorzystania uczenia maszynowego na rynku akcji. Tekst obejmuje projekt systemu, który konsekwentnie pokonywał S&amp;amp;P 500, dopóki nie został zamknięty w lipcu 2022 roku. Jest tu wiele, w tym dyskusja na temat dynamiki rynku, podejścia do modelowania, stosu technologicznego, inżynierii funkcji, pipeline ML i nie tylko. Czyta się długo, ale warto! &lt;a href="https://principiamundi.com/posts/didact-anatomy/"&gt;&lt;strong&gt;Didact AI: The anatomy of an ML-powered stock picking engine&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Poza tym sporo dzisiaj materiałów o przetwarzaniu tekstu (na róźnym poziomie zaawansowania), kilka &lt;em&gt;przydasiów&lt;/em&gt; do Apache Kafka, nauka SQLAlchemy (czyli &lt;em&gt;jak w Pythonie gadać z bazami danych&lt;/em&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-05</title><link>https://blog.prokulski.science/2022/09/05/newsletter-dane-i-analizy-2022-09-05/</link><pubDate>Mon, 05 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/05/newsletter-dane-i-analizy-2022-09-05/</guid><description>&lt;p&gt;Pod logiem Fundacji Apache aż roi się od projektów, a świat big data to pewnie w 90-95% Apache COŚ. Znamy Kafkę, znamy Apache Spark, Apache Hadoop. Dzisiaj przedstawiamy (w dziale BigData) kilkoro innych członków rodziny.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zaś mamy dużo mapek do wyświetlenia naszym klientom na stronie (bo na przykład monitorujemy każdy wypożyczony rower, hulajnogę czy samochód i mamy miliony wejść na stronę dziennie) to w dziale DevOps coś o rozwiązaniu open soruce, które może zmniejszyć nasze koszty.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-29</title><link>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</link><pubDate>Mon, 29 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</guid><description>&lt;p&gt;Uważni czytelnicy fanpage&amp;rsquo;a &lt;a href="https://fb.com/daneanalizy"&gt;Dane i Analizy&lt;/a&gt; już zapewne przeczytali mój nowy post o analizie tras rowerowych (heatmapa w nim prezentowana już nieaktualna), ale jeśli kogoś ominęło to &lt;a href="../../2022/08/22/strava-in-python/"&gt;&lt;strong&gt;zapraszam&lt;/strong&gt;&lt;/a&gt;. Pokazuję w nim:&lt;br&gt;&#10;jak przeczytać plik XML jak agregować dwuwymiarowe dane w NumPy jak agregować je w Pandas jak przygotować mapkę w Folium&lt;/p&gt;&#10;&lt;p&gt;A jak już tamten tekst znasz to dzisiaj też niemało do wyboru. Zapraszam do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://stackify.com/flask-vs-django-which-python-framework-is-better-for-machine-learning-apps/"&gt;&lt;strong&gt;Which Python Framework is Better for Machine Learning Apps?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Mamy jakiś nasz cudowny model, daje świetne wyniki, ale predykcje można dostać tylko uruchamiając skrypt z konsoli albo jeszcze gorzej w Jupyter Notebooku. Co zrobić, żeby było to użytecznie online&amp;rsquo;owe narzędzie? Opakować w API.&#10;Ale który pythonowy framework wybrać?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-22</title><link>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</link><pubDate>Mon, 22 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</guid><description>&lt;p&gt;Czy mniejsza liczba artykułów (nie wiem czy to zauważalne&amp;hellip;) to dla Was lepiej czy gorzej? Przeczytacie w związku z tym więcej (wszystkie?) czy tak samo jak zwykle 2-3, a reszta to nuda?&lt;/p&gt;&#10;&lt;p&gt;Dzisiejszy numer to nieco eksperyment ale - przyznajmy to szczerze - wynik sezonu wakacyjnego. Oj ciężko się zebrać do roboty, ciężko&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mlu-explain.github.io/"&gt;&lt;strong&gt;MLU-Explain&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działają lasy losowe? Co to jest krzywa ROC i AUC? Jeśli nie wiesz to ten serwis w przystępny, graficzny sposób pomoże to zrozumieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-15</title><link>https://blog.prokulski.science/2022/08/15/newsletter-dane-i-analizy-2022-08-15/</link><pubDate>Mon, 15 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/15/newsletter-dane-i-analizy-2022-08-15/</guid><description>&lt;p&gt;Świat działa w realtime i tylko to się liczy - dlatego data scientiści też powinni na takie działanie się przygotować, a dobry tekst wprowadzający znajdziecie niżej.&lt;/p&gt;&#10;&lt;p&gt;No a jak Ci się znudził Excel plus Access wspomagane VBA (wg mnie to jest zmora korporacji - blokuje kreatywność i spowalnia rozwój) to dowiedz się gdzie kierować się dalej. Dla developerów z backendowym zacięciem też coś się znajdzie.&lt;/p&gt;&#10;&lt;p&gt;Dla tych co siedzą głęboko w modelach: połączenie Boruty z wartościami Shapleya do selekcji ważnych cech dla modeli - sprytne, ciekawe.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-08</title><link>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</link><pubDate>Mon, 08 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</guid><description>&lt;p&gt;Wakacje za półmetkiem, więc tematy w dzisiejszym newsletterze tak pół na pół.&lt;/p&gt;&#10;&lt;p&gt;Z jednej strony mamy ciężkie rzeczy: nowe naukowe &lt;em&gt;pejpery&lt;/em&gt; czy omówienie algorytmu grupowania przestrzennego opartego na gęstości. Ale z drugiej - automatyzację w Excelu czy kilka(naście) inspiracji dotyczących prezentowania danych.&lt;/p&gt;&#10;&lt;p&gt;Dla tych zaś co lubią wdrażanie i Kubernetesy - też coś się znajdzie, chociażby cluster na malinach ;-)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/6-papers-every-modern-data-scientist-must-read-1d0e708becd"&gt;&lt;strong&gt;6 Papers Every Modern Data Scientist Must Read&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przegląd prasy (publikacji naukowych) dla prawdziwych nerdów AI/ML. Jaki &amp;ldquo;pejper&amp;rdquo; czytasz dzisiaj?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-01</title><link>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</link><pubDate>Mon, 01 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</guid><description>&lt;p&gt;Dzisiaj nieco więcej materiałów z krainy &amp;ldquo;ops&amp;rdquo; w świecie &amp;ldquo;devops&amp;rdquo;. Warto znać obie ziemie, żeby nie mieć problemu chociażby z uruchomieniem kilku aplikacji (dockerowymi) pod różnymi ścieżkami na jednej domenie. Dlatego warto zajrzeć do tekstów o Nginx.&lt;/p&gt;&#10;&lt;p&gt;Ale sprawy związane z analizowaniem danych czy też ich przetwarzaniem w celu przewidywania przyszłości tradycyjnie też są na poniższej liście interesujących artykułów z minionego tygodnia.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://miroslawmamczur.pl/czym-jest-i-jak-zbadac-dryft-modelu-model-drift/"&gt;&lt;strong&gt;Czym jest i jak zbadać dryft modelu (model drift)?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dryft modelu odnosi się do spadku wydajności modelu z powodu zmian danych i relacji między zmiennymi wejściowymi i wyjściowymi&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-25</title><link>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</link><pubDate>Mon, 25 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</guid><description>&lt;p&gt;Wakacje wakacjami, ale te kilka godzin poświęciłem specjalnie dla Was aby przygotować dzisiejsze wydanie newslettera.&lt;/p&gt;&#10;&lt;p&gt;Pamiętacie &lt;strong&gt;Wojny Rdzeniowe&lt;/strong&gt;? Dla tych, którzy nie bardzo - &lt;a href="https://informatykzakladowy.pl/wojny-rdzeniowe-czyli-core-wars/"&gt;ciekawy tekst&lt;/a&gt; (po polsku, co rzadkie tutaj ;) opowiadający historię tych&amp;hellip; hmmm&amp;hellip; konkursów? zawodów?&lt;/p&gt;&#10;&lt;p&gt;A gdyby tak przygotować wewnętrzne rozgrywki tego typu? Co o tym sądzicie? Piszcie!&lt;/p&gt;&#10;&lt;p&gt;Zamiast jednak programować można klikać. Jeśli ktoś jest zwolennnikiem no-code to pewnie zainteresuje się &lt;a href="https://betterprogramming.pub/top-8-no-code-machine-learning-platforms-you-should-use-in-2020-1d1801300dd0"&gt;przeglądem platform&lt;/a&gt; tego typu przeznaczonych do zadań machine learningu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-18</title><link>https://blog.prokulski.science/2022/07/18/newsletter-dane-i-analizy-2022-07-18/</link><pubDate>Mon, 18 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/18/newsletter-dane-i-analizy-2022-07-18/</guid><description>&lt;p&gt;W tym tygodniu sporo materiałów związanych z przygotowywaniem modelu danych w bazie - to istotne zagadnienie, warto się chociaż trochę w temacie orientować jeśli projektujemy coś co ma dane przechować (i potem je przekazać dalej albo przekształcić).&lt;/p&gt;&#10;&lt;p&gt;Tak też wyszło, że zebrało się kilka zagadnień związanych z przetwarzaniem tekstu w Pythonie oraz przetwarzaniem (np. poprzez OCR) całych dokumentów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ml-prediction-on-streaming-data-using-kafka-streams-1e4ebd21008"&gt;&lt;strong&gt;ML prediction on streaming data using Kafka Streams&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Najsmaczniejsze kąski w przetwarzaniu danych w czasie rzeczywistym są właśnie takie - jest strumień danych, na nim działają jakieś modele machine learningowe i o czymś decydują. Tutaj dowiesz się jak to zbudować w kilku krokach&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-20</title><link>https://blog.prokulski.science/2022/06/20/newsletter-dane-i-analizy-2022-06-20/</link><pubDate>Mon, 20 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/20/newsletter-dane-i-analizy-2022-06-20/</guid><description>&lt;p&gt;Długi weekend się przedłużył&amp;hellip; ale zgodnie z planem (a nie że &amp;ldquo;melanż poniósł za daleko&amp;rdquo; ;-). Newsletter przygotowany, a (prawie) jednodniowe opóźnienie nie powinno zmienić Waszego stosunku do zawartości. Odrobina tęsknoty (mam nadzieję) nikomu jeszcze nie zaszkodziła.&lt;/p&gt;&#10;&lt;p&gt;Deszcz pada w całym kraju, zapraszam zatem do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/analytics-vidhya/fundamentals-of-mlops-part-4-tracking-with-mlflow-deployment-with-fastapi-61614115436"&gt;&lt;strong&gt;Model Tracking with MLFlow &amp;amp; Deployment with FastAPI&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Fajny tutorial pokazujący jak śledzić wyniki modelu przez MLFlow oraz serwować ten najlepszy przez FastAPI&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-13</title><link>https://blog.prokulski.science/2022/06/13/newsletter-dane-i-analizy-2022-06-13/</link><pubDate>Mon, 13 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/13/newsletter-dane-i-analizy-2022-06-13/</guid><description>&lt;p&gt;Jak być data scientistą w Pythonie?&lt;/p&gt;&#10;&lt;p&gt;import pandas as pd&lt;/p&gt;&#10;&lt;p&gt;i gotowe!&lt;/p&gt;&#10;&lt;p&gt;Żart oczywiście (taki familiadowy, ale kto boomerowi zabroni?), a o samym Pandasie polecam &lt;a href="https://youtu.be/t-8ZIWCRvP0"&gt;wystąpienie Jana Kantego Milczka z PyData w Bydgoszczy&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://eng.uber.com/ubers-real-time-document-check/"&gt;&lt;strong&gt;Uber’s Real-Time Document Check&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak Uber zrobił weryfikację na podstawie dokumentów typu dowód osobisty?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/intro-to-mlops-using-amazon-sagemaker-5a43b9161fa"&gt;&lt;strong&gt;Intro to MLOps Using Amazon SageMaker&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Co to MLOps i jak SageMaker pomaga? A chyba pomaga, skoro to najpopularniejsze tego typu narzędzie (tak przynajmniej wynika z case studies pokazywanych na konferencjach)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-06</title><link>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</link><pubDate>Mon, 06 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</guid><description>&lt;p&gt;W tym tygodniu sporo rozwiązań big data&amp;rsquo;owych i ciekawostek ogólnie związanych z przetwarzaniem danych.&lt;/p&gt;&#10;&lt;p&gt;Ale jeśli interesuje Cię coś bardziej &amp;ldquo;biznesowego&amp;rdquo;, w szczególności jak &lt;em&gt;projektuje się produkty&lt;/em&gt; to gorąco polecam rozmowę z Marcinem Zarembą o projektowaniu autobookingu w Dobrym Mechaniku oraz dodatkowo &lt;a href="https://marcinzaremba.pl/2022/05/12/jak-powstawal-autobooking/?utm_source=newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;tekst o tymże&lt;/a&gt; u Marcina na blogu. Świetny case study, serio serio.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-mask-rcnn-net-for-object-detection-in-60-lines-of-code-9b6bbff292c3"&gt;&lt;strong&gt;Train Mask R-CNN Net for Object Detection in 60 Lines of Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie obiektów na zdjęciach - jak to działa?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-23</title><link>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</link><pubDate>Mon, 23 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</guid><description>&lt;p&gt;Dzisiaj delikatnie więcej tematów bliższych &lt;em&gt;biznesowi&lt;/em&gt; niż IT - mierniki, jakość, zaangażowanie w pracę (to polecam każdemu). &lt;a href="https://prokulski.science"&gt;Dane i Analizy&lt;/a&gt; to też consulting tego typu rozwiązań - jeśli trzeba to zapraszam do kontaktu&lt;/p&gt;&#10;&lt;p&gt;Są też standardowo poradniki związane głównie z Pythonem i Big Data, ale znajdzie się też coś dla chcących zacząć poważniej pisać w Javie&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/greenlit-using-gpt-j-with-multi-task-learning-to-create-new-screenplays-54a2d04f761c"&gt;&lt;strong&gt;GreenLIT: Using GPT-J to Create Screenplays&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy sztuczna inteligencja może pisać scenariusze filmowe?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-xgboost-models-in-amazon-sagemaker-in-4-simple-steps-4eb3e104ee61"&gt;&lt;strong&gt;Train XGBoost Models in Amazon SageMaker in 4 Simple Steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak wykorzysać Amazon SageMaker do trenowania modeli w chmurze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-09</title><link>https://blog.prokulski.science/2022/05/09/newsletter-dane-i-analizy-2022-05-09/</link><pubDate>Mon, 09 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/09/newsletter-dane-i-analizy-2022-05-09/</guid><description>&lt;p&gt;Dzisiaj mamy fajną paczkę tekstów o hiperparametrach, skalowaniu cech i innych rzeczach związanych z uczeniem maszynowym i &lt;em&gt;podkręcaniem&lt;/em&gt; modeli. Tradycyjnie też kształcimy i rozwijamy się nieco w Pythonie.&lt;/p&gt;&#10;&lt;p&gt;W bardziej zaawansowanych tematach coś, czym firma &lt;a href="https://prokulski.science/"&gt;Dane i Analizy&lt;/a&gt; zajmuje się na co dzień: inżynieria danych, przepływy głównie z wykorzystaniem Apache Kafka czy też projektowanie architektury zbliżonej do tej którą wykorzystuje Airbnb.&lt;/p&gt;&#10;&lt;p&gt;Polecam też nową inicjatywę Krzysztofa Sopyły - Podcast Biznes AI. Zapowiada się dobrze, powodzenia Krzysiek!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-02</title><link>https://blog.prokulski.science/2022/05/02/newsletter-dane-i-analizy-2022-05-02/</link><pubDate>Mon, 02 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/02/newsletter-dane-i-analizy-2022-05-02/</guid><description>&lt;p&gt;Dzisiaj wielkie święto. I nie chodzi o święto flagi, a o nowy post na blogu. Minął prawie rok od poprzedniego, więc dzień ten zasługuje na miano święta ;-)&lt;/p&gt;&#10;&lt;p&gt;Rozproszona architektura, mikroserwisy i baza nosql - taka armata na zwykły sklep internetowy? Tak! Z wyjaśnieniem dlaczego i przykładami w Pythonie! Właśnie to znajdziecie w moim wpisie &lt;a href="../../2022/04/26/sklep-rozproszony/?utm_source=dia_nlt"&gt;&lt;strong&gt;Sklep rozproszony&lt;/strong&gt;&lt;/a&gt;. To zrobiony w kilka dni &lt;em&gt;proof of concept&lt;/em&gt; działania nowoczesnej architektury w dość prostym problemie. Zapraszam do lektury.&lt;/p&gt;</description></item><item><title>Sklep rozproszony</title><link>https://blog.prokulski.science/2022/04/26/sklep-rozproszony/</link><pubDate>Tue, 26 Apr 2022 12:52:17 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/26/sklep-rozproszony/</guid><description>&lt;p&gt;Od kilku lat zajmuję się przede wszystkim wymyślaniem &lt;em&gt;jak coś ma działać&lt;/em&gt;, opisywaniem tego i oddawaniem do zespołu developerskiego. Głównie są to rzeczy związane z real-time’owym działaniem systemów wszelakich. I dzisiaj przykład takiego działania. Dodatkowo - próbowałem napisać kod tak, żeby był łatwy do rozbudowy.&lt;/p&gt;&#10;&lt;h2 id="o-co-chodzi"&gt;O co chodzi?&lt;/h2&gt;&#10;&lt;p&gt;Zbudujemy coś na kształt prostego sklepu internetowego. Całość będzie zbudowana w nowoczesny (a przynajmniej tak się mówi na konferencjach, a jest to właściwie &lt;em&gt;jedyny słuszny&lt;/em&gt;) sposób, komponenty będą od siebie niezależne, a kod w zamyśle ma wspierać taką niezależność.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-04</title><link>https://blog.prokulski.science/2022/04/04/newsletter-dane-i-analizy-2022-04-04/</link><pubDate>Mon, 04 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/04/newsletter-dane-i-analizy-2022-04-04/</guid><description>&lt;p&gt;Dzisiaj skupiamy się na Kafce i innych kolejkach (MQTT, Redis). Trochę też o długu technologicznym (i nie tylko) oraz wytłumaczenie o co chodzi z tymi &lt;em&gt;@property&lt;/em&gt; czy &lt;em&gt;@staticmethod&lt;/em&gt; w Pythonie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/machine-learning-pipeline-with-ploomber-pycaret-and-mlflow-db6e76ee8a10"&gt;&lt;strong&gt;Machine Learning Pipeline with Ploomber, PyCaret and MLFlow&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Cały &amp;ldquo;rurociąg&amp;rdquo; związany z uczeniem maszynowym, od początku do końca, od czyszczenia danychy do uczenia modeli&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/machine-learning-rules-of-thumb-b50232b4b2f8"&gt;&lt;strong&gt;Machine Learning Rules of Thumb&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Po co wymyślać koło od początku skoro jest kilka dobrych i sprawdzonych sposobów na pierwsze kroki w przygotowywaniu modelu ML?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-28</title><link>https://blog.prokulski.science/2022/03/28/newsletter-dane-i-analizy-2022-03-28/</link><pubDate>Mon, 28 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/28/newsletter-dane-i-analizy-2022-03-28/</guid><description>&lt;p&gt;Połowa dzisiejszych materiałów to konkretne projekty związane z danymi. Albo wyciąganie informacji z rachunków z przejazdy Uberem, albo realtime&amp;rsquo;owe wizualizacje tego co co się zmienia w Wikipedii, albo big data w Big Query. Plus raport Stanford AI Index Report&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/artefact-engineering-and-data-science/is-facebook-prophet-suited-for-doing-good-predictions-in-a-real-world-project-44be1fe4ce91"&gt;&lt;strong&gt;Is Facebook Prophet suited for doing good predictions in a real-world project?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak biblioteka Prophet do prognozowania szeregów czasowych sprawdza się w realnych zastosowaniach?&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@ali.soleymani.co/stop-using-random-forest-feature-importances-take-this-intuitive-approach-instead-4335205b933f"&gt;&lt;strong&gt;Stop using random forest feature importances&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Skąd wiecie, że dana cecha jest istona w Waszym modelu? &amp;ldquo;feature importances&amp;rdquo; z lasów losowych ma pewne niedociąnięcia o których warto wiedzieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-21</title><link>https://blog.prokulski.science/2022/03/21/newsletter-dane-i-analizy-2022-03-21/</link><pubDate>Mon, 21 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/21/newsletter-dane-i-analizy-2022-03-21/</guid><description>&lt;p&gt;Podoba nie rozpieszcza, nie ma czasu na pisanie. Mam nadzieję, że znajdziecie czas na czytanie :)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2022/03/end-to-end-hotel-booking-cancellation-machine-learning-model/"&gt;&lt;strong&gt;End-to-End Hotel Booking Cancellation Machine Learning Model&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy gość przyjedzie do naszego pokoju hotelowego czy nie przyjedzie? Jak buduje się modele, które potrafią odpowiedzieć na takie pytania? Znajomity tutorial&lt;/p&gt;&#10;&lt;h3 id="big_data"&gt;#big_data&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mherzog01.medium.com/a-spark-streaming-pipeline-with-microservices-c2cfc42dda9f"&gt;&lt;strong&gt;A Spark Streaming pipeline with microservices&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Spark, Kafka i uczenie maszynowe w tle - takie projekty lubimy!&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://selectfrom.dev/querying-kafka-topics-using-presto-5f1bb915a918"&gt;&lt;strong&gt;Querying Kafka Topics Using Presto&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A gdyby tak pytać topików kafkowych tak jak bazę danych?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-07</title><link>https://blog.prokulski.science/2022/03/07/newsletter-dane-i-analizy-2022-03-07/</link><pubDate>Mon, 07 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/07/newsletter-dane-i-analizy-2022-03-07/</guid><description>&lt;p&gt;Dzisiaj świetne teksty o feature selection czy projektowaniu i rozwijaniu API. O API to nawet komiks mamy :)&lt;/p&gt;&#10;&lt;p&gt;Przypominam też, że za chwilę (11 marca) startuje &lt;strong&gt;CuValley Hack&lt;/strong&gt; - hackathon, który organizowany jest przez #KGHM w ramach programu #DolinaMiedziowa.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cuvalley.com"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/cuvalley_900x500.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Uczestnicy skupią się na analizie danych oraz wykorzystaniu AI/ML w układach automatyki przemysłowej. Co Was czeka?&lt;br&gt;&#10;3 zadania i 120 000 PLN do wygrania! 40h kodowania tysiące dostępnych danych webinary, Keynote Speakerzy i duża dawka wiedzy&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-21</title><link>https://blog.prokulski.science/2022/02/21/newsletter-dane-i-analizy-2022-02-21/</link><pubDate>Mon, 21 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/21/newsletter-dane-i-analizy-2022-02-21/</guid><description>&lt;p&gt;Dzisiaj sporo rzeczy związanych z Wordle - bo to jest świetny poligon doświadczalny na analizę danych i kombinatorykę, ale też ciekawe są wyniki tego jak ludzie grają w tę grę (poniżej link do artykułu na ten temat).&lt;/p&gt;&#10;&lt;p&gt;Świetny jest też tekst Maćka &lt;a href="https://wiadrodanych.pl/bazy-danych/elasticsearch/jak-wykryc-phishing/"&gt;Jak wykryć phishing&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Dla początkujących adeptów Pythona kilka solidnych podstaw - warto prześledzić wszystko z dzisiejszej sekcji &lt;strong&gt;#python_junior&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/bentoml-create-an-ml-powered-prediction-service-in-minutes-23d135d6ca76"&gt;&lt;strong&gt;Create an ML Powered Prediction Service in Minutes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Prosty i szybki sposób na umieszczanie modeli machine learningowych na produkcji&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-14</title><link>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</link><pubDate>Mon, 14 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</guid><description>&lt;p&gt;Dzisiaj coś trudniejszego niż MNIST oraz ściągawka z algorytmów grupowania elementów (clustering). Do tego ciekawy projekt wizualizacji danych z meczów piłki nożnej.&lt;/p&gt;&#10;&lt;p&gt;A jeśli myślisz o projektowaniu systemów a nie tylko o samej analizie danych to wykład Sławka Sobótki o Domain Driven Design powinien Cię uradować.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-google-cloud-machine-learning-apis-programmatically-in-python-part-1-430f608af6a5"&gt;&lt;strong&gt;Using Google Cloud Machine Learning APIs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak korzystać z interfejsów machine learning API od Google w Pythonie? Część pierwsza cyklu&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-fastai-to-classify-japanese-kanji-characters-47d7edd4d569"&gt;&lt;strong&gt;Using FastAI to classify Japanese kanji characters&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie pisanych ręcznie cyfr - czyli zbiór MNIST - to może być zbyt prosty problem dla adeptów sztuki nauki o danych&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-31</title><link>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</link><pubDate>Mon, 31 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</guid><description>&lt;p&gt;Dzisiaj &lt;em&gt;odcinek&lt;/em&gt; dość pythonowy, ale za to z obszernym tekstem o tworzeniu modeli w R - cały proces opisany po kolei. Polecam!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.pinecone.io/learn/nlp/?utm_medium=link&amp;amp;utm_source=data-elixir&amp;amp;utm_campaign=sponsored"&gt;&lt;strong&gt;Natural Language Processing (NLP) for Semantic Search&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Duża pozycja, która wprowadza w świat NLP&lt;/p&gt;&#10;&lt;h3 id="ciekawostki"&gt;#ciekawostki&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://opendatascience.com/what-does-a-data-driven-government-look-like/"&gt;&lt;strong&gt;What Does a Data-Driven Government Look Like?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Teoretycznie więcej danych to lepsze decyzje. Czy zarządzanie maistem albo państwem jest możliwe w oparciu o dane? Jak może to wyglądać?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ai-geospatial-wildfire-risk-prediction-8c6b1d415eb4"&gt;&lt;strong&gt;AI Geospatial Wildfire Risk Prediction&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przewidywanie zdarzeń związanych z geografią - pogoda, pożary - ciekawe zagadanienie, a często pomijane przy np. poradnikach ML.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-24</title><link>https://blog.prokulski.science/2022/01/24/newsletter-dane-i-analizy-2022-01-24/</link><pubDate>Mon, 24 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/24/newsletter-dane-i-analizy-2022-01-24/</guid><description>&lt;p&gt;W ostatnim tygodniu na sile przybrała moda na &lt;strong&gt;Wordle&lt;/strong&gt;. Co to? To taka gra podobna do znanego od lat &amp;lsquo;70 XX wieku &lt;a href="https://pl.wikipedia.org/wiki/Mastermind_(gra_planszowa)"&gt;Masterminda&lt;/a&gt;. Trzeba w 6 ruchach odgadnąć sześcioliterowe słowo. Jedyne podpowiedzi to kolor:&lt;br&gt;&#10;zielony = odpowiednia litera stoi w odpowiednim miejscu, żółty = odpowiednia litera stoi na złym miejscu, czarny = &lt;em&gt;to zła litera jest&lt;/em&gt; (parafrazując pewnego aktora z pewnego filmu).&lt;/p&gt;&#10;&lt;p&gt;Gra w wersji oryginalnej (angielskiej) dostępna jest &lt;a href="https://www.powerlanguage.co.uk/wordle/"&gt;tej na stronie&lt;/a&gt;. Oczywiście jest też wersja z &lt;a href="https://literalnie.fun/"&gt;polskimi słowami&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-10</title><link>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</link><pubDate>Mon, 10 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</guid><description>&lt;p&gt;Koniec przerw świątecznych, koniec długich weekendów, czas wracać do pracy.&lt;/p&gt;&#10;&lt;p&gt;Dla mnie osobiście rok zaczął się zabawą z Raspberry Pi i próbwaniem co to cudo potrafi. Nigdzie nie ma Raspberry Pi 4, więc zadowoliłem się na start Pi Zero. Mały, ale wariat - używam do PiHole oraz staram się podglądać co robi w nocy kot. Jak? A no tym prostym &lt;a href="https://github.com/prokulski/rasppi_motion_capture/blob/main/main.py"&gt;skryptem&lt;/a&gt; i kamerką podłączoną po USB.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/11-dimensionality-reduction-techniques-you-should-know-in-2021-dcb9500d388b"&gt;&lt;strong&gt;11 Dimensionality reduction techniques you should know in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;11 metod na redukcję rozmiarów Twoich danych. Ale zmniejszenie wielkości to nie jedyne zastosowanie - przy redukcji wymiarów często odsłaniają się ukryte informacje&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-20</title><link>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</link><pubDate>Mon, 20 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</guid><description>&lt;p&gt;To ostatni numer newslettera&amp;hellip; przed Bożym Narodzeniem.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym przede wszystkim życzę Ci spokoju, spędzenia mile czasu z najbliższymi, odpoczynku (też od komputerów) i jeszcze raz pieniędzy.&lt;/p&gt;&#10;&lt;p&gt;Do życzeń dołączam pythonową choinkę:&lt;/p&gt;&#10;&lt;p&gt;def holidaybush(n):&lt;br&gt;&#10;    for i in range(n):&lt;br&gt;&#10;        print((&amp;quot;+&amp;quot; * (i * 2 + 1)).center(n * 2 - 1))&lt;br&gt;&#10;    print(&amp;quot;+++&amp;quot;.center(n * 2 - 1))&lt;/p&gt;&#10;&lt;p&gt;holidaybush(15)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://glassboxmedicine.com/2019/09/15/best-use-of-train-val-test-splits-with-tips-for-medical-data/"&gt;&lt;strong&gt;Best Use of Train/Val/Test Splits, with Tips for Medical Data&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Modele, uczenie, dane treningowe, testowe, walidacyjne&amp;hellip; ale właściwie dlaczego tak?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-06</title><link>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</link><pubDate>Mon, 06 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</guid><description>&lt;p&gt;Na Mikołajki przegląd internetu pod kątem danych, ich analiz i sposobów programowania oraz wdrażania zaprogramowanych rozwiązań.&lt;br&gt;&#10;Najciekawszym dla początkujących będzie pewnie zbiór ponad 200 tekstów zgromadzonych w jednym miejscu na różne tematy związane z machine learingiem (to prawdę mówiąc trochę jak &lt;a href="https://thecleverprogrammer.com/machine-learning/"&gt;spis treści jednego bloga&lt;/a&gt;), a bardziej doświadczeni dowiedzą się jak połączyć C++ z Pythonem. Są też ciekawe teksty o R (i Shiny), co się ostatnio dość rzadko zdarzało.&lt;/p&gt;&#10;&lt;p&gt;Skoro jesteśmy przy R - w piątek (10 grudnia) zaś konferencja &lt;strong&gt;WhyR?&lt;/strong&gt; - rezerwujcie sobie czas, bo materiału sporo (co widać po zaplanowanych streamingach na YouTube). Więcej szczegółów na stronie imprezy &lt;a href="https://2021.whyr.pl/"&gt;2021.whyr.pl&lt;/a&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-25</title><link>https://blog.prokulski.science/2021/10/25/newsletter-dane-i-analizy-2021-10-25/</link><pubDate>Mon, 25 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/25/newsletter-dane-i-analizy-2021-10-25/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/optimize-ml-modeling-using-a-timing-decorator-2b113c6b60d9"&gt;&lt;strong&gt;Optimize ML modeling using a timing decorator&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Record the execution time of ML training using timing decorators and use it for productive data science and ML optimization Image source : Pixabay (Free to use) Why measuring time is important We can go on and provide hundreds of arguments and quotes showing why the act of measurement is important in science and technology. Here is a powerful one, One accurate measurement is worth a thousand (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-23</title><link>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</link><pubDate>Sat, 23 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</guid><description>&lt;p&gt;&lt;a href="https://preettheman.medium.com/best-front-end-python-frameworks-in-2021-643d1df6922c"&gt;&lt;strong&gt;Best front-end Python frameworks in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Welcome back! Python is an awesome programming language with a ton of capability, one of these functions is building GUI’s (front-ends), so let’s talk about some of my favorite front-ends frameworks for Python. Now, Python is an awesome language for web development as well, if you want to see some sample websites you can build with Python, check out this article below: Let’s take a look at some (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-27</title><link>https://blog.prokulski.science/2021/09/27/newsletter-dane-i-analizy-2021-09-27/</link><pubDate>Mon, 27 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/27/newsletter-dane-i-analizy-2021-09-27/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/t-sne-machine-learning-algorithm-a-great-tool-for-dimensionality-reduction-in-python-ec01552f1a1e?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;t-SNE Machine Learning Algorithm — A Great Tool for Dimensionality Reduction in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning t-SNE Machine Learning Algorithm — A Great Tool for Dimensionality Reduction in Python How to use t-Distributed Stochastic Neighbor Embedding (t-SNE) to visualize high-dimensionality data? t-SNE visualization with different perplexities. Gif image by  author . Intro A successful data scientist understands a wide range of Machine Learning algorithms and can explain the results to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-28</title><link>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</link><pubDate>Mon, 28 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</guid><description>&lt;p&gt;&lt;a href="https://erdavis.com/2021/06/26/average-colors-of-the-world/"&gt;&lt;strong&gt;Average colors of the world&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;I wrote that I wanted to expand creatively beyond maps in 2021, but here we are, halfway in, and half my posts are maps. In my defense, I made these last year and just haven’t gotten around to posting them yet! They’ve been sitting in a folder since December, mocking me. It’s time to get […]&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/4-tricks-to-use-python-f-strings-more-efficiently-4f389e890514?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;4 Tricks to Use Python F-strings More Efficiently&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Have full control over what you print out. String interpolation is a way to embed variables into strings. It makes it easy to manipulate and enrich strings. Thus, the print statements are much more powerful with string interpolation. Formatted string literals, also known as f-strings, are a highly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-21</title><link>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</link><pubDate>Mon, 21 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</guid><description>&lt;p&gt;&lt;a href="https://jellyfish.tech/implementation-of-common-design-patterns-in-python/"&gt;&lt;strong&gt;Implementation of Top Design Patterns in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;*according to developer &amp;amp; software architect with 9+ years of experience&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/a-hands-on-demo-of-analyzing-big-data-with-spark-68cb6600a295?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A hands-on demo of analyzing big data with Spark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Scan a novel, calculate pi, and run regression on 50 million rows Conclusions This post was a deep dive on using Spark to process big data. We started with an overview of distributed computing before counting the frequency of each letter in Dostoyevsky’s War and Peace , estimating π with randomly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-07</title><link>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</link><pubDate>Mon, 07 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/3-examples-that-show-the-unlimited-flexibility-of-pyspark-319ab22d5a?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;3 Examples That Show The Unlimited Flexibility of PySpark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A combination of Python and SQL but easier than both Spark is an analytics engine used for large-scale data processing. It lets you spread both data and computations over clusters to achieve a substantial performance increase. It is easier than ever to collect, transfer, and store data. Hence, we (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cmdlinetips.com/2021/06/row-wise-operations-in-r/"&gt;&lt;strong&gt;Row-wise operations in R: compute row means in tidyverse&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial shows how to perform row-wise operations in R using tidyverse. We will use three key functions, rowwise(), c_across() and rowMeans() to perform to perform row-wise operations on a dataframe. rowwise() and c_across() functions are from dplyr. rowwise() function is available in dplyr (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-14</title><link>https://blog.prokulski.science/2021/05/14/newsletter-dane-i-analizy-2021-05-14/</link><pubDate>Fri, 14 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/14/newsletter-dane-i-analizy-2021-05-14/</guid><description>&lt;p&gt;&lt;a href="https://medium.com/swlh/a-modern-set-up-for-python-package-development-f60b27a26bd7"&gt;&lt;strong&gt;A Modern Set-up for Python Package Development&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;From dependency management to quality assurance, documentation, and CI/CD&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://blog.adnansiddiqi.me/create-your-first-sales-dashboard-in-apache-superset/"&gt;&lt;strong&gt;Create your first sales dashboard in Apache Superset&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Superset dashboard tutorial. A step by step guide about how to use Apache Superset to create an interactive e-commerce sales dashboard to track enterprise KPIs. A free and open-source business intelligence tool to create interactive sales dashboard&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://blog.adnansiddiqi.me/getting-started-with-elasticsearch-7-in-python/"&gt;&lt;strong&gt;Getting started with Elasticsearch 7 in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Learn the basics of Elasticsearch 7.x, its setup, and implementation in Python.&lt;/p&gt;</description></item></channel></rss>