<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Spark on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/spark/</link><description>Recent content in Spark on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 25 May 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/spark/index.xml" rel="self" type="application/rss+xml"/><item><title>Czy AI Slop zaleje sieć? Plus Spark, Kafka i SQL</title><link>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</link><pubDate>Mon, 25 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz ich głębokiej integracji z codziennym workflow inżynierskim.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenty Playwright i protokół MCP automatyzują cykl życia błędu, od wykrycia po zgłoszenie w Jirze, pokazujemy, jak Claude Code i lokalne modele Qwen2.5 zmieniają zasady gry w analizie danych i budowaniu dashboardów, i sprawdzamy, ile &amp;ldquo;śmieciowego&amp;rdquo; AI (slop) faktycznie krąży w sieci i jak to wpływa na jakość informacji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych skupiamy się na wydajności, optymalizacji kosztów i mądrym wyborze silników bazodanowych.&lt;/p&gt;</description></item><item><title>Agenty w produkcji, DuckDB na sterydach i kłamstwa Kubernetesowi</title><link>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</link><pubDate>Mon, 11 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na profesjonalizacji narzędzi AI w codziennej pracy inżynierskiej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak Databricks i Shopify wbudowują agentów AI bezpośrednio w swoje platformy, pokazujemy, dlaczego AI przestaje być dodatkiem, a staje się integralną warstwą systemów, i tłumaczymy zmianę podejścia: od prompt engineeringu do context engineeringu i pracy na głębszych warstwach modeli LLM.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu wracają do gry lekkie, lokalne silniki analityczne.&lt;/p&gt;&#10;&lt;p&gt;Przyglądamy się, jak DuckDB i Polars redefiniują wydajność pracy z danymi na pojedynczej maszynie, pokazujemy, kiedy lokalne przetwarzanie wygrywa z klasycznym podejściem cloud-first, a także wracamy do fundamentów: Kafka i Spark wciąż żyją, ale wymagają konkretnych checklist optymalizacyjnych przy skali produkcyjnej.&lt;/p&gt;</description></item><item><title>Rób produkcyjnie agentów AI, platformy danych i automatyzacje, które naprawdę dowożą</title><link>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</link><pubDate>Mon, 26 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</guid><description>&lt;p&gt;To wydanie to mocny pakiet o tym, jak przestać bawić się w „demka” i zacząć budować produkcyjne systemy danych, AI i automatyzacji – od architektury agentów, przez hurtownie, po niskopoziomowe optymalizacje.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu blok tekstów o agentach AI (platformy, orkiestracja, pamięć, narzędzia, realne case’y typu monitoring w Slacku), który pokazuje, co trzeba dostarczyć, żeby agenci nie wybuchli przy pierwszym większym ruchu. Do tego zestaw materiałów o analityce i data engineeringu: dobre EDA, przetwarzanie danych geograficznych z DuckDB + GeoPandas, kontrakty danych, wzorce ETL/ELT (Snowflake + dbt + Airflow, migracja z Airflow do Databricks), patterny pod &lt;em&gt;AI‑ready pipelines&lt;/em&gt; i benchmark DuckDB vs Spark.&lt;/p&gt;</description></item><item><title>Jak ludzie korzystają z AI w pracy?</title><link>https://blog.prokulski.science/2025/12/15/jak-ludzie-korzystaja-z-ai-w-pracy/</link><pubDate>Mon, 15 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/15/jak-ludzie-korzystaja-z-ai-w-pracy/</guid><description>&lt;p&gt;Ten tydzień - ostatni pełny przed świętami - to raczej czas porządków, niż wielkich premier. Choć niektórzy testują, jak naprawdę radzi sobie &lt;a href="https://openai.com/pl-PL/index/introducing-gpt-5-2/"&gt;GTP-5.2&lt;/a&gt; - najnowsze dziecko OpenAI.&lt;br&gt;&#10;Na dziś wystarczy tej dolinokratycznej magii. Przejdźmy do rzeczy, które mają większy sens: praktyka, konkret, zero ściemy (bo po to tu jesteś, nie?).&lt;/p&gt;&#10;&lt;p&gt;W tym numerze skupiamy się na tym, co daje realny efekt. Optymalizacja. Wydajność. Sprytne podejścia do codziennej roboty z danymi. Mamy PostgreSQL i DuckDB w akcji, Parquet na sterydach oraz garść sztuczek w Apache Spark i SQLAlchemy. Dorzucamy integrację DuckDB z Amazon S3 i pomysł na streamingowy ETL bez klasycznych hurtowni - lekko, elastycznie i bez ton konfiguracji.&lt;/p&gt;</description></item><item><title>Sporo "przydasiów" do Linuxa oraz LLMów</title><link>https://blog.prokulski.science/2025/12/01/sporo-przydasiow-do-linuxa-oraz-llmow/</link><pubDate>Mon, 01 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/01/sporo-przydasiow-do-linuxa-oraz-llmow/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach zarządzania danymi i sztuczną inteligencją w środowiskach produkcyjnych. Przedstawiamy kompleksowe podejścia do integracji modeli językowych: orkiestrację wielu LLM za pomocą Spring AI oraz budowę niestandardowych pipeline&amp;rsquo;ów z LangGraph. Znajdziecie również porównanie platform MLOps (MLFlow, Metaflow, Kubeflow).&lt;/p&gt;&#10;&lt;p&gt;W obszarze Big Data i data engineeringu omawiamy kluczowe technologie i wzorce architektoniczne. Delta Lake jako warstwa transakcyjna dla Apache Spark, praktyczne wzorce współpracy zespołowej z DuckDB, dyskusja o przyszłości koncepcji data mesh oraz kompleksowe spojrzenie na ekosystem Big Data – od kolejek wiadomości po HDFS, czyli standardowy stack big data (nota bene - możesz mieć big data w domu - zapraszam do &lt;a href="https://github.com/dane-analizy/big-data-stack"&gt;repo&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Kafka jest szybka, ale użyję Postgres</title><link>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</link><pubDate>Mon, 03 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się rozwiązaniom praktycznym z kilku kluczowych obszarów analizy i przetwarzania danych. Zaczynamy od fuzzy string matching i technik dopasowywania niedoskonałych tekstów, przechodzimy przez architekturę pipeline&amp;rsquo;ów ETL opartych na open source, aż po szczegóły integracji Kafka, Flink i Spark w systemach streamingowych.&lt;/p&gt;&#10;&lt;p&gt;W sekcji Python znajdziesz porównanie nowości w wersjach 3.13 i 3.14, kompleksowy przewodnik (a nawet dwa, aby niejako dopełnić wiedzę) po Pydantic oraz praktyczne wzorce projektowe dla FastAPI. Nie zabraknie też tematów związanych z optymalizacją PostgreSQL w aplikacjach czasu rzeczywistego, zarządzaniem kosztami w chmurze AWS oraz głęboko partycjonowanymi danymi w Apache Spark.&lt;/p&gt;</description></item><item><title>Nie tylko obraz tego, co się dzieje, ale jak to wykorzystać w praktyce</title><link>https://blog.prokulski.science/2025/09/29/nie-tylko-obraz-tego-co-sie-dzieje-ale-jak-to-wykorzystac-w-praktyce/</link><pubDate>Mon, 29 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/29/nie-tylko-obraz-tego-co-sie-dzieje-ale-jak-to-wykorzystac-w-praktyce/</guid><description>&lt;p&gt;Czy kiedykolwiek marzyłeś o tym, żeby skrócić generowanie raportu z 6 godzin do 15 minut? A może zastąpić tradycyjne procesy ETL jednym narzędziem, które działa nawet 100 razy szybciej niż Spark?&lt;/p&gt;&#10;&lt;p&gt;To nie science fiction – to rzeczywistość dzisiejszego numeru!&lt;/p&gt;&#10;&lt;p&gt;Od &lt;strong&gt;agentic AI&lt;/strong&gt;, które rewolucjonizuje kariery specjalistów IT, po konkretne implementacje MCP w firmach CRM – jak zwykle w tym newsletterze nie tylko obraz tego, co się dzieje, ale przede wszystkim &lt;strong&gt;jak to wykorzystać w praktyce&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-02</title><link>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</link><pubDate>Mon, 02 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</guid><description>&lt;p&gt;Ten tydzień przyniósł interesującą mieszankę praktycznych rozwiązań i technologicznych rewolucji. Od monitorowania nocnych maratonów chomików (to ta rewolucja, wiadomo) po architekturę Apache Spark - branża pokazuje, że innowacja kryje się w każdym zakątku.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie ciekawy jest trend odchodzenia od tradycyjnych rozwiązań na rzecz nowoczesnych alternatyw. Na przykład zamiast odpalać joby w cronie można wykorzystać Change Data Capture (CDC), a API-first podejście staje się standardem dla 74% zespołów. Apache Iceberg wygra wojnę formatów tabel, a FastAPI udowadnia, że Python może być równie wydajny co elegancki.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-10</title><link>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</link><pubDate>Mon, 10 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</guid><description>&lt;p&gt;Zanim przejdę do sedna, czyli bieżącego numeru, mam dla Ciebie informację. Otóż za moment będzie dostępny kompleksowy e-book typu &lt;strong&gt;&amp;ldquo;od juniora do mida&amp;rdquo;&lt;/strong&gt;. Książka to projekt, który kompleksowo przeprowadza przez budowę aplikacji - od komunikacji z API, przez bazę danych, aż po konteneryzację. Bez pierdół teoretycznych, za to z mocnym naciskiem na praktykę. Szczegóły już niedługo w oddzielnym mailu, więc trzymajcie się blisko skrzynki odbiorczej!&lt;/p&gt;&#10;&lt;p&gt;A co Cię czeka w tym numerze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-13</title><link>https://blog.prokulski.science/2025/01/13/newsletter-dane-i-analizy-2025-01-13/</link><pubDate>Mon, 13 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/13/newsletter-dane-i-analizy-2025-01-13/</guid><description>&lt;p&gt;Mam dla Ciebie nową porcję ciekawych tekstów, artykułów, zestawień i tutoriali – jak zwykle trochę o Pythonie, trochę o analizie danych, no i oczywiście coś o AI i ML. Ale spokojnie, nie wszystko tutaj to programowanie (chociaż wiadomo, że to nasz główny temat :). Znajdziesz tu materiały dla każdego: od tych, którzy dopiero zaczynają, po treści dla bardziej zaawansowanych.&lt;br&gt;&#10;Oto, co między innymi znajdziesz dzisiaj poniżej:&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Sztuczna inteligencja i uczenie maszynowe&lt;/strong&gt; – rozpocznij rok od 50 najważniejszych materiałów o AI w 2025 roku, dowiedz się, jak zoptymalizować modele takie jak YOLOv8 na małych urządzeniach, i poznaj sposób na tworzenie asystentów AI do analizy rynków surowcowych. A może zainspiruje Cię budowa medycznego chatbota lub wykorzystanie MLFlow w agnostycznym podejściu do zarządzania modelami? &lt;strong&gt;Analiza danych i inżynieria danych&lt;/strong&gt; – zanurz się w zaawansowanych technikach SQL dla niestrukturalnych danych, poznaj tajniki przetwarzania strumieniowego z użyciem Apache Spark, Kafka i Airflow, a także odkryj różnice między Elasticsearch a Apache Doris w analizie danych w czasie rzeczywistym. &lt;strong&gt;Python w praktyce&lt;/strong&gt; – dowiedz się, jak stworzyć system powiadomień z FastAPI, pracować z danymi przestrzennymi za pomocą GeoAlchemy, czy automatycznie generować diagramy architektury z kodu. Tu mała zapowiedź (bo jak się powie publicznie to ciąży taka motywacja &amp;ldquo;przecież obiecałem&amp;rdquo;), niejako przy okazji. Szykuję ebooka, który poprowadzi Cię krok po kroku przez projekt budowy aplikacji w Pythonie. Co więcej, w ebooku zajmiemy się naprawdę praktycznymi zadaniami, które odciążają od nudnej pracy. Wspólnie stworzymy dwie aplikacje, ucząc się po drodze, jak wykorzystywać usługi sieciowe, jak działać z bazami danych, i jak efektywnie wyświetlać zapisane dane. A żeby było co wyświetlać – sami stworzymy bazę danych, do której będziemy dodawać informacje! Ciekawe? Więcej szczegółów być może już za tydzień. Wypatruj! &lt;strong&gt;Bezpieczeństwo i ciekawostki&lt;/strong&gt; – przeanalizuj globalne statystyki dotyczące otwartego portu 80, odkryj sposoby, w jakie Uber oszczędza czas dzięki Text-to-SQL, i sprawdź, jak korzystać z YouTube prosto z terminala. Inne inspiracje – od katalogów danych i ich obserwowalności po trendy marketingowe według TikToka – każdy znajdzie coś dla siebie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-01</title><link>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</link><pubDate>Mon, 01 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</guid><description>&lt;p&gt;Razem z początkiem lipca zwykle w mediach rozpoczyna się sezon ogórkowy. Upały dają się we znaki, &lt;em&gt;żar leje się z nieba&lt;/em&gt; (pozdrawiamy fanów &amp;ldquo;Hydrozagadki&amp;rdquo; oraz Asa!), jedyne o czym chce się myśleć to schłodzone napoje i leżenie w basenie.&lt;/p&gt;&#10;&lt;p&gt;Ale mimo tych przeciwności losu przed Wami kolejna porcja wiedzy w postaci ręcznie wybranych najlepszych tekstów o AI i ML plus okolicach związanych z przetwarzaniem danych jakie przewinęły się przez cały tydzień w różnych mediach czy też innych newsletterach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-27</title><link>https://blog.prokulski.science/2024/05/27/newsletter-dane-i-analizy-2024-05-27/</link><pubDate>Mon, 27 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/27/newsletter-dane-i-analizy-2024-05-27/</guid><description>&lt;p&gt;Dzisiaj krótko, bo tydzień krótszy i &amp;ldquo;nie ma czasu załadować taczek&amp;rdquo;. Może tak lepiej?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@busariajibola2001/customer-segmentation-rfm-analysis-de72f7385bf3"&gt;&lt;strong&gt;Customer Segmentation&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza RFM (Recency, Frequency and Monetary) wykorzystana do segmentacji klientów. Bardziej opis niż zajęcia praktyczne, a praktyka podana w excelu&lt;/p&gt;&#10;&lt;h3 id="architektura"&gt;#architektura&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@vutrinh274/how-twitter-processes-4-billion-events-in-real-time-daily-942db8f7d7b5"&gt;&lt;strong&gt;How Twitter processes 4 billion events in real-time daily&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Od architektury Lambda do Kappa&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pathtosenior.substack.com/p/3-reasons-why-you-might-want-to-use?sd=pf"&gt;&lt;strong&gt;3 Reasons Why You Might Want to Use Monolith Instead of Microservice&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czyżby odwrót od podejścia mikroserwisowego? A może tylko kilka szczególnych przypadków?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-13</title><link>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</link><pubDate>Mon, 13 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</guid><description>&lt;p&gt;Za chwilę w świat pójdą pierwsze odcinki nowego podcastu przygotowanego przez zespół Big Data &amp;amp; AI PZU: &lt;strong&gt;#SilniwIT o technologiach&lt;/strong&gt;. To seria, w ramach której rozmawiam (wspólnie z Tomkiem z zespołu Fabryki Sztucznej Inteligencji) z gośćmi o szeroko pojętej sztucznej inteligencji. Wypatrujcie postów na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;FB&lt;/a&gt;, &lt;a href="https://www.linkedin.com/company/daneianalizy/"&gt;LinkedIn&lt;/a&gt; i pewnie w przyszłym newsletterze - mam nadzieję, że jak na amatorów - daliśmy radę. Staraliśmy się ucinać korpo-gadkę, powinno być interesująco ;-)&lt;/p&gt;&#10;&lt;p&gt;Wcześniej możecie posłuchać podsumowania z pierwszej konferencji OpenAI (firmy, która stworzyła ChatGPT) dla developerów w podcaście &lt;a href="https://podcasters.spotify.com/pod/show/artur-kurasinski/episodes/Podsumowanie-OpenAI-DevDay-2023-e2bles4"&gt;Technofobia&lt;/a&gt; Artura Kurasińskiego.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-16</title><link>https://blog.prokulski.science/2023/10/16/newsletter-dane-i-analizy-2023-10-16/</link><pubDate>Mon, 16 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/16/newsletter-dane-i-analizy-2023-10-16/</guid><description>&lt;p&gt;Dzisiaj dwa raporty o AI. Pierwszy to bardziej zbiór krótkich esejów&amp;hellip; gdzie prawie każdy prowadzi do rozbudowanego notebooka z szerszym komentarzem, wykresami i - jak to w Kaggle bywa - kodem. W Kaggle, bo to &lt;a href="https://www.kaggle.com/AI-Report-2023"&gt;&lt;strong&gt;AI Report 2023&lt;/strong&gt;&lt;/a&gt; od Kaggle właśnie.&lt;/p&gt;&#10;&lt;p&gt;Drugi raport to State of &lt;a href="https://www.stateof.ai/"&gt;&lt;strong&gt;AI Report 2023&lt;/strong&gt;&lt;/a&gt; od Air Street Capital. To opublikowany już szósty raz roczny raport o stanie sztucznej inteligencji. Ponad 160 stron, obejmujących:&lt;/p&gt;&#10;&lt;p&gt;Badania: Przełomy technologiczne i ich możliwości Przemysł: Obszary komercyjnego zastosowania sztucznej inteligencji i jej wpływ na biznes Polityka: regulacje dotyczące sztucznej inteligencji, jej implikacje gospodarcze i ewoluująca geopolityka sztucznej inteligencji Bezpieczeństwo: identyfikacja i łagodzenie katastrofalnych zagrożeń, jakie mogą dla nas stanowić przyszłe wysoce wydajne systemy sztucznej inteligencji Prognozy: to, w co wierzymy, że się wydarzy, oraz przegląd wyników, aby zachować uczciwość&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-08-14</title><link>https://blog.prokulski.science/2023/08/08/newsletter-dane-i-analizy-2023-08-14/</link><pubDate>Tue, 08 Aug 2023 00:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/08/08/newsletter-dane-i-analizy-2023-08-14/</guid><description>&lt;p&gt;Na początek &lt;a href="https://youtu.be/NwiI4y8PC9g"&gt;tutorial&lt;/a&gt; (YT, 30 minut, po polsku), tym razem z LLMami w roli głównej - o tym jak zbudować chatbota odpowiadającego na pytania z własnej bazy wiedzy. Bardzo fajny materiał, takich trochę brakuje - chłopaki opowiadają o tych najbardziej kluczowych kawałkach kodu a nie o podstawach. Rozumiesz o czym jest mowa, nie ma straty czasu na opowiadanie co do jest model albo funkcja w Pythonie ;-)&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj też &lt;a href="https://levelup.gitconnected.com/mlops-mastering-machine-learning-deployment-an-intro-to-docker-kubernetes-helm-and-modern-web-b14dd140a9bf"&gt;pelny proces MLOps&lt;/a&gt; - wprowadzenie zawierające wszystkie elementy. Super tekst na początek dla każdego DevOpsa który chce się zająć tematami ML oraz każdego data scientisty, który chce umieć nowocześnie wdrażać swoje modele.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-03</title><link>https://blog.prokulski.science/2023/07/03/newsletter-dane-i-analizy-2023-07-03/</link><pubDate>Mon, 03 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/03/newsletter-dane-i-analizy-2023-07-03/</guid><description>&lt;p&gt;Wzorce projektowe ułatwiają pracę. Kod jest bardziej czytelny, łatwiej go rozbudować i nie trzeba przebudowywać całej aplikacji. Tych wzorców jest bardzo dużo, możesz zacząć od &amp;ldquo;top 10&amp;rdquo; opisanych w artykule &lt;a href="https://pub.towardsai.net/10-underrated-software-patterns-every-ml-engineer-should-know-92e702b96407"&gt;&amp;ldquo;10 Underrated Software Patterns Every ML Engineer Should Know&amp;rdquo;&lt;/a&gt;, który patrzy na wzorce projektowe przez pryzmat projektów machine learning.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zaś potrzebujesz przykładu kodu to dobre wprowadzenie daje tekst &lt;a href="https://python.plainenglish.io/structural-design-patterns-a-comprehensive-guide-for-developers-c0cde4a86319"&gt;&amp;ldquo;Structural Design Patterns: A Comprehensive Guide for Developers&amp;rdquo;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Największą jednak i darmową bazą, obejmującą kilka języków (angielski, niemiecki, polski też&amp;hellip; a nie! - o języki programowania chodzi: C#, C++, Go, Java, PHP, Python, Ruby, Rust, Swift oraz TypeScript) jest strona &lt;a href="https://refactoring.guru/pl/design-patterns/"&gt;&lt;strong&gt;Refactoring.Guru&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-26</title><link>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</link><pubDate>Mon, 26 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</guid><description>&lt;p&gt;Rozpoczynamy pierwszy tydzień wakacji, ale to wcale nie oznacza, że newsletter ma urlop. Wręcz przeciwnie.&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym wydaniu kilka tekstów opisujących dobre praktyki i całe cykle tutorialowe: CRUD-woe API dla MongoDB czy też asynchroniczne mikroserwisy spięte Rabbitem. To dla tych średniozaawansowanych programistów (i tych, którzy chcą swoją wiedzę przenieść z poziomu juniorskiego na wyższy). Dla tych bardziej juniorów - korepetycje z Window Functions w SQLu i &amp;ldquo;rozpakowywujących&amp;rdquo; gwiazdek w Pythonie (mimo że to nie Gwiazdka, he he, zacny suchar).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-05</title><link>https://blog.prokulski.science/2023/06/05/newsletter-dane-i-analizy-2023-06-05/</link><pubDate>Mon, 05 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/05/newsletter-dane-i-analizy-2023-06-05/</guid><description>&lt;p&gt;Czy ChatGPT może nauczyć Cię data science? Czy czas mentorów się kończy?&lt;/p&gt;&#10;&lt;p&gt;Raczej nie &amp;ldquo;włoży&amp;rdquo; do Twojej głowy wiedzy, ale może pokazać kierunki, w których warto podążać w poszukiwaniu kolejnych elementów wiedzy. Może też odpowiedzieć na pytania, podać gotowe rozwiązania (chociażby w postaci fragmentów kodu). O tym mówi &lt;a href="https://pub.towardsai.net/supercharge-your-skills-with-chatgpt-to-get-a-head-99-of-data-scientist-b03a566d4ad#8338"&gt;ten tekst&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Ale czy to, że mamy takie narzędzia dostępne na wyciągnięcie ręki sprawi, że staniemy się mądrzejsi? Dzisiaj dział ChatGPT dość obfity - chyba uczymy się powoli wykorzystywać to narzędzie w różnych zastosowaniach, po prostu w swojej pracy.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-29</title><link>https://blog.prokulski.science/2023/05/29/newsletter-dane-i-analizy-2023-05-29/</link><pubDate>Mon, 29 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/29/newsletter-dane-i-analizy-2023-05-29/</guid><description>&lt;p&gt;Dość przekrojowo dzisiaj.&lt;/p&gt;&#10;&lt;p&gt;Najciekasze według mnie tekstu to ten o sensownym nadawaniu gwiazdek produktom (ile razy filtrowaliście produkty w sklepie internetowym przed kupnem po najlepszej ocenie i okazywało się, że z &amp;ldquo;piątką&amp;rdquo; jest tylko jeden?), ten o SoftMax (nie przeraź się równaniami na początku, chociaż może podstawy matematyczne są akutat dla Ciebie cenne?).&lt;/p&gt;&#10;&lt;p&gt;Bardzo dajny jest też dział Python - od rzeczy prostych typu wiele wykresów na jednym obrazku do modelu (no&amp;hellip;) informującego o tym że akcje należy kupić albo sprzedać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-08</title><link>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</link><pubDate>Mon, 08 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</guid><description>&lt;p&gt;Majówka, majówka i po majówce. Wypoczęci? Ja zwiedziłem z rodziną Trójmiasto, jestem zadowolony i o to właściwie w wypoczynku chodzi. Tylko dlaczego tak wieje nad morzem?&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym odcinku zaś szczególnie polecam książkę Françoisa Fleureta &lt;a href="https://fleuret.org/francois/"&gt;&lt;strong&gt;The Little Book of Deep Learning&lt;/strong&gt;&lt;/a&gt; - sporo teorii o tym jak działa głębokie uczenie, różne typy warstw i w ogóle na czym ta cała sztuczna inteligencja polega. Książka wygląda na przyciętą formatem do ekranu telefonu - przyznam, że to interesujący pomysł (ale już go znamy z chociażby [reklama] &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;Kart Data Science&lt;/strong&gt;&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-20</title><link>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</link><pubDate>Mon, 20 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</guid><description>&lt;p&gt;Wiecie kto generuje najwięcej ruchu w internecie? Kiedyś to było porno i torrenty (albo inne sposoby wymiany plików peer-to-peer). Teraz układ wygląda jak na poniższym obrazku, przynajmniej według danych &lt;a href="https://www.statista.com/chart/15692/distribution-of-global-downstream-traffic/"&gt;opublikowanych&lt;/a&gt; przez serwis Statista.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://prokulski.science/temp/static/nlt/global_internet_traffic.jpeg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj bardzo dużo treści - oraz eksperyment - polskie tytuły (ale przeważnie angielskie teksty). Wśród tych tekstów sporo o Apache Spark i konkretnych wykorzystaniach albo rozwiązaniach konkretnych problemów.&lt;br&gt;&#10;Znajdziecie też kilka fajnych tekstów o różnego typu problemach rozwiązywanych przez analizę czy modele danych (rekomendacje w Netflixie, OHE i Pandas), gorąco polecam tekst o Apache Arrow.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-13</title><link>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</link><pubDate>Mon, 13 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</guid><description>&lt;p&gt;Wielokrotnie na łamach niniejszego newslettera poruszane były tematy związane z Apache Kafka. A to podejście architektoniczne z grubsza mówiące dlaczego Kafka jest fajna i przydatna, a to podejście developerskie - o tym jak wysyłać i konsumować wiadomości z Kafki. Często też trafiają się bardziej zaawansowane przykłady - traktujące Kafkę jako bazę danych (z ktable czy ksql), czasem uzupełnione o Spark Streaming czy inne dodatkowe narzędzia typu Trino.&lt;/p&gt;&#10;&lt;p&gt;Ale najczęściej chyba Kafka wykorzystywana jest do przesyłania komunikatów w podejściu &lt;em&gt;publish &amp;amp; subscribe&lt;/em&gt;. Są jednak przecież inne rozwiązania kolejkowe - Rabbit, czy na przykład MQTT popularne w rozwiązaniach Internet of Things. &lt;a href="https://emqx.medium.com/mqtt-and-kafka-f20d79d9dea4"&gt;Przeczytajcie o podobieństwach i różnicach Kafki z MQTT&lt;/a&gt; (tekst &lt;a href="https://medium.com/techieahead/kafka-vs-rabbitmq-comparison-61d7a7b425d7"&gt;Kafka vs Rabbit&lt;/a&gt; też oczywiście jest).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-30</title><link>https://blog.prokulski.science/2023/01/30/newsletter-dane-i-analizy-2023-01-30/</link><pubDate>Mon, 30 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/30/newsletter-dane-i-analizy-2023-01-30/</guid><description>&lt;p&gt;Dzisiaj na początek trochę o orkiestracji za pomocą Apache Airflow. Zobaczymy co potrafi to narzędzie w zakresie sterowania pobieraniem danych i jak sprawuje się na produkcji.&lt;/p&gt;&#10;&lt;p&gt;A jak już mamy pobrane dane to możemy z nimi coś zrobić korzystając z jednej z bibliotek pythonowych. Albo policzyć jakieś modele i z ich pomocą przeanalizować na przykład klientów i ich drogę przez koszyk zakupowy.&lt;/p&gt;&#10;&lt;p&gt;W sumie - u laików - synonimem słowa &amp;ldquo;model&amp;rdquo; jest &amp;ldquo;sztuczna inteligencja&amp;rdquo;. A jak sztuczna inteligencja to może od razu ChatGPT (z którego już dzieciaki korzystają żeby pisać prace domowe)?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-31</title><link>https://blog.prokulski.science/2022/10/31/newsletter-dane-i-analizy-2022-10-31/</link><pubDate>Mon, 31 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/31/newsletter-dane-i-analizy-2022-10-31/</guid><description>&lt;p&gt;Poprzednie wydanie newslettera skupiało się na szeregach czasowych (zobacz w &lt;a href="../../2022/10/24/newsletter-dane-i-analizy-2022-10-24/"&gt;archiwum&lt;/a&gt;). Dla odmiany dzisiaj coś o analizie koszykowej - czyli co z czym się kupuje i co z tego wynika? Przykłady w kliku językach programowania znajdziecie niżej, w dedykowanej sekcji.&lt;/p&gt;&#10;&lt;p&gt;Nieco standardowo, albo może raczej - tradycyjnie - sporą część publikowanych dzisiaj tekstów mówi o technologiach streamingowych i big data. Zatem jest o rodzinie i znajomych Apache: Kafka, Spark, Iceberg, gdzieś przewinął się chyba też Flink. Czy to są interesujące dla Was tematy? A może rysowanie mapek jest ciekawsze? ;-)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-24</title><link>https://blog.prokulski.science/2022/10/24/newsletter-dane-i-analizy-2022-10-24/</link><pubDate>Mon, 24 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/24/newsletter-dane-i-analizy-2022-10-24/</guid><description>&lt;p&gt;Dzisiejsze wydanie newslettera skupia się na szeregach czasowych. Szeregiem czasowym jest pewnie jakieś 60% danych, na pewno wszystkie zmieniające się w czasie. Tak więc liczba klientów w sklepie (albo stronie internetowej), wynik pomiarów z jakiegoś czujnika (temperatura) itd itp - wszystko to układa się w szeregi czasowe.&lt;/p&gt;&#10;&lt;p&gt;A takie szeregi pozwalają na przewidywanie przyszłości. Czasem jest to łatwe, czasem trudne (giełda to też w zasadzie szereg czasowy, a przewidywanie nie jest takie oczywiste). I trochę o tym dzisiaj.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-19</title><link>https://blog.prokulski.science/2022/09/19/newsletter-dane-i-analizy-2022-09-19/</link><pubDate>Mon, 19 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/19/newsletter-dane-i-analizy-2022-09-19/</guid><description>&lt;p&gt;Dzisiaj sporo tekstów dotyka sieci neuronowych. a może lepiej powiedzieć: TensorFlow. Mamy krótkie przedstawienie jak w ogóle sieci działają, kilka tekstów pokazujących jak z TensorFlow pracować i przygotowywać modele. Interesujące jest porównanie modeli regresji liniowej zawartych w pythonowym SciKit-Learn.&lt;/p&gt;&#10;&lt;p&gt;Dla początkujących i średniozaawansowanych mamy dwa obszary: scheduler zadań czyli coś o Apache Airflow oraz (też Apache) Spark o łączeniu danych i wykorzystaniu w NLP&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Mam też dla Was coś specjalnego.&lt;/strong&gt; Każdy lubi rabaty, a ja daję &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;bezterminowo 15% zniżki na Karty Data Science!&lt;/strong&gt;&lt;/a&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-05</title><link>https://blog.prokulski.science/2022/09/05/newsletter-dane-i-analizy-2022-09-05/</link><pubDate>Mon, 05 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/05/newsletter-dane-i-analizy-2022-09-05/</guid><description>&lt;p&gt;Pod logiem Fundacji Apache aż roi się od projektów, a świat big data to pewnie w 90-95% Apache COŚ. Znamy Kafkę, znamy Apache Spark, Apache Hadoop. Dzisiaj przedstawiamy (w dziale BigData) kilkoro innych członków rodziny.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zaś mamy dużo mapek do wyświetlenia naszym klientom na stronie (bo na przykład monitorujemy każdy wypożyczony rower, hulajnogę czy samochód i mamy miliony wejść na stronę dziennie) to w dziale DevOps coś o rozwiązaniu open soruce, które może zmniejszyć nasze koszty.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-29</title><link>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</link><pubDate>Mon, 29 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</guid><description>&lt;p&gt;Uważni czytelnicy fanpage&amp;rsquo;a &lt;a href="https://fb.com/daneanalizy"&gt;Dane i Analizy&lt;/a&gt; już zapewne przeczytali mój nowy post o analizie tras rowerowych (heatmapa w nim prezentowana już nieaktualna), ale jeśli kogoś ominęło to &lt;a href="../../2022/08/22/strava-in-python/"&gt;&lt;strong&gt;zapraszam&lt;/strong&gt;&lt;/a&gt;. Pokazuję w nim:&lt;br&gt;&#10;jak przeczytać plik XML jak agregować dwuwymiarowe dane w NumPy jak agregować je w Pandas jak przygotować mapkę w Folium&lt;/p&gt;&#10;&lt;p&gt;A jak już tamten tekst znasz to dzisiaj też niemało do wyboru. Zapraszam do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://stackify.com/flask-vs-django-which-python-framework-is-better-for-machine-learning-apps/"&gt;&lt;strong&gt;Which Python Framework is Better for Machine Learning Apps?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Mamy jakiś nasz cudowny model, daje świetne wyniki, ale predykcje można dostać tylko uruchamiając skrypt z konsoli albo jeszcze gorzej w Jupyter Notebooku. Co zrobić, żeby było to użytecznie online&amp;rsquo;owe narzędzie? Opakować w API.&#10;Ale który pythonowy framework wybrać?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-22</title><link>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</link><pubDate>Mon, 22 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</guid><description>&lt;p&gt;Czy mniejsza liczba artykułów (nie wiem czy to zauważalne&amp;hellip;) to dla Was lepiej czy gorzej? Przeczytacie w związku z tym więcej (wszystkie?) czy tak samo jak zwykle 2-3, a reszta to nuda?&lt;/p&gt;&#10;&lt;p&gt;Dzisiejszy numer to nieco eksperyment ale - przyznajmy to szczerze - wynik sezonu wakacyjnego. Oj ciężko się zebrać do roboty, ciężko&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mlu-explain.github.io/"&gt;&lt;strong&gt;MLU-Explain&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działają lasy losowe? Co to jest krzywa ROC i AUC? Jeśli nie wiesz to ten serwis w przystępny, graficzny sposób pomoże to zrozumieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-08</title><link>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</link><pubDate>Mon, 08 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</guid><description>&lt;p&gt;Wakacje za półmetkiem, więc tematy w dzisiejszym newsletterze tak pół na pół.&lt;/p&gt;&#10;&lt;p&gt;Z jednej strony mamy ciężkie rzeczy: nowe naukowe &lt;em&gt;pejpery&lt;/em&gt; czy omówienie algorytmu grupowania przestrzennego opartego na gęstości. Ale z drugiej - automatyzację w Excelu czy kilka(naście) inspiracji dotyczących prezentowania danych.&lt;/p&gt;&#10;&lt;p&gt;Dla tych zaś co lubią wdrażanie i Kubernetesy - też coś się znajdzie, chociażby cluster na malinach ;-)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/6-papers-every-modern-data-scientist-must-read-1d0e708becd"&gt;&lt;strong&gt;6 Papers Every Modern Data Scientist Must Read&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przegląd prasy (publikacji naukowych) dla prawdziwych nerdów AI/ML. Jaki &amp;ldquo;pejper&amp;rdquo; czytasz dzisiaj?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-25</title><link>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</link><pubDate>Mon, 25 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</guid><description>&lt;p&gt;Wakacje wakacjami, ale te kilka godzin poświęciłem specjalnie dla Was aby przygotować dzisiejsze wydanie newslettera.&lt;/p&gt;&#10;&lt;p&gt;Pamiętacie &lt;strong&gt;Wojny Rdzeniowe&lt;/strong&gt;? Dla tych, którzy nie bardzo - &lt;a href="https://informatykzakladowy.pl/wojny-rdzeniowe-czyli-core-wars/"&gt;ciekawy tekst&lt;/a&gt; (po polsku, co rzadkie tutaj ;) opowiadający historię tych&amp;hellip; hmmm&amp;hellip; konkursów? zawodów?&lt;/p&gt;&#10;&lt;p&gt;A gdyby tak przygotować wewnętrzne rozgrywki tego typu? Co o tym sądzicie? Piszcie!&lt;/p&gt;&#10;&lt;p&gt;Zamiast jednak programować można klikać. Jeśli ktoś jest zwolennnikiem no-code to pewnie zainteresuje się &lt;a href="https://betterprogramming.pub/top-8-no-code-machine-learning-platforms-you-should-use-in-2020-1d1801300dd0"&gt;przeglądem platform&lt;/a&gt; tego typu przeznaczonych do zadań machine learningu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-11</title><link>https://blog.prokulski.science/2022/07/11/newsletter-dane-i-analizy-2022-07-11/</link><pubDate>Mon, 11 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/11/newsletter-dane-i-analizy-2022-07-11/</guid><description>&lt;p&gt;Machine learning czy też sztuczna inteligencja to nie są &lt;em&gt;czarne skrzynki&lt;/em&gt; które dają odpowiedź na każde pytania. Owszem - ML/AI daje odpowiedzi (lub nie) na &lt;strong&gt;konkretne&lt;/strong&gt; pytania (trzeba umieć je postawić, ale też zaakceptować niepewność odpowiedzi) i - po setkach spotkań &lt;em&gt;z biznesem&lt;/em&gt; - to wydaje się najtrudniejsze do zrozumienia. AI da odpowiedź na konkretne pytanie - czy na obrazku jest pies czy kot albo jaka zapewne będzie wartość takiego czy innego wskaźnika za dwa tygodnie (skoro ostatnie pół roku było tak). A oprócz tego wszystkiego - AI/ML wymaga sporo pracy, o czym możecie przeczytać w opracowaniu &lt;a href="https://arxiv.org/abs/2205.02302"&gt;Machine Learning Operations (MLOps): Overview, Definition, and Architecture&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-30</title><link>https://blog.prokulski.science/2022/05/30/newsletter-dane-i-analizy-2022-05-30/</link><pubDate>Mon, 30 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/30/newsletter-dane-i-analizy-2022-05-30/</guid><description>&lt;p&gt;Znacie metodę &amp;ldquo;getting things done&amp;rdquo;? Jest taka książka Davida Allena opowiadająca dokładnie co i jak. Ale kto by czytał całą książkę, jeśli jest wersja skrócona? &lt;a href="https://hamberg.no/gtd"&gt;&lt;strong&gt;Polecam.&lt;/strong&gt;&lt;/a&gt; Jeśli wolicie książkę to w Helionie jest &lt;a href="https://helion.pl/view/14029A/gett2e.htm"&gt;promocja na e-booka&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Polecam dzisiaj trochę oglądania - praktyczne wykorzystaniu narzędzi ML w banku w prezentacji &lt;a href="https://www.youtube.com/watch?v=zsbniuvS3_o"&gt;XGBoost w praktyce&lt;/a&gt; oraz &lt;a href="https://www.youtube.com/watch?v=OWAqIgpekdg"&gt;DDD w systemach rozproszonych&lt;/a&gt;. Cała reszta materiałów równie znakomita :)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/5-ways-to-use-histograms-with-machine-learning-algorithms-e32042dfbe3e"&gt;&lt;strong&gt;5 Ways to Use Histograms&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Sposoby na użycie histogramów&amp;hellip; z perspektywy machine learningu&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-23</title><link>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</link><pubDate>Mon, 23 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</guid><description>&lt;p&gt;Dzisiaj delikatnie więcej tematów bliższych &lt;em&gt;biznesowi&lt;/em&gt; niż IT - mierniki, jakość, zaangażowanie w pracę (to polecam każdemu). &lt;a href="https://prokulski.science"&gt;Dane i Analizy&lt;/a&gt; to też consulting tego typu rozwiązań - jeśli trzeba to zapraszam do kontaktu&lt;/p&gt;&#10;&lt;p&gt;Są też standardowo poradniki związane głównie z Pythonem i Big Data, ale znajdzie się też coś dla chcących zacząć poważniej pisać w Javie&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/greenlit-using-gpt-j-with-multi-task-learning-to-create-new-screenplays-54a2d04f761c"&gt;&lt;strong&gt;GreenLIT: Using GPT-J to Create Screenplays&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy sztuczna inteligencja może pisać scenariusze filmowe?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-xgboost-models-in-amazon-sagemaker-in-4-simple-steps-4eb3e104ee61"&gt;&lt;strong&gt;Train XGBoost Models in Amazon SageMaker in 4 Simple Steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak wykorzysać Amazon SageMaker do trenowania modeli w chmurze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-25</title><link>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</link><pubDate>Mon, 25 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</guid><description>&lt;p&gt;Dzisiaj zapraszam na duży pakiet związany z Apache Spark - od instalacji, poprzez stosunkowo mało zaawansowane tutoriale, a na debugowaniu i optymalizacji zapytań skończywszy.&lt;/p&gt;&#10;&lt;p&gt;Standardowo jest też trochę Pythona (na przykład świetny kurs spaCy - ale to fani &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;a Dane i Analizy&lt;/a&gt; już znają czy też coś o wzorcach projektowych albo aplikacjach wielowątkowych), a w części &amp;ldquo;analiza danych&amp;rdquo; dość przekrojowe zagadnienia (np. &lt;em&gt;computer vision&lt;/em&gt; bez sieci neuronowych - dość sprytne podejście do tematu zajętych miejsc parkingowych).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-11</title><link>https://blog.prokulski.science/2022/04/11/newsletter-dane-i-analizy-2022-04-11/</link><pubDate>Mon, 11 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/11/newsletter-dane-i-analizy-2022-04-11/</guid><description>&lt;p&gt;Trochę mniej artykułów, ale jeden z nich to potężny kolos (ten o SHAP). Do tego bardzo fajne porady dla początkujących w Pythonie i ciekawe koncepcje w świecie big data (jakby ktoś chciał postawić klaster to jest o tym poradnik).&lt;/p&gt;&#10;&lt;p&gt;Zaś w przyszłym tygodniu zrobimy sobie przerwę świąteczną - polewajcie się wodą za tydzień (oby pogoda dopisała), a nie zajmujcie się komputerami. Wesołych Świąt!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/revisiting-mnist-with-fresh-eyes-36f9d19a75d1"&gt;&lt;strong&gt;Revisiting MNIST with Fresh Eyes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy kto próbował machine learningu albo deep learningu (w szczególności sieci CNN) zetknął się ze zbiorem ręcznie pisanych cyfr MNIST. Tutaj inne podejście do znanego problemu&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-28</title><link>https://blog.prokulski.science/2022/03/28/newsletter-dane-i-analizy-2022-03-28/</link><pubDate>Mon, 28 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/28/newsletter-dane-i-analizy-2022-03-28/</guid><description>&lt;p&gt;Połowa dzisiejszych materiałów to konkretne projekty związane z danymi. Albo wyciąganie informacji z rachunków z przejazdy Uberem, albo realtime&amp;rsquo;owe wizualizacje tego co co się zmienia w Wikipedii, albo big data w Big Query. Plus raport Stanford AI Index Report&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/artefact-engineering-and-data-science/is-facebook-prophet-suited-for-doing-good-predictions-in-a-real-world-project-44be1fe4ce91"&gt;&lt;strong&gt;Is Facebook Prophet suited for doing good predictions in a real-world project?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak biblioteka Prophet do prognozowania szeregów czasowych sprawdza się w realnych zastosowaniach?&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@ali.soleymani.co/stop-using-random-forest-feature-importances-take-this-intuitive-approach-instead-4335205b933f"&gt;&lt;strong&gt;Stop using random forest feature importances&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Skąd wiecie, że dana cecha jest istona w Waszym modelu? &amp;ldquo;feature importances&amp;rdquo; z lasów losowych ma pewne niedociąnięcia o których warto wiedzieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-21</title><link>https://blog.prokulski.science/2022/03/21/newsletter-dane-i-analizy-2022-03-21/</link><pubDate>Mon, 21 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/21/newsletter-dane-i-analizy-2022-03-21/</guid><description>&lt;p&gt;Podoba nie rozpieszcza, nie ma czasu na pisanie. Mam nadzieję, że znajdziecie czas na czytanie :)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2022/03/end-to-end-hotel-booking-cancellation-machine-learning-model/"&gt;&lt;strong&gt;End-to-End Hotel Booking Cancellation Machine Learning Model&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy gość przyjedzie do naszego pokoju hotelowego czy nie przyjedzie? Jak buduje się modele, które potrafią odpowiedzieć na takie pytania? Znajomity tutorial&lt;/p&gt;&#10;&lt;h3 id="big_data"&gt;#big_data&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mherzog01.medium.com/a-spark-streaming-pipeline-with-microservices-c2cfc42dda9f"&gt;&lt;strong&gt;A Spark Streaming pipeline with microservices&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Spark, Kafka i uczenie maszynowe w tle - takie projekty lubimy!&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://selectfrom.dev/querying-kafka-topics-using-presto-5f1bb915a918"&gt;&lt;strong&gt;Querying Kafka Topics Using Presto&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A gdyby tak pytać topików kafkowych tak jak bazę danych?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-14</title><link>https://blog.prokulski.science/2022/03/14/newsletter-dane-i-analizy-2022-03-14/</link><pubDate>Mon, 14 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/14/newsletter-dane-i-analizy-2022-03-14/</guid><description>&lt;p&gt;Mam nadzieję, że wiosna nadchodzi wielkimi krokami, więc dzisiaj trochę lżejszy dobór tematów.&lt;/p&gt;&#10;&lt;p&gt;Koniecznie zobacz nagranie z webinaru u Vladimira o BI i ML!&lt;/p&gt;&#10;&lt;p&gt;Polecam też zainteresować się Mermaid - rozszerzeniem do Markdown pozwalającym rysować diagramy. Da się też eksportować je później do np. PDFów - istnieje odpowiedni &lt;a href="https://github.com/raghur/mermaid-filter"&gt;dodatek do pandoc&lt;/a&gt;. A o Meramind wiem od &lt;a href="https://www.youtube.com/watch?v=JiQmpA474BY"&gt;Arjana i jego filmu&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.youtube.com/watch?v=ANEJADyAyOE"&gt;&lt;strong&gt;Business Intelligence z Machine Learning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Zapis ciekawego webinaru łączącego oba wspominane w tytule zagadnienia&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-10</title><link>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</link><pubDate>Mon, 10 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</guid><description>&lt;p&gt;Koniec przerw świątecznych, koniec długich weekendów, czas wracać do pracy.&lt;/p&gt;&#10;&lt;p&gt;Dla mnie osobiście rok zaczął się zabawą z Raspberry Pi i próbwaniem co to cudo potrafi. Nigdzie nie ma Raspberry Pi 4, więc zadowoliłem się na start Pi Zero. Mały, ale wariat - używam do PiHole oraz staram się podglądać co robi w nocy kot. Jak? A no tym prostym &lt;a href="https://github.com/prokulski/rasppi_motion_capture/blob/main/main.py"&gt;skryptem&lt;/a&gt; i kamerką podłączoną po USB.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/11-dimensionality-reduction-techniques-you-should-know-in-2021-dcb9500d388b"&gt;&lt;strong&gt;11 Dimensionality reduction techniques you should know in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;11 metod na redukcję rozmiarów Twoich danych. Ale zmniejszenie wielkości to nie jedyne zastosowanie - przy redukcji wymiarów często odsłaniają się ukryte informacje&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-20</title><link>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</link><pubDate>Mon, 20 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</guid><description>&lt;p&gt;To ostatni numer newslettera&amp;hellip; przed Bożym Narodzeniem.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym przede wszystkim życzę Ci spokoju, spędzenia mile czasu z najbliższymi, odpoczynku (też od komputerów) i jeszcze raz pieniędzy.&lt;/p&gt;&#10;&lt;p&gt;Do życzeń dołączam pythonową choinkę:&lt;/p&gt;&#10;&lt;p&gt;def holidaybush(n):&lt;br&gt;&#10;    for i in range(n):&lt;br&gt;&#10;        print((&amp;quot;+&amp;quot; * (i * 2 + 1)).center(n * 2 - 1))&lt;br&gt;&#10;    print(&amp;quot;+++&amp;quot;.center(n * 2 - 1))&lt;/p&gt;&#10;&lt;p&gt;holidaybush(15)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://glassboxmedicine.com/2019/09/15/best-use-of-train-val-test-splits-with-tips-for-medical-data/"&gt;&lt;strong&gt;Best Use of Train/Val/Test Splits, with Tips for Medical Data&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Modele, uczenie, dane treningowe, testowe, walidacyjne&amp;hellip; ale właściwie dlaczego tak?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-08</title><link>https://blog.prokulski.science/2021/11/08/newsletter-dane-i-analizy-2021-11-08/</link><pubDate>Mon, 08 Nov 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/08/newsletter-dane-i-analizy-2021-11-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/orchestrate-a-data-science-project-in-python-with-prefect-e69c61a49074?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Orchestrate a Data Science Project in Python With Prefect&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Optimize Your Data Science Workflow in a Few Lines of Code Motivation As a data scientist, why should you care about optimizing your data science workflow? Let’s start with an example of a basic data science project. Imagine you were working with an Iris dataset. You started with building functions to process your data. &lt;a href="https://medium.com/media/e479ca8deb87434b1859864118ec3bcc/href"&gt;https://medium.com/media/e479ca8deb87434b1859864118ec3bcc/href&lt;/a&gt; After defining (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/dealing-with-dates-in-pandas-6-common-operations-you-should-know-1ea6057c6f4f"&gt;&lt;strong&gt;Dealing With Dates in Pandas — 6 Common Operations You Should Know&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dealing With Dates in Pandas — 6 Common Operations You Should Know Never confused with dates again, hopefully. Besides texts and numbers, dates are a very common data type in our datasets. When we use Pandas to process dates, it’s definitely not the most straightforward task for most data scientists. When I began to use Pandas, I wasn’t familiar with date-related features, so every time when I (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-25</title><link>https://blog.prokulski.science/2021/10/25/newsletter-dane-i-analizy-2021-10-25/</link><pubDate>Mon, 25 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/25/newsletter-dane-i-analizy-2021-10-25/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/optimize-ml-modeling-using-a-timing-decorator-2b113c6b60d9"&gt;&lt;strong&gt;Optimize ML modeling using a timing decorator&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Record the execution time of ML training using timing decorators and use it for productive data science and ML optimization Image source : Pixabay (Free to use) Why measuring time is important We can go on and provide hundreds of arguments and quotes showing why the act of measurement is important in science and technology. Here is a powerful one, One accurate measurement is worth a thousand (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-23</title><link>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</link><pubDate>Sat, 23 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</guid><description>&lt;p&gt;&lt;a href="https://preettheman.medium.com/best-front-end-python-frameworks-in-2021-643d1df6922c"&gt;&lt;strong&gt;Best front-end Python frameworks in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Welcome back! Python is an awesome programming language with a ton of capability, one of these functions is building GUI’s (front-ends), so let’s talk about some of my favorite front-ends frameworks for Python. Now, Python is an awesome language for web development as well, if you want to see some sample websites you can build with Python, check out this article below: Let’s take a look at some (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-04</title><link>https://blog.prokulski.science/2021/10/04/newsletter-dane-i-analizy-2021-10-04/</link><pubDate>Mon, 04 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/04/newsletter-dane-i-analizy-2021-10-04/</guid><description>&lt;p&gt;&lt;a href="https://gist.github.com/Adricarpin/a004fe0edd5b72eab193c7904dbdae8c"&gt;&lt;strong&gt;MLOps with Docker and Jenkins: Automating Machine Learning Pipelines&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to containerize your ML models with Docker and automate a Pipeline with Jenkins&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/performing-deduplication-with-record-linkage-and-supervised-learning-b01a66cc6882"&gt;&lt;strong&gt;Performing Deduplication with Record Linkage and Supervised Learning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Identifying duplicate records with a machine-learning approach Introduction Most data are recorded manually by humans and most often is not reviewed, not synchronized, and simply because there were mistakes made such as typos. Think for a second, have you ever filled out the same form twice before but with a slight difference in your address? For example, you submitted a form like this (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-06</title><link>https://blog.prokulski.science/2021/09/06/newsletter-dane-i-analizy-2021-09-06/</link><pubDate>Mon, 06 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/06/newsletter-dane-i-analizy-2021-09-06/</guid><description>&lt;p&gt;&lt;a href="https://flowingdata.com/2021/09/03/everything-more-from-home/"&gt;&lt;strong&gt;How Much More Time We Spent at Home&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;We had to do more from home. Here&amp;rsquo;s how much everything shifted by total minutes in a day. Tags: home , time use&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/image-processing-tool-a1b8fe66c957?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A Comprehensive Guide to Image Processing: Using an OpenCV Tool&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Image Processing Essentials An image processing tool with OpenCV, QT Creator, and C++ As the last part of this series on the Image Processing flow, I want to present a simple Image Processing Tool implemented using OpenCV 3.2.0 on QT Creator (5.12.10) with C++ to apply almost all the Image Processing operations discussed in the previous posts. To be able to use it, it’s enough to build OpenCV (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-23</title><link>https://blog.prokulski.science/2021/08/23/newsletter-dane-i-analizy-2021-08-23/</link><pubDate>Mon, 23 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/23/newsletter-dane-i-analizy-2021-08-23/</guid><description>&lt;p&gt;&lt;a href="https://gist.github.com/24939c89f67e5950bf00f5ddcc08ff97"&gt;&lt;strong&gt;Scala is like Python 4&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Although it’s fundamentally closer to Java, Scala has clearly taken a lot of influence from Python in terms of style and functionality. As someone who has written Python code for ~7 years now, playing around with Scala feels surprisingly familiar, but it’s more akin to using a statically typed and compiled version of Python 3. Obviously, they’re very different languages, b ut if you’re an (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-19</title><link>https://blog.prokulski.science/2021/07/19/newsletter-dane-i-analizy-2021-07-19/</link><pubDate>Mon, 19 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/19/newsletter-dane-i-analizy-2021-07-19/</guid><description>&lt;p&gt;&lt;a href="https://techblog.ing.pl/blog/dobry-zly-i-brzydki-pare-slow-o-pandas-udf-w-apache-spark"&gt;&lt;strong&gt;Dobry, zły i brzydki – Parę słów o Pandas UDF w Apache Spark | Tech Blog ING Bank Śląski&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Spark to bardzo użyteczne narzędzie do pracy z Big Data. Niestety, czasem brakuje mu pewnych funkcjonalności. Na szczęście twórcy wyszli na przeciw oczekiwaniom użytkowników, dodając Pandas UDF, dzięki czemu zachowując elastyczność Pythona nie tracimy na wydajności. Zobaczmy więc, czym są i jak (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/geocoding-in-python-a-complete-guide-d68a4faafdc6?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Geocoding in Python: A Complete Guide&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A step-by-step tutorial on geocoding with Python Continue reading on Towards Data Science »&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-21</title><link>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</link><pubDate>Mon, 21 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</guid><description>&lt;p&gt;&lt;a href="https://jellyfish.tech/implementation-of-common-design-patterns-in-python/"&gt;&lt;strong&gt;Implementation of Top Design Patterns in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;*according to developer &amp;amp; software architect with 9+ years of experience&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/a-hands-on-demo-of-analyzing-big-data-with-spark-68cb6600a295?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A hands-on demo of analyzing big data with Spark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Scan a novel, calculate pi, and run regression on 50 million rows Conclusions This post was a deep dive on using Spark to process big data. We started with an overview of distributed computing before counting the frequency of each letter in Dostoyevsky’s War and Peace , estimating π with randomly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-07</title><link>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</link><pubDate>Mon, 07 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/3-examples-that-show-the-unlimited-flexibility-of-pyspark-319ab22d5a?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;3 Examples That Show The Unlimited Flexibility of PySpark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A combination of Python and SQL but easier than both Spark is an analytics engine used for large-scale data processing. It lets you spread both data and computations over clusters to achieve a substantial performance increase. It is easier than ever to collect, transfer, and store data. Hence, we (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cmdlinetips.com/2021/06/row-wise-operations-in-r/"&gt;&lt;strong&gt;Row-wise operations in R: compute row means in tidyverse&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial shows how to perform row-wise operations in R using tidyverse. We will use three key functions, rowwise(), c_across() and rowMeans() to perform to perform row-wise operations on a dataframe. rowwise() and c_across() functions are from dplyr. rowwise() function is available in dplyr (&amp;hellip;)&lt;/p&gt;</description></item><item><title>(py)Spark, Hadoop i HDFS - podstawy</title><link>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</link><pubDate>Thu, 09 Apr 2020 19:06:13 +0000</pubDate><guid>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</guid><description>&lt;p&gt;Dzisiaj zajmiemy się wykorzystaniem Sparka i Hadoopa do przetwarzania większej ilości danych. Oraz do budowania prostego modelu (regresji liniowej). Może jeszcze nie jest to big data, ale mechanizmy są identyczne jak w przypadku większej liczby danych. Wystarczy tylko tych danych więcej zgromadzić, zbudować większe środowisko (dużo serwerów) i… też będzie działało.&lt;/p&gt;&#10;&lt;p&gt;A w dodatku poznamy pakiet &lt;em&gt;faker&lt;/em&gt; który pozwoli nam na wygenerowanie sztucznych danych.&lt;/p&gt;&#10;&lt;h3 id="spark-i-hadoop"&gt;Spark i Hadoop&lt;/h3&gt;&#10;&lt;p&gt;&lt;strong&gt;Apache Spark&lt;/strong&gt; to rozwijana na zasadach open source platforma klastrowego przetwarzania danych, która ma interfejsy API dla takich języków programowania jak Scala, Python, Java i R.&lt;/p&gt;</description></item><item><title>Spark, czyli opóźnienia pociągów</title><link>https://blog.prokulski.science/2018/12/21/spark-czyli-opoznienia-pociagow/</link><pubDate>Fri, 21 Dec 2018 14:52:21 +0000</pubDate><guid>https://blog.prokulski.science/2018/12/21/spark-czyli-opoznienia-pociagow/</guid><description>&lt;p&gt;Czy polskie pociągi są punktualne? To pytanie, na które poszukamy odpowiedzi, ale jest ono tylko przyczynkiem do dzisiejszego wpisu.&lt;/p&gt;&#10;&lt;p&gt;Chciałbym pokazać dzisiaj sposób znalezienia odpowiedzi, nawet nie samą odpowiedź. Skąd wziąć dane? Jak sobie z nimi poradzić? Czym je uzupełnić?&lt;/p&gt;&#10;&lt;h3 id="pozyskanie-danych"&gt;Pozyskanie danych&lt;/h3&gt;&#10;&lt;p&gt;W pierwszym odruchu pomyślałem o stronach PKP i webscrappingu. Ale na Twitterze mojego bota &lt;a href="https://twitter.com/rstatspl"&gt;@rstatspl&lt;/a&gt; obserwuje inny bot - &lt;a href="https://twitter.com/OpPociagow"&gt;@OpPociagow&lt;/a&gt;, który prezentuje ciekawe dane. Skoro prezentuje to je ma. Skoro ma, to gdzieś są. Chwila rozmowy z twórcą i uzyskujemy adres &lt;a href="http://ipa.lovethosetrains.com/"&gt;InfoPasażer Archiver - archiwum opóźnień pociągów&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Rowery Veturilo - część pierwsza</title><link>https://blog.prokulski.science/2017/05/08/rowery-veturilo-i/</link><pubDate>Mon, 08 May 2017 15:54:27 +0000</pubDate><guid>https://blog.prokulski.science/2017/05/08/rowery-veturilo-i/</guid><description>&lt;p&gt;Czy popularność rowerów Veturilo w Warszawie od czegoś zależy?&#10;Dzisiaj, po majowej przerwie (spędzonej między innymi na rowerze) zajmiemy się nieco większymi zbiorami danych.&#10;Na początek kilka słów o przygotowaniu danych.&lt;/p&gt;&#10;&lt;h3 id="rowery-veturilo"&gt;Rowery Veturilo&lt;/h3&gt;&#10;&lt;p&gt;Od początku marca (od bodaj 11) zbierałem dane wystawione przez NextBike (operatora rowerów m.in. Veturilo) dla kilkudziesięciu miast. Ograniczyłem się tylko do Warszawy, dane były pobierane co 5 minut. Jak wyglądają te dane możecie sprawdzić sami - to &lt;a href="http://nextbike.net/maps/nextbike-official.xml?city=210"&gt;dostępny online plik XML&lt;/a&gt;. W pliku znaleźć można wszystkie potrzebne nam informacje:&lt;/p&gt;</description></item></channel></rss>