<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Time Series on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/time-series/</link><description>Recent content in Time Series on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 02 Jun 2025 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/time-series/index.xml" rel="self" type="application/rss+xml"/><item><title>Newsletter Dane i Analizy, 2025-06-02</title><link>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</link><pubDate>Mon, 02 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</guid><description>&lt;p&gt;Ten tydzień przyniósł interesującą mieszankę praktycznych rozwiązań i technologicznych rewolucji. Od monitorowania nocnych maratonów chomików (to ta rewolucja, wiadomo) po architekturę Apache Spark - branża pokazuje, że innowacja kryje się w każdym zakątku.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie ciekawy jest trend odchodzenia od tradycyjnych rozwiązań na rzecz nowoczesnych alternatyw. Na przykład zamiast odpalać joby w cronie można wykorzystać Change Data Capture (CDC), a API-first podejście staje się standardem dla 74% zespołów. Apache Iceberg wygra wojnę formatów tabel, a FastAPI udowadnia, że Python może być równie wydajny co elegancki.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-19</title><link>https://blog.prokulski.science/2025/05/19/newsletter-dane-i-analizy-2025-05-19/</link><pubDate>Mon, 19 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/19/newsletter-dane-i-analizy-2025-05-19/</guid><description>&lt;p&gt;W świecie, który coraz mocniej stawia na wykorzystanie sztucznej inteligencji, OpenAI wprowadza Codex - asystenta AI, który może tworzyć kod na podstawie prostych instrukcji tekstowych. Tymczasem ciekawy eksperyment z czterema różnymi modelami LLM poddanymi zadaniu projektowania architektury oprogramowania pokazuje, gdzie obecnie stoją możliwości AI w zastępowaniu ludzkich specjalistów. Pytanie &lt;strong&gt;&amp;ldquo;co dalej z Eldorado?&amp;rdquo;&lt;/strong&gt; pozostaje w mocy?&lt;/p&gt;&#10;&lt;p&gt;Nie brakuje też w dzisiejszym wydaniu konkretnych tutoriali i praktycznych przewodników - od budowy systemów przetwarzania danych w Airflow 3 z wykorzystaniem AI SDK i analizę danych z League of Legends, albo z Ligi Mistrzów UEFA, po tworzenie efektownych wizualizacji takich jak mapy kafelkowe czy wykresy parlamentarne (mimo, że mamy wybory prezydenckie). Dla fanów uczenia maszynowego mam artykuły o klasycznych algorytmach klasyfikacyjnych i praktycznym łączeniu bibliotek Pandas, NumPy i scikit-learn. Plus &lt;a href="https://www.subscribepage.com/python_data_science/?utm_source=newsletter-dia-2025-05-19&amp;amp;utm_medium=link-wstep&amp;amp;utm_campaign=daneianalizy"&gt;swój własny cykl&lt;/a&gt; uczący analizy danych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-05</title><link>https://blog.prokulski.science/2025/05/05/newsletter-dane-i-analizy-2025-05-05/</link><pubDate>Mon, 05 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/05/newsletter-dane-i-analizy-2025-05-05/</guid><description>&lt;p&gt;Tym razem, pomimo majówki, zebrałem specjalnie dla Ciebie kolekcję tekstów, które łączy jeden wspólny mianownik - praktyczność. Mniej teorii, więcej konkretów, które możesz zastosować już dziś w swojej pracy z danymi i kodem.&lt;/p&gt;&#10;&lt;p&gt;W świecie AI i ML możesz przyjrzeć się technikom monitorowania sieci neuronowych podczas treningu oraz implementacji autokoderów wariacyjnych z Keras. Oba teksty to solidne przewodniki, które pomogą Ci lepiej zrozumieć, co dzieje się &amp;ldquo;pod maską&amp;rdquo; Twoich modeli.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-07</title><link>https://blog.prokulski.science/2025/04/07/newsletter-dane-i-analizy-2025-04-07/</link><pubDate>Mon, 07 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/07/newsletter-dane-i-analizy-2025-04-07/</guid><description>&lt;p&gt;Dzisiaj &amp;ldquo;mapy rozwoju&amp;rdquo; - czyli listy zagadnień, które warto poznać, zgłębić, nauczyć się, aby rozwinąć się w danej dziedzinie. Dziedziny te oczywiście bliskie są tematom przewodnim tego newslettera - przetwarzaniu danych. Zatem jest &amp;ldquo;ścieżka rozwojowa&amp;rdquo; dla inżynierów danych oraz dla zajmujących się machine learningiem (i jego &amp;ldquo;operacjonalizacyjną&amp;rdquo; stroną - MLOps).&lt;/p&gt;&#10;&lt;p&gt;Ciekawe dla Ciebie mogą być również dwa świeże raporty (za 2024 rok) związane z bezpieczeństwem - jeden z CERT, więc bezpieczeństwo raczej ogólne. Drugi z Komisji Nadzoru Finansowego dotyczący instytucji finansowych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-06</title><link>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</link><pubDate>Mon, 06 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</guid><description>&lt;p&gt;W dniu, gdy tradycyjnie Trzej Mędrcy dotarli do celu swojej podróży kierując się gwiazdą, ja przybywam z kolekcją wartościowych znalezisk ze świata Pythona i analizy danych. Mędrcy przynieśli złoto, kadzidło i mirrę - dzisiejsze wydanie niesie pakiet różnorodnych artykułów, które (mam nadzieję) okażą się równie cennymi darami dla Twojego rozwoju zawodowego.&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu znajdziesz standardowo kilka praktycznych materiałów z zakresu data science: od budowania systemu tradingowego opartego na średniej kroczącej, przez analizę szeregów czasowych, aż po wykorzystanie biblioteki statsmodels.&lt;br&gt;&#10;Dla osób zainteresowanych automatyzacją wdrożeń (i nie tylko) mamy podstawową dawkę wiedzy o GitHub Actions i skryptach bashowych, a na koniec dość klasyczna integracja FastAPI z Reactem.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-02</title><link>https://blog.prokulski.science/2024/12/02/newsletter-dane-i-analizy-2024-12-02/</link><pubDate>Mon, 02 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/02/newsletter-dane-i-analizy-2024-12-02/</guid><description>&lt;p&gt;Motywem przewodnim w dzisiejszym odcinku jest API. Jakich frameworków użyć (w Pythonie), czym od siebie się różnią? A może websocket?&lt;/p&gt;&#10;&lt;p&gt;Podobnie mamy w sekcji z praktycznymi projektami z zakresu analizy danych (nie zawsze tam o samą analizę chodzi - czasem bardziej o uczenie maszynowe niż analizowanie w rozumieniu tzw. EDA): wykrywanie wartości odstających w zbiorach.&lt;/p&gt;&#10;&lt;p&gt;Co tydzień przedstawiamy tutaj kilka projektów wykorzystujących analizę danych, machine learning czy też AI. Zamiast czekać kilkanaście tygodni (i liczyć że temat, który Cię interesuje się pojawi) możesz zerknąć na &lt;a href="https://www.geeksforgeeks.org/top-data-science-projects/"&gt;&lt;strong&gt;stronę&lt;/strong&gt;&lt;/a&gt; gdzie zgromadzono ponad 65 (może i 69, a więc prawie 70!) przykładowych projektów razem z kodem źródłowym. Boot-camp z ML? Niepotrzebny! Wystarczą te projekty&amp;hellip; oraz porządne doczytanie dlaczego tak a nie inaczej zrobiono to czy tamto.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-18</title><link>https://blog.prokulski.science/2024/11/18/newsletter-dane-i-analizy-2024-11-18/</link><pubDate>Mon, 18 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/18/newsletter-dane-i-analizy-2024-11-18/</guid><description>&lt;p&gt;Newslettery&amp;hellip; czy wiecie, że tylko nieco ponad 1/3 newsletterów ma swój drugi numer? Co 10-ty newsletter (precyzyjniej: 11%) ukazuje się dłużej niż 10 numerów. A jednocześnie 23-krotnie wzrosła liczba newsletterów od 2019 roku na platformie Substack. Tak mówi &lt;a href="https://reletter.com/blog/newsletter-fade/"&gt;źródło&lt;/a&gt; tych danych.&lt;/p&gt;&#10;&lt;p&gt;Nasz newsletter ma jakieś 3 lata (przynajmniej w redakcyjnym archiwum w serwisie &lt;a href="https://raindrop.io/"&gt;Raindrop.io&lt;/a&gt; gdzie zebrane są wszystkie teksty jest tag #newsletter_2021-11-15), co by znaczyło jakieś 150 wydań. W archiwum, bo były czasy przed budowaniem archiwum (kilkanaście tygodni na pewno), ale tak starych ludzi już nie ma&amp;hellip; :-)&lt;br&gt;&#10;Archiwum mówi też o ponad 3400 tysiącu tekstów 😮&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-11</title><link>https://blog.prokulski.science/2024/11/11/newsletter-dane-i-analizy-2024-11-11/</link><pubDate>Mon, 11 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/11/newsletter-dane-i-analizy-2024-11-11/</guid><description>&lt;p&gt;Święto lasu słuchajcie! I to nie chodzi wcale o to, że dzisiaj mamy Narodowe Święto Niepodległości, ale o to, że w newsletterze mało o Pythonie! Więcej mamy w działce &amp;ldquo;DevOps&amp;rdquo; (która nie tylko o procesach CI/CD jest, ale też o tym jak pisać - i w tym numerze też debuggować - skrypty w Bashu) niż programowania przepływów danych czy innych finezyjnych (mniej lub bardziej) sztuczek w Pandas albo DuckDB&amp;hellip;&lt;/p&gt;&#10;&lt;p&gt;Za to dowozi dzisiaj sekcja opisująca nieco bardziej teoretycznie zagadnienia ML-owe. Chyba dobrze, co?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-21</title><link>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</link><pubDate>Mon, 21 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</guid><description>&lt;p&gt;OpenAI ze swoim modelem w wersji o1 wróciło na szczyt listy przebojów w kategorii LLM. Garść firm zajmujących się GenAI zaczyna generować poważne przychody. Co jeszcze dzieje się na rynku AI w 2024 roku? Jaki jest &amp;ldquo;Stan AI w 2024&amp;rdquo;? O tym dowiecie się z raportu, do którego link poniżej, w sekcji AI/ML.&lt;/p&gt;&#10;&lt;p&gt;Sporo w tym wydaniu o bazach danych (co najmniej dwa razy pojawia się Postgres i Redis, ale są też inne rozwiązania: wektorowa &lt;a href="https://milvus.io/"&gt;Milvus&lt;/a&gt;, &lt;a href="https://www.influxdata.com/"&gt;InfluxDB&lt;/a&gt; do szeregów czasowych, grafowa &lt;a href="https://neo4j.com/"&gt;Neo4j&lt;/a&gt;, dobrze znany stałym czytelnikom &lt;a href="https://duckdb.org/"&gt;DuckDB&lt;/a&gt;oraz &lt;a href="https://tile38.com/"&gt;Tile38&lt;/a&gt; do zadań geo).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-09</title><link>https://blog.prokulski.science/2024/09/09/newsletter-dane-i-analizy-2024-09-09/</link><pubDate>Mon, 09 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/09/newsletter-dane-i-analizy-2024-09-09/</guid><description>&lt;p&gt;W tym tygodniu prowadzę szkolenie (a w zeszłym prowadziłem przykładowo konkurs na imprezie firmowej - więc &lt;em&gt;&amp;ldquo;szkolenia, prelekcje, podcasty, śluby, chrzciny i pogrzeby&amp;rdquo;&lt;/em&gt; są w ofercie &lt;a href="https://prokulski.science/"&gt;Dane i Analizy&lt;/a&gt; :), więc nieco mniej czasu na przygotowanie newslettera - wybaczcie zatem, że bez standardowego wstępu. Liczę jednak na to, że dobór materiałów na zadowalającym poziomie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://python.plainenglish.io/evaluating-handwritten-digit-recognition-models-insights-and-observations-74dcc0841ffe"&gt;&lt;strong&gt;Evaluating Handwritten digital Recognition Models&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;MNIST to jeden z najpopularniejszych zbiorów danych. Porównanie modeli rozpoznających ręcznie pisane cyfry (i tu zbiorem nie jest MNIST).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-22</title><link>https://blog.prokulski.science/2024/07/22/newsletter-dane-i-analizy-2024-07-22/</link><pubDate>Mon, 22 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/22/newsletter-dane-i-analizy-2024-07-22/</guid><description>&lt;p&gt;Tomek zwrócił się do mnie z prośbą o przekazanie informacji o jego książce (e-booku). Otóż napisał ogromną ilość tekstu (ze 100 stron) na temat tego jak budować projekty data science w Pythonie. Jak układać pliki w folderach, jak zarządzać wymaganiami, jak zarządzać prerekwizytami typu dane czy też wynikowe wykresy, predykcje, modele. Jest też o automatycznym formatowaniu i sprawdzaniu kodu przy użyciu Ruff oraz dość sporo o notatnikach Jupytera. Normalnie książka coś kosztuje (30 zł), ale dla Was - do 5 sierpnia - jest za darmo, o &lt;a href="https://cart.easy.tools/checkout/19955710/smart-structuring?promo=DANEIANALIZY"&gt;&lt;strong&gt;tutaj&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-03-25</title><link>https://blog.prokulski.science/2024/03/25/newsletter-dane-i-analizy-2024-03-25/</link><pubDate>Mon, 25 Mar 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/03/25/newsletter-dane-i-analizy-2024-03-25/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://deepmind.google/discover/blog/tacticai-ai-assistant-for-football-tactics/"&gt;&lt;strong&gt;TacticAI: an AI assistant for football tactics&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy AI zmieni sposób gry w piłkę nożną? Zobacz czym owocuje współpraca FC Liverpool z DeepMind należącym do Google&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2024/03/live-object-detection-and-image-segmentation-with-yolov8/"&gt;&lt;strong&gt;Live Object Detection and Image Segmentation with YOLOv8&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działa YOLOv8? I jak szybko, z gotowych klocków, użyć tego algorytmu?&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://andlukyane.com//blog/paper-review-2thgnn"&gt;&lt;strong&gt;Personalized Audiobook Recommendations at Spotify Through Graph Neural Networks&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Autor opisuje/recenzuje publikację mówiącą o modelach rekomendacyjnych zbudowanych przez Spotify, mających na celu proponowaniu użytkownikom podcastów i audiobooków&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-03-04</title><link>https://blog.prokulski.science/2024/03/04/newsletter-dane-i-analizy-2024-03-04/</link><pubDate>Mon, 04 Mar 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/03/04/newsletter-dane-i-analizy-2024-03-04/</guid><description>&lt;p&gt;W tym tygodniu cała masa materiału związanego z prezentacją danych - jak je pokazać efektywnie, czytelnie i przy okazji jak to się robi w kodzie? Czytaj po kolei, a to mięsko w ostatniej sekcji.&lt;/p&gt;&#10;&lt;p&gt;Ponieważ głównym założeniem tego newslettera jest dzielenie się wiedzą - dzisiaj również coś o rozwoju kariery. Jak z juniora zostać seniorem? I co to oznacza być seniorem (w oczach juniora, ale też w rzeczywistości).&lt;/p&gt;&#10;&lt;p&gt;Na koniec dzisiejszych polecajek: kilka tekstów o milionach. Milionach szybko generowanych PDFów, milionach requestów do API i milionach wierszy w plikach CSV. Jak to optymalizować, żeby się szybko działo?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-02-05</title><link>https://blog.prokulski.science/2024/02/05/newsletter-dane-i-analizy-2024-02-05/</link><pubDate>Mon, 05 Feb 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/02/05/newsletter-dane-i-analizy-2024-02-05/</guid><description>&lt;p&gt;W dzisiejszym wydaniu znajdziecie potężny tekst wprowadzający w świat programowania obiektowego w Pythonie. Wszystko co trzeba wiedzieć o klasach, metodach, konstruktorach i dziedziczeniu. A do tego jeszcze dorzucamy materiały uzupełniające: skupiające się na bardziej precyzyjnych aspektach klas i metod (oraz dekoratorów do tychże).&lt;br&gt;&#10;To dla praktyków programowania.&lt;/p&gt;&#10;&lt;p&gt;Dla osób z okolic zarządzania - coś o miernikach. Jak monitorować czy zespół wytwórczy pracuje na stabilnym poziomie i czy ten poziom jest wysoki? Teksty o definicjach i przykładach wykorzystania mierników. Jeśli zarządzasz zespołem i chciałbyś mierniki przełożyć na cele to może metoda OKR znajdzie zastosowanie? Dobrze zacząć od zestawienia &lt;a href="https://okry.pl/wskazniki-wyprzedzajace-opoznione-kpi/"&gt;OKR vs KPI&lt;/a&gt; o którym pisze Tomek Bienias.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-15</title><link>https://blog.prokulski.science/2024/01/15/newsletter-dane-i-analizy-2024-01-15/</link><pubDate>Mon, 15 Jan 2024 11:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/15/newsletter-dane-i-analizy-2024-01-15/</guid><description>&lt;p&gt;Idzie (właściwie już jest) karnawał, może drinka? Jakie drinki są aktualnie popularne? Ładna &lt;a href="https://www.visualcapitalist.com/the-most-popular-cocktail-drinks-in-2024/"&gt;infografika&lt;/a&gt; nam to pokaże :). A jeśli chodzi o obrazki, a może raczej - pokazywanie danych - to na samym końcu tego wydania coś o dobieraniu wykresu do danych, które chcemy zaprezentować. Taki to kończący szkołę i rozpoczynający ferie numer mamy.&lt;/p&gt;&#10;&lt;p&gt;Bo sporo też stosunkowo &amp;ldquo;juniorskich&amp;rdquo; tekstów dla adeptów programowania w Pythonie. Ale dla seniorów - spora książka o analizie danych geograficznych. Czytajcie uważnie, szukajcie dokładnie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-08</title><link>https://blog.prokulski.science/2024/01/08/newsletter-dane-i-analizy-2024-01-08/</link><pubDate>Mon, 08 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/08/newsletter-dane-i-analizy-2024-01-08/</guid><description>&lt;p&gt;Dzisiaj w ramach wstępu - pakiet specjalny, pakiet linków dodatkowych, bo każdy z początkujących data scientistów przechodzi przez podobne zagadnienia. Najpierw uczymy się wczytywać dane, potem je filtrować i przekształcać.&lt;/p&gt;&#10;&lt;p&gt;Często przekształcenia polegają na przejściu wiersz po wierszu w naszych danych. Jak już umiemy nieco programować to - dla przykładu pandasowy iterrows() wydaje się być dobrym rozwiązaniem. Przecież dla każdego wiersza w naszej tabeli powinniśmy wykonać jakąś operację. No, ale nie zawsze pętle mają sens i &lt;a href="https://www.kaggle.com/code/youssef19/how-to-eliminate-loops-from-your-python-code"&gt;ten notebook&lt;/a&gt; pokazuje jak się ich pozbyć, chociaż akurat nie w pandasowych tabelkach. No, ale nie po to wymyślono w Pythonie listy, żeby z nich nie korzystać! Często są bardzo szybkie i naprawdę wygodne!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-04</title><link>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</link><pubDate>Mon, 04 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</guid><description>&lt;p&gt;W poprzednim tygodniu przeczytać mogliście króciutkie podsumowanie Data Science Summit, a tam stwierdzenie, że dużo się mówi o Streamlit jako sposobie na &lt;em&gt;PoC-owanie&lt;/em&gt; prezentacji danych. Świat obecnie idzie również w stronę streamingu i obsługi tak przesyłanych danych - głównie Flinkiem. I na Flinku skupia się dzisiejszy numer naszego newslettera.&lt;/p&gt;&#10;&lt;p&gt;Ciekawy jest też niespełna półgodzinne nagranie prezentujące możliwości DuckDB w kontekście danych przestrzennych pozyskanych z Open Street Maps. Chwilę bawiłem się DuckDB ale w połączeniu ze sporymi zbiorami geo (zapisanymi w ShapeFile&amp;rsquo;ach) i śmiga to wspaniale. Jedyny minus - to baza plikowa, więc średnio do użycia w przypadku dostępu przez wiele aplikacji na raz. Ale jako element w procesie &lt;em&gt;data engineeringu&lt;/em&gt; może się bardzo przydać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-27</title><link>https://blog.prokulski.science/2023/11/27/newsletter-dane-i-analizy-2023-11-27/</link><pubDate>Mon, 27 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/27/newsletter-dane-i-analizy-2023-11-27/</guid><description>&lt;p&gt;W minionym tygodniu miałem okazję być uczestnikiem konferencji &lt;strong&gt;Data Science Summit&lt;/strong&gt;. Moje obserwacje są dość proste (ale przyznam, że interesowały mnie ścieżki bliższe data engineering niż data science czy wręcz precyzyjnie LLM):&lt;br&gt;&#10;budowanie modeli przestało być zagadnieniem zagadnieniem jest ich wdrażanie, utrzymywanie, sprawianie by szybko działały i były łatwe do podmiany na swoje lepsze wersje a więc &lt;strong&gt;znaczenie ma MLOps&lt;/strong&gt; hasło &lt;em&gt;data mesh&lt;/em&gt; straciło impakt - nadal mówi się o tym, że dane to powinien być produkt, że ważny jest &amp;ldquo;demokratyczny dostęp do danych&amp;rdquo;, ale nie ma takiego hype jak rok temu dużo mówi się o Streamlit jako narzędziu do szybkiego budowania dedykowanych rozwiązań do prezentacji danych (i interakcji z nimi), właściwie obok dedykowanych narzędzi BI (PowerBI, MS Fabric, Tableau) Streamlit był jedynym rozwiązaniem open source&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-03</title><link>https://blog.prokulski.science/2023/07/03/newsletter-dane-i-analizy-2023-07-03/</link><pubDate>Mon, 03 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/03/newsletter-dane-i-analizy-2023-07-03/</guid><description>&lt;p&gt;Wzorce projektowe ułatwiają pracę. Kod jest bardziej czytelny, łatwiej go rozbudować i nie trzeba przebudowywać całej aplikacji. Tych wzorców jest bardzo dużo, możesz zacząć od &amp;ldquo;top 10&amp;rdquo; opisanych w artykule &lt;a href="https://pub.towardsai.net/10-underrated-software-patterns-every-ml-engineer-should-know-92e702b96407"&gt;&amp;ldquo;10 Underrated Software Patterns Every ML Engineer Should Know&amp;rdquo;&lt;/a&gt;, który patrzy na wzorce projektowe przez pryzmat projektów machine learning.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zaś potrzebujesz przykładu kodu to dobre wprowadzenie daje tekst &lt;a href="https://python.plainenglish.io/structural-design-patterns-a-comprehensive-guide-for-developers-c0cde4a86319"&gt;&amp;ldquo;Structural Design Patterns: A Comprehensive Guide for Developers&amp;rdquo;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Największą jednak i darmową bazą, obejmującą kilka języków (angielski, niemiecki, polski też&amp;hellip; a nie! - o języki programowania chodzi: C#, C++, Go, Java, PHP, Python, Ruby, Rust, Swift oraz TypeScript) jest strona &lt;a href="https://refactoring.guru/pl/design-patterns/"&gt;&lt;strong&gt;Refactoring.Guru&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-26</title><link>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</link><pubDate>Mon, 26 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</guid><description>&lt;p&gt;Rozpoczynamy pierwszy tydzień wakacji, ale to wcale nie oznacza, że newsletter ma urlop. Wręcz przeciwnie.&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym wydaniu kilka tekstów opisujących dobre praktyki i całe cykle tutorialowe: CRUD-woe API dla MongoDB czy też asynchroniczne mikroserwisy spięte Rabbitem. To dla tych średniozaawansowanych programistów (i tych, którzy chcą swoją wiedzę przenieść z poziomu juniorskiego na wyższy). Dla tych bardziej juniorów - korepetycje z Window Functions w SQLu i &amp;ldquo;rozpakowywujących&amp;rdquo; gwiazdek w Pythonie (mimo że to nie Gwiazdka, he he, zacny suchar).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-08</title><link>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</link><pubDate>Mon, 08 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</guid><description>&lt;p&gt;Majówka, majówka i po majówce. Wypoczęci? Ja zwiedziłem z rodziną Trójmiasto, jestem zadowolony i o to właściwie w wypoczynku chodzi. Tylko dlaczego tak wieje nad morzem?&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym odcinku zaś szczególnie polecam książkę Françoisa Fleureta &lt;a href="https://fleuret.org/francois/"&gt;&lt;strong&gt;The Little Book of Deep Learning&lt;/strong&gt;&lt;/a&gt; - sporo teorii o tym jak działa głębokie uczenie, różne typy warstw i w ogóle na czym ta cała sztuczna inteligencja polega. Książka wygląda na przyciętą formatem do ekranu telefonu - przyznam, że to interesujący pomysł (ale już go znamy z chociażby [reklama] &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;Kart Data Science&lt;/strong&gt;&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-20</title><link>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</link><pubDate>Mon, 20 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</guid><description>&lt;p&gt;Wiecie kto generuje najwięcej ruchu w internecie? Kiedyś to było porno i torrenty (albo inne sposoby wymiany plików peer-to-peer). Teraz układ wygląda jak na poniższym obrazku, przynajmniej według danych &lt;a href="https://www.statista.com/chart/15692/distribution-of-global-downstream-traffic/"&gt;opublikowanych&lt;/a&gt; przez serwis Statista.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://prokulski.science/temp/static/nlt/global_internet_traffic.jpeg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj bardzo dużo treści - oraz eksperyment - polskie tytuły (ale przeważnie angielskie teksty). Wśród tych tekstów sporo o Apache Spark i konkretnych wykorzystaniach albo rozwiązaniach konkretnych problemów.&lt;br&gt;&#10;Znajdziecie też kilka fajnych tekstów o różnego typu problemach rozwiązywanych przez analizę czy modele danych (rekomendacje w Netflixie, OHE i Pandas), gorąco polecam tekst o Apache Arrow.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-06</title><link>https://blog.prokulski.science/2023/03/06/newsletter-dane-i-analizy-2023-03-06/</link><pubDate>Mon, 06 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/06/newsletter-dane-i-analizy-2023-03-06/</guid><description>&lt;p&gt;Prosty zestaw danych - tylko 6 liczb, po dwie dla 6 kategorii, każda z kategorii dodatkowo podzielona na 2 lata. Na ile sposobów można takie dane pokazać? Kilka, prawda? Bo ileż można wymyślać? I faktycznie - czasem jest &lt;em&gt;nawymyślane&lt;/em&gt; nieco do przesady. Ale &lt;a href="https://100.datavizproject.com/"&gt;&lt;strong&gt;ta strona&lt;/strong&gt;&lt;/a&gt; pokazuje aż 100 (słownie: sto!) przykładów wizualizacji tych 6 liczb. Fascynujące, inspirujące i&amp;hellip; zdumiewające?&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj też sporo w sekcji o analizie danych. Dwa ciekawe pakiety (&lt;a href="https://greatexpectations.io/"&gt;Great Expectations&lt;/a&gt; oraz &lt;a href="https://www.nannyml.com/"&gt;NannyML&lt;/a&gt;) plus wręcz zbiór ułatwiaczy EDA. Dodatkowo bardzo fajny projekt rozpoznawania szachów (i możliwych ruchów) oraz wieloręki bandyta - sposób na optymalizację testów typu A/B przy ograniczonym budżecie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-12</title><link>https://blog.prokulski.science/2022/12/12/newsletter-dane-i-analizy-2022-12-12/</link><pubDate>Mon, 12 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/12/newsletter-dane-i-analizy-2022-12-12/</guid><description>&lt;p&gt;Dzisiaj nie będzie o GPT-3 i &lt;a href="https://chat.openai.com/chat"&gt;chacie OpenAI&lt;/a&gt; (jak &lt;a href="https://www.google.com/search?tbm=nws&amp;amp;q=Chat+GPT"&gt;wszędzie&lt;/a&gt;), ale będzie wprowadzenie w temat szeregów czasowych oraz coś o metrykach dla modeli rekomendacyjnych.&lt;/p&gt;&#10;&lt;p&gt;Jest też trochę materiałów dla początkujących i średnio-zaawansowanych w Pythonie, a sekcja &lt;strong&gt;ciekawostek&lt;/strong&gt; pozwoli wybrać książkę dla inżynierów danych albo&amp;hellip; nauczyć się programu do obsługi audio/wideo.&lt;/p&gt;&#10;&lt;p&gt;Pamiętacie o &lt;strong&gt;Kartach Data Science&lt;/strong&gt;? Właśnie pojawiła się aktualizacja o paczkę dotyczącą szeregów czasowych (dobrze komponuje się z dzisiejszym wydaniem, prawda?). To coś dla Ciebie? A może na prezent pod choinkę dla kogoś znajomego? Tak czy inaczej ja daję &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;bezterminowo 15% zniżki&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-24</title><link>https://blog.prokulski.science/2022/10/24/newsletter-dane-i-analizy-2022-10-24/</link><pubDate>Mon, 24 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/24/newsletter-dane-i-analizy-2022-10-24/</guid><description>&lt;p&gt;Dzisiejsze wydanie newslettera skupia się na szeregach czasowych. Szeregiem czasowym jest pewnie jakieś 60% danych, na pewno wszystkie zmieniające się w czasie. Tak więc liczba klientów w sklepie (albo stronie internetowej), wynik pomiarów z jakiegoś czujnika (temperatura) itd itp - wszystko to układa się w szeregi czasowe.&lt;/p&gt;&#10;&lt;p&gt;A takie szeregi pozwalają na przewidywanie przyszłości. Czasem jest to łatwe, czasem trudne (giełda to też w zasadzie szereg czasowy, a przewidywanie nie jest takie oczywiste). I trochę o tym dzisiaj.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-22</title><link>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</link><pubDate>Mon, 22 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</guid><description>&lt;p&gt;Czy mniejsza liczba artykułów (nie wiem czy to zauważalne&amp;hellip;) to dla Was lepiej czy gorzej? Przeczytacie w związku z tym więcej (wszystkie?) czy tak samo jak zwykle 2-3, a reszta to nuda?&lt;/p&gt;&#10;&lt;p&gt;Dzisiejszy numer to nieco eksperyment ale - przyznajmy to szczerze - wynik sezonu wakacyjnego. Oj ciężko się zebrać do roboty, ciężko&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mlu-explain.github.io/"&gt;&lt;strong&gt;MLU-Explain&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działają lasy losowe? Co to jest krzywa ROC i AUC? Jeśli nie wiesz to ten serwis w przystępny, graficzny sposób pomoże to zrozumieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-08</title><link>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</link><pubDate>Mon, 08 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</guid><description>&lt;p&gt;Wakacje za półmetkiem, więc tematy w dzisiejszym newsletterze tak pół na pół.&lt;/p&gt;&#10;&lt;p&gt;Z jednej strony mamy ciężkie rzeczy: nowe naukowe &lt;em&gt;pejpery&lt;/em&gt; czy omówienie algorytmu grupowania przestrzennego opartego na gęstości. Ale z drugiej - automatyzację w Excelu czy kilka(naście) inspiracji dotyczących prezentowania danych.&lt;/p&gt;&#10;&lt;p&gt;Dla tych zaś co lubią wdrażanie i Kubernetesy - też coś się znajdzie, chociażby cluster na malinach ;-)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/6-papers-every-modern-data-scientist-must-read-1d0e708becd"&gt;&lt;strong&gt;6 Papers Every Modern Data Scientist Must Read&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przegląd prasy (publikacji naukowych) dla prawdziwych nerdów AI/ML. Jaki &amp;ldquo;pejper&amp;rdquo; czytasz dzisiaj?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-11</title><link>https://blog.prokulski.science/2022/04/11/newsletter-dane-i-analizy-2022-04-11/</link><pubDate>Mon, 11 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/11/newsletter-dane-i-analizy-2022-04-11/</guid><description>&lt;p&gt;Trochę mniej artykułów, ale jeden z nich to potężny kolos (ten o SHAP). Do tego bardzo fajne porady dla początkujących w Pythonie i ciekawe koncepcje w świecie big data (jakby ktoś chciał postawić klaster to jest o tym poradnik).&lt;/p&gt;&#10;&lt;p&gt;Zaś w przyszłym tygodniu zrobimy sobie przerwę świąteczną - polewajcie się wodą za tydzień (oby pogoda dopisała), a nie zajmujcie się komputerami. Wesołych Świąt!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/revisiting-mnist-with-fresh-eyes-36f9d19a75d1"&gt;&lt;strong&gt;Revisiting MNIST with Fresh Eyes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy kto próbował machine learningu albo deep learningu (w szczególności sieci CNN) zetknął się ze zbiorem ręcznie pisanych cyfr MNIST. Tutaj inne podejście do znanego problemu&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-28</title><link>https://blog.prokulski.science/2022/02/28/newsletter-dane-i-analizy-2022-02-28/</link><pubDate>Mon, 28 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/28/newsletter-dane-i-analizy-2022-02-28/</guid><description>&lt;p&gt;Po raz drugi Dane i Analizy są patronem medialnym &lt;strong&gt;CuValley Hack&lt;/strong&gt;. To też druga edycja tego hackathonu, który organizowany jest przez #KGHM w ramach programu #DolinaMiedziowa.&lt;/p&gt;&#10;&lt;p&gt;Impreza startuje &lt;strong&gt;11 marca&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cuvalley.com"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/cuvalley_900x500.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Hackathon zrzesza otwarte umysły i pomysłowych specjalistów, którzy chcą tworzyć innowacyjne projekty dla polskiej miedzi. Uczestnicy skupią się na analizie danych oraz wykorzystaniu #AI, #MachineLearning czy #BigData w układach automatyki przemysłowej. Co Was czeka?&lt;br&gt;&#10;3 zadania, w których do wygrania wysokie nagrody pieniężne 40 godzin kodowania i networking na kanale Slack tysiące dostępnych danych webinary, Keynote Speakerzy, porządna dawka wiedzy i inspiracji!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-10</title><link>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</link><pubDate>Mon, 10 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</guid><description>&lt;p&gt;Koniec przerw świątecznych, koniec długich weekendów, czas wracać do pracy.&lt;/p&gt;&#10;&lt;p&gt;Dla mnie osobiście rok zaczął się zabawą z Raspberry Pi i próbwaniem co to cudo potrafi. Nigdzie nie ma Raspberry Pi 4, więc zadowoliłem się na start Pi Zero. Mały, ale wariat - używam do PiHole oraz staram się podglądać co robi w nocy kot. Jak? A no tym prostym &lt;a href="https://github.com/prokulski/rasppi_motion_capture/blob/main/main.py"&gt;skryptem&lt;/a&gt; i kamerką podłączoną po USB.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/11-dimensionality-reduction-techniques-you-should-know-in-2021-dcb9500d388b"&gt;&lt;strong&gt;11 Dimensionality reduction techniques you should know in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;11 metod na redukcję rozmiarów Twoich danych. Ale zmniejszenie wielkości to nie jedyne zastosowanie - przy redukcji wymiarów często odsłaniają się ukryte informacje&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-20</title><link>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</link><pubDate>Mon, 20 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</guid><description>&lt;p&gt;To ostatni numer newslettera&amp;hellip; przed Bożym Narodzeniem.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym przede wszystkim życzę Ci spokoju, spędzenia mile czasu z najbliższymi, odpoczynku (też od komputerów) i jeszcze raz pieniędzy.&lt;/p&gt;&#10;&lt;p&gt;Do życzeń dołączam pythonową choinkę:&lt;/p&gt;&#10;&lt;p&gt;def holidaybush(n):&lt;br&gt;&#10;    for i in range(n):&lt;br&gt;&#10;        print((&amp;quot;+&amp;quot; * (i * 2 + 1)).center(n * 2 - 1))&lt;br&gt;&#10;    print(&amp;quot;+++&amp;quot;.center(n * 2 - 1))&lt;/p&gt;&#10;&lt;p&gt;holidaybush(15)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://glassboxmedicine.com/2019/09/15/best-use-of-train-val-test-splits-with-tips-for-medical-data/"&gt;&lt;strong&gt;Best Use of Train/Val/Test Splits, with Tips for Medical Data&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Modele, uczenie, dane treningowe, testowe, walidacyjne&amp;hellip; ale właściwie dlaczego tak?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-01</title><link>https://blog.prokulski.science/2021/11/01/newsletter-dane-i-analizy-2021-11-01/</link><pubDate>Mon, 01 Nov 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/01/newsletter-dane-i-analizy-2021-11-01/</guid><description>&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2021/10/beginners-guide-to-automl-with-an-easy-autogluon-example/"&gt;&lt;strong&gt;Beginner’s Guide to AutoML with an Easy AutoGluon Example&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This article was published as a part of the Data Science Blogathon Machine Learning is popular and is being used everywhere for applications ranging from financial services to healthcare, marketing &amp;amp; advertising to manufacturing. Almost all industries seem to derive substantial benefit using some form of Machine Learning. Over the recent past, automation technology also […] The post (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/visualising-similarity-clusters-with-interactive-graphs-20a4b2a18534?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Visualising Similarity Clusters with Interactive Graphs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Take advantage of Python, Plotly, and NetworkX to create interactive graphs to find similarity clusters Let us assume, as a running example, that my data is composed of word embeddings of the English language. I want to gain insights about the word distribution in the embedding space, specifically, if there are any clusters of very similar words, if there are words that are completely different (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-25</title><link>https://blog.prokulski.science/2021/10/25/newsletter-dane-i-analizy-2021-10-25/</link><pubDate>Mon, 25 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/25/newsletter-dane-i-analizy-2021-10-25/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/optimize-ml-modeling-using-a-timing-decorator-2b113c6b60d9"&gt;&lt;strong&gt;Optimize ML modeling using a timing decorator&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Record the execution time of ML training using timing decorators and use it for productive data science and ML optimization Image source : Pixabay (Free to use) Why measuring time is important We can go on and provide hundreds of arguments and quotes showing why the act of measurement is important in science and technology. Here is a powerful one, One accurate measurement is worth a thousand (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-23</title><link>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</link><pubDate>Sat, 23 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</guid><description>&lt;p&gt;&lt;a href="https://preettheman.medium.com/best-front-end-python-frameworks-in-2021-643d1df6922c"&gt;&lt;strong&gt;Best front-end Python frameworks in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Welcome back! Python is an awesome programming language with a ton of capability, one of these functions is building GUI’s (front-ends), so let’s talk about some of my favorite front-ends frameworks for Python. Now, Python is an awesome language for web development as well, if you want to see some sample websites you can build with Python, check out this article below: Let’s take a look at some (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-11</title><link>https://blog.prokulski.science/2021/10/11/newsletter-dane-i-analizy-2021-10-11/</link><pubDate>Mon, 11 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/11/newsletter-dane-i-analizy-2021-10-11/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/top-5-time-series-analytics-71a46fbda379?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Top 5 Time Series Analytics&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Learn about the top use-cases and techniques for time-series data Time is present in most of the data around us. From retail product sales data to financial stock price, to IoT sensor data, all have a notion of time in it. So mastering time-series analytics is going to make you master of the data science world The top 5 analytics which I will demonstrate here are Seasonality Detection to find (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-13</title><link>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</link><pubDate>Mon, 13 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/still-using-the-os-module-in-python-this-alternative-is-remarkably-better-7d728ce22fb7"&gt;&lt;strong&gt;Still Using the OS Module in Python? This Alternative is Remarkably Better&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Python’s OS module is a nightmare for managing files and folders. You should try Pathlib. File and folder management with Python’s os module is a nightmare. Yet, it’s an essential part of every data science workflow. Saving reports, reading configuration files, you name it — there’s no way around it. Picture this — you spend weeks building an API around your model, and it works flawlessly, at (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-02</title><link>https://blog.prokulski.science/2021/08/02/newsletter-dane-i-analizy-2021-08-02/</link><pubDate>Mon, 02 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/02/newsletter-dane-i-analizy-2021-08-02/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/how-to-use-yield-in-python-5f1fbb864f94"&gt;&lt;strong&gt;How To Use “yield” in Python?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Python Generator — from basic to advanced usage Continue reading on Towards Data Science »&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/10-best-practices-to-write-readable-and-maintainable-sql-code-427f6bb98208"&gt;&lt;strong&gt;10 Best Practices to Write Readable and Maintainable SQL Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to write SQL queries that your team can easily read and maintain? It’s easy to mess with SQL without proper guidelines. Since everybody in your team might have their own habits of writing SQL, you can quickly end up with a confusing code that nobody understands. You probably realized the importance of following a set of good practices. May this article give you the guidance you’re (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-31</title><link>https://blog.prokulski.science/2021/07/31/newsletter-dane-i-analizy-2021-07-31/</link><pubDate>Sat, 31 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/31/newsletter-dane-i-analizy-2021-07-31/</guid><description>&lt;p&gt;&lt;a href="https://medium.com/geekculture/how-to-model-time-between-events-using-the-exponential-gamma-and-poisson-distributions-4b058a357a55"&gt;&lt;strong&gt;How to Model Time Between Events Using the Exponential, Gamma, and Poisson Distributions&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to model time-to-event and ‘time between events’ on real data using the Exponential Family to optimize returns of time driven investments. Screenshots from within the article. Usually, when we have time as a variable on a dataset, we can model other variables reflected in time itself, whether we apply Time Series Analysis or just use time to cut our data and apply continual ML or S tate Space (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-26</title><link>https://blog.prokulski.science/2021/07/26/newsletter-dane-i-analizy-2021-07-26/</link><pubDate>Mon, 26 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/26/newsletter-dane-i-analizy-2021-07-26/</guid><description>&lt;p&gt;&lt;a href="http://datasciencein.pl/ocena-modeli-klasyfikacyjnych-od-tablicy-pomylek-do-f1/"&gt;&lt;strong&gt;Ocena modeli klasyfikacyjnych - od tablicy pomyłek do F1 - Data science in pl&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Zrozumieć modele klasyfikacyjne. Tablica pomyłek, czułość, swoistość precyzja i F1 - opis i intuicyjne przykłady.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/word-embedding-techniques-word2vec-and-tf-idf-explained-c5d02e34d08?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Word Embedding Techniques: Word2Vec and TF-IDF Explained&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;The words need to be made meaningful for machine learning or deep learning algorithms. Therefore, they must be expressed numerically. Algorithms such as One Hot Encoding, TF-IDF, Word2Vec, FastText enable words to be expressed mathematically as word embedding techniques used to solve such problems. (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Jak odczytać maile z Gmaila w R?</title><link>https://blog.prokulski.science/2018/10/08/gmail-w-r/</link><pubDate>Mon, 08 Oct 2018 15:51:43 +0000</pubDate><guid>https://blog.prokulski.science/2018/10/08/gmail-w-r/</guid><description>&lt;p&gt;Wszystko zaczęło się od awarii Home.pl i jednego postu na Facebooku…&#10;&lt;strong&gt;&lt;a href="https://www.facebook.com/photo.php?fbid=10156666399649183"&gt;Post&lt;/a&gt;&lt;/strong&gt;, o którym mowa to screen shot skrzynki mailowej pełnej informacji od czytelników &lt;a href="https://niebezpiecznik.pl/"&gt;Niebezpiecznika&lt;/a&gt; donoszących o awarii serwerów Home.pl (o samej awarii &lt;a href="https://niebezpiecznik.pl/post/potezna-awaria-dns-w-home-pl-od-kilku-godzin-klienci-nie-moga-skorzystac-z-zadnych-uslug/"&gt;tutaj&lt;/a&gt;).&lt;/p&gt;&#10;&lt;p&gt;W komentarzach pojawił się pomysł, żeby stworzyć mechanizm informujący, że w skrzynce odbiorczej wzrasta liczba maili dotyczących określonego tematu. Jak do tego podejść?&#10;Zastanówmy się czego potrzebujemy, aby taki “sygnalizator” przygotować. W najprostszej formie, przynajmniej na początek. Potrzebujemy:&lt;/p&gt;</description></item><item><title>Przewidywanie pogody</title><link>https://blog.prokulski.science/2018/04/12/przewidywanie-pogody/</link><pubDate>Thu, 12 Apr 2018 08:42:57 +0000</pubDate><guid>https://blog.prokulski.science/2018/04/12/przewidywanie-pogody/</guid><description>&lt;p&gt;W &lt;a href="../../2018/03/27/lato-bylo-cieplejsze/"&gt;poprzednim odcinku&lt;/a&gt; zebraliśmy dane o pogodzie w Polsce od 1951 roku. Dzisiaj przygotujemy prognozę pogody. Ale przede wszystkim nauczymy się weryfikować modele.&#10;Mając zgromadzone dane o pogodzie z ponad 60 lat (1951-2017) możemy pokusić się o prognozowanie temperatury w przyszłości. Wykorzystamy trzy (właściwie dwa) modele dostępne &lt;em&gt;od ręki&lt;/em&gt; w popularnych bibliotekach R oraz zaprzęgniemy do prognozowania sieć neuronową.&#10;Zaczniemy od potrzebnych bibliotek:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;tidyverse&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;lubridate&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;DBI&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# pobieranie danych z bazy SQLite&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;forecast&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# na potrzeby modeli ARIMA i ETS/STLF&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;keras&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# na potrzeby LSTM w TensorFlow&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;corrgram&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# wykres korelacji&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Na początek pobieramy dane o średniej dziennej temperaturze wszystkich stacji w latach 2000-2016. Te dane potraktujemy jako dane treningowe. Dane z 2017 roku potraktujemy jako testowe.&lt;/p&gt;</description></item><item><title>Nowe pojazdy w Polsce po roku 2010</title><link>https://blog.prokulski.science/2017/04/29/nowe-pojazdy-w-polsce-po-roku-2010/</link><pubDate>Sat, 29 Apr 2017 09:57:58 +0000</pubDate><guid>https://blog.prokulski.science/2017/04/29/nowe-pojazdy-w-polsce-po-roku-2010/</guid><description>&lt;p&gt;Gdzie rejestruje się najwięcej nowych samochodów?&#10;&lt;strong&gt;Jak to porównywać i pokazywać?&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj proste zadanie, ale wymagające nieco gimnastyki. Otóż sprawdzimy gdzie przybywa najwięcej nowych samochodów. Skorzystamy z danych &lt;a href="https://bdl.stat.gov.pl/BDL/dane/podgrup/temat"&gt;GUSu&lt;/a&gt; (precyzyjniej jest to Kategoria: TRANSPORT I ŁĄCZNOŚĆ, Grupa: POJAZDY, Podgrupa: Zarejestrowane nowe pojazdy samochodowe (dane kwartalne)).&#10;Pobieramy ręcznie plik CSV (dane dla wszystkich okresów i wszystkich lat, tylko samochody osobowe), pamiętając żeby przed pobraniem pliku przełączyć układ danych na “według TERYT” (klucz TERYT jest najlepszy do łączenia danych z mapami - pobranymi w plikach SHP z &lt;a href="http://www.codgik.gov.pl/index.php/darmowe-dane/prg.html"&gt;CODGiK&lt;/a&gt; - zdaje się, że &lt;a href="../../2017/03/30/szybka-mapka-z-miastami/"&gt;było już o tym&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Prognoza stopy bezrobocia na 2017-2018</title><link>https://blog.prokulski.science/2017/04/26/prognoza-stopy-bezrobocia-na-2017-2018/</link><pubDate>Wed, 26 Apr 2017 12:28:23 +0000</pubDate><guid>https://blog.prokulski.science/2017/04/26/prognoza-stopy-bezrobocia-na-2017-2018/</guid><description>&lt;p&gt;Jakie będzie bezrobocie za dwa lata?&#10;A właściwie - jak wyznaczyć przyszłe dane na podstawie historii?&#10;Dzisiaj zajmiemy się prostą (automatyczną) predykcją szeregów czasowych.&#10;Co to jest &lt;strong&gt;szereg czasowy&lt;/strong&gt;? Ano, zbiór danych przypisanych do kolejnych dat (chwil w czasie - będąc bardziej precyzyjnym). Może to być wartość akcji dzień po dniu, może to być temperatura (czy dowolne inne wartości opisujące pogodę) lub cokolwiek innego, co ma swoje wartości w kolejnych momentach czasu. My zajmiemy się stopą bezrobocia w Polsce.&#10;Skorzystamy z miesięcznych danych &lt;a href="http://stat.gov.pl/obszary-tematyczne/rynek-pracy/bezrobocie-rejestrowane/stopa-bezrobocia-w-latach-1990-2017,4,1.html"&gt;publikowanych przez GUS&lt;/a&gt;. Dane są w ładnej tabelce na stronie, można więc je łatwo z niej wyciągnąć.&lt;/p&gt;</description></item></channel></rss>