<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Pandas on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/pandas/</link><description>Recent content in Pandas on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 06 Jul 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/pandas/index.xml" rel="self" type="application/rss+xml"/><item><title>Lokalni agenci, schema evolution i najgorsze błędy XGBoost</title><link>https://blog.prokulski.science/2026/07/06/lokalni-agenci-schema-evolution-i-najgorsze-bledy-xgboost/</link><pubDate>Mon, 06 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/06/lokalni-agenci-schema-evolution-i-najgorsze-bledy-xgboost/</guid><description>&lt;p&gt;To wydanie zadaje dwa pytania, które wielu z nas ma gdzieś z tyłu głowy: czy narzędzia, których używam na co dzień, to nadal dobry wybór - i czy warto rozejrzeć się za czymś nowym? Na tapecie znalazły się dbt Core 2.0, DuckDB jako zamiennik Pandas, lokalne agenty AI do pisania kodu oraz nowe modele uczenia maszynowego, które chcą wypchnąć XGBoost z piedestału. Jeśli masz wrażenie, że świat danych zmienia się szybciej niż jesteś w stanie za nim nadążyć - ten numer to potwierdza.&lt;/p&gt;</description></item><item><title>Rób produkcyjnie agentów AI, platformy danych i automatyzacje, które naprawdę dowożą</title><link>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</link><pubDate>Mon, 26 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</guid><description>&lt;p&gt;To wydanie to mocny pakiet o tym, jak przestać bawić się w „demka” i zacząć budować produkcyjne systemy danych, AI i automatyzacji – od architektury agentów, przez hurtownie, po niskopoziomowe optymalizacje.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu blok tekstów o agentach AI (platformy, orkiestracja, pamięć, narzędzia, realne case’y typu monitoring w Slacku), który pokazuje, co trzeba dostarczyć, żeby agenci nie wybuchli przy pierwszym większym ruchu. Do tego zestaw materiałów o analityce i data engineeringu: dobre EDA, przetwarzanie danych geograficznych z DuckDB + GeoPandas, kontrakty danych, wzorce ETL/ELT (Snowflake + dbt + Airflow, migracja z Airflow do Databricks), patterny pod &lt;em&gt;AI‑ready pipelines&lt;/em&gt; i benchmark DuckDB vs Spark.&lt;/p&gt;</description></item><item><title>Zrób sobie lakehouse na laptopie</title><link>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</link><pubDate>Mon, 12 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy z pogranicza AI, data engineeringu i praktyk inżynierskich. Szczególną uwagę poświęcamy agentom AI - od pisania skutecznych CLAUDE.md i budowy prostych agentów kodujących w 200 liniach, po zaawansowany monitoring autonomicznych systemów i wzorce projektowe dla inteligentnych aplikacji.&lt;/p&gt;&#10;&lt;p&gt;W sekcji data engineering znajdziesz konkretne rozwiązania: od wzorców partycjonowania przyspieszających zapytania, przez budowę lokalnego pipeline&amp;rsquo;u ELT z DuckDB i dbt (bez kosztów chmury), aż po kompletny przewodnik tworzenia lakehouse&amp;rsquo;a z Apache Iceberg, Trino i MinIO. Nie zabrakło też materiałów przygotowujących do rozmów rekrutacyjnych - 10 kluczowych tematów system design dla data engineerów w 2026 roku.&lt;/p&gt;</description></item><item><title>Kryzys pracowniczy w branży + konferencja AI Dev 25</title><link>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</link><pubDate>Mon, 08 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się transformacji współczesnych architektur IT – od rosnącej konkurencji dla RESTa i mikroserwisów, przez natywną obsługę wektorów w Postgresie, aż po praktyczne wzorce partycjonowania Parquet. W sekcji AI i ML znajdziecie przewodnik po PyTorch dla chcących zacząć z sieciami neuronowymi i budowaniem własnych modeli AI. Znajdziecie też tekst o metodach interpretacji predykcji XGBoost z wykorzystaniem SHAP.&lt;/p&gt;&#10;&lt;p&gt;Dla programistów Pythona przygotowaliśmy materiały o walidacji outputów LLM z Pydantic, monitoringu FastAPI, zaawansowanych technikach pandas oraz nowym narzędziu &amp;ldquo;ty&amp;rdquo; do automatyzacji przepływów w chmurze. DevOpsi mogą sprawdzić tutorial wdrażania Spring Boot na Kubernetes, rozwiązanie problemu rozbieżności między środowiskami lokalnym a produkcyjnym oraz master class z tcpdump i Wireshark.&lt;/p&gt;</description></item><item><title>Agenci AI, data engineering i fine-tuning LLM</title><link>https://blog.prokulski.science/2025/11/17/agenci-ai-data-engineering-i-fine-tuning-llm/</link><pubDate>Mon, 17 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/17/agenci-ai-data-engineering-i-fine-tuning-llm/</guid><description>&lt;p&gt;W dzisiejszym wydaniu koncentrujemy się na praktycznych aspektach pracy z danymi i sztuczną inteligencją (co nie jest niczym nowym dla stałych czytelników newslettera; a nowych - serdecznie witam!).&lt;br&gt;&#10;Znajdziesz tu kompleksowe tutoriale budowy agentów AI z LangChain, przewodniki po fine-tuningu modeli językowych metodą QLoRA oraz zaawansowane techniki pracy z PostgreSQL i jego rozszerzeniami.&lt;/p&gt;&#10;&lt;p&gt;Szczególną uwagę poświęcamy inżynierii danych: od strategii inkrementalnego ładowania i projektowania idempotentnych pipeline&amp;rsquo;ów, przez real-time CDC z Debezium i Kafką, aż po nowoczesne podejście lakehouse z DuckDB.&lt;br&gt;&#10;Nie zabrakło również głębokiej analizy matematyki stojącej za zero-shot learning, przeglądu metryk klasyfikacyjnych oraz praktycznych rozwiązań dla systemów rozproszonych, jak predykcyjne autoskalowanie Apache Flink.&lt;/p&gt;</description></item><item><title>Konkretne projekty z analizy danych (jak zawsze :)</title><link>https://blog.prokulski.science/2025/10/20/konkretne-projekty-z-analizy-danych-jak-zawsze/</link><pubDate>Mon, 20 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/20/konkretne-projekty-z-analizy-danych-jak-zawsze/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych rozwiązaniach dla każdego etapu pracy z danymi - od modelowania i inżynierii cech przez optymalizację baz danych, aż po wdrażanie w produkcji.&lt;/p&gt;&#10;&lt;p&gt;Czeka Cię porównanie modeli predykcyjnych (typowe zadanie dla juniorów - wytłumaczone krok po kroku) i nowe możliwości DuckDB, które zastępują całe pipeline&amp;rsquo;y w Pandas. Znajdziesz też wyzwania związane z architekturą: jak budować skalowalne systemy danych od podstaw oraz gdzie naprawdę powinny znaleźć się kontrakty danych. Dla miłośników LLMów jest przewodnik po LangChain oraz LangGraph, praktyczną instrukcję budowy lokalnego systemu RAG oraz analizę gotowości &lt;em&gt;foundation models&lt;/em&gt; do pracy z danymi tabelarycznymi.&lt;/p&gt;</description></item><item><title>Nie tylko obraz tego, co się dzieje, ale jak to wykorzystać w praktyce</title><link>https://blog.prokulski.science/2025/09/29/nie-tylko-obraz-tego-co-sie-dzieje-ale-jak-to-wykorzystac-w-praktyce/</link><pubDate>Mon, 29 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/29/nie-tylko-obraz-tego-co-sie-dzieje-ale-jak-to-wykorzystac-w-praktyce/</guid><description>&lt;p&gt;Czy kiedykolwiek marzyłeś o tym, żeby skrócić generowanie raportu z 6 godzin do 15 minut? A może zastąpić tradycyjne procesy ETL jednym narzędziem, które działa nawet 100 razy szybciej niż Spark?&lt;/p&gt;&#10;&lt;p&gt;To nie science fiction – to rzeczywistość dzisiejszego numeru!&lt;/p&gt;&#10;&lt;p&gt;Od &lt;strong&gt;agentic AI&lt;/strong&gt;, które rewolucjonizuje kariery specjalistów IT, po konkretne implementacje MCP w firmach CRM – jak zwykle w tym newsletterze nie tylko obraz tego, co się dzieje, ale przede wszystkim &lt;strong&gt;jak to wykorzystać w praktyce&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-19</title><link>https://blog.prokulski.science/2025/05/19/newsletter-dane-i-analizy-2025-05-19/</link><pubDate>Mon, 19 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/19/newsletter-dane-i-analizy-2025-05-19/</guid><description>&lt;p&gt;W świecie, który coraz mocniej stawia na wykorzystanie sztucznej inteligencji, OpenAI wprowadza Codex - asystenta AI, który może tworzyć kod na podstawie prostych instrukcji tekstowych. Tymczasem ciekawy eksperyment z czterema różnymi modelami LLM poddanymi zadaniu projektowania architektury oprogramowania pokazuje, gdzie obecnie stoją możliwości AI w zastępowaniu ludzkich specjalistów. Pytanie &lt;strong&gt;&amp;ldquo;co dalej z Eldorado?&amp;rdquo;&lt;/strong&gt; pozostaje w mocy?&lt;/p&gt;&#10;&lt;p&gt;Nie brakuje też w dzisiejszym wydaniu konkretnych tutoriali i praktycznych przewodników - od budowy systemów przetwarzania danych w Airflow 3 z wykorzystaniem AI SDK i analizę danych z League of Legends, albo z Ligi Mistrzów UEFA, po tworzenie efektownych wizualizacji takich jak mapy kafelkowe czy wykresy parlamentarne (mimo, że mamy wybory prezydenckie). Dla fanów uczenia maszynowego mam artykuły o klasycznych algorytmach klasyfikacyjnych i praktycznym łączeniu bibliotek Pandas, NumPy i scikit-learn. Plus &lt;a href="https://www.subscribepage.com/python_data_science/?utm_source=newsletter-dia-2025-05-19&amp;amp;utm_medium=link-wstep&amp;amp;utm_campaign=daneianalizy"&gt;swój własny cykl&lt;/a&gt; uczący analizy danych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-17</title><link>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</link><pubDate>Mon, 17 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</guid><description>&lt;p&gt;Sztuczna inteligencja w praktyce: Zajrzyj do repozytorium z technikami Retrieval-Augmented Generation (RAG), gdzie krok po kroku poznasz ich implementację, lub dowiedz się, jak AI może usprawnić procesy rejestracji użytkowników i przegląd kodu. Nie zabrakło też przeglądu narzędzi AI, które mogą znacząco zwiększyć Twoją produktywność.&lt;/p&gt;&#10;&lt;p&gt;Praca z danymi: Od modelowania danych w SQL dla sektora detalicznego po przetwarzanie danych w Microsoft Fabric z wykorzystaniem bibliotek takich jak pandas czy duckdb – znajdziesz tu konkretne przykłady i wskazówki, jak efektywnie zarządzać danymi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-27</title><link>https://blog.prokulski.science/2025/01/27/newsletter-dane-i-analizy-2025-01-27/</link><pubDate>Mon, 27 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/27/newsletter-dane-i-analizy-2025-01-27/</guid><description>&lt;p&gt;Na bieżący numer złapało się kilka ciekawych tematów. Warto zwrócić uwagę na tekst o systemach automatyzacji w Amazonie i Netfliksie - pokazuje podejście dużych firm do skalowalności i bezpieczeństwa. Dobry jest artykuł o &lt;em&gt;topic modeling&lt;/em&gt; z użyciem BERTopic i FASTopic - może się przydać przy przetwarzaniu skarg klientów.&lt;/p&gt;&#10;&lt;p&gt;Dla fanów Kafki znajdzie się materiał o konsumentach wiadomości, a dla pythonowców zestaw o wizualizacjach z Pythona w Power BI, budowaniu API gateway na FastAPI i poradnik &amp;ldquo;10 Tips to Become REALLY Good at Python&amp;rdquo;, gdzie w pół godziny Arjan mówi o tym, co jest najważniejsze przy nauce Pythona, od czego trzeba zacząć i co doskonalić na początku. Do tego jest też wideo dla początkujących adeptów Pandas.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-11</title><link>https://blog.prokulski.science/2024/11/11/newsletter-dane-i-analizy-2024-11-11/</link><pubDate>Mon, 11 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/11/newsletter-dane-i-analizy-2024-11-11/</guid><description>&lt;p&gt;Święto lasu słuchajcie! I to nie chodzi wcale o to, że dzisiaj mamy Narodowe Święto Niepodległości, ale o to, że w newsletterze mało o Pythonie! Więcej mamy w działce &amp;ldquo;DevOps&amp;rdquo; (która nie tylko o procesach CI/CD jest, ale też o tym jak pisać - i w tym numerze też debuggować - skrypty w Bashu) niż programowania przepływów danych czy innych finezyjnych (mniej lub bardziej) sztuczek w Pandas albo DuckDB&amp;hellip;&lt;/p&gt;&#10;&lt;p&gt;Za to dowozi dzisiaj sekcja opisująca nieco bardziej teoretycznie zagadnienia ML-owe. Chyba dobrze, co?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-08</title><link>https://blog.prokulski.science/2024/01/08/newsletter-dane-i-analizy-2024-01-08/</link><pubDate>Mon, 08 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/08/newsletter-dane-i-analizy-2024-01-08/</guid><description>&lt;p&gt;Dzisiaj w ramach wstępu - pakiet specjalny, pakiet linków dodatkowych, bo każdy z początkujących data scientistów przechodzi przez podobne zagadnienia. Najpierw uczymy się wczytywać dane, potem je filtrować i przekształcać.&lt;/p&gt;&#10;&lt;p&gt;Często przekształcenia polegają na przejściu wiersz po wierszu w naszych danych. Jak już umiemy nieco programować to - dla przykładu pandasowy iterrows() wydaje się być dobrym rozwiązaniem. Przecież dla każdego wiersza w naszej tabeli powinniśmy wykonać jakąś operację. No, ale nie zawsze pętle mają sens i &lt;a href="https://www.kaggle.com/code/youssef19/how-to-eliminate-loops-from-your-python-code"&gt;ten notebook&lt;/a&gt; pokazuje jak się ich pozbyć, chociaż akurat nie w pandasowych tabelkach. No, ale nie po to wymyślono w Pythonie listy, żeby z nich nie korzystać! Często są bardzo szybkie i naprawdę wygodne!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-11</title><link>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</link><pubDate>Mon, 11 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</guid><description>&lt;p&gt;Miniony tydzień to uruchomienie nowej wersji asysstenta AI od Google, czyli Gemini (w miejsce Barda). Sam model mówi o sobie, że &lt;em&gt;&amp;ldquo;jestem zarówno Bardem, jak i Gemini. Bard to nazwa użytkownika, którą wykorzystuję do interakcji z użytkownikami, podczas gdy Gemini to nazwa platformy AI, na której jestem oparty&amp;rdquo;&lt;/em&gt;.&lt;br&gt;&#10;&lt;a href="https://deepmind.google/technologies/gemini/#introduction"&gt;Przedstawienie projektu&lt;/a&gt; (przez twórców) mówi o lepszych wynikach od ChataGPT v4 w prawie każdym mierniku., ale niby ma to dostęp do najnowszej wiedzy, ale jednak &lt;a href="https://g.co/bard/share/c0633f7cd6ac"&gt;taki sobie&lt;/a&gt;. Z literaturą nieco starszą radzi sobie&amp;hellip; &lt;a href="https://g.co/bard/share/21dc6e2f9212"&gt;sami zobaczcie&lt;/a&gt;. Słowacki i &amp;ldquo;Wesele&amp;rdquo;? to mogłoby być ciekawe, ale wolę wersję Wyspiańskiego (a filmową od Wajdy stawiam tuż za wajdowską &amp;ldquo;Ziemią obiecaną&amp;rdquo;). Czyli też zmyśla.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-13</title><link>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</link><pubDate>Mon, 13 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</guid><description>&lt;p&gt;Za chwilę w świat pójdą pierwsze odcinki nowego podcastu przygotowanego przez zespół Big Data &amp;amp; AI PZU: &lt;strong&gt;#SilniwIT o technologiach&lt;/strong&gt;. To seria, w ramach której rozmawiam (wspólnie z Tomkiem z zespołu Fabryki Sztucznej Inteligencji) z gośćmi o szeroko pojętej sztucznej inteligencji. Wypatrujcie postów na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;FB&lt;/a&gt;, &lt;a href="https://www.linkedin.com/company/daneianalizy/"&gt;LinkedIn&lt;/a&gt; i pewnie w przyszłym newsletterze - mam nadzieję, że jak na amatorów - daliśmy radę. Staraliśmy się ucinać korpo-gadkę, powinno być interesująco ;-)&lt;/p&gt;&#10;&lt;p&gt;Wcześniej możecie posłuchać podsumowania z pierwszej konferencji OpenAI (firmy, która stworzyła ChatGPT) dla developerów w podcaście &lt;a href="https://podcasters.spotify.com/pod/show/artur-kurasinski/episodes/Podsumowanie-OpenAI-DevDay-2023-e2bles4"&gt;Technofobia&lt;/a&gt; Artura Kurasińskiego.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-11</title><link>https://blog.prokulski.science/2023/09/11/newsletter-dane-i-analizy-2023-09-11/</link><pubDate>Mon, 11 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/11/newsletter-dane-i-analizy-2023-09-11/</guid><description>&lt;p&gt;Dzisiaj sporo materiałów wideo. Od prostych przewodników po kilkanaście minut (z czego &amp;ldquo;mięso&amp;rdquo; zajmuje do 5-10, a i to najwyżej) do dużego kursu na półtorej godziny. Trochę też o budowaniu czy może raczej ulepszaniu swojego środowiska pracy. Czy to w Linuxie czy to w VSCode. Ciekawostka, szok i niedowierzanie: oba te &amp;ldquo;zakresy tematyczne&amp;rdquo; (poprawa wygody pracy i wideo) mają części wspólne!&lt;/p&gt;&#10;&lt;p&gt;Dla tych którzy wierzą w &lt;a href="https://pl.wikipedia.org/wiki/Smugi_chemiczne"&gt;chemtrails&lt;/a&gt; też coś mamy ;-) a z całego tekstu, który znajdziecie niżej najlepszy i tak zawsze jest gotowy &lt;a href="https://www.kaggle.com/code/mnokno/getting-started-eda-model-train-submit"&gt;notebook z kodem&lt;/a&gt; (znowu Torch a nie TensorFlow - coś jest na rzeczy, prawda?)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-17</title><link>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</link><pubDate>Mon, 17 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</guid><description>&lt;p&gt;Gorąco polecam tekst &lt;a href="https://towardsdev.com/data-engineering-project-imdb-movie-analysis-3f79de2f4ce7"&gt;Data Engineering Project: IMDB Movie Analysis&lt;/a&gt; - przykład świetnego projektu pozyskiwania i przetwarzania danych.&lt;/p&gt;&#10;&lt;p&gt;A kiedy dane są już przetworzone - można je pokazać. Wspomniany tekst analizujący dane z IMDB też zawiera ten element, ale dzisiejsze wydanie pokazuje więcej takich przykładów czy też tutoriali. Mamy coś o rysowaniu wykresów (super jest &lt;a href="https://towardsdatascience.com/plotly-and-pandas-combining-forces-for-effective-data-visualization-2e2caad52de9"&gt;Plotly and Pandas: Combining Forces for Effective Data Visualization&lt;/a&gt;) ale też &lt;a href="https://nightingaledvs.com/data-journalism-colour-accessibility/"&gt;o kolorach i ich doborze&lt;/a&gt; do wykresów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://python.plainenglish.io/the-complete-guide-to-keras-loss-functions-776d319e729d"&gt;&lt;strong&gt;The Complete Guide to Keras Loss Functions&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy model uczy się tak, aby dopasować się do metryki, która weryfikuje czy działa on dobrze czy źle. Trzeba więc wiedzieć jak te metryki działają, aby osiągnąć to, czego chcemy. Tutaj znajdziesz informacje o metrykach dostępnych w TF&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-15</title><link>https://blog.prokulski.science/2023/05/15/newsletter-dane-i-analizy-2023-05-15/</link><pubDate>Mon, 15 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/15/newsletter-dane-i-analizy-2023-05-15/</guid><description>&lt;p&gt;Wielokrotnie w newsletterze znalazły się teksty mówiące o wykorzystaniu Snowflake, BigQuery czy Databricks. Dzisiaj przyszedł jednak czas na szybkie wprowadzenie do tych narzędzi - jak zacząć z nich korzystać? Jak stworzyć konto, jak załadować pierwsze dane?&lt;/p&gt;&#10;&lt;p&gt;A wiecie, że narzędzia Microsoftu - na przykład Excel (poprzez VBA) czy też PowerBI potrafią współpracować z zewnętrznymi skryptami napisanymi w Pythonie albo R? Jeśli nie, to poniżej znajdziecie przykłady takiej współpracy. Swoją drogą - pewnie już ze dwa lata mija od plotek o wprowadzeniu Pythona do Excela&amp;hellip; ale coś nie widać zmiany.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-20</title><link>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</link><pubDate>Mon, 20 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</guid><description>&lt;p&gt;Wiecie kto generuje najwięcej ruchu w internecie? Kiedyś to było porno i torrenty (albo inne sposoby wymiany plików peer-to-peer). Teraz układ wygląda jak na poniższym obrazku, przynajmniej według danych &lt;a href="https://www.statista.com/chart/15692/distribution-of-global-downstream-traffic/"&gt;opublikowanych&lt;/a&gt; przez serwis Statista.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://prokulski.science/temp/static/nlt/global_internet_traffic.jpeg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj bardzo dużo treści - oraz eksperyment - polskie tytuły (ale przeważnie angielskie teksty). Wśród tych tekstów sporo o Apache Spark i konkretnych wykorzystaniach albo rozwiązaniach konkretnych problemów.&lt;br&gt;&#10;Znajdziecie też kilka fajnych tekstów o różnego typu problemach rozwiązywanych przez analizę czy modele danych (rekomendacje w Netflixie, OHE i Pandas), gorąco polecam tekst o Apache Arrow.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-16</title><link>https://blog.prokulski.science/2023/01/16/newsletter-dane-i-analizy-2023-01-16/</link><pubDate>Mon, 16 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/16/newsletter-dane-i-analizy-2023-01-16/</guid><description>&lt;p&gt;Czy wiecie, że książka &lt;em&gt;&amp;ldquo;365 dni&amp;rdquo;&lt;/em&gt; jest bardziej o Massimo niż o Laurze? W sumie w całej książce użyte jest jakieś 8350 różnych słów, z czego 50% treści wykorzystuje 425 z nich (czyli 5% użytych słów stanowi 50% treści!). Oczywiście chodzi o lematy, z wykluczonymi &lt;em&gt;stopwords&lt;/em&gt;. Polecam &lt;a href="https://youtu.be/NpPfa61P2jk"&gt;wykład na TEDx Koszalin&lt;/a&gt; o NLP dla laików, trochę zabawne, na pewno inspirujące - właśnie z tej inspiracji te wyliczenia.&lt;/p&gt;&#10;&lt;p&gt;A co poza tym dzisiaj? Sporo o MLOps (cały dział!) Trochę o przetwarzaniu danych dla początkujących - Pandas i PySpark.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-29</title><link>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</link><pubDate>Mon, 29 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</guid><description>&lt;p&gt;Uważni czytelnicy fanpage&amp;rsquo;a &lt;a href="https://fb.com/daneanalizy"&gt;Dane i Analizy&lt;/a&gt; już zapewne przeczytali mój nowy post o analizie tras rowerowych (heatmapa w nim prezentowana już nieaktualna), ale jeśli kogoś ominęło to &lt;a href="../../2022/08/22/strava-in-python/"&gt;&lt;strong&gt;zapraszam&lt;/strong&gt;&lt;/a&gt;. Pokazuję w nim:&lt;br&gt;&#10;jak przeczytać plik XML jak agregować dwuwymiarowe dane w NumPy jak agregować je w Pandas jak przygotować mapkę w Folium&lt;/p&gt;&#10;&lt;p&gt;A jak już tamten tekst znasz to dzisiaj też niemało do wyboru. Zapraszam do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://stackify.com/flask-vs-django-which-python-framework-is-better-for-machine-learning-apps/"&gt;&lt;strong&gt;Which Python Framework is Better for Machine Learning Apps?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Mamy jakiś nasz cudowny model, daje świetne wyniki, ale predykcje można dostać tylko uruchamiając skrypt z konsoli albo jeszcze gorzej w Jupyter Notebooku. Co zrobić, żeby było to użytecznie online&amp;rsquo;owe narzędzie? Opakować w API.&#10;Ale który pythonowy framework wybrać?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-20</title><link>https://blog.prokulski.science/2022/06/20/newsletter-dane-i-analizy-2022-06-20/</link><pubDate>Mon, 20 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/20/newsletter-dane-i-analizy-2022-06-20/</guid><description>&lt;p&gt;Długi weekend się przedłużył&amp;hellip; ale zgodnie z planem (a nie że &amp;ldquo;melanż poniósł za daleko&amp;rdquo; ;-). Newsletter przygotowany, a (prawie) jednodniowe opóźnienie nie powinno zmienić Waszego stosunku do zawartości. Odrobina tęsknoty (mam nadzieję) nikomu jeszcze nie zaszkodziła.&lt;/p&gt;&#10;&lt;p&gt;Deszcz pada w całym kraju, zapraszam zatem do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/analytics-vidhya/fundamentals-of-mlops-part-4-tracking-with-mlflow-deployment-with-fastapi-61614115436"&gt;&lt;strong&gt;Model Tracking with MLFlow &amp;amp; Deployment with FastAPI&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Fajny tutorial pokazujący jak śledzić wyniki modelu przez MLFlow oraz serwować ten najlepszy przez FastAPI&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-13</title><link>https://blog.prokulski.science/2022/06/13/newsletter-dane-i-analizy-2022-06-13/</link><pubDate>Mon, 13 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/13/newsletter-dane-i-analizy-2022-06-13/</guid><description>&lt;p&gt;Jak być data scientistą w Pythonie?&lt;/p&gt;&#10;&lt;p&gt;import pandas as pd&lt;/p&gt;&#10;&lt;p&gt;i gotowe!&lt;/p&gt;&#10;&lt;p&gt;Żart oczywiście (taki familiadowy, ale kto boomerowi zabroni?), a o samym Pandasie polecam &lt;a href="https://youtu.be/t-8ZIWCRvP0"&gt;wystąpienie Jana Kantego Milczka z PyData w Bydgoszczy&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://eng.uber.com/ubers-real-time-document-check/"&gt;&lt;strong&gt;Uber’s Real-Time Document Check&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak Uber zrobił weryfikację na podstawie dokumentów typu dowód osobisty?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/intro-to-mlops-using-amazon-sagemaker-5a43b9161fa"&gt;&lt;strong&gt;Intro to MLOps Using Amazon SageMaker&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Co to MLOps i jak SageMaker pomaga? A chyba pomaga, skoro to najpopularniejsze tego typu narzędzie (tak przynajmniej wynika z case studies pokazywanych na konferencjach)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-06</title><link>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</link><pubDate>Mon, 06 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</guid><description>&lt;p&gt;W tym tygodniu sporo rozwiązań big data&amp;rsquo;owych i ciekawostek ogólnie związanych z przetwarzaniem danych.&lt;/p&gt;&#10;&lt;p&gt;Ale jeśli interesuje Cię coś bardziej &amp;ldquo;biznesowego&amp;rdquo;, w szczególności jak &lt;em&gt;projektuje się produkty&lt;/em&gt; to gorąco polecam rozmowę z Marcinem Zarembą o projektowaniu autobookingu w Dobrym Mechaniku oraz dodatkowo &lt;a href="https://marcinzaremba.pl/2022/05/12/jak-powstawal-autobooking/?utm_source=newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;tekst o tymże&lt;/a&gt; u Marcina na blogu. Świetny case study, serio serio.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-mask-rcnn-net-for-object-detection-in-60-lines-of-code-9b6bbff292c3"&gt;&lt;strong&gt;Train Mask R-CNN Net for Object Detection in 60 Lines of Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie obiektów na zdjęciach - jak to działa?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-09</title><link>https://blog.prokulski.science/2022/05/09/newsletter-dane-i-analizy-2022-05-09/</link><pubDate>Mon, 09 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/09/newsletter-dane-i-analizy-2022-05-09/</guid><description>&lt;p&gt;Dzisiaj mamy fajną paczkę tekstów o hiperparametrach, skalowaniu cech i innych rzeczach związanych z uczeniem maszynowym i &lt;em&gt;podkręcaniem&lt;/em&gt; modeli. Tradycyjnie też kształcimy i rozwijamy się nieco w Pythonie.&lt;/p&gt;&#10;&lt;p&gt;W bardziej zaawansowanych tematach coś, czym firma &lt;a href="https://prokulski.science/"&gt;Dane i Analizy&lt;/a&gt; zajmuje się na co dzień: inżynieria danych, przepływy głównie z wykorzystaniem Apache Kafka czy też projektowanie architektury zbliżonej do tej którą wykorzystuje Airbnb.&lt;/p&gt;&#10;&lt;p&gt;Polecam też nową inicjatywę Krzysztofa Sopyły - Podcast Biznes AI. Zapowiada się dobrze, powodzenia Krzysiek!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-02</title><link>https://blog.prokulski.science/2022/05/02/newsletter-dane-i-analizy-2022-05-02/</link><pubDate>Mon, 02 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/02/newsletter-dane-i-analizy-2022-05-02/</guid><description>&lt;p&gt;Dzisiaj wielkie święto. I nie chodzi o święto flagi, a o nowy post na blogu. Minął prawie rok od poprzedniego, więc dzień ten zasługuje na miano święta ;-)&lt;/p&gt;&#10;&lt;p&gt;Rozproszona architektura, mikroserwisy i baza nosql - taka armata na zwykły sklep internetowy? Tak! Z wyjaśnieniem dlaczego i przykładami w Pythonie! Właśnie to znajdziecie w moim wpisie &lt;a href="../../2022/04/26/sklep-rozproszony/?utm_source=dia_nlt"&gt;&lt;strong&gt;Sklep rozproszony&lt;/strong&gt;&lt;/a&gt;. To zrobiony w kilka dni &lt;em&gt;proof of concept&lt;/em&gt; działania nowoczesnej architektury w dość prostym problemie. Zapraszam do lektury.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-25</title><link>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</link><pubDate>Mon, 25 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</guid><description>&lt;p&gt;Dzisiaj zapraszam na duży pakiet związany z Apache Spark - od instalacji, poprzez stosunkowo mało zaawansowane tutoriale, a na debugowaniu i optymalizacji zapytań skończywszy.&lt;/p&gt;&#10;&lt;p&gt;Standardowo jest też trochę Pythona (na przykład świetny kurs spaCy - ale to fani &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;a Dane i Analizy&lt;/a&gt; już znają czy też coś o wzorcach projektowych albo aplikacjach wielowątkowych), a w części &amp;ldquo;analiza danych&amp;rdquo; dość przekrojowe zagadnienia (np. &lt;em&gt;computer vision&lt;/em&gt; bez sieci neuronowych - dość sprytne podejście do tematu zajętych miejsc parkingowych).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-21</title><link>https://blog.prokulski.science/2022/03/21/newsletter-dane-i-analizy-2022-03-21/</link><pubDate>Mon, 21 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/21/newsletter-dane-i-analizy-2022-03-21/</guid><description>&lt;p&gt;Podoba nie rozpieszcza, nie ma czasu na pisanie. Mam nadzieję, że znajdziecie czas na czytanie :)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2022/03/end-to-end-hotel-booking-cancellation-machine-learning-model/"&gt;&lt;strong&gt;End-to-End Hotel Booking Cancellation Machine Learning Model&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy gość przyjedzie do naszego pokoju hotelowego czy nie przyjedzie? Jak buduje się modele, które potrafią odpowiedzieć na takie pytania? Znajomity tutorial&lt;/p&gt;&#10;&lt;h3 id="big_data"&gt;#big_data&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mherzog01.medium.com/a-spark-streaming-pipeline-with-microservices-c2cfc42dda9f"&gt;&lt;strong&gt;A Spark Streaming pipeline with microservices&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Spark, Kafka i uczenie maszynowe w tle - takie projekty lubimy!&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://selectfrom.dev/querying-kafka-topics-using-presto-5f1bb915a918"&gt;&lt;strong&gt;Querying Kafka Topics Using Presto&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A gdyby tak pytać topików kafkowych tak jak bazę danych?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-31</title><link>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</link><pubDate>Mon, 31 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</guid><description>&lt;p&gt;Dzisiaj &lt;em&gt;odcinek&lt;/em&gt; dość pythonowy, ale za to z obszernym tekstem o tworzeniu modeli w R - cały proces opisany po kolei. Polecam!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.pinecone.io/learn/nlp/?utm_medium=link&amp;amp;utm_source=data-elixir&amp;amp;utm_campaign=sponsored"&gt;&lt;strong&gt;Natural Language Processing (NLP) for Semantic Search&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Duża pozycja, która wprowadza w świat NLP&lt;/p&gt;&#10;&lt;h3 id="ciekawostki"&gt;#ciekawostki&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://opendatascience.com/what-does-a-data-driven-government-look-like/"&gt;&lt;strong&gt;What Does a Data-Driven Government Look Like?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Teoretycznie więcej danych to lepsze decyzje. Czy zarządzanie maistem albo państwem jest możliwe w oparciu o dane? Jak może to wyglądać?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ai-geospatial-wildfire-risk-prediction-8c6b1d415eb4"&gt;&lt;strong&gt;AI Geospatial Wildfire Risk Prediction&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przewidywanie zdarzeń związanych z geografią - pogoda, pożary - ciekawe zagadanienie, a często pomijane przy np. poradnikach ML.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-08</title><link>https://blog.prokulski.science/2021/11/08/newsletter-dane-i-analizy-2021-11-08/</link><pubDate>Mon, 08 Nov 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/08/newsletter-dane-i-analizy-2021-11-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/orchestrate-a-data-science-project-in-python-with-prefect-e69c61a49074?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Orchestrate a Data Science Project in Python With Prefect&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Optimize Your Data Science Workflow in a Few Lines of Code Motivation As a data scientist, why should you care about optimizing your data science workflow? Let’s start with an example of a basic data science project. Imagine you were working with an Iris dataset. You started with building functions to process your data. &lt;a href="https://medium.com/media/e479ca8deb87434b1859864118ec3bcc/href"&gt;https://medium.com/media/e479ca8deb87434b1859864118ec3bcc/href&lt;/a&gt; After defining (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/dealing-with-dates-in-pandas-6-common-operations-you-should-know-1ea6057c6f4f"&gt;&lt;strong&gt;Dealing With Dates in Pandas — 6 Common Operations You Should Know&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dealing With Dates in Pandas — 6 Common Operations You Should Know Never confused with dates again, hopefully. Besides texts and numbers, dates are a very common data type in our datasets. When we use Pandas to process dates, it’s definitely not the most straightforward task for most data scientists. When I began to use Pandas, I wasn’t familiar with date-related features, so every time when I (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-20</title><link>https://blog.prokulski.science/2021/09/20/newsletter-dane-i-analizy-2021-09-20/</link><pubDate>Mon, 20 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/20/newsletter-dane-i-analizy-2021-09-20/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/vlookup-implementation-in-python-in-three-simple-steps-93b5a290fd72"&gt;&lt;strong&gt;VLOOKUP implementation in Python in three simple steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Oftentimes, in the field of data analytics, it’s the data cleaning and processing that takes the most amount of time and effort. While the steps such as data cleaning, filtering, and pre-processing are generally under-evaluated or overlooked as compared to more juicy components such as the model development, it’s the quality of data that determines the quality of output. As it is rightly said, (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-13</title><link>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</link><pubDate>Mon, 13 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/still-using-the-os-module-in-python-this-alternative-is-remarkably-better-7d728ce22fb7"&gt;&lt;strong&gt;Still Using the OS Module in Python? This Alternative is Remarkably Better&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Python’s OS module is a nightmare for managing files and folders. You should try Pathlib. File and folder management with Python’s os module is a nightmare. Yet, it’s an essential part of every data science workflow. Saving reports, reading configuration files, you name it — there’s no way around it. Picture this — you spend weeks building an API around your model, and it works flawlessly, at (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-06</title><link>https://blog.prokulski.science/2021/09/06/newsletter-dane-i-analizy-2021-09-06/</link><pubDate>Mon, 06 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/06/newsletter-dane-i-analizy-2021-09-06/</guid><description>&lt;p&gt;&lt;a href="https://flowingdata.com/2021/09/03/everything-more-from-home/"&gt;&lt;strong&gt;How Much More Time We Spent at Home&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;We had to do more from home. Here&amp;rsquo;s how much everything shifted by total minutes in a day. Tags: home , time use&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/image-processing-tool-a1b8fe66c957?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A Comprehensive Guide to Image Processing: Using an OpenCV Tool&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Image Processing Essentials An image processing tool with OpenCV, QT Creator, and C++ As the last part of this series on the Image Processing flow, I want to present a simple Image Processing Tool implemented using OpenCV 3.2.0 on QT Creator (5.12.10) with C++ to apply almost all the Image Processing operations discussed in the previous posts. To be able to use it, it’s enough to build OpenCV (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-30</title><link>https://blog.prokulski.science/2021/08/30/newsletter-dane-i-analizy-2021-08-30/</link><pubDate>Mon, 30 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/30/newsletter-dane-i-analizy-2021-08-30/</guid><description>&lt;p&gt;&lt;a href="https://lucidmanager.org/data-science/monte-carlo-cost-estimates/"&gt;&lt;strong&gt;Monte Carlo Cost Estimates: Engineers Throwing Dice&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Estimating the cost of a complex project is not a trivial task. Traditional cost estimates are full of assumptions about the future state of the market and the final deliverable. Monte Carlo cost estimates are a tool to better understand the risks in your project and enable better cost control. Monte Carlo simulations are a technique to control your “known unknowns”. Albert Einstein famously said (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-09</title><link>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</link><pubDate>Mon, 09 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-08</title><link>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</link><pubDate>Sun, 08 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-19</title><link>https://blog.prokulski.science/2021/07/19/newsletter-dane-i-analizy-2021-07-19/</link><pubDate>Mon, 19 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/19/newsletter-dane-i-analizy-2021-07-19/</guid><description>&lt;p&gt;&lt;a href="https://techblog.ing.pl/blog/dobry-zly-i-brzydki-pare-slow-o-pandas-udf-w-apache-spark"&gt;&lt;strong&gt;Dobry, zły i brzydki – Parę słów o Pandas UDF w Apache Spark | Tech Blog ING Bank Śląski&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Spark to bardzo użyteczne narzędzie do pracy z Big Data. Niestety, czasem brakuje mu pewnych funkcjonalności. Na szczęście twórcy wyszli na przeciw oczekiwaniom użytkowników, dodając Pandas UDF, dzięki czemu zachowując elastyczność Pythona nie tracimy na wydajności. Zobaczmy więc, czym są i jak (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/geocoding-in-python-a-complete-guide-d68a4faafdc6?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Geocoding in Python: A Complete Guide&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A step-by-step tutorial on geocoding with Python Continue reading on Towards Data Science »&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-28</title><link>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</link><pubDate>Mon, 28 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</guid><description>&lt;p&gt;&lt;a href="https://erdavis.com/2021/06/26/average-colors-of-the-world/"&gt;&lt;strong&gt;Average colors of the world&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;I wrote that I wanted to expand creatively beyond maps in 2021, but here we are, halfway in, and half my posts are maps. In my defense, I made these last year and just haven’t gotten around to posting them yet! They’ve been sitting in a folder since December, mocking me. It’s time to get […]&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/4-tricks-to-use-python-f-strings-more-efficiently-4f389e890514?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;4 Tricks to Use Python F-strings More Efficiently&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Have full control over what you print out. String interpolation is a way to embed variables into strings. It makes it easy to manipulate and enrich strings. Thus, the print statements are much more powerful with string interpolation. Formatted string literals, also known as f-strings, are a highly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-31</title><link>https://blog.prokulski.science/2021/05/31/newsletter-dane-i-analizy-2021-05-31/</link><pubDate>Mon, 31 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/31/newsletter-dane-i-analizy-2021-05-31/</guid><description>&lt;p&gt;&lt;a href="https://gursimar27.medium.com/containers-the-actual-mechanism-behind-the-technology-and-why-kubernetes-depreciated-docker-74b3f2e51cd6"&gt;&lt;strong&gt;Containers: The actual mechanism behind the technology and why Kubernetes depreciated Docker&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;In this article, we will be covering all the details about containers i.e. how they actually work behind the scene and all the parts it… Continue reading on Medium »&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-hierarchical-clustering-with-python-ebb256317b50"&gt;&lt;strong&gt;Fully Explained Hierarchical Clustering with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Programming Agglomerative clustering in unsupervised machine learning Hierarchical clustering. A photo by Author In this article, we will discuss hierarchical clustering algorithms in unsupervised machine learning. This algorithm is based on the splitting and merging of nested clusters. The linkage (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-10</title><link>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</link><pubDate>Mon, 10 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</guid><description>&lt;p&gt;&lt;a href="https://blog.dataiku.com/how-to-perform-basic-ml-serving-with-python-docker-kubernetes"&gt;&lt;strong&gt;How to Perform Basic ML Serving With Python, Docker, and Kubernetes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial provides a basic, step-by-step example of real-time serving a machine learning (ML) model as a REST API with Python, Docker, and Kubernetes. We’ll build a basic REST API with Python, test it locally with Docker, and deploy our API with Kubernetes. By the way, if you want to go faster, (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.r-bloggers.com/2021/05/dockerizing-shiny-applications/"&gt;&lt;strong&gt;Dockerizing Shiny Applications&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Docker provides isolation to applications. Images are immutable. Running multiple instances of the same image can serve many users at the same time. All these general advantages of containerized applications apply to Shiny apps too. The post Dockerizing Shiny Applications first appeared on (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-03</title><link>https://blog.prokulski.science/2021/05/03/newsletter-dane-i-analizy-2021-05-03/</link><pubDate>Mon, 03 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/03/newsletter-dane-i-analizy-2021-05-03/</guid><description>&lt;p&gt;&lt;a href="https://www.enterprisedb.com/blog/comparison-joins-mongodb-vs-postgresql"&gt;&lt;strong&gt;Comparison of JOINS: MongoDB vs. PostgreSQL | EDB&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This is the second in a continuing series comparing MongoDB capabilities with those of Postgres. The first post covered “Schema Later Considered Harmful.”&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-machine-learning-to-predict-customers-next-purchase-day-7895ad49b4db"&gt;&lt;strong&gt;Using Machine Learning to Predict Customers Next Purchase Day&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning model to predict whether customers will make their next purchase after a certain period. Image by Mediamodifier and can be accessed  here . Introduction If there is one major lesson that those in the retail business have learnt from the SARS-CoV-2 pandemic, it is the demand to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Hyperopt i szukanie najlepszego parametru</title><link>https://blog.prokulski.science/2020/12/23/hyperopt-scikit-learn/</link><pubDate>Wed, 23 Dec 2020 15:04:21 +0000</pubDate><guid>https://blog.prokulski.science/2020/12/23/hyperopt-scikit-learn/</guid><description>&lt;p&gt;Kontynuując cykl o Pipelines w SciKit-Learn zajmiemy się tematem &lt;em&gt;kręcenia śrubkami&lt;/em&gt; w modelach w poszukiwaniu najlepszego wyniku. Użyjemy do tego pakietu hyperopt.&lt;/p&gt;&#10;&lt;p&gt;W poprzednich częściach &lt;a href="../../2020/10/10/pipeline-w-scikit-learn/"&gt;poznawaliśmy co to &amp;ldquo;pipeline&amp;rdquo; w SciKit-Learn&lt;/a&gt;, &lt;a href="../../2020/11/05/pipeline-w-scikit-learn-wlasny-estymator/"&gt;tworzyliśmy własne estymatory&lt;/a&gt; (przy okazji ucząc się trochę o programowaniu obiektowym, klasach i dziedziczeniu - nawet jeśli to było nieświadome). Dzisiaj ostatnia część z cyklu - kręcenie śrubkami zwanymi hyperparametrami.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="../../downloads/2020/12/srubki-300x200.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Ostatnio przeszukiwaliśmy siatkę hyperparametrów (wszystkie możliwe kombinacje) przy użyciu wbudowanych w SciKit-Learn mechanizmów (na przykład GridSearchCV). Dzisiaj poszukamy innej metody, innego pakietu. A będzie nim &lt;code&gt;hyperopt&lt;/code&gt;.&lt;/p&gt;</description></item><item><title>Pipeline w SciKit Learn - własny estymator</title><link>https://blog.prokulski.science/2020/11/05/pipeline-w-scikit-learn-wlasny-estymator/</link><pubDate>Thu, 05 Nov 2020 15:32:20 +0000</pubDate><guid>https://blog.prokulski.science/2020/11/05/pipeline-w-scikit-learn-wlasny-estymator/</guid><description>&lt;p&gt;Dzisiaj napiszemy własny (a raczej poznamy mechanikę działania) oraz nauczymy się szukać najlepszych hyper parametrów dla modelu (właściwie: całego pipeline) w zwarty sposób.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="../../2020/10/10/pipeline-w-scikit-learn/"&gt;W pierszej części&lt;/a&gt; zobaczyliśmy jak zbudować &lt;em&gt;pipeline&lt;/em&gt; dla danych i modeli. Dzięki temu dostaliśmy możliwość zmiany sposobu transformacji danych i zmiany modeli w ramach prostego, zwartego kodu. Ale co jeśli potrzebujemy jakiś &lt;em&gt;transformator&lt;/em&gt; którego nie ma w pakietach?&lt;/p&gt;&#10;&lt;p&gt;Tak jak poprzednio - nasze działania oprzemy na Pythonie i pakiecie scikit learn. Podobne rozwiązania można znaleźć w R (jeśli tego szukasz - zainteresuj się &lt;a href="https://www.tidymodels.org/"&gt;Tidymodels&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Pipeline w SciKit Learn</title><link>https://blog.prokulski.science/2020/10/10/pipeline-w-scikit-learn/</link><pubDate>Sat, 10 Oct 2020 11:21:01 +0000</pubDate><guid>https://blog.prokulski.science/2020/10/10/pipeline-w-scikit-learn/</guid><description>&lt;p&gt;Co to są &lt;em&gt;pipelines&lt;/em&gt; w sci-kit learn i jak je wykorzystać? Czyli &lt;strong&gt;bardziej efektywne szukanie najlepszego modelu&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="../../downloads/2020/10/jj-ying-4XvAZN8_WHo-unsplash.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Photo by &lt;a href="https://unsplash.com/@jjying"&gt;JJ Ying&lt;/a&gt; on &lt;a href="https://unsplash.com/s/photos/pipeline"&gt;Unsplash&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Jeśli zajmujesz się tworzeniem modeli na przykład klasyfikujących jakieś dane to pewnie wielokrotnie powtarzasz te same kroki:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;wczytanie danych&lt;/li&gt;&#10;&lt;li&gt;oczyszczenie danych&lt;/li&gt;&#10;&lt;li&gt;uzupełnienie braków&lt;/li&gt;&#10;&lt;li&gt;przygotowanie dodatkowych cech (&lt;em&gt;feature engineering&lt;/em&gt;)&lt;/li&gt;&#10;&lt;li&gt;podział danych na treningowe i testowe&lt;/li&gt;&#10;&lt;li&gt;dobór hyperparametrów modelu&lt;/li&gt;&#10;&lt;li&gt;trenowanie modelu&lt;/li&gt;&#10;&lt;li&gt;testowanie modelu (sprawdzenie skuteczności działania)&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;I tak w kółko, z każdym nowy modelem.&lt;/p&gt;</description></item><item><title>(py)Spark, Hadoop i HDFS - podstawy</title><link>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</link><pubDate>Thu, 09 Apr 2020 19:06:13 +0000</pubDate><guid>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</guid><description>&lt;p&gt;Dzisiaj zajmiemy się wykorzystaniem Sparka i Hadoopa do przetwarzania większej ilości danych. Oraz do budowania prostego modelu (regresji liniowej). Może jeszcze nie jest to big data, ale mechanizmy są identyczne jak w przypadku większej liczby danych. Wystarczy tylko tych danych więcej zgromadzić, zbudować większe środowisko (dużo serwerów) i… też będzie działało.&lt;/p&gt;&#10;&lt;p&gt;A w dodatku poznamy pakiet &lt;em&gt;faker&lt;/em&gt; który pozwoli nam na wygenerowanie sztucznych danych.&lt;/p&gt;&#10;&lt;h3 id="spark-i-hadoop"&gt;Spark i Hadoop&lt;/h3&gt;&#10;&lt;p&gt;&lt;strong&gt;Apache Spark&lt;/strong&gt; to rozwijana na zasadach open source platforma klastrowego przetwarzania danych, która ma interfejsy API dla takich języków programowania jak Scala, Python, Java i R.&lt;/p&gt;</description></item><item><title>Muzyka i data science</title><link>https://blog.prokulski.science/2020/03/24/muzyka-i-data-science/</link><pubDate>Tue, 24 Mar 2020 17:11:08 +0000</pubDate><guid>https://blog.prokulski.science/2020/03/24/muzyka-i-data-science/</guid><description>&lt;p&gt;Każdego dnia pojawia się nowa muzyka, w wielu różnych gatunkach. Jak wybrać to, czemu warto poświęcić czas?&lt;/p&gt;&#10;&lt;p&gt;Dodatkowo dowiemy się jakie znaczenie ma uczciwe przygotowanie danych.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="../../downloads/2020/03/franck-v-U3sOwViXhkY-unsplash-scaled.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Zdjęcie na &lt;em&gt;okładce&lt;/em&gt;: &lt;a href="https://unsplash.com/@franckinjapan"&gt;Franck V. on Unsplash&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Gdybym miał powiedzieć co lubię najbardziej bez wątpienia byłaby to muzyka. Słucham dużo, nie wyobrażam sobie życia w ciszy. Ale mimo dostępu do nieskończonych (powiedzmy) zasobów muzycznych chociażby poprzez Spotify zauważyłem, że zamykam się w bańce już znanych wykonawców i utworów. A ja lubię odkrywać nowe dźwięki, tylko nie mam czasu (trochę też zbyt na to jestem leniwy) na szukanie nieznanych utworów czy wykonawców. Po co mam poświęcać kupę czasu na szukanie czegoś co mi się nie spodoba?&lt;/p&gt;</description></item><item><title>Mapy w Pythonie</title><link>https://blog.prokulski.science/2020/02/28/mapy-w-pythonie/</link><pubDate>Fri, 28 Feb 2020 15:07:09 +0000</pubDate><guid>https://blog.prokulski.science/2020/02/28/mapy-w-pythonie/</guid><description>&lt;p&gt;Jakiś czas temu pokazywałem jak w prosty sposób narysować mapę w R. Dzisiaj powtórzymy zadanie dla Pythona.&lt;/p&gt;&#10;&lt;p&gt;Skorzystamy z danych GUS na temat bezrobocia oraz liczby ludności (pomijając dokładność &lt;em&gt;złożenia&lt;/em&gt; danych - interesuje nas rysowanie map, a nie analiza bezrobocia) oraz map z Głównego Urzędu Geodezji i Kartografii.&lt;/p&gt;&#10;&lt;blockquote&gt;&#10;&lt;p&gt;Jeśli potrzebujesz podobnych informacji jak zrobić to wszysto w R sprawdź na początek wszystko co jest w ramach tagu &lt;a href="../../tags/mapa/"&gt;mapa&lt;/a&gt;&lt;/p&gt;&#10;&lt;/blockquote&gt;&#10;&lt;h3 id="skąd-pobrać-dane"&gt;Skąd pobrać dane?&lt;/h3&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;Dane o liczbie ludności&lt;/strong&gt;: &lt;a href="https://bdl.stat.gov.pl/BDL/metadane/cechy/2137"&gt;Ludność / Stan ludności / Ludność wg grup wieku i płci&lt;/a&gt; w tzw. &lt;strong&gt;BDLu&lt;/strong&gt; (czyli Banku Danych Lokalnych GUS) - bierzemy dane z 2018 roku (najnowsze pełne jakie są); Wiek = ogółem, Płeć = ogółem; wszystkie jednostki terytorialne. W wyniku klikania dostaniemy się do tabeli, którą ściągamy lokalnie poprzez &lt;strong&gt;Export / CSV - tablica wielowymiarowa&lt;/strong&gt;.&lt;/li&gt;&#10;&lt;li&gt;Dokładnie tak samo pozyskujemy &lt;strong&gt;dane o liczbie bezrobotnych&lt;/strong&gt;: &lt;a href="https://bdl.stat.gov.pl/BDL/metadane/cechy/1944"&gt;Rynek pracy / Bezrobocie rejestrowane / Bezrobotni zarejestrowani wg płci w gminach&lt;/a&gt; (znowu: ogółem, 2019 rok, wszystkie jednostki; pobieramy plik CSV dokładnie tak samo jak wyżej).&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;Dane mapowe&lt;/strong&gt; bierzemy z &lt;a href="http://www.gugik.gov.pl/pzgik/dane-bez-oplat/dane-z-panstwowego-rejestru-granic-i-powierzchni-jednostek-podzialow-terytorialnych-kraju-prg"&gt;GUGiK&lt;/a&gt; - interesuje nas archiwum &lt;a href="ftp://91.223.135.109/prg/jednostki_administracyjne.zip"&gt;PRG – jednostki administracyjne&lt;/a&gt; (uwaga - to ma 375 MB!). To archiwum rozpakowujemy i (coś co ja robię, żeby później nie było problemów) zmieniamy nazwy plików tak, aby pozbyć się polskich znaków i wszystkie litery w nazwie były małe.&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="przygotowanie-danych-z-gus"&gt;Przygotowanie danych z GUS&lt;/h3&gt;&#10;&lt;p&gt;Ale zanim - potrzebne nam będzie kilka pakietów Pythona do dalszej pracy:`&lt;/p&gt;</description></item><item><title>Montaż filmowy w Pythonie?</title><link>https://blog.prokulski.science/2020/01/28/montaz-filmowy-w-pythonie/</link><pubDate>Tue, 28 Jan 2020 13:56:30 +0000</pubDate><guid>https://blog.prokulski.science/2020/01/28/montaz-filmowy-w-pythonie/</guid><description>&lt;p&gt;Czy da się automatycznie rozdzielić film na poszczególne ujęcia?&lt;/p&gt;&#10;&lt;p&gt;Oczywiście da się. Ale jak do tego podejść?&lt;/p&gt;&#10;&lt;p&gt;Dzisiejszy wpis to swego rodzaju zapis sposobu rozwiązania problemu. Wielkiej sztuki programistycznej tutaj nie ma, ale (mam nadzieję) ciekawa jest droga przez całą analizę do uzyskania konkretnego efektu.&lt;/p&gt;&#10;&lt;p&gt;Obraz cyfrowy składa się z punktów (określonej ich liczbie - wysokość x szerokość) o różnej barwie. Barwę najczęściej opisują trzy składowe: czerwona, zielona i niebieska (RGB). Wideo to nic innego jak ciąg (kolejne klatki) takich statycznych obrazów.&lt;/p&gt;</description></item><item><title>Analiza własnych finansów</title><link>https://blog.prokulski.science/2019/12/13/analiza-wyciagow-z-karty-kredytowej/</link><pubDate>Fri, 13 Dec 2019 14:20:00 +0000</pubDate><guid>https://blog.prokulski.science/2019/12/13/analiza-wyciagow-z-karty-kredytowej/</guid><description>&lt;p&gt;Jak nauczyć się analizy danych? Robiąc małe i duże projekty.&lt;/p&gt;&#10;&lt;p&gt;Kiedyś napisałem post o &lt;a href="../../2017/04/14/csi-lemur/"&gt;tym jak się przemieszczam&lt;/a&gt; w którym odsłoniłem dość dużo swojej prywatności, dzisiaj ciąg dalszy.&lt;/p&gt;&#10;&lt;p&gt;Postanowiłem, że mocniej wezmę się za Pythona i to co potrafię dość szybko zrobić w R będę robił w Pythonie. To najlepszy sposób na naukę - zmuszać się w pewnym sensie do przełamywania własnych oporów. Z drugiej strony - od dawna chodził za mną tekst związany z analizą własnych wydatków.&lt;/p&gt;</description></item><item><title>Najpopularniejsze imiona dzieci nadane w 2018 roku</title><link>https://blog.prokulski.science/2019/03/05/najpopularniejsze-imiona-dzieci-nadane-w-2018-roku/</link><pubDate>Tue, 05 Mar 2019 16:07:11 +0000</pubDate><guid>https://blog.prokulski.science/2019/03/05/najpopularniejsze-imiona-dzieci-nadane-w-2018-roku/</guid><description>&lt;p&gt;Niedawno Ministerstwo Cyfryzacji opublikowało &lt;a href="https://www.gov.pl/web/cyfryzacja/imiona"&gt;listę najpopularniejszych imion&lt;/a&gt; nadawanych dzieciom w 2018 roku. Wykorzystamy to do połączenia Pythona z R (albo R z Pythonem).&lt;/p&gt;&#10;&lt;p&gt;Lista opublikowana została w postaci serii tekstów na stronach Ministerstwa, w formie całkowicie niezjadliwej. Co więcej - prasa podała informacje dalej, bez żadnego obrobienia tych danych. Zróbmy to więc jak należy przy okazji łącząc R i Pythona.&lt;/p&gt;&#10;&lt;p&gt;Aby móc w RStudio używać Pythona oraz mieć dostęp do obiektów Pythona w sesji R potrzebujemy biblioteki &lt;em&gt;&lt;a href="https://rstudio.github.io/reticulate/"&gt;reticulate&lt;/a&gt;&lt;/em&gt; - polecam się z nią zapoznać. Daje ciekawe możliwości, które właśnie za chwilę zobaczymy na konkretnym przykładzie.&lt;/p&gt;</description></item><item><title>R-base, R-dplyr, R-data.table i Python</title><link>https://blog.prokulski.science/2018/05/23/r-i-python/</link><pubDate>Wed, 23 May 2018 15:44:07 +0000</pubDate><guid>https://blog.prokulski.science/2018/05/23/r-i-python/</guid><description>&lt;p&gt;Podstawy manipulacji danymi w tabelkach. W R (trzy wersje) oraz w Pythonie. Bo to pierwszy post z cyklu &lt;em&gt;idziemy w stronę Pythona&lt;/em&gt;.&#10;W dzisiejszym wpisie zajmiemy się podstawowymi operacjami na tabelach (data frame) z danymi. &lt;strong&gt;Dlaczego to jest ważne?&lt;/strong&gt; Są to najczęściej wykonywane operacje w trakcie analizy danych, bo przecież:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;dane trzeba wczytać &lt;em&gt;do komputera&lt;/em&gt;&lt;/li&gt;&#10;&lt;li&gt;czasem zmodyfikować, na przykład policzyć wartość na podstawie dwóch lub więcej kolumn&lt;/li&gt;&#10;&lt;li&gt;wybrać określone wiersze lub określone kolumny&lt;/li&gt;&#10;&lt;li&gt;połączyć jedną tabelę z inną&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Z tak przygotowanych danych można później na przykład narysować wykres czy też wrzucić je do modelu. I to jest wystarczające, na co dowodem jest pewnie z 70% moich wpisów z ostatnich 12 miesięcy (albo i więcej). Kolejne 20% wpisów to sposób pozyskania danych. 10% było pewnie o modelach wszelakich.&#10;Osobiście uważam, że w R nauczyłem się na tyle dużo, aby przejść na kolejny poziom. W pracy są to aplikacje w Shiny czy też panele w wykorzystaniem &lt;em&gt;flexdashboard&lt;/em&gt; (znowu: w obu przypadkach 70% pracy to manipulacja danymi w tabelkach), ale ciągnie mnie do Pythona. Gdybym zaczynał przygodę z machine learning czy data science to wybrałbym Pythona. Jednocześnie mam nadzieję, że dla osób znających jeden z języków niniejszy wpis będzie ciekawym wprowadzeniem w drugi język.&#10;Jeśli chodzi o R to zobaczymy jak wykonać podstawowe operacje wykorzystując standardowe możliwości R (R-base), wykorzystując pakiety &lt;em&gt;dplyr&lt;/em&gt; (wchodzący w skład ekosystemu &lt;em&gt;tidyverse&lt;/em&gt;) oraz &lt;em&gt;data.table&lt;/em&gt;. W przykładach dla Pythona będzie to &lt;em&gt;pandas&lt;/em&gt;.&#10;Dlaczego data.table? &lt;a href="https://github.com/Rdatatable/data.table/wiki/Benchmarks-%3A-Grouping"&gt;Porównanie prędkości&lt;/a&gt; pokazuje, że dla bardzo dużych tabel data.table jest najszybszy.&#10;Zaczniemy od wczytania odpowiednich bibliotek. W R oczywiście:&lt;/p&gt;</description></item></channel></rss>