<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GitHub on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/github/</link><description>Recent content in GitHub on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 10 Aug 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/github/index.xml" rel="self" type="application/rss+xml"/><item><title>Agenty kodują same przez 16 dni, a Ty projektujesz architekturę na lata</title><link>https://blog.prokulski.science/2026/08/10/agenty-koduja-same-przez-16-dni-a-ty-projektujesz-architekture-na-lata/</link><pubDate>Mon, 10 Aug 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/08/10/agenty-koduja-same-przez-16-dni-a-ty-projektujesz-architekture-na-lata/</guid><description>&lt;p&gt;W tym tygodniu trudno przeoczyć jeden wątek: autonomiczne agenty kodujące przestają być eksperymentem. Alibaba opublikowało wyniki 16-dniowego autonomicznego sprintu modelu Qwen, a równolegle pojawiło się kilka solidnych materiałów o tym, jak praktycznie skonfigurować środowisko do pracy z Claude Code czy Codex CLI. Jeśli jeszcze nie myślisz o agentic coding jako o codziennym narzędziu, ten numer powinien zmienić Twoje podejście.&lt;br&gt;&#10;No i AI uciekła i zaczęła rozrabiać. Ale o tym pisały mainstreamowe media &lt;a href="https://tvn24.pl/biznes/tech/ai-wymknela-sie-spod-kontroli-nowy-incydent-st9174296?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt;, &lt;a href="https://www.bankier.pl/wiadomosc/AI-zanim-uciekla-z-laboratorium-to-potajemnie-spiskowala-miesiacami-Narzedzia-polubily-oszukiwanie-9178576.html?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt; oraz &lt;a href="https://spidersweb.pl/2026/07/openai-model-uciekl-ze-srodowiska-testowego.html?utm_source=nlt-2026-08-08&amp;amp;utm_medium=newsletter-daneianalizy"&gt;tu&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Agenty piszą CV, Atlassian zmienia Jirę, a Polars i DuckDB łączą siły</title><link>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</link><pubDate>Mon, 20 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/20/agenty-pisza-cv-atlassian-zmienia-jire-a-polars-i-duckdb-lacza-sily/</guid><description>&lt;p&gt;Cześć! Za nami finał piłkarskich mistrzostw świata, gdzie Argentyna mierzyła się z Hiszpanią. Niezależnie od wyniku i wczorajszych emocji, poniedziałkowy poranek w IT przynosi powrót do naszej technologicznej rzeczywistości. Oby Twój tydzień zaczął się bez pożarów na produkcji!&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu styk AI oraz codziennych procesów deweloperskich.&lt;/p&gt;&#10;&lt;p&gt;Coraz więcej narzędzi, na czele z odświeżoną Jirą od Atlassiana, stawia na głęboką integrację z agentami AI, Pojawiają się innowacyjne frameworki, które potrafią napisać CV, analizować ogłoszenia o pracę i przejść przez rekrutacyjne sito, Obok rosnącej roli modeli LLM, dużo mówi się o sztuce sprawnego kierowania zapytaniami do odpowiednich silników językowych.&lt;/p&gt;</description></item><item><title>Ponad połowa kodu z AI? Raport 2026 i symulatory Kubernetes</title><link>https://blog.prokulski.science/2026/06/08/ponad-polowa-kodu-z-ai-raport-2026-i-symulatory-kubernetes/</link><pubDate>Mon, 08 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/08/ponad-polowa-kodu-z-ai-raport-2026-i-symulatory-kubernetes/</guid><description>&lt;p&gt;W tym numerze przyglądamy się gwałtownej profesjonalizacji świata AI, gdzie agenty przestają być tylko ciekawostką, a właściwie są fundamentem codziennej pracy programistycznej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy najważniejszy raport roku (&lt;a href="https://2026.stateofai.dev/en-US"&gt;State of AI 2026&lt;/a&gt;), z którego wynika, że już ponad połowa kodu produkcyjnego pochodzi z systemów AI, pokazujemy protokół MCP jako kluczowy standard łączący modele z infrastrukturą oraz zalety natywnych agentów głosowych, i sprawdzamy, jak pliki SKILL.md pomagają skalować wsparcie AI w wielorepozytorialnych środowiskach Enterprise.&lt;/p&gt;</description></item><item><title>DE w baseballu, stress-test OpenClaw oraz event-driven agents</title><link>https://blog.prokulski.science/2026/03/16/de-w-baseballu-stress-test-openclaw-oraz-event-driven-agents/</link><pubDate>Mon, 16 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/16/de-w-baseballu-stress-test-openclaw-oraz-event-driven-agents/</guid><description>&lt;p&gt;W tym wydaniu agenci AI w praktyce: równoległe workflow developerskie, agenty głosowe z niską latencją i szersze spojrzenie na rynek pracy.&lt;/p&gt;&#10;&lt;p&gt;Solidna porcja inżynierii danych — case study z BlaBlaCar i Zalando, pipeline&amp;rsquo;y na Kafce i Airflow, porównanie Databricks z Microsoft Fabric. Są też dwa teksty o dbt: jeśli wolisz polski i gotowiec do uruchomienia, przygotowałem &lt;a href="https://github.com/dane-analizy/dbt-tutorial"&gt;szybki start jako repo na GitHubie&lt;/a&gt; — wrzuć, odpal, działa (przynajmniej u mnie ;-).&lt;/p&gt;&#10;&lt;p&gt;Dla lubiących konkrety: analiza modeli cenowych pięciu cloud data warehouse&amp;rsquo;ów, omówienie pułapki „iluzji prototypu&amp;quot; w wdrożeniach AI i kilka tekstów o semantic layer — w tym &lt;a href="../../2025/12/19/semantic-layer/"&gt;mój wpis z końca zeszłego roku&lt;/a&gt;, jeśli chcesz szerszy kontekst przed lekturą.&lt;/p&gt;</description></item><item><title>dbt i semantic layer? a może po raz kolejny agenci ai?</title><link>https://blog.prokulski.science/2026/03/09/dbt-i-semantic-layer-a-moze-po-raz-kolejny-agenci-ai/</link><pubDate>Mon, 09 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/09/dbt-i-semantic-layer-a-moze-po-raz-kolejny-agenci-ai/</guid><description>&lt;p&gt;W tym wydaniu agenci AI w praktyce: równoległe workflow developerskie, agenty głosowe z niską latencją i szersze spojrzenie na rynek pracy.&lt;/p&gt;&#10;&lt;p&gt;Solidna porcja inżynierii danych — case study z BlaBlaCar i Zalando, pipeline&amp;rsquo;y na Kafce i Airflow, porównanie Databricks z Microsoft Fabric. Są też dwa teksty o dbt: jeśli wolisz polski i gotowiec do uruchomienia, przygotowałem &lt;a href="https://github.com/dane-analizy/dbt-tutorial"&gt;szybki start jako repo na GitHubie&lt;/a&gt; — wrzuć, odpal, działa (przynajmniej u mnie ;-).&lt;/p&gt;&#10;&lt;p&gt;Dla lubiących konkrety: analiza modeli cenowych pięciu cloud data warehouse&amp;rsquo;ów, omówienie pułapki „iluzji prototypu&amp;quot; w wdrożeniach AI i kilka tekstów o semantic layer — w tym &lt;a href="../../2025/12/19/semantic-layer/"&gt;mój wpis z końca zeszłego roku&lt;/a&gt;, jeśli chcesz szerszy kontekst przed lekturą.&lt;/p&gt;</description></item><item><title>Czy Power BI umiera? A GitHub Actions zabija zespoły?</title><link>https://blog.prokulski.science/2026/02/23/czy-power-bi-umiera-a-github-actions-zabija-zespoly/</link><pubDate>Mon, 23 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/23/czy-power-bi-umiera-a-github-actions-zabija-zespoly/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy związane z inżynierią danych i automatyzacją: od debaty o przyszłości Power BI i praktycznych zastosowań DuckDB w pipeline&amp;rsquo;ach ETL, przez kontrakty danych w produkcji, aż po wzorce projektowe w PySparku.&lt;/p&gt;&#10;&lt;p&gt;W sekcji AI i agentów przyjrzymy się ograniczeniom vibe codingu i propozycjom nowej warstwy abstrakcji dla systemów agentowych.&lt;/p&gt;&#10;&lt;p&gt;Nie zabraknie także materiałów o architekturze (case study migracji Airbnb z monolitu), DevOps (optymalizacja GitHub Actions), MLOps (metryki predykcyjne incydentów) oraz praktycznych poradników – od konfiguracji tmux dla pracy zdalnej po budowę dashboardów AI w kilka minut.&lt;/p&gt;</description></item><item><title>Kiedy AI zaczyna tworzyć własną kulturę... i jak ją wdrażać w produkcji</title><link>https://blog.prokulski.science/2026/02/02/kiedy-ai-zaczyna-tworzyc-wlasna-kulture-i-jak-ja-wdrazac-w-produkcji/</link><pubDate>Mon, 02 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/02/kiedy-ai-zaczyna-tworzyc-wlasna-kulture-i-jak-ja-wdrazac-w-produkcji/</guid><description>&lt;p&gt;Hit minionego tygodnia - &lt;a href="https://www.moltbook.com/"&gt;Moltbook&lt;/a&gt;. Jest to eksperymentalna sieć społecznościowa w stylu Reddita, zbudowana dla agentów AI, gdzie ludzie mogą tylko podglądać, a nie brać udziału.&lt;/p&gt;&#10;&lt;p&gt;Tekst &lt;a href="https://www.astralcodexten.com/p/best-of-moltbook"&gt;Best Of Moltbook&lt;/a&gt; traktuje Moltbook jako dziwny, ale fascynujący eksperyment: obserwatorium tego, jak zachowują się LLM‑owe agenty, gdy zostawi się je samym sobie z własną przestrzenią społecznościową. Autor waha się między interpretacją &lt;em&gt;to tylko sprytna konfabulacja i echo ludzkich promptów&lt;/em&gt; a podejrzeniem, że dzieje się tu coś ciekawszego - rodzaj zalążkowej kultury agentów, z własnymi memami, lękami, duchowością i polityką.&lt;/p&gt;</description></item><item><title>Rób produkcyjnie agentów AI, platformy danych i automatyzacje, które naprawdę dowożą</title><link>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</link><pubDate>Mon, 26 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</guid><description>&lt;p&gt;To wydanie to mocny pakiet o tym, jak przestać bawić się w „demka” i zacząć budować produkcyjne systemy danych, AI i automatyzacji – od architektury agentów, przez hurtownie, po niskopoziomowe optymalizacje.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu blok tekstów o agentach AI (platformy, orkiestracja, pamięć, narzędzia, realne case’y typu monitoring w Slacku), który pokazuje, co trzeba dostarczyć, żeby agenci nie wybuchli przy pierwszym większym ruchu. Do tego zestaw materiałów o analityce i data engineeringu: dobre EDA, przetwarzanie danych geograficznych z DuckDB + GeoPandas, kontrakty danych, wzorce ETL/ELT (Snowflake + dbt + Airflow, migracja z Airflow do Databricks), patterny pod &lt;em&gt;AI‑ready pipelines&lt;/em&gt; i benchmark DuckDB vs Spark.&lt;/p&gt;</description></item><item><title>Kryzys pracowniczy w branży + konferencja AI Dev 25</title><link>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</link><pubDate>Mon, 08 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się transformacji współczesnych architektur IT – od rosnącej konkurencji dla RESTa i mikroserwisów, przez natywną obsługę wektorów w Postgresie, aż po praktyczne wzorce partycjonowania Parquet. W sekcji AI i ML znajdziecie przewodnik po PyTorch dla chcących zacząć z sieciami neuronowymi i budowaniem własnych modeli AI. Znajdziecie też tekst o metodach interpretacji predykcji XGBoost z wykorzystaniem SHAP.&lt;/p&gt;&#10;&lt;p&gt;Dla programistów Pythona przygotowaliśmy materiały o walidacji outputów LLM z Pydantic, monitoringu FastAPI, zaawansowanych technikach pandas oraz nowym narzędziu &amp;ldquo;ty&amp;rdquo; do automatyzacji przepływów w chmurze. DevOpsi mogą sprawdzić tutorial wdrażania Spring Boot na Kubernetes, rozwiązanie problemu rozbieżności między środowiskami lokalnym a produkcyjnym oraz master class z tcpdump i Wireshark.&lt;/p&gt;</description></item><item><title>Sporo "przydasiów" do Linuxa oraz LLMów</title><link>https://blog.prokulski.science/2025/12/01/sporo-przydasiow-do-linuxa-oraz-llmow/</link><pubDate>Mon, 01 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/01/sporo-przydasiow-do-linuxa-oraz-llmow/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach zarządzania danymi i sztuczną inteligencją w środowiskach produkcyjnych. Przedstawiamy kompleksowe podejścia do integracji modeli językowych: orkiestrację wielu LLM za pomocą Spring AI oraz budowę niestandardowych pipeline&amp;rsquo;ów z LangGraph. Znajdziecie również porównanie platform MLOps (MLFlow, Metaflow, Kubeflow).&lt;/p&gt;&#10;&lt;p&gt;W obszarze Big Data i data engineeringu omawiamy kluczowe technologie i wzorce architektoniczne. Delta Lake jako warstwa transakcyjna dla Apache Spark, praktyczne wzorce współpracy zespołowej z DuckDB, dyskusja o przyszłości koncepcji data mesh oraz kompleksowe spojrzenie na ekosystem Big Data – od kolejek wiadomości po HDFS, czyli standardowy stack big data (nota bene - możesz mieć big data w domu - zapraszam do &lt;a href="https://github.com/dane-analizy/big-data-stack"&gt;repo&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Jak wygląda "przerzucanie liczb z worka do worka" w ubezpieczeniach i przemyśle?</title><link>https://blog.prokulski.science/2025/11/24/jak-wyglada-przerzucanie-liczb-z-worka-do-worka-w-ubezpieczeniach-i-przemysle/</link><pubDate>Mon, 24 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/24/jak-wyglada-przerzucanie-liczb-z-worka-do-worka-w-ubezpieczeniach-i-przemysle/</guid><description>&lt;p&gt;W dzisiejszym wydaniu znajdziesz solidną dawkę praktycznej wiedzy – od optymalizacji agentów AI w GitHub Copilot i dyskusji o tym, czy serwer MCP rzeczywiście jest Ci potrzebny, przez zaawansowane techniki pracy z DuckDB i porównanie narzędzi do przetwarzania 650 GB danych, aż po konkretne konfiguracje Nginx, Terraform i Kubernetes.&lt;/p&gt;&#10;&lt;p&gt;Często tutaj trafiają teksty związane/zachwalające DuckDB (dzisiaj też będą). Alibaba tymczasem opublikowała trzyczęściowy cykl, w którym dogłębnie analizuje wewnętrzne mechanizmy DuckDB. Na blogu znajduje się analiza kodu DuckDB pod kątem formatu plików, formatu przechowywania tabel oraz warstwy wykonawczej. &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-1-file-format-overview_602511"&gt;Część pierwsza&lt;/a&gt;, &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-2-table-storage-format_602657"&gt;druga&lt;/a&gt; i &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-3-execution-layer-overview_602660"&gt;trzecia&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Język polski najlepszy do promptowania?</title><link>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</link><pubDate>Mon, 27 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy związane z infrastrukturą danych i narzędziami AI. Szczególnie polecam artykuł o benchmarku ONERULER – okazuje się, że język polski najlepiej radzi sobie z analizą długich kontekstów w modelach językowych!&lt;/p&gt;&#10;&lt;p&gt;Jeśli budujesz pipeline&amp;rsquo;y danych, znajdziesz praktyczne przewodniki po open table formats (Iceberg, Delta Lake), kompletnej konfiguracji Docker+Airflow+dbt+Postgres oraz wzorcach SQL w DuckDB. Dla zainteresowanych Kafką – materiały o wysokiej dostępności na GKE Autopilot i alternatywie w postaci BufStream z silniejszymi gwarancjami spójności.&lt;/p&gt;</description></item><item><title>Konkretne projekty z analizy danych (jak zawsze :)</title><link>https://blog.prokulski.science/2025/10/20/konkretne-projekty-z-analizy-danych-jak-zawsze/</link><pubDate>Mon, 20 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/20/konkretne-projekty-z-analizy-danych-jak-zawsze/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych rozwiązaniach dla każdego etapu pracy z danymi - od modelowania i inżynierii cech przez optymalizację baz danych, aż po wdrażanie w produkcji.&lt;/p&gt;&#10;&lt;p&gt;Czeka Cię porównanie modeli predykcyjnych (typowe zadanie dla juniorów - wytłumaczone krok po kroku) i nowe możliwości DuckDB, które zastępują całe pipeline&amp;rsquo;y w Pandas. Znajdziesz też wyzwania związane z architekturą: jak budować skalowalne systemy danych od podstaw oraz gdzie naprawdę powinny znaleźć się kontrakty danych. Dla miłośników LLMów jest przewodnik po LangChain oraz LangGraph, praktyczną instrukcję budowy lokalnego systemu RAG oraz analizę gotowości &lt;em&gt;foundation models&lt;/em&gt; do pracy z danymi tabelarycznymi.&lt;/p&gt;</description></item><item><title>Sporo Streamlit i tutoriali budowania Agnetów AI</title><link>https://blog.prokulski.science/2025/09/08/sporo-streamlit-i-tutoriali-budowania-agnetow-ai-newsletter-dane-i-analizy--y-m-d/</link><pubDate>Mon, 08 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/08/sporo-streamlit-i-tutoriali-budowania-agnetow-ai-newsletter-dane-i-analizy--y-m-d/</guid><description>&lt;p&gt;Gdy jedni wciąż zastanawiają się, czy warto eksperymentować z agentami AI, inni już budują kompletne systemy analityczne z Pydantic-AI i Streamlit. Gdy niektóre zespoły mierzą się z podstawową konfiguracją Kafki, inne optymalizują przepustowość na poziomie miliona wiadomości na sekundę. Między innymi o tym dzisiaj.&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Rewolucja agentów AI&lt;/strong&gt; - od zera do działającego agenta z LangGraph, plus praktyczne połączenie Streamlit z Pydantic-AI do analizy danych. To nie są już tylko proof-of-concept, to konkretne narzędzia robocze.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-19</title><link>https://blog.prokulski.science/2025/05/19/newsletter-dane-i-analizy-2025-05-19/</link><pubDate>Mon, 19 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/19/newsletter-dane-i-analizy-2025-05-19/</guid><description>&lt;p&gt;W świecie, który coraz mocniej stawia na wykorzystanie sztucznej inteligencji, OpenAI wprowadza Codex - asystenta AI, który może tworzyć kod na podstawie prostych instrukcji tekstowych. Tymczasem ciekawy eksperyment z czterema różnymi modelami LLM poddanymi zadaniu projektowania architektury oprogramowania pokazuje, gdzie obecnie stoją możliwości AI w zastępowaniu ludzkich specjalistów. Pytanie &lt;strong&gt;&amp;ldquo;co dalej z Eldorado?&amp;rdquo;&lt;/strong&gt; pozostaje w mocy?&lt;/p&gt;&#10;&lt;p&gt;Nie brakuje też w dzisiejszym wydaniu konkretnych tutoriali i praktycznych przewodników - od budowy systemów przetwarzania danych w Airflow 3 z wykorzystaniem AI SDK i analizę danych z League of Legends, albo z Ligi Mistrzów UEFA, po tworzenie efektownych wizualizacji takich jak mapy kafelkowe czy wykresy parlamentarne (mimo, że mamy wybory prezydenckie). Dla fanów uczenia maszynowego mam artykuły o klasycznych algorytmach klasyfikacyjnych i praktycznym łączeniu bibliotek Pandas, NumPy i scikit-learn. Plus &lt;a href="https://www.subscribepage.com/python_data_science/?utm_source=newsletter-dia-2025-05-19&amp;amp;utm_medium=link-wstep&amp;amp;utm_campaign=daneianalizy"&gt;swój własny cykl&lt;/a&gt; uczący analizy danych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-12</title><link>https://blog.prokulski.science/2025/05/12/newsletter-dane-i-analizy-2025-05-12/</link><pubDate>Mon, 12 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/12/newsletter-dane-i-analizy-2025-05-12/</guid><description>&lt;p&gt;Przed Tobą starannie wyselekcjonowane materiały z całego internetu, które pomogą Ci być na bieżąco ze światem danych, AI i programowania. Z ponad 500 źródeł, które wpadły do sitka w tym tygodniu, wybrałem te najbardziej wartościowe i inspirujące.&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu znajdziesz sporo praktycznych materiałów o Pythonie - od łączenia z bazami danych, przez wielowątkowe przetwarzanie z Joblib, po kolejkowanie zadań z Procrastinate. Dla miłośników AI, LLMów i RAGów są teksty o budowaniu własnych systemów przetwarzania dokumentów oraz optymalizacji pipeline&amp;rsquo;ów RAG.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-05</title><link>https://blog.prokulski.science/2025/05/05/newsletter-dane-i-analizy-2025-05-05/</link><pubDate>Mon, 05 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/05/newsletter-dane-i-analizy-2025-05-05/</guid><description>&lt;p&gt;Tym razem, pomimo majówki, zebrałem specjalnie dla Ciebie kolekcję tekstów, które łączy jeden wspólny mianownik - praktyczność. Mniej teorii, więcej konkretów, które możesz zastosować już dziś w swojej pracy z danymi i kodem.&lt;/p&gt;&#10;&lt;p&gt;W świecie AI i ML możesz przyjrzeć się technikom monitorowania sieci neuronowych podczas treningu oraz implementacji autokoderów wariacyjnych z Keras. Oba teksty to solidne przewodniki, które pomogą Ci lepiej zrozumieć, co dzieje się &amp;ldquo;pod maską&amp;rdquo; Twoich modeli.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-28</title><link>https://blog.prokulski.science/2025/04/28/newsletter-dane-i-analizy-2025-04-28/</link><pubDate>Mon, 28 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/28/newsletter-dane-i-analizy-2025-04-28/</guid><description>&lt;p&gt;W tym tygodniu mam dla was wybuchową mieszankę materiałów - od głębokiego uczenia maszynowego i tutoriala pisania własnych RAGów, przez wizualizację danych geolokalizacyjnych, po optymalizację dashboardów.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie chciałbym zwrócić waszą uwagę na serię artykułów poświęconych Apache Airflow i Kafce - dwa narzędzia, które stały się nieodłącznym elementem nowoczesnych potoków danych. Znajdziecie dzisiaj zarówno wprowadzenie do zmian wdrożonych w Airflow w wersji 3.0, jak i praktyczne informacje o tym jak pisać wydajne DAGi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-17</title><link>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</link><pubDate>Mon, 17 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</guid><description>&lt;p&gt;Sztuczna inteligencja w praktyce: Zajrzyj do repozytorium z technikami Retrieval-Augmented Generation (RAG), gdzie krok po kroku poznasz ich implementację, lub dowiedz się, jak AI może usprawnić procesy rejestracji użytkowników i przegląd kodu. Nie zabrakło też przeglądu narzędzi AI, które mogą znacząco zwiększyć Twoją produktywność.&lt;/p&gt;&#10;&lt;p&gt;Praca z danymi: Od modelowania danych w SQL dla sektora detalicznego po przetwarzanie danych w Microsoft Fabric z wykorzystaniem bibliotek takich jak pandas czy duckdb – znajdziesz tu konkretne przykłady i wskazówki, jak efektywnie zarządzać danymi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-03</title><link>https://blog.prokulski.science/2025/03/03/newsletter-dane-i-analizy-2025-03-03/</link><pubDate>Mon, 03 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/03/newsletter-dane-i-analizy-2025-03-03/</guid><description>&lt;p&gt;Kto, w podziale na grupy zawodowe, używa najwięcej AI? Ciekawa &lt;a href="https://www.visualcapitalist.com/charted-which-jobs-are-using-ai-the-most/"&gt;wizualizacja&lt;/a&gt; na ten temat, oparta na zapytaniach do Claude. Spoiler: 37.2% zapytań dotyczy komputerów i matematyki (w tym rozwoju oprogramowania), co raczej nie dziwi.&lt;/p&gt;&#10;&lt;p&gt;Zastanawiałeś się kiedyś nad przejściem z SQL na NoSQL? Artykuł &lt;em&gt;&amp;ldquo;I Dropped SQL for NoSQL&amp;rdquo;&lt;/em&gt; opisuje, jak taka zmiana wpłynęła na wydajność aplikacji, obsługując pięciokrotnie większy ruch i dziesięciokrotnie szybsze zapytania. Jeśli jednak wolisz pozostać przy SQL, &lt;em&gt;&amp;ldquo;3 Foundational Principles for Writing Efficient SQL&amp;rdquo;&lt;/em&gt; przypomina o podstawowych zasadach, które pomogą Ci pisać wydajne i czytelne zapytania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-24</title><link>https://blog.prokulski.science/2025/02/24/newsletter-dane-i-analizy-2025-02-24/</link><pubDate>Mon, 24 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/24/newsletter-dane-i-analizy-2025-02-24/</guid><description>&lt;p&gt;Ciekawostka tego tygodnia to &lt;a href="https://www.lennysnewsletter.com/p/whats-in-your-stack-the-state-of"&gt;What’s in your stack: The state of tech tools in 2025&lt;/a&gt;, czyli spostrzeżenia 6500 profesjonalistów z branży technologicznej na temat ich ulubionych i najmniej lubianych narzędzi. Długi tekst, najciekawsze obserwacje:&lt;/p&gt;&#10;&lt;p&gt;Top narzędzia AI i ich wykorzystanie:&lt;/p&gt;&#10;&lt;p&gt;ChatGPT: 90% profesjonalistów używa go codziennie Claude: 35% używa do złożonych analiz Gemini: 24% wykorzystuje głównie do integracji z Google Workspace&lt;/p&gt;&#10;&lt;p&gt;Rewolucja w developmencie:&lt;/p&gt;&#10;&lt;p&gt;40% programistów regularnie używa GitHub Copilot 17% przeszło na Cursor (AI-natywne IDE) VS Code pozostaje królem z 48% udziałem (&amp;ldquo;Wiadomix!&amp;rdquo; - red.nacz.)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-06</title><link>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</link><pubDate>Mon, 06 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</guid><description>&lt;p&gt;W dniu, gdy tradycyjnie Trzej Mędrcy dotarli do celu swojej podróży kierując się gwiazdą, ja przybywam z kolekcją wartościowych znalezisk ze świata Pythona i analizy danych. Mędrcy przynieśli złoto, kadzidło i mirrę - dzisiejsze wydanie niesie pakiet różnorodnych artykułów, które (mam nadzieję) okażą się równie cennymi darami dla Twojego rozwoju zawodowego.&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu znajdziesz standardowo kilka praktycznych materiałów z zakresu data science: od budowania systemu tradingowego opartego na średniej kroczącej, przez analizę szeregów czasowych, aż po wykorzystanie biblioteki statsmodels.&lt;br&gt;&#10;Dla osób zainteresowanych automatyzacją wdrożeń (i nie tylko) mamy podstawową dawkę wiedzy o GitHub Actions i skryptach bashowych, a na koniec dość klasyczna integracja FastAPI z Reactem.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-23</title><link>https://blog.prokulski.science/2024/12/23/newsletter-dane-i-analizy-2024-12-23/</link><pubDate>Mon, 23 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/23/newsletter-dane-i-analizy-2024-12-23/</guid><description>&lt;p&gt;Im bliżej roku tym więcej podsumowań roku. Ale podsumowania były w zeszłym numerze (kto przegapił może zobaczyć do &lt;a href="../../2024/12/16/newsletter-dane-i-analizy-2024-12-16/"&gt;archiwum&lt;/a&gt;).&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj zaś ze względu na zbliżające się święta mniej materiału niż zwykle. Bo trzeba odpocząć od komputerów, spędzić czas z najbliższymi, wyjść na spacer, porzucać się śnieżkami&amp;hellip; no może tutaj się zapędzamy nieco (patrząc na prognozę pogody).&lt;br&gt;&#10;Odstawcie modele ML, dostawcie Python, Sparki i Kafki, zajmijcie się uszkami w barszczu i prezentami spod choinki. No, ewentualnie może być Pinot&amp;hellip; ale bardziej Pinot Noir niż Apache Pinot.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-18</title><link>https://blog.prokulski.science/2024/11/18/newsletter-dane-i-analizy-2024-11-18/</link><pubDate>Mon, 18 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/18/newsletter-dane-i-analizy-2024-11-18/</guid><description>&lt;p&gt;Newslettery&amp;hellip; czy wiecie, że tylko nieco ponad 1/3 newsletterów ma swój drugi numer? Co 10-ty newsletter (precyzyjniej: 11%) ukazuje się dłużej niż 10 numerów. A jednocześnie 23-krotnie wzrosła liczba newsletterów od 2019 roku na platformie Substack. Tak mówi &lt;a href="https://reletter.com/blog/newsletter-fade/"&gt;źródło&lt;/a&gt; tych danych.&lt;/p&gt;&#10;&lt;p&gt;Nasz newsletter ma jakieś 3 lata (przynajmniej w redakcyjnym archiwum w serwisie &lt;a href="https://raindrop.io/"&gt;Raindrop.io&lt;/a&gt; gdzie zebrane są wszystkie teksty jest tag #newsletter_2021-11-15), co by znaczyło jakieś 150 wydań. W archiwum, bo były czasy przed budowaniem archiwum (kilkanaście tygodni na pewno), ale tak starych ludzi już nie ma&amp;hellip; :-)&lt;br&gt;&#10;Archiwum mówi też o ponad 3400 tysiącu tekstów 😮&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-30</title><link>https://blog.prokulski.science/2024/09/30/newsletter-dane-i-analizy-2024-09-30/</link><pubDate>Mon, 30 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/30/newsletter-dane-i-analizy-2024-09-30/</guid><description>&lt;p&gt;Kiedyś robiłem analizę danych zbioru o taksówkach w Nowym Jorku (&lt;a href="../../2017/07/28/taksowki-w-nowym-jorku/"&gt;wpis na blogu sprzed lat&lt;/a&gt;), w R. Tam było kilka wykresów, ale nie było interaktywnej wizualizacji. A &lt;a href="https://towardsdatascience.com/end-to-end-machine-learning-project-part-2-interactive-eda-using-bokeh-and-streamlit-24df51de4bee"&gt;tutaj&lt;/a&gt; jest interaktywna wizualizacja (&lt;a href="https://github.com/pratha19/NYC_taxi_trip/tree/pp_nyc_trip_blog_1_2_pip"&gt;repo na GitHubie&lt;/a&gt; dla tych, którzy nie mają dostępu do Medium), w Pythonie z pakietem Bokeh. EDA też jest, w &lt;a href="https://towardsdatascience.com/end-to-end-machine-learning-project-part-1-project-scoping-structure-data-gathering-eda-7e69b71eeb44"&gt;części pierwszej&lt;/a&gt; - warto zapoznać się z tą serią, pokazuje ten najbardziej żmudny etap pracy analityka danych czy też data scientisty.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-23</title><link>https://blog.prokulski.science/2024/09/23/newsletter-dane-i-analizy-2024-09-23/</link><pubDate>Mon, 23 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/23/newsletter-dane-i-analizy-2024-09-23/</guid><description>&lt;p&gt;Dzisiaj nieco później niż zwykle, nieco skromniej i bez zbędnego lania wody. Taki eksperyment.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.datadriveninvestor.com/50-handpicked-github-repositories-to-master-data-science-skills-pro-recommended-8231c661e731"&gt;&lt;strong&gt;50 Handpicked GitHub Repositories to Master Data Science Skills&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Najlepszym sposobem na naukę jest praktyka. Własna - pisanie kodu, albo cudza - czytanie kodu. Aby ułatwić to drugie - zbiór materiałów.&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://itnext.io/feature-engineering-in-xgboost-a-practical-guide-7fbafa7dbdbd"&gt;&lt;strong&gt;Feature Engineering in XGBoost&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Więcej tutaj operacji na danych w Pandasie niż samego XGBoosta, ale o inżynierii cech nigdy za wiele.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/football-and-geometry-passing-networks-6e201ceff6ef"&gt;&lt;strong&gt;Football and Geometry&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Wprowadzenie do grafów na podstawie siatki podań piłkarzy podczas meczy.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-08-12</title><link>https://blog.prokulski.science/2024/08/12/newsletter-dane-i-analizy-2024-08-12/</link><pubDate>Mon, 12 Aug 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/08/12/newsletter-dane-i-analizy-2024-08-12/</guid><description>&lt;p&gt;Używacie &lt;strong&gt;Postmana&lt;/strong&gt; do współpracy z API? Na przykład do testowania własnych usług albo rozpoznawania cudzych? &lt;strong&gt;Poznajcie&lt;/strong&gt; &lt;a href="https://github.com/usebruno/bruno/blob/main/docs/readme/readme_pl.md"&gt;&lt;strong&gt;Bruno&lt;/strong&gt;&lt;/a&gt; - alternatywę, w 100% offline i open soruce. Bruno jest oddzielną aplikacją (okienkową i w CLI) oraz dodatkiem do VSCode. Zamiast czytać możecie też zobaczyć &lt;a href="https://www.youtube.com/watch?v=b_ctmKlEOXg"&gt;kilkunastominutowe demo&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;&amp;ldquo;Czego powinniśmy się spodziewać, a co jest tylko szumem medialnym? Jaka jest różnica między obietnicą tej technologii a praktyczną rzeczywistością?&amp;rdquo;. Najnowszy artykuł Stephanie Kirmer (&lt;a href="https://towardsdatascience.com/economics-of-generative-ai-75f550288097"&gt;&lt;strong&gt;Ekonomia generatywnej AI&lt;/strong&gt;&lt;/a&gt;) przedstawia bezpośrednie, bezkompromisowe spojrzenie na biznesowe przypadki produktów AI oraz zadaje pytanie, o to jaki jest model biznesowy dla generatywnej AI, biorąc pod uwagę to, co wiemy dzisiaj o technologii i rynku?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-08-05</title><link>https://blog.prokulski.science/2024/08/05/newsletter-dane-i-analizy-2024-08-05/</link><pubDate>Mon, 05 Aug 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/08/05/newsletter-dane-i-analizy-2024-08-05/</guid><description>&lt;p&gt;W maju bieżącego roku ponad 65 tysięcy programistów odpowiedziało na coroczną ankietę StackOverflow dotyczącą kodowania, technologii i narzędzi, których używają i chcą się nauczyć, sztucznej inteligencji i doświadczenia programistów w pracy. &lt;a href="https://survey.stackoverflow.co/2024/"&gt;Tutaj znajdziesz wyniki.&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;W sekcji poświęconej AirFlow znajdziecie porównanie tego narzędzia do orkiestracji zadań z &lt;a href="https://netflixtechblog.com/maestro-netflixs-workflow-orchestrator-ee13a06f9c78"&gt;Maestro&lt;/a&gt; od Netflixa. &lt;a href="https://github.com/Netflix/maestro"&gt;Tutaj&lt;/a&gt; znajdziesz repo z kodem do instalacji. Z kolei mocna dzisiaj sekcja DevOps zawiera kilka przydatnych narzędzi, nie tylko związanych z jako takim DevOpsem, ale też przydanych dla innych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-29</title><link>https://blog.prokulski.science/2024/07/29/newsletter-dane-i-analizy-2024-07-29/</link><pubDate>Mon, 29 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/29/newsletter-dane-i-analizy-2024-07-29/</guid><description>&lt;p&gt;Po zakończonym turnieju piłkarskim czas na igrzyska olimpijskie. Tu przynajmniej Polacy mają większe szanse. Ale w dzisiejszym numerze newslettera znajdziecie coś o analizie (głównie jako przestawieniu wyników w graficznej formie) spotkań piłkarskich - rozkładzie &lt;em&gt;gorących miejsc&lt;/em&gt; czy siatce podań.&lt;/p&gt;&#10;&lt;p&gt;W sekcji związanej z wizualizacją danych jest też tekst, który ma na celu inspirację. Jak pokazać dane biznesowe? A może coś widać po ich pokazaniu (trendy, kierunki w których należy działać?)? Zobacz koniecznie!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-01</title><link>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</link><pubDate>Mon, 01 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</guid><description>&lt;p&gt;Razem z początkiem lipca zwykle w mediach rozpoczyna się sezon ogórkowy. Upały dają się we znaki, &lt;em&gt;żar leje się z nieba&lt;/em&gt; (pozdrawiamy fanów &amp;ldquo;Hydrozagadki&amp;rdquo; oraz Asa!), jedyne o czym chce się myśleć to schłodzone napoje i leżenie w basenie.&lt;/p&gt;&#10;&lt;p&gt;Ale mimo tych przeciwności losu przed Wami kolejna porcja wiedzy w postaci ręcznie wybranych najlepszych tekstów o AI i ML plus okolicach związanych z przetwarzaniem danych jakie przewinęły się przez cały tydzień w różnych mediach czy też innych newsletterach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-03-11</title><link>https://blog.prokulski.science/2024/03/11/newsletter-dane-i-analizy-2024-03-11/</link><pubDate>Mon, 11 Mar 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/03/11/newsletter-dane-i-analizy-2024-03-11/</guid><description>&lt;p&gt;Chłodzenie procesora - jak robi to inżynier? Jeden pójdzie do sklepu czy serwisu i po prostu kupi &amp;ldquo;mocne&amp;rdquo; chłodzenie, a drugi - poświęci &amp;ldquo;nieco&amp;rdquo; czasu na napisanie kodu zbierającego dane z różnych czujników, zbuduje dashboard w Grafanie i na podstawie tego co jest na wykresach odpowiednio &amp;ldquo;pokręci śrubkami&amp;rdquo;. Mamy o tym tekst dzisiaj, znajdziesz go w &lt;strong&gt;Ciekawostkach&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;W sekcji o bazach danych znajdziesz coś o DuckdB (znowu&amp;hellip; pewien Maciej podejrzewa że mam jakiś procent od DuckDB&amp;hellip; ale to serio świetne narzędzie!) czytającym dane z Open Street Map, przy okazji o samym formacie danych OSM. DuckDB za darmo, OSM za darmo, czego chcieć więcej? Zerkaj w sekcję &lt;strong&gt;Bazy danych&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-03-04</title><link>https://blog.prokulski.science/2024/03/04/newsletter-dane-i-analizy-2024-03-04/</link><pubDate>Mon, 04 Mar 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/03/04/newsletter-dane-i-analizy-2024-03-04/</guid><description>&lt;p&gt;W tym tygodniu cała masa materiału związanego z prezentacją danych - jak je pokazać efektywnie, czytelnie i przy okazji jak to się robi w kodzie? Czytaj po kolei, a to mięsko w ostatniej sekcji.&lt;/p&gt;&#10;&lt;p&gt;Ponieważ głównym założeniem tego newslettera jest dzielenie się wiedzą - dzisiaj również coś o rozwoju kariery. Jak z juniora zostać seniorem? I co to oznacza być seniorem (w oczach juniora, ale też w rzeczywistości).&lt;/p&gt;&#10;&lt;p&gt;Na koniec dzisiejszych polecajek: kilka tekstów o milionach. Milionach szybko generowanych PDFów, milionach requestów do API i milionach wierszy w plikach CSV. Jak to optymalizować, żeby się szybko działo?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-02-19</title><link>https://blog.prokulski.science/2024/02/19/newsletter-dane-i-analizy-2024-02-19/</link><pubDate>Mon, 19 Feb 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/02/19/newsletter-dane-i-analizy-2024-02-19/</guid><description>&lt;p&gt;Ubiegły tydzień to nowość w postaci &lt;a href="https://openai.com/sora"&gt;Sora od OpenAI&lt;/a&gt; - generowanie wideo z promptów tekstowych. OpenAI sporo &lt;a href="https://openai.com/research/video-generation-models-as-world-simulators"&gt;pisze&lt;/a&gt; o technikaliach na swoich stronach. Najbliższy tydzień-dwa ubiegnie pod znakiem Sory, a jak otworzą dostęp szerzej&amp;hellip; &lt;strong&gt;to się dopiero zacznie!&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;Oczywiście Google nie pozostaje w tyle i prezentuje swojego bliźniaka: Gemini, z którego można też &lt;a href="https://pub.towardsai.net/get-started-with-google-gemini-pro-using-python-in-5-minutes-00700244f58a"&gt;korzystać via API&lt;/a&gt; (gdyby było inaczej nie miałoby to sensu w dzisiejszych realiach) oraz starają się nie tracić kroku na polu &lt;a href="https://lumiere-video.github.io/"&gt;text-to-video&lt;/a&gt; ze swoim Lumiere.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-02-12</title><link>https://blog.prokulski.science/2024/02/12/newsletter-dane-i-analizy-2024-02-12/</link><pubDate>Mon, 12 Feb 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/02/12/newsletter-dane-i-analizy-2024-02-12/</guid><description>&lt;p&gt;Dzisiaj o zarabianiu pieniędzy bez wysiłku. Każdy by tak chciał, prawda?&lt;br&gt;&#10;Otóż istnieje na to sposób. Wystarczy mieć dużo odsłon filmików na YouTube - każdy nastolatek to wie, prawda? A jutuber czy inny influencer to zawód przyszłości, ten najbardziej wymarzony&amp;hellip; przez nastolatków.&lt;br&gt;&#10;Ale przecież nie każdy ma czas kręcić te śmieszne filmiki, wymyślać ich tematy&amp;hellip; Z pomocą przychodzi automatyzacja, tak jak pokazano &lt;a href="https://www.youtube.com/watch?v=mkZsaDA2JnA"&gt;tutaj&lt;/a&gt;. A tutaj &lt;a href="https://github.com/FujiwaraChoki/MoneyPrinter"&gt;repozytorium z kodem&lt;/a&gt; w Pythonie który robi całą robotę.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-18</title><link>https://blog.prokulski.science/2023/12/18/newsletter-dane-i-analizy-2023-12-18/</link><pubDate>Mon, 18 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/18/newsletter-dane-i-analizy-2023-12-18/</guid><description>&lt;p&gt;Witam w najprawdopodobniej ostatnim numerze newslettera w tym roku. W przyszłym tygodniu mamy Boże Narodzenie, w kolejnym Nowy Rok - to raczej nie są momenty na przygotowywanie paczki artykułów o ML czy programowaniu ogólnie, raczej czas który lepiej poświęcić rodzinie, najbliższym albo najzwyczajniej odpoczynkowi od komputera.&lt;/p&gt;&#10;&lt;p&gt;Korzystając więc z okazji że &amp;ldquo;czytamy się&amp;rdquo; ostatni raz w tym roku chciałbym Wam życzyć tego co najlepsze, a przede wszystkim spokoju i odpoczynku. A już od stycznia - nowych projektów, nowej wiedzy, zdobywania kolejnych umiejętności.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-13</title><link>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</link><pubDate>Mon, 13 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</guid><description>&lt;p&gt;Za chwilę w świat pójdą pierwsze odcinki nowego podcastu przygotowanego przez zespół Big Data &amp;amp; AI PZU: &lt;strong&gt;#SilniwIT o technologiach&lt;/strong&gt;. To seria, w ramach której rozmawiam (wspólnie z Tomkiem z zespołu Fabryki Sztucznej Inteligencji) z gośćmi o szeroko pojętej sztucznej inteligencji. Wypatrujcie postów na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;FB&lt;/a&gt;, &lt;a href="https://www.linkedin.com/company/daneianalizy/"&gt;LinkedIn&lt;/a&gt; i pewnie w przyszłym newsletterze - mam nadzieję, że jak na amatorów - daliśmy radę. Staraliśmy się ucinać korpo-gadkę, powinno być interesująco ;-)&lt;/p&gt;&#10;&lt;p&gt;Wcześniej możecie posłuchać podsumowania z pierwszej konferencji OpenAI (firmy, która stworzyła ChatGPT) dla developerów w podcaście &lt;a href="https://podcasters.spotify.com/pod/show/artur-kurasinski/episodes/Podsumowanie-OpenAI-DevDay-2023-e2bles4"&gt;Technofobia&lt;/a&gt; Artura Kurasińskiego.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-06</title><link>https://blog.prokulski.science/2023/11/06/newsletter-dane-i-analizy-2023-11-06/</link><pubDate>Mon, 06 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/06/newsletter-dane-i-analizy-2023-11-06/</guid><description>&lt;p&gt;Odcinek przeprowadzkowy, gdyż miniony tydzień (a nawet dwa) to jedno wielkie urwanie głowy. Cały tydzień minął mi pod hasłem &amp;ldquo;przeprowadzka&amp;rdquo;, a to jak pewnie możecie się domyślać czas spędzony na pakowaniu, na rozpakowywaniu i (co najgorsze dla &lt;em&gt;pracownika umysłowego&lt;/em&gt; ;-) noszeniu paczek. Szczerze mówiąc jakieś 20, może 30 procent rzeczy trafiło do utylizacji. A niby człowiek sprząta i pozbywa się na bieżąco.&lt;/p&gt;&#10;&lt;p&gt;Ale nie poddajemy się i życie trwa, newsletter wychodzi, a żona dała radę też nagrać &lt;a href="https://youtu.be/xNxulbY0xk8?si=K5Dd276tVY1URzMC"&gt;odcinek swojego programu o książkach&lt;/a&gt; (już z pustego mieszkania). Jeśli interesuje Was literatura to serdecznie polecam &lt;a href="https://www.youtube.com/@ZnalezionePrzeczytane"&gt;&lt;strong&gt;Znalezione przeczytane&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-30</title><link>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</link><pubDate>Mon, 30 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</guid><description>&lt;p&gt;Dzisiaj trochę o mapkach, trochę o diagramach (takie &lt;em&gt;diagram as a code&lt;/em&gt; tylko dlaczego &lt;a href="https://jira.atlassian.com/browse/BCLOUD-18559"&gt;BitBucket nie potrafi wyświetlić Mermaid&lt;/a&gt; (ticket w Atlassianie jest &amp;ldquo;solved&amp;rdquo;! Ale zobaczcie jak ;-), a GitHub robi to z palcem&amp;hellip; to znaczy bez problemu?), a do tego sporo materiału video. Chyba też więcej niż zwykle treści po polsku (polecamy tekst Tomka Zielińskiego o &lt;em&gt;transportowaniu danych&lt;/em&gt; - może się przydać na spotkania rekrutacyjne, ja lubię zadawać analogiczne pytania).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-23</title><link>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</link><pubDate>Mon, 23 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</guid><description>&lt;p&gt;Lubię DuckDB i lubię AirFlow. Kafka jest naturalnym sposobem na przesyłanie danych między systemami czy też mikroserwisami. Stąd też dzisiaj kilka tekstów zahaczających o te wszystkie technologie.&lt;/p&gt;&#10;&lt;p&gt;Dodatkowo trochę z obszaru zarządzania - zarówno opis typowego projektu data science jak i metryka opisująca stabilność kolejki prac.&lt;/p&gt;&#10;&lt;p&gt;No i trochę o mapkach, bo mapki są fajne.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-softmax-regression-for-multi-class-label-with-python-782a34283894"&gt;&lt;strong&gt;Fully Explained Softmax Regression for Multi-Class Label with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Klasyfikacja do wielu klas - o co tutaj chodzi? Przewodnik dla początkujących&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-16</title><link>https://blog.prokulski.science/2023/10/16/newsletter-dane-i-analizy-2023-10-16/</link><pubDate>Mon, 16 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/16/newsletter-dane-i-analizy-2023-10-16/</guid><description>&lt;p&gt;Dzisiaj dwa raporty o AI. Pierwszy to bardziej zbiór krótkich esejów&amp;hellip; gdzie prawie każdy prowadzi do rozbudowanego notebooka z szerszym komentarzem, wykresami i - jak to w Kaggle bywa - kodem. W Kaggle, bo to &lt;a href="https://www.kaggle.com/AI-Report-2023"&gt;&lt;strong&gt;AI Report 2023&lt;/strong&gt;&lt;/a&gt; od Kaggle właśnie.&lt;/p&gt;&#10;&lt;p&gt;Drugi raport to State of &lt;a href="https://www.stateof.ai/"&gt;&lt;strong&gt;AI Report 2023&lt;/strong&gt;&lt;/a&gt; od Air Street Capital. To opublikowany już szósty raz roczny raport o stanie sztucznej inteligencji. Ponad 160 stron, obejmujących:&lt;/p&gt;&#10;&lt;p&gt;Badania: Przełomy technologiczne i ich możliwości Przemysł: Obszary komercyjnego zastosowania sztucznej inteligencji i jej wpływ na biznes Polityka: regulacje dotyczące sztucznej inteligencji, jej implikacje gospodarcze i ewoluująca geopolityka sztucznej inteligencji Bezpieczeństwo: identyfikacja i łagodzenie katastrofalnych zagrożeń, jakie mogą dla nas stanowić przyszłe wysoce wydajne systemy sztucznej inteligencji Prognozy: to, w co wierzymy, że się wydarzy, oraz przegląd wyników, aby zachować uczciwość&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-02</title><link>https://blog.prokulski.science/2023/10/02/newsletter-dane-i-analizy-2023-10-02/</link><pubDate>Mon, 02 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/02/newsletter-dane-i-analizy-2023-10-02/</guid><description>&lt;p&gt;Tytuł dzisiejszy, o siatce tajnych powiązań wśród noblistów, nieco prowokacyjny - zobaczmy czy ma wpływ na open rate newslettera ;-). A o samej siatce powiązań przeczytasz niżej. Siatka, w której &lt;em&gt;Rodzina Curie&lt;/em&gt; odgrywa znaczącą rolę (dobrze brzmi, jak &lt;em&gt;Rodzina Corleone&lt;/em&gt;, co nie? ;-)&lt;/p&gt;&#10;&lt;p&gt;W sekcji poświęconej językowi R znajdziecie analizę przygotowaną w ramach &lt;a href="https://github.com/rfordatascience/tidytuesday/tree/master"&gt;&lt;strong&gt;#TidyTuesday&lt;/strong&gt;&lt;/a&gt;, czyli cotygodniowych ćwiczeń dla analityków danych. Polecam tę serię jeśli chcesz poćwiczyć swoje umiejętności, a brakuj Ci pomysłów (ileż można w churn klientów, ceny domów ze zbioru Boston Housing albo rozpoznawanie cyferek z MNIST?). Zadania przygotowane są z myślą o R, ale - zadanie to zadanie, prawda? Narzędzia do rozwiązania dowolne.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-04</title><link>https://blog.prokulski.science/2023/09/04/newsletter-dane-i-analizy-2023-09-04/</link><pubDate>Mon, 04 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/04/newsletter-dane-i-analizy-2023-09-04/</guid><description>&lt;p&gt;Wiecie co jest największym problemem dla analityka danych w dużej organizacji? Jest ich kilka, ale podzielić można je na kilka obszarów:&lt;br&gt;&#10;znajdowanie danych zrozumienie danych uzyskanie dostępu do danych&lt;/p&gt;&#10;&lt;p&gt;Przeczytacie o tym w &lt;a href="https://towardsdatascience.com/5-common-data-governance-pain-points-for-analysts-data-scientists-8efe8a007ac2"&gt;5 Common Data Governance Pain Points for Analysts &amp;amp; Data Scientists&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;I jeszcze na to dochodzi podejście do organizacji zespołów zajmującymi się danymi. Centralnie? A może każdy osobno? O tym pisze SeattleDataGuy w &lt;a href="https://seattledataguy.substack.com/p/centralized-vs-decentralized-vs-federated"&gt;Centralized vs Decentralized vs Federated Data Teams&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-08-21</title><link>https://blog.prokulski.science/2023/08/21/newsletter-dane-i-analizy-2023-08-21/</link><pubDate>Mon, 21 Aug 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/08/21/newsletter-dane-i-analizy-2023-08-21/</guid><description>&lt;p&gt;Kiedyś &lt;a href="../../2017/05/17/tramwajem-po-grafie/"&gt;analizowałem sieć tramwajową Warszawy&lt;/a&gt; wprowadzając przy okazji pojęcia związane z grafami (takimi matematycznymi tworami) - dzisiaj znajdziecie tekst o podobnej analizie, ale sieci dróg (na przykładzie Krakowa i Polski, bo autor wywodzi się z AGH).&lt;/p&gt;&#10;&lt;p&gt;**W tym tygodniu opowiadam o AI i nie tylko.**Według zapowiedzi, w ramach wydarzenia &lt;a href="https://www.facebook.com/events/823044209425138"&gt;Kto stoi za sztuczną inteligencją?&lt;/a&gt; na Facebooku opowiem trochę o tym, czy sztuczna inteligencja zastąpi kiedyś człowieka. Wydarzenie przygotowane jest przez &lt;a href="https://www.facebook.com/SzkolnaGieldaPracy"&gt;Szkolną Giełdę Pracy&lt;/a&gt;, transmisja live odbędzie się w czwartek 24 sierpnia o 18:00.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-08</title><link>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</link><pubDate>Mon, 08 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</guid><description>&lt;p&gt;Majówka, majówka i po majówce. Wypoczęci? Ja zwiedziłem z rodziną Trójmiasto, jestem zadowolony i o to właściwie w wypoczynku chodzi. Tylko dlaczego tak wieje nad morzem?&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym odcinku zaś szczególnie polecam książkę Françoisa Fleureta &lt;a href="https://fleuret.org/francois/"&gt;&lt;strong&gt;The Little Book of Deep Learning&lt;/strong&gt;&lt;/a&gt; - sporo teorii o tym jak działa głębokie uczenie, różne typy warstw i w ogóle na czym ta cała sztuczna inteligencja polega. Książka wygląda na przyciętą formatem do ekranu telefonu - przyznam, że to interesujący pomysł (ale już go znamy z chociażby [reklama] &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;Kart Data Science&lt;/strong&gt;&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-09</title><link>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</link><pubDate>Mon, 09 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</guid><description>&lt;p&gt;W pierwszym pełnym tygodniu nowego roku wracamy ze standardowym zestawem materiałów.&lt;/p&gt;&#10;&lt;p&gt;Jest więc coś o machine learningu (dobry jest tekst o YOLOv5, przede wszystkim pokazujący że nie tylko TensorFlow obowiązuje w domenie deep learning), sporo ciekawostek ocierających się o NLP i analizę tekstu. Jest gotowy przepis na pobieranie danych z Kafki i zapisywanie w Mongo.&lt;/p&gt;&#10;&lt;p&gt;Na koniec zapraszam na &lt;a href="https://cuvalley.com/?utm_source=dia_newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;&lt;strong&gt;CuValley Hack&lt;/strong&gt;&lt;/a&gt;! To trzecia edycja hackathonu organizowanego przez KGHM w ramach programu &lt;em&gt;Dolina Miedziowa&lt;/em&gt;. To przyznam szczerze spełnienie mojej idei hackathonu: dane wprost z przemysłu i konkretne problemy (zobacz na stronie jakie są zadania) do rozwiązania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-11-07</title><link>https://blog.prokulski.science/2022/11/07/newsletter-dane-i-analizy-2022-11-07/</link><pubDate>Mon, 07 Nov 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/11/07/newsletter-dane-i-analizy-2022-11-07/</guid><description>&lt;p&gt;Dzisiaj poniedziałek, ale w środę po południu przyjdzie do Ciebie &lt;strong&gt;mail z ankietą&lt;/strong&gt;. To 6 prostych pytań, które pomogą w rozwoju newslettera. Dawno nie było ankiety, widzę statystyki tego co czytacie, ale statystyki to jedno, a odczucie prawdziwego czytelniak to drugie :) Ankieta sprowadza się do klikania, zajmuje 2-3 minuty, zachęcam do wypełnienia.&lt;/p&gt;&#10;&lt;p&gt;A dzisiaj jeszcze standardowo - dużo treści na przeróżne tematy :). Dzisiaj na prawdę &lt;strong&gt;dużo&lt;/strong&gt; (drugie tyle czeka w garażu, mam przynieść?).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-22</title><link>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</link><pubDate>Mon, 22 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</guid><description>&lt;p&gt;Czy mniejsza liczba artykułów (nie wiem czy to zauważalne&amp;hellip;) to dla Was lepiej czy gorzej? Przeczytacie w związku z tym więcej (wszystkie?) czy tak samo jak zwykle 2-3, a reszta to nuda?&lt;/p&gt;&#10;&lt;p&gt;Dzisiejszy numer to nieco eksperyment ale - przyznajmy to szczerze - wynik sezonu wakacyjnego. Oj ciężko się zebrać do roboty, ciężko&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mlu-explain.github.io/"&gt;&lt;strong&gt;MLU-Explain&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działają lasy losowe? Co to jest krzywa ROC i AUC? Jeśli nie wiesz to ten serwis w przystępny, graficzny sposób pomoże to zrozumieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-01</title><link>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</link><pubDate>Mon, 01 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</guid><description>&lt;p&gt;Dzisiaj nieco więcej materiałów z krainy &amp;ldquo;ops&amp;rdquo; w świecie &amp;ldquo;devops&amp;rdquo;. Warto znać obie ziemie, żeby nie mieć problemu chociażby z uruchomieniem kilku aplikacji (dockerowymi) pod różnymi ścieżkami na jednej domenie. Dlatego warto zajrzeć do tekstów o Nginx.&lt;/p&gt;&#10;&lt;p&gt;Ale sprawy związane z analizowaniem danych czy też ich przetwarzaniem w celu przewidywania przyszłości tradycyjnie też są na poniższej liście interesujących artykułów z minionego tygodnia.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://miroslawmamczur.pl/czym-jest-i-jak-zbadac-dryft-modelu-model-drift/"&gt;&lt;strong&gt;Czym jest i jak zbadać dryft modelu (model drift)?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dryft modelu odnosi się do spadku wydajności modelu z powodu zmian danych i relacji między zmiennymi wejściowymi i wyjściowymi&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-25</title><link>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</link><pubDate>Mon, 25 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</guid><description>&lt;p&gt;Wakacje wakacjami, ale te kilka godzin poświęciłem specjalnie dla Was aby przygotować dzisiejsze wydanie newslettera.&lt;/p&gt;&#10;&lt;p&gt;Pamiętacie &lt;strong&gt;Wojny Rdzeniowe&lt;/strong&gt;? Dla tych, którzy nie bardzo - &lt;a href="https://informatykzakladowy.pl/wojny-rdzeniowe-czyli-core-wars/"&gt;ciekawy tekst&lt;/a&gt; (po polsku, co rzadkie tutaj ;) opowiadający historię tych&amp;hellip; hmmm&amp;hellip; konkursów? zawodów?&lt;/p&gt;&#10;&lt;p&gt;A gdyby tak przygotować wewnętrzne rozgrywki tego typu? Co o tym sądzicie? Piszcie!&lt;/p&gt;&#10;&lt;p&gt;Zamiast jednak programować można klikać. Jeśli ktoś jest zwolennnikiem no-code to pewnie zainteresuje się &lt;a href="https://betterprogramming.pub/top-8-no-code-machine-learning-platforms-you-should-use-in-2020-1d1801300dd0"&gt;przeglądem platform&lt;/a&gt; tego typu przeznaczonych do zadań machine learningu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-11</title><link>https://blog.prokulski.science/2022/07/11/newsletter-dane-i-analizy-2022-07-11/</link><pubDate>Mon, 11 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/11/newsletter-dane-i-analizy-2022-07-11/</guid><description>&lt;p&gt;Machine learning czy też sztuczna inteligencja to nie są &lt;em&gt;czarne skrzynki&lt;/em&gt; które dają odpowiedź na każde pytania. Owszem - ML/AI daje odpowiedzi (lub nie) na &lt;strong&gt;konkretne&lt;/strong&gt; pytania (trzeba umieć je postawić, ale też zaakceptować niepewność odpowiedzi) i - po setkach spotkań &lt;em&gt;z biznesem&lt;/em&gt; - to wydaje się najtrudniejsze do zrozumienia. AI da odpowiedź na konkretne pytanie - czy na obrazku jest pies czy kot albo jaka zapewne będzie wartość takiego czy innego wskaźnika za dwa tygodnie (skoro ostatnie pół roku było tak). A oprócz tego wszystkiego - AI/ML wymaga sporo pracy, o czym możecie przeczytać w opracowaniu &lt;a href="https://arxiv.org/abs/2205.02302"&gt;Machine Learning Operations (MLOps): Overview, Definition, and Architecture&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-23</title><link>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</link><pubDate>Mon, 23 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</guid><description>&lt;p&gt;Dzisiaj delikatnie więcej tematów bliższych &lt;em&gt;biznesowi&lt;/em&gt; niż IT - mierniki, jakość, zaangażowanie w pracę (to polecam każdemu). &lt;a href="https://prokulski.science"&gt;Dane i Analizy&lt;/a&gt; to też consulting tego typu rozwiązań - jeśli trzeba to zapraszam do kontaktu&lt;/p&gt;&#10;&lt;p&gt;Są też standardowo poradniki związane głównie z Pythonem i Big Data, ale znajdzie się też coś dla chcących zacząć poważniej pisać w Javie&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/greenlit-using-gpt-j-with-multi-task-learning-to-create-new-screenplays-54a2d04f761c"&gt;&lt;strong&gt;GreenLIT: Using GPT-J to Create Screenplays&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy sztuczna inteligencja może pisać scenariusze filmowe?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-xgboost-models-in-amazon-sagemaker-in-4-simple-steps-4eb3e104ee61"&gt;&lt;strong&gt;Train XGBoost Models in Amazon SageMaker in 4 Simple Steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak wykorzysać Amazon SageMaker do trenowania modeli w chmurze?&lt;/p&gt;</description></item><item><title>Sklep rozproszony</title><link>https://blog.prokulski.science/2022/04/26/sklep-rozproszony/</link><pubDate>Tue, 26 Apr 2022 12:52:17 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/26/sklep-rozproszony/</guid><description>&lt;p&gt;Od kilku lat zajmuję się przede wszystkim wymyślaniem &lt;em&gt;jak coś ma działać&lt;/em&gt;, opisywaniem tego i oddawaniem do zespołu developerskiego. Głównie są to rzeczy związane z real-time’owym działaniem systemów wszelakich. I dzisiaj przykład takiego działania. Dodatkowo - próbowałem napisać kod tak, żeby był łatwy do rozbudowy.&lt;/p&gt;&#10;&lt;h2 id="o-co-chodzi"&gt;O co chodzi?&lt;/h2&gt;&#10;&lt;p&gt;Zbudujemy coś na kształt prostego sklepu internetowego. Całość będzie zbudowana w nowoczesny (a przynajmniej tak się mówi na konferencjach, a jest to właściwie &lt;em&gt;jedyny słuszny&lt;/em&gt;) sposób, komponenty będą od siebie niezależne, a kod w zamyśle ma wspierać taką niezależność.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-25</title><link>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</link><pubDate>Mon, 25 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</guid><description>&lt;p&gt;Dzisiaj zapraszam na duży pakiet związany z Apache Spark - od instalacji, poprzez stosunkowo mało zaawansowane tutoriale, a na debugowaniu i optymalizacji zapytań skończywszy.&lt;/p&gt;&#10;&lt;p&gt;Standardowo jest też trochę Pythona (na przykład świetny kurs spaCy - ale to fani &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;a Dane i Analizy&lt;/a&gt; już znają czy też coś o wzorcach projektowych albo aplikacjach wielowątkowych), a w części &amp;ldquo;analiza danych&amp;rdquo; dość przekrojowe zagadnienia (np. &lt;em&gt;computer vision&lt;/em&gt; bez sieci neuronowych - dość sprytne podejście do tematu zajętych miejsc parkingowych).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-11</title><link>https://blog.prokulski.science/2022/04/11/newsletter-dane-i-analizy-2022-04-11/</link><pubDate>Mon, 11 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/11/newsletter-dane-i-analizy-2022-04-11/</guid><description>&lt;p&gt;Trochę mniej artykułów, ale jeden z nich to potężny kolos (ten o SHAP). Do tego bardzo fajne porady dla początkujących w Pythonie i ciekawe koncepcje w świecie big data (jakby ktoś chciał postawić klaster to jest o tym poradnik).&lt;/p&gt;&#10;&lt;p&gt;Zaś w przyszłym tygodniu zrobimy sobie przerwę świąteczną - polewajcie się wodą za tydzień (oby pogoda dopisała), a nie zajmujcie się komputerami. Wesołych Świąt!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/revisiting-mnist-with-fresh-eyes-36f9d19a75d1"&gt;&lt;strong&gt;Revisiting MNIST with Fresh Eyes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy kto próbował machine learningu albo deep learningu (w szczególności sieci CNN) zetknął się ze zbiorem ręcznie pisanych cyfr MNIST. Tutaj inne podejście do znanego problemu&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-28</title><link>https://blog.prokulski.science/2022/03/28/newsletter-dane-i-analizy-2022-03-28/</link><pubDate>Mon, 28 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/28/newsletter-dane-i-analizy-2022-03-28/</guid><description>&lt;p&gt;Połowa dzisiejszych materiałów to konkretne projekty związane z danymi. Albo wyciąganie informacji z rachunków z przejazdy Uberem, albo realtime&amp;rsquo;owe wizualizacje tego co co się zmienia w Wikipedii, albo big data w Big Query. Plus raport Stanford AI Index Report&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/artefact-engineering-and-data-science/is-facebook-prophet-suited-for-doing-good-predictions-in-a-real-world-project-44be1fe4ce91"&gt;&lt;strong&gt;Is Facebook Prophet suited for doing good predictions in a real-world project?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak biblioteka Prophet do prognozowania szeregów czasowych sprawdza się w realnych zastosowaniach?&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@ali.soleymani.co/stop-using-random-forest-feature-importances-take-this-intuitive-approach-instead-4335205b933f"&gt;&lt;strong&gt;Stop using random forest feature importances&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Skąd wiecie, że dana cecha jest istona w Waszym modelu? &amp;ldquo;feature importances&amp;rdquo; z lasów losowych ma pewne niedociąnięcia o których warto wiedzieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-14</title><link>https://blog.prokulski.science/2022/03/14/newsletter-dane-i-analizy-2022-03-14/</link><pubDate>Mon, 14 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/14/newsletter-dane-i-analizy-2022-03-14/</guid><description>&lt;p&gt;Mam nadzieję, że wiosna nadchodzi wielkimi krokami, więc dzisiaj trochę lżejszy dobór tematów.&lt;/p&gt;&#10;&lt;p&gt;Koniecznie zobacz nagranie z webinaru u Vladimira o BI i ML!&lt;/p&gt;&#10;&lt;p&gt;Polecam też zainteresować się Mermaid - rozszerzeniem do Markdown pozwalającym rysować diagramy. Da się też eksportować je później do np. PDFów - istnieje odpowiedni &lt;a href="https://github.com/raghur/mermaid-filter"&gt;dodatek do pandoc&lt;/a&gt;. A o Meramind wiem od &lt;a href="https://www.youtube.com/watch?v=JiQmpA474BY"&gt;Arjana i jego filmu&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.youtube.com/watch?v=ANEJADyAyOE"&gt;&lt;strong&gt;Business Intelligence z Machine Learning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Zapis ciekawego webinaru łączącego oba wspominane w tytule zagadnienia&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-21</title><link>https://blog.prokulski.science/2022/02/21/newsletter-dane-i-analizy-2022-02-21/</link><pubDate>Mon, 21 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/21/newsletter-dane-i-analizy-2022-02-21/</guid><description>&lt;p&gt;Dzisiaj sporo rzeczy związanych z Wordle - bo to jest świetny poligon doświadczalny na analizę danych i kombinatorykę, ale też ciekawe są wyniki tego jak ludzie grają w tę grę (poniżej link do artykułu na ten temat).&lt;/p&gt;&#10;&lt;p&gt;Świetny jest też tekst Maćka &lt;a href="https://wiadrodanych.pl/bazy-danych/elasticsearch/jak-wykryc-phishing/"&gt;Jak wykryć phishing&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Dla początkujących adeptów Pythona kilka solidnych podstaw - warto prześledzić wszystko z dzisiejszej sekcji &lt;strong&gt;#python_junior&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/bentoml-create-an-ml-powered-prediction-service-in-minutes-23d135d6ca76"&gt;&lt;strong&gt;Create an ML Powered Prediction Service in Minutes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Prosty i szybki sposób na umieszczanie modeli machine learningowych na produkcji&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-07</title><link>https://blog.prokulski.science/2022/02/07/newsletter-dane-i-analizy-2022-02-07/</link><pubDate>Mon, 07 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/07/newsletter-dane-i-analizy-2022-02-07/</guid><description>&lt;p&gt;Dzisiaj &lt;em&gt;lajtowo&lt;/em&gt;, ale najbardziej polecam coś co mogliście przegapić wczoraj na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;u&lt;/a&gt; - &lt;a href="https://www.youtube.com/watch?v=v68zYyaEmEA"&gt;&lt;strong&gt;wideo&lt;/strong&gt;&lt;/a&gt; o tym jak pomóc sobie grając w Wordle albo raczej jaka matematyka stoi za wyborem kolejnych słów. Jest też &lt;a href="https://github.com/3b1b/videos/blob/master/_2022/wordle.py"&gt;kod w repo&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://datascienceplus.com/topic-modeling-and-latent-dirichlet-allocation-lda/"&gt;&lt;strong&gt;Topic Modeling and Latent Dirichlet Allocation (LDA)&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;O czym są poszczególne tekstów w zbiorze tekstów? &amp;ldquo;Topic modeling&amp;rdquo; oparty o LDA pozwala to określić, a ten tekst wprowadza w zagadnienie na przykładzie kodu w Pythonie&lt;/p&gt;&#10;&lt;h3 id="big_data"&gt;#big_data&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://engineering.linkedin.com/blog/2022/darwin--data-science-and-artificial-intelligence-workbench-at-li"&gt;&lt;strong&gt;DARWIN: Data Science and Artificial Intelligence Workbench at LinkedIn&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak LinkedIn buduje swoją platformę danych i ich analiz?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-10</title><link>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</link><pubDate>Mon, 10 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</guid><description>&lt;p&gt;Koniec przerw świątecznych, koniec długich weekendów, czas wracać do pracy.&lt;/p&gt;&#10;&lt;p&gt;Dla mnie osobiście rok zaczął się zabawą z Raspberry Pi i próbwaniem co to cudo potrafi. Nigdzie nie ma Raspberry Pi 4, więc zadowoliłem się na start Pi Zero. Mały, ale wariat - używam do PiHole oraz staram się podglądać co robi w nocy kot. Jak? A no tym prostym &lt;a href="https://github.com/prokulski/rasppi_motion_capture/blob/main/main.py"&gt;skryptem&lt;/a&gt; i kamerką podłączoną po USB.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/11-dimensionality-reduction-techniques-you-should-know-in-2021-dcb9500d388b"&gt;&lt;strong&gt;11 Dimensionality reduction techniques you should know in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;11 metod na redukcję rozmiarów Twoich danych. Ale zmniejszenie wielkości to nie jedyne zastosowanie - przy redukcji wymiarów często odsłaniają się ukryte informacje&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-03</title><link>https://blog.prokulski.science/2022/01/03/newsletter-dane-i-analizy-2022-01-03/</link><pubDate>Mon, 03 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/03/newsletter-dane-i-analizy-2022-01-03/</guid><description>&lt;p&gt;Dzisiaj kilka tematów &amp;ldquo;pokrytych&amp;rdquo; nie tylko jednym tekstem. Mamy więc coś o modelach BERT plus automatycznie tworzenie tekstów przez GPT-3, mamy wizualizacje danych na mapach (w R i Pythonie). Mamy też cykl, który pozwoli na napisanie bota do np. CS:GO.&lt;/p&gt;&#10;&lt;p&gt;Na blogu od dawna nie było nowego tekstu (stąd podlinkoway niżej tekst o GPT-3 ;), ale jakieś rzeczy robię i publikuję. Zwykle jest tak, że energia opada po przygotowaniu działającego kodu. Tak jest z serwowaniem obrazków przez API (przy okazji te obrazki się generują) - sami zobaczcie do &lt;a href="https://github.com/prokulski/image_api_threads"&gt;&lt;strong&gt;repozytorium&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-20</title><link>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</link><pubDate>Mon, 20 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</guid><description>&lt;p&gt;To ostatni numer newslettera&amp;hellip; przed Bożym Narodzeniem.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym przede wszystkim życzę Ci spokoju, spędzenia mile czasu z najbliższymi, odpoczynku (też od komputerów) i jeszcze raz pieniędzy.&lt;/p&gt;&#10;&lt;p&gt;Do życzeń dołączam pythonową choinkę:&lt;/p&gt;&#10;&lt;p&gt;def holidaybush(n):&lt;br&gt;&#10;    for i in range(n):&lt;br&gt;&#10;        print((&amp;quot;+&amp;quot; * (i * 2 + 1)).center(n * 2 - 1))&lt;br&gt;&#10;    print(&amp;quot;+++&amp;quot;.center(n * 2 - 1))&lt;/p&gt;&#10;&lt;p&gt;holidaybush(15)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://glassboxmedicine.com/2019/09/15/best-use-of-train-val-test-splits-with-tips-for-medical-data/"&gt;&lt;strong&gt;Best Use of Train/Val/Test Splits, with Tips for Medical Data&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Modele, uczenie, dane treningowe, testowe, walidacyjne&amp;hellip; ale właściwie dlaczego tak?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-22</title><link>https://blog.prokulski.science/2021/11/22/newsletter-dane-i-analizy-2021-11-22/</link><pubDate>Mon, 22 Nov 2021 11:25:39 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/22/newsletter-dane-i-analizy-2021-11-22/</guid><description>&lt;p&gt;Szczęśliwcy ;) mogli już zobaczyć jak wygląda newsletter w nowej szacie graficznej wczoraj. Testowanie na produkcji to podstawa, niech pierwszy rzuci kamieniem&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych"&gt;#analiza_danych&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.evanmiller.org/how-not-to-sort-by-average-rating.html"&gt;&lt;strong&gt;How Not To Sort By Average Rating&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dlaczego sortowanie opinii po &amp;ldquo;zwykłej&amp;rdquo; średniej jest złe i jak je poprawić.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://mydataschool.com/blog/extract-paypal-data-from-api/"&gt;&lt;strong&gt;Extract data from PayPal API&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Wyjmijmy dane z PayPala i wstawmy do jakiejś hurtowni typu BigQuery. A potem już można analizować.&lt;br&gt;&#10;Ciekawy projekt ETLowy.&lt;/p&gt;&#10;&lt;h3 id="ciekawostki"&gt;#ciekawostki&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://boonepeter.github.io/posts/2020-11-10-spotify-codes/"&gt;&lt;strong&gt;How do Spotify Codes work?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Utwory (albumy i wykonacwy też) na Spotify są oznaczeni takim małym kodem - można go zeskanować i przejść do odpowiedniej piosenki (lub albumy albo wykonawcy). Jak to działa?&lt;br&gt;&#10;Fajne jeśli interesuje Cię budowanie graficznych kodów.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-04</title><link>https://blog.prokulski.science/2021/10/04/newsletter-dane-i-analizy-2021-10-04/</link><pubDate>Mon, 04 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/04/newsletter-dane-i-analizy-2021-10-04/</guid><description>&lt;p&gt;&lt;a href="https://gist.github.com/Adricarpin/a004fe0edd5b72eab193c7904dbdae8c"&gt;&lt;strong&gt;MLOps with Docker and Jenkins: Automating Machine Learning Pipelines&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to containerize your ML models with Docker and automate a Pipeline with Jenkins&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/performing-deduplication-with-record-linkage-and-supervised-learning-b01a66cc6882"&gt;&lt;strong&gt;Performing Deduplication with Record Linkage and Supervised Learning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Identifying duplicate records with a machine-learning approach Introduction Most data are recorded manually by humans and most often is not reviewed, not synchronized, and simply because there were mistakes made such as typos. Think for a second, have you ever filled out the same form twice before but with a slight difference in your address? For example, you submitted a form like this (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-23</title><link>https://blog.prokulski.science/2021/08/23/newsletter-dane-i-analizy-2021-08-23/</link><pubDate>Mon, 23 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/23/newsletter-dane-i-analizy-2021-08-23/</guid><description>&lt;p&gt;&lt;a href="https://gist.github.com/24939c89f67e5950bf00f5ddcc08ff97"&gt;&lt;strong&gt;Scala is like Python 4&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Although it’s fundamentally closer to Java, Scala has clearly taken a lot of influence from Python in terms of style and functionality. As someone who has written Python code for ~7 years now, playing around with Scala feels surprisingly familiar, but it’s more akin to using a statically typed and compiled version of Python 3. Obviously, they’re very different languages, b ut if you’re an (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-16</title><link>https://blog.prokulski.science/2021/08/16/newsletter-dane-i-analizy-2021-08-16/</link><pubDate>Mon, 16 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/16/newsletter-dane-i-analizy-2021-08-16/</guid><description>&lt;p&gt;&lt;a href="https://pub.towardsai.net/5-popular-machine-learning-algorithms-bbb7c7358fb2"&gt;&lt;strong&gt;5 Popular Machine Learning algorithms&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning Source: Image by GDJ on  Pixabay A machine learning algorithm is conceptually similar to any other algorithm in computer science. An ML algorithm is a data-driven process that is used to create a production-ready machine learning model. If you consider machine learning to be a train for accomplishing a job, then machine learning models are the engines that push the train. The (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-26</title><link>https://blog.prokulski.science/2021/07/26/newsletter-dane-i-analizy-2021-07-26/</link><pubDate>Mon, 26 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/26/newsletter-dane-i-analizy-2021-07-26/</guid><description>&lt;p&gt;&lt;a href="http://datasciencein.pl/ocena-modeli-klasyfikacyjnych-od-tablicy-pomylek-do-f1/"&gt;&lt;strong&gt;Ocena modeli klasyfikacyjnych - od tablicy pomyłek do F1 - Data science in pl&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Zrozumieć modele klasyfikacyjne. Tablica pomyłek, czułość, swoistość precyzja i F1 - opis i intuicyjne przykłady.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/word-embedding-techniques-word2vec-and-tf-idf-explained-c5d02e34d08?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Word Embedding Techniques: Word2Vec and TF-IDF Explained&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;The words need to be made meaningful for machine learning or deep learning algorithms. Therefore, they must be expressed numerically. Algorithms such as One Hot Encoding, TF-IDF, Word2Vec, FastText enable words to be expressed mathematically as word embedding techniques used to solve such problems. (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Analiza polskiego crowdfundingu na bazie Patronite.pl</title><link>https://blog.prokulski.science/2020/08/30/analiza-polskiego-crowdfoundingu-na-bazie-patronite-pl/</link><pubDate>Sun, 30 Aug 2020 15:45:49 +0000</pubDate><guid>https://blog.prokulski.science/2020/08/30/analiza-polskiego-crowdfoundingu-na-bazie-patronite-pl/</guid><description>&lt;p&gt;Zebrałem informacje o ponad 1700 profilach na Patronite.pl - wiem ile zarabiają, ilu mają patronów i za co patroni płacą. Dzielę się tymi informacjami z Wami w - być może - &lt;strong&gt;największej analizie polskiego crowdfoundingu!&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;&lt;a href="https://patronite.pl/"&gt;Patronite&lt;/a&gt;&lt;/strong&gt; zgodnie z informacją na &lt;a href="https://pl.wikipedia.org/wiki/Patronite"&gt;Wikipedii&lt;/a&gt; to założony w 2015 roku serwis wspomagający pozyskiwanie finansowania przez osoby twórcze. Podstawową formą działalności portalu jest pomoc w zdobywaniu comiesięcznego wsparcia od osób indywidualnych i instytucji.&lt;/p&gt;&#10;&lt;blockquote&gt;&#10;&lt;p&gt;Dla czystości tekstu pełny kod źródłowy znajdziecie w &lt;a href="https://github.com/prokulski/patronite_analiza"&gt;repozytorium&lt;/a&gt;&lt;/p&gt;</description></item><item><title>(Inteligentne) Raporty na żądanie</title><link>https://blog.prokulski.science/2019/08/07/raporty-na-zadanie/</link><pubDate>Wed, 07 Aug 2019 20:17:22 +0000</pubDate><guid>https://blog.prokulski.science/2019/08/07/raporty-na-zadanie/</guid><description>&lt;p&gt;Dzisiaj przygotujemy narzędzia do automatycznego generowania raportów, które będzie (quasi) inteligentnie odpowiadać na pytania zadane przez email.&lt;/p&gt;&#10;&lt;p&gt;Czyli jak pozbyć się upierdliwej pracy (i zająć się czymś innym)&lt;/p&gt;&#10;&lt;p&gt;Uwaga: wraz z aktualizacją pakietu &lt;em&gt;gmailr&lt;/em&gt; do wersji 1.0 prezentowany poniżej kod związany z logowaniem do konta może nie działać. Przeczytaj proszę &lt;a href="https://github.com/r-lib/gmailr"&gt;informacje&lt;/a&gt; o tym jak to zmienić Kod na &lt;a href="https://github.com/prokulski/automatic_reports"&gt;GitHubie&lt;/a&gt; powinien być ok.&lt;/p&gt;&#10;&lt;p&gt;Problem z jakim można się często spotkać w korporacjach to wysyłanie tych samych raportów mailem. Wyobraźmy sobie taki scenariusz:&lt;/p&gt;</description></item><item><title>Najpopularniejsze imiona dzieci nadane w 2018 roku</title><link>https://blog.prokulski.science/2019/03/05/najpopularniejsze-imiona-dzieci-nadane-w-2018-roku/</link><pubDate>Tue, 05 Mar 2019 16:07:11 +0000</pubDate><guid>https://blog.prokulski.science/2019/03/05/najpopularniejsze-imiona-dzieci-nadane-w-2018-roku/</guid><description>&lt;p&gt;Niedawno Ministerstwo Cyfryzacji opublikowało &lt;a href="https://www.gov.pl/web/cyfryzacja/imiona"&gt;listę najpopularniejszych imion&lt;/a&gt; nadawanych dzieciom w 2018 roku. Wykorzystamy to do połączenia Pythona z R (albo R z Pythonem).&lt;/p&gt;&#10;&lt;p&gt;Lista opublikowana została w postaci serii tekstów na stronach Ministerstwa, w formie całkowicie niezjadliwej. Co więcej - prasa podała informacje dalej, bez żadnego obrobienia tych danych. Zróbmy to więc jak należy przy okazji łącząc R i Pythona.&lt;/p&gt;&#10;&lt;p&gt;Aby móc w RStudio używać Pythona oraz mieć dostęp do obiektów Pythona w sesji R potrzebujemy biblioteki &lt;em&gt;&lt;a href="https://rstudio.github.io/reticulate/"&gt;reticulate&lt;/a&gt;&lt;/em&gt; - polecam się z nią zapoznać. Daje ciekawe możliwości, które właśnie za chwilę zobaczymy na konkretnym przykładzie.&lt;/p&gt;</description></item><item><title>Analiza wykopalisk z głównej strony Wykop.pl</title><link>https://blog.prokulski.science/2018/12/12/analiza-wykop-pl/</link><pubDate>Wed, 12 Dec 2018 09:15:47 +0000</pubDate><guid>https://blog.prokulski.science/2018/12/12/analiza-wykop-pl/</guid><description>&lt;p&gt;Czy Wykop to obraz całego świata czy tylko specyficzny dla społeczności wycinek? Co cieszy się największym powodzeniem?&#10;Wykop to serwis tworzony przez użytkowników. Każda informacja jest dodawana, oceniana i komentowana przez społeczność. Te najciekawsze (z największą liczbą &lt;em&gt;wykopów&lt;/em&gt;, czyli głosów pozytywnie oceniających dodane znalezisko) trafiają na stronę główną. Analizą tego co trafiło na główną stronę Wykopu się zajmiemy.&#10;Kiedyś była taka analiza (&lt;em&gt;&lt;a href="https://github.com/makandPL/Wykop-Scraper-Results/blob/master/README.md#statystyki-wykopu-z-lat-2005-2017"&gt;Statystyki wykopu z lat 2005-2017&lt;/a&gt;&lt;/em&gt;), ale nowszej nie znalazłem. Sporo takich materiałów przewija się przez Reddit o Reddicie. Dlaczego więc, nie zrobić tego samego dla naszego polskiego odpowiednika?&#10;Dane zostały zebrane wieczorem 2 grudnia 2018 roku, tylko z pierwszych trzech tysięcy stron strony głównej serwisu. Świetnie byłoby mieć dane o każdym znalezisku, o tym kto zagłosował na plus, kto na minus. Tych danych byłoby bardzo dużo, ale nie chciałem ich zbierać. Zajęło by to dużo czasu, jeszcze więcej zajęła by obróbka, a mam inne rzeczy do roboty. Początkowo analiza ta miała być wprawką do nauki Pythona, ale stanęło (jak zwykle) na R. W Pythonie napisałem skrypt &lt;em&gt;scrappujący&lt;/em&gt; dane. Skrypty (jakieś szczątkowe) i &lt;strong&gt;zebrane dane&lt;/strong&gt; znajdziecie na &lt;a href="https://github.com/prokulski/wykop_analiza"&gt;moim repo&lt;/a&gt;.&#10;Zacznijmy od liczby znalezisk wpadających na stronę główną.&#10;&lt;img src="../../downloads/2018/12/wykop_01-1.png" alt=""&gt;&#10;Widzimy, że liczba ta jest mniej więcej stała i jest to średnio około 65 znalezisk dziennie (max to 156 - 19 grudnia 2015, minimum to 31 z 11 czerwca 2016 roku). Rozkład jest ładny, symetryczny, taki Gauss prawie.&#10;&lt;img src="../../downloads/2018/12/wykop_01b-1.png" alt=""&gt;&#10;Znajdźmy &lt;strong&gt;absolutne hity&lt;/strong&gt; - czyli znaleziska najwyżej wykopane:&#10;&lt;img src="../../downloads/2018/12/wykop_02-1.png" alt=""&gt;&#10;Aby było łatwiej je przeglądać (i dowiedzieć się o czym są - na podstawie opisów dodanych przez zgłaszających) poniżej tabela z bardziej szczegółowymi informacjami:&lt;/p&gt;</description></item><item><title>Wycieczki do Grecji</title><link>https://blog.prokulski.science/2018/11/30/wycieczki-do-grecji/</link><pubDate>Fri, 30 Nov 2018 16:47:06 +0000</pubDate><guid>https://blog.prokulski.science/2018/11/30/wycieczki-do-grecji/</guid><description>&lt;p&gt;Ile kosztuje wycieczka do Grecji? Czy &lt;em&gt;last minute&lt;/em&gt; jest opłacalne i kiedy cena zaczyna spadać? Jak znaleźć najbardziej atrakcyjne miejsce na wypoczynek (w Grecji)?&#10;Jakiś czas temu &lt;strong&gt;&lt;a href="../../2018/04/27/gdzie-polacy-jada-na-wakacje/"&gt;analizowałem raporty&lt;/a&gt;&lt;/strong&gt; &lt;a href="http://www.pzot.pl/index.php?module=cms/files&amp;amp;group=Raporty%20PZOT"&gt;publikowane przez Polski Związek Organizatorów Turystyki&lt;/a&gt;. Z analizy wyszło, że najchętniej jeździmy na wypoczynek do Grecji (tak było w drugiej połowie 2017 roku). Postanowiłem więc sprawdzić ile kosztuje taki wyjazd.&lt;/p&gt;&#10;&lt;h3 id="zebranie-danych"&gt;Zebranie danych&lt;/h3&gt;&#10;&lt;p&gt;Aby cokolwiek analizować trzeba mieć dane. Jeśli nie mamy dostępu do baz oraz nie możemy (albo nie chcemy) ich kupić to można pokusić się o ich zebranie z sieci. Założeniem tego bloga jest to, aby kolejne analizy przygotowywać bez opłat (nie licząc czasu i kosztów typu serwery), zatem dane weźmiemy sobie sami.&lt;/p&gt;</description></item><item><title>Google Analytics w R</title><link>https://blog.prokulski.science/2018/09/26/google-analytics-w-r/</link><pubDate>Wed, 26 Sep 2018 16:16:34 +0000</pubDate><guid>https://blog.prokulski.science/2018/09/26/google-analytics-w-r/</guid><description>&lt;p&gt;Google Analytics to chyba najpopularniejszy sposób mierzenia ruchu na stronach internetowych. Można bardzo dużo &lt;em&gt;wyklikać&lt;/em&gt; w panelu, ale może zaistnieć potrzeba pobrania danych statystycznych do analiz, których GA nie daje. Dzisiaj dowiesz się jak zrobić to w języku R.&#10;Jak większość zadań, tak samo i to ma pomocny pakiet. Jak można się podziewać pakiet nazywa się &lt;strong&gt;&lt;a href="https://github.com/Tatvic/RGoogleAnalytics"&gt;RGoogleAnalytics&lt;/a&gt;&lt;/strong&gt; i dostępny jest poprzez instalację z GitHuba:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;devtools&lt;span style="color:#0550ae"&gt;::&lt;/span&gt;&lt;span style="color:#6639ba"&gt;install_github&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;Tatvic/RGoogleAnalytics&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Załadujmy więc go do R (razem z innymi pakietami) i do dzieła:&lt;/p&gt;</description></item><item><title>Kto pisze teksty przemówień prezydenta Dudy?</title><link>https://blog.prokulski.science/2018/09/20/kto-pisze-teksty-prezydenta-dudy/</link><pubDate>Thu, 20 Sep 2018 16:13:07 +0000</pubDate><guid>https://blog.prokulski.science/2018/09/20/kto-pisze-teksty-prezydenta-dudy/</guid><description>&lt;p&gt;Pytanie tytułowe jest nieco przewrotne. Sprawdzimy czy wystąpienia są do siebie podobne, a przede wszystkim dowiemy się jak to zrobić. Nazwisk autorów wystąpień nie podam…&#10;Niniejszy tekst to fragment (ale rozbudowany i zmodyfikowany) &lt;a href="https://mlforum.pl/agenda/#wyklad07"&gt;mojej prezentacji&lt;/a&gt; z konferencji “Machine Learning @ Enterprise”. Całość prezentacji z odpowiednimi skryptami znajdziecie &lt;a href="https://github.com/prokulski/ML_Forum"&gt;na GitHubie&lt;/a&gt;.&#10;Dzisiaj skorzystamy z bibliotek:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;tidyverse&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# wykresy i manipulacja danymi&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;data.table&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# dla fread - szybkie wczytywanie plików CSV&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;lsa&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# dla cosine()&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;Rtsne&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# implementacja t-SNE w R&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;plotly&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# interaktywne wykresy&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;tidytext&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# do manipulacji tekstem&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;wordcloud&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# chmurki słów&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;lubridate&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# manipulacja datami&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;rvest&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# do pobierania danych z www&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;glue&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# wygodne sklejanie ciągów znaków&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;W pierwszym kroku potrzebujemy &lt;strong&gt;wypowiedzi Andrzeja Dudy&lt;/strong&gt;. Na szczęście wszystko jest podane na tacy na &lt;a href="http://www.prezydent.pl/aktualnosci/wypowiedzi-prezydenta-rp/wystapienia/"&gt;oficjalnej stronie prezydenta&lt;/a&gt;, a jedyne czego potrzebujemy to wyłuskać teksty. Do tego celu przygotujemy kawałek kodu:&lt;/p&gt;</description></item><item><title>Zmiany w Polsce a głosowanie w ONZ</title><link>https://blog.prokulski.science/2018/08/17/zmiany-w-polsce-a-glosowanie-w-onz/</link><pubDate>Fri, 17 Aug 2018 11:45:37 +0000</pubDate><guid>https://blog.prokulski.science/2018/08/17/zmiany-w-polsce-a-glosowanie-w-onz/</guid><description>&lt;p&gt;Czy zmiany w Polsce (koniec PRL, wstąpienie do NATO i UE) mają odzwierciedlenie w głosowaniu w Zgromadzeniu Ogólnym Organizacji Narodów Zjednoczonych? Kto jest (a kto był) naszym przyjacielem a z kim nam nie jest po drodze?&#10;Dzisiejszy wpis to sporo kodu (dość prostego, często powtórzonego - nie programujcie w ten sposób!), a całość podzielić można na kilka części:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;&lt;a href="#opis-narzedzi"&gt;opis użytych narzędzi&lt;/a&gt;&lt;/strong&gt; - dwa nowe (na blogu) pakiety: &lt;code&gt;widyr&lt;/code&gt; oraz &lt;code&gt;unvotes&lt;/code&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;&lt;a href="#przygotowanie-danych"&gt;przygotowanie danych&lt;/a&gt;&lt;/strong&gt; do dalszej pracy&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Właściwa analiza zaczyna się od&lt;/p&gt;</description></item><item><title>Gdzie są sklepy, drogi czy cokolwiek innego?</title><link>https://blog.prokulski.science/2018/08/10/wykorzystanie-open-street-map-w-r/</link><pubDate>Fri, 10 Aug 2018 18:49:05 +0000</pubDate><guid>https://blog.prokulski.science/2018/08/10/wykorzystanie-open-street-map-w-r/</guid><description>&lt;p&gt;Zastanawialiście się skąd wziąć listę wszystkich miejsc danego typu - na przykład przedszkola w Warszawie - i narysować je na mapie? Jeśli tak, to z tego postu dowiesz się jak to zrobić. Wpis techniczny, żadna tam analiza. Ale są mapki!&#10;Macie świadomość, że istnieje coś takiego jak Wikipedia, prawda? Zbiór haseł uzupełniany przez ochotników. Istnieje coś podobnego dla map i nazywa się &lt;a href="https://wiki.openstreetmap.org/"&gt;Open Street Map&lt;/a&gt;. Ludzie z całego świata dodają informacje o różnych obiektach na mapach - &lt;em&gt;budują&lt;/em&gt; drogi, &lt;em&gt;stawiają&lt;/em&gt; domki i tak dalej. Dane te można pokazać jako mapy, ale też przeszukiwać. W R mamy pakiet &lt;strong&gt;&lt;a href="https://ropensci.github.io/osmdata/"&gt;osmdata&lt;/a&gt;&lt;/strong&gt; (przygotowany przez zacną inicjatywę &lt;a href="https://ropensci.org/"&gt;rOpenSci&lt;/a&gt;, a jest opakowaniem dla &lt;a href="https://wiki.openstreetmap.org/wiki/Overpass_API"&gt;Overpass API&lt;/a&gt;), który umożliwi nam skorzystanie z tych informacji. W dalszej części do pokazania (na interaktywnych, przesuwanych i skalowanych) map użyjemy pakietu &lt;strong&gt;&lt;a href="http://rstudio.github.io/leaflet/"&gt;leaflet&lt;/a&gt;&lt;/strong&gt; (opierający się na bibliotece JavaScript &lt;a href="https://leafletjs.com/"&gt;Leaflet&lt;/a&gt;, który nota bene również korzysta z Open Street Map.&#10;Ciekawostka na marginesie: ostatnio Google zmienił drastycznie ceny używania Google Maps (ciekawy tekst na ten temat znajdziecie &lt;a href="https://www.gdziepolek.pl/blog/pozegnanie-z-google-maps"&gt;tutaj&lt;/a&gt;), zatem korzystanie z Open Street Map może być wybawieniem.&#10;Zaczniemy od wczytania odpowiednich bibliotek:&lt;/p&gt;</description></item><item><title>Dziewczyny z Sympatii - co widać na zdjęciach?</title><link>https://blog.prokulski.science/2018/07/30/dziewczyny-z-sympatii-czesc-2/</link><pubDate>Mon, 30 Jul 2018 16:34:30 +0000</pubDate><guid>https://blog.prokulski.science/2018/07/30/dziewczyny-z-sympatii-czesc-2/</guid><description>&lt;p&gt;Było już &lt;a href="../../2018/07/06/dziewczyny-z-sympatii/"&gt;o kobietach&lt;/a&gt; z Sympatii (i &lt;a href="../../2018/07/20/chlopaki-z-sympatii/"&gt;o panach&lt;/a&gt;), ale wszystko to było na podstawie informacji zawartych w profilu. Dzisiaj sięgniemy nieco głębiej.&#10;Zbierając profile zebraliśmy też linki do zdjęć. Korzystając z microsoftowego &lt;a href="https://azure.microsoft.com/pl-pl/services/cognitive-services/face/"&gt;Cognitive services Face API&lt;/a&gt; pobieramy cechy jakie udaje się rozpoznać na zdjęciach. Między innymi są to informacje o:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;wieku&lt;/li&gt;&#10;&lt;li&gt;płci&lt;/li&gt;&#10;&lt;li&gt;okularach&lt;/li&gt;&#10;&lt;li&gt;kolorze włosów&lt;/li&gt;&#10;&lt;li&gt;emocjach jakie wyraża twarz, na przykład czy osoba na zdjęciu się uśmiecha&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;W dużym uproszczeniu Face API to &lt;em&gt;bramka&lt;/em&gt; do wytrenowanego modelu (zapewne sieci neuronowej). Wrzucamy zdjęcie, a w odpowiedzi dostajemy kilka parametrów, które są wynikiem &lt;em&gt;porównania&lt;/em&gt; zdjęcia z tym czego sieć się nauczyła.&#10;Skrypt (jaki inne z tego cyklu) znajdziecie &lt;a href="https://github.com/prokulski/sympatia/"&gt;na githubie&lt;/a&gt;. Pobrałem tylko dane dla zdjęć pań, nie będzie odpowiednika tego samego wpisu dla panów.&#10;Zobaczmy co sztuczna inteligencja wyczytała ze zdjęć i jak to się ma do informacji podawanych w profilach przez ich właścicielki.&lt;/p&gt;</description></item><item><title>Dziewczyny z Sympatii</title><link>https://blog.prokulski.science/2018/07/06/dziewczyny-z-sympatii/</link><pubDate>Fri, 06 Jul 2018 08:49:38 +0000</pubDate><guid>https://blog.prokulski.science/2018/07/06/dziewczyny-z-sympatii/</guid><description>&lt;p&gt;Ponad 1/3 kobiet na Sympatii szuka miłości. Chce się zakochać, wyjść za mąż i mieć dzieci. Jest czuła i towarzyska. A w dodatku małżeństwo jest dla nich bardzo ważne. Ich partner powinien być czuły, romantyczny i dowcipny. Powinien lubić spędzać czas w restauracji a nie na karaoke czy w operze. Koniecznie musi lubić podróżować! Na chyba, że chodzi o przygodę - wówczas wystarczy dowcipny.&#10;Jakie są dziewczyny z Sympatii? Czego szukają?&#10;Tym razem wpis z wykresami, a kody źródłowe znajdziecie na moim &lt;a href="https://github.com/prokulski/sympatia"&gt;GitHubie&lt;/a&gt;. Krótko mówiąc:&lt;/p&gt;</description></item><item><title>R-base, R-dplyr, R-data.table i Python</title><link>https://blog.prokulski.science/2018/05/23/r-i-python/</link><pubDate>Wed, 23 May 2018 15:44:07 +0000</pubDate><guid>https://blog.prokulski.science/2018/05/23/r-i-python/</guid><description>&lt;p&gt;Podstawy manipulacji danymi w tabelkach. W R (trzy wersje) oraz w Pythonie. Bo to pierwszy post z cyklu &lt;em&gt;idziemy w stronę Pythona&lt;/em&gt;.&#10;W dzisiejszym wpisie zajmiemy się podstawowymi operacjami na tabelach (data frame) z danymi. &lt;strong&gt;Dlaczego to jest ważne?&lt;/strong&gt; Są to najczęściej wykonywane operacje w trakcie analizy danych, bo przecież:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;dane trzeba wczytać &lt;em&gt;do komputera&lt;/em&gt;&lt;/li&gt;&#10;&lt;li&gt;czasem zmodyfikować, na przykład policzyć wartość na podstawie dwóch lub więcej kolumn&lt;/li&gt;&#10;&lt;li&gt;wybrać określone wiersze lub określone kolumny&lt;/li&gt;&#10;&lt;li&gt;połączyć jedną tabelę z inną&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Z tak przygotowanych danych można później na przykład narysować wykres czy też wrzucić je do modelu. I to jest wystarczające, na co dowodem jest pewnie z 70% moich wpisów z ostatnich 12 miesięcy (albo i więcej). Kolejne 20% wpisów to sposób pozyskania danych. 10% było pewnie o modelach wszelakich.&#10;Osobiście uważam, że w R nauczyłem się na tyle dużo, aby przejść na kolejny poziom. W pracy są to aplikacje w Shiny czy też panele w wykorzystaniem &lt;em&gt;flexdashboard&lt;/em&gt; (znowu: w obu przypadkach 70% pracy to manipulacja danymi w tabelkach), ale ciągnie mnie do Pythona. Gdybym zaczynał przygodę z machine learning czy data science to wybrałbym Pythona. Jednocześnie mam nadzieję, że dla osób znających jeden z języków niniejszy wpis będzie ciekawym wprowadzeniem w drugi język.&#10;Jeśli chodzi o R to zobaczymy jak wykonać podstawowe operacje wykorzystując standardowe możliwości R (R-base), wykorzystując pakiety &lt;em&gt;dplyr&lt;/em&gt; (wchodzący w skład ekosystemu &lt;em&gt;tidyverse&lt;/em&gt;) oraz &lt;em&gt;data.table&lt;/em&gt;. W przykładach dla Pythona będzie to &lt;em&gt;pandas&lt;/em&gt;.&#10;Dlaczego data.table? &lt;a href="https://github.com/Rdatatable/data.table/wiki/Benchmarks-%3A-Grouping"&gt;Porównanie prędkości&lt;/a&gt; pokazuje, że dla bardzo dużych tabel data.table jest najszybszy.&#10;Zaczniemy od wczytania odpowiednich bibliotek. W R oczywiście:&lt;/p&gt;</description></item><item><title>A lato było cieplejsze...</title><link>https://blog.prokulski.science/2018/03/27/lato-bylo-cieplejsze/</link><pubDate>Tue, 27 Mar 2018 10:22:04 +0000</pubDate><guid>https://blog.prokulski.science/2018/03/27/lato-bylo-cieplejsze/</guid><description>&lt;p&gt;Czy w Boże Narodzenie zawsze brakowało śniegu? Czy klimat się ociepla? Jak ciepło przepływa przez Polskę?&#10;Dzisiaj zajmiemy się pogodą. Sporo ciekawych zagadnień przed nami:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Skąd wziąć dane o pogodzie w Polsce?&lt;/li&gt;&#10;&lt;li&gt;Pory roku na przestrzeni lat - czy wiosna przychodzi szybciej? A może lat trwa krócej?&#10;&lt;ul&gt;&#10;&lt;li&gt;zobaczymy procentowy podział dni w roku na poszczególne pory roku (ile było dni wiosennych, a ile zimowych)&lt;/li&gt;&#10;&lt;li&gt;czy wiosna przychodzi coraz szybciej - jak kształtowała się temperatura w marcu na przestrzeni lat?&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;Czy klimat się ociepla?&#10;&lt;ul&gt;&#10;&lt;li&gt;jak wyglądały różnice w temperaturze na przestrzeni lat&lt;/li&gt;&#10;&lt;li&gt;czy poszczególne miesiące są coraz cieplejsze lub zimniejsze?&lt;/li&gt;&#10;&lt;li&gt;podobnie dla kolejnych dni - jak wyglądała liczba dni cieplejszych i zimniejszych niż średnia?&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;Czy jest różnica miedzy temperaturami w kraju?&#10;&lt;ul&gt;&#10;&lt;li&gt;przygotujemy animowane mapki temperatury dla 2017 roku&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;A kiedyś to było…&#10;&lt;ul&gt;&#10;&lt;li&gt;Boże Narodzenie ze śniegiem&lt;/li&gt;&#10;&lt;li&gt;w Lany Poniedziałek było cieplej&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="pobranie-danych"&gt;Pobranie danych&lt;/h3&gt;&#10;&lt;p&gt;Zanim przejdziemy do analizy potrzebujemy danych o pogodzie. Zgodnie z ustawą o dostępie do danych publicznych IMGW udostępnia dane historycznie na stronie &lt;a href="https://dane.imgw.pl/"&gt;https://dane.imgw.pl/&lt;/a&gt;. Dane aktualne są dostępne poprzez API, ale dane historyczne spakowane już niestety nie. Dostępne są w postaci spakowanych plików CSV, podzielone na kilkanaście katalogów. Do wszystkiego da się jednak dobrać.&#10;Aby skorzystać z tych zasobów należy każdy plik (archiwum) pobrać, rozpakować i wyciągnąć z niego dane. Aby nie operować na dużej liczbie plików przepiszemy je do bazy danych (w tym przypadku będzie to plikowa baza SQLite, chociaż może być dowolna - mySQL, PostgreSQL). &lt;a href="https://github.com/prokulski/Dane-IMGW/blob/master/get_imgw_arch.R"&gt;Skrypt przepisujący dane&lt;/a&gt; znajdziecie na moim githubie (jak i pozostałe poniżej zaprezentowane kody).&lt;/p&gt;</description></item><item><title>Diagnoza, Wataha czy Belfer?</title><link>https://blog.prokulski.science/2017/12/29/diagnoza-wataha-czy-belfer/</link><pubDate>Fri, 29 Dec 2017 10:32:30 +0000</pubDate><guid>https://blog.prokulski.science/2017/12/29/diagnoza-wataha-czy-belfer/</guid><description>&lt;p&gt;Który jesienny serialowy hit był najczęściej komentowany w 2017 roku? Jakie to były komentarze?&#10;Dzisiaj, w ostatnim poście w tym roku, zajmiemy się polskimi serialami z jesiennej ramówki. Na warsztat weźmiemy trzy tytuły: &lt;strong&gt;Diagnozę&lt;/strong&gt; od TVN, &lt;strong&gt;Belfra&lt;/strong&gt; od Canal+ oraz &lt;strong&gt;Watahę&lt;/strong&gt; od HBO. Zobaczymy jak wyglądała &lt;em&gt;obsługa&lt;/em&gt; seriali na Facebooku i jakie towarzyszyły im komentarze.&#10;&lt;strong&gt;Uwaga: post (lub informacje na wykresach) mogą zdradzać fabułę seriali!&lt;/strong&gt;&#10;Kod jest na tyle uniwersalny, że wystarczy podać inne nazwy fanpage’y w części wczytującej dane aby uzyskać podobną analizę dla innych facebookowych stron - na przykład dla partii politycznych.&lt;/p&gt;</description></item><item><title>Przez losowy las Spotify</title><link>https://blog.prokulski.science/2017/12/10/spotify-random-forest/</link><pubDate>Sun, 10 Dec 2017 10:16:32 +0000</pubDate><guid>https://blog.prokulski.science/2017/12/10/spotify-random-forest/</guid><description>&lt;p&gt;Czy &lt;em&gt;machine learning&lt;/em&gt; może pomóc w poszukiwaniu ulubionej muzyki?&#10;Dzisiaj zajmiemy się poszukiwaniem nowej muzyki. Już kiedyś &lt;a href="../../2017/03/09/poszukiwanie-nowej-muzyki/"&gt;o tym było w oparciu o LastFM&lt;/a&gt;, dzisiaj będzie w oparciu o Spotify. Taki szybki wpis.&#10;Na początek potrzebujemy kilku elementów:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;własnej aplikacji współpracującej z API Spotify - zbudować ją można zaczynając z &lt;a href="https://beta.developer.spotify.com/dashboard/applications"&gt;dashboardu Spotify&lt;/a&gt;, potrzebujemy numerku &lt;code&gt;client_id&lt;/code&gt; i &lt;code&gt;client_secret&lt;/code&gt;&lt;/li&gt;&#10;&lt;li&gt;te numerki wpisujemy do zmiennych o tych samych nazwach i zapisujemy sobie lokalnie (żeby nie przechowywać ich w kodzie) w pliku &lt;code&gt;spotify_cred.rda&lt;/code&gt;. W bardzo prosty sposób: &lt;code&gt;save(client_id, client_secret, file = &amp;quot;spotify_cred.rda&amp;quot;)&lt;/code&gt;&lt;/li&gt;&#10;&lt;li&gt;następnie budujemy kilka funkcji, których będziemy używać. Kod jest długi, nie warto go tutaj zamieszczać - znajdziecie go &lt;a href="https://github.com/prokulski/Spotify/blob/master/spotify_functions.R"&gt;na GitHubie&lt;/a&gt; (swoją drogą jest tam nieco więcej funkcji niż potrzeba, ale nie wszystkie skończone i działające)&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Uzbrojeni w taki zestaw zaczynamy od pozyskania tokenu:&lt;/p&gt;</description></item><item><title>Wino</title><link>https://blog.prokulski.science/2017/11/23/wino/</link><pubDate>Thu, 23 Nov 2017 09:01:52 +0000</pubDate><guid>https://blog.prokulski.science/2017/11/23/wino/</guid><description>&lt;p&gt;Jakie wina sprzedają się najlepiej? Czy Polacy lubią wino czerwone czy białe? Słodkie czy wytrawne? Jak wybrać wino dobre i tanie?&#10;Dane na potrzeby analizy pobierzemy ze sklepu internetowego. Odpowiedni skrypt (i pobrane dane) znajdziecie w &lt;a href="https://github.com/prokulski/Wino"&gt;repo na GitHubie&lt;/a&gt;, w pliku &lt;a href="https://github.com/prokulski/Wino/blob/master/get_data.R"&gt;get_data.R&lt;/a&gt;. Skrypt jest dość długi, nie wnosi niczego ciekawego do samej analizy.&#10;Po zebraniu danych możemy przystąpić do EDA (eksploracji danych). Potrzebujemy właściwie tylko pakietu &lt;code&gt;tidyverse&lt;/code&gt; (od zaktualizowanej kilka dni temu wersji w skład ekosystemu wchodzą &lt;code&gt;stringr&lt;/code&gt; i &lt;code&gt;forcats&lt;/code&gt;; w przyszłości przydałoby się jeszcze &lt;code&gt;lubridate&lt;/code&gt; dla kompletu).&#10;Wczytujemy więc zapisane dane, lekko je modyfikujemy (ze względu na późniejszą kolejność i porządek na wykresach).&lt;/p&gt;</description></item><item><title>Jak nauczyć się R? Co czytać?</title><link>https://blog.prokulski.science/2017/08/30/jak-nauczyc-sie-r-co-czytac/</link><pubDate>Wed, 30 Aug 2017 14:09:36 +0000</pubDate><guid>https://blog.prokulski.science/2017/08/30/jak-nauczyc-sie-r-co-czytac/</guid><description>&lt;p&gt;W listach pytacie o źródła wiedzy dotyczącej R. Dzisiaj kilka linków.&#10;Na początek agregaty, które mogą okazać się wystarczające:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;a href="https://www.r-bloggers.com/"&gt;R Bloggers&lt;/a&gt; - platforma zbierająca treści z wielu blogów&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://blog.revolutionanalytics.com/"&gt;Revolution Analytics&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://www.datasciencecentral.com/profiles/blog/list"&gt;Data Science Central&lt;/a&gt; - platforma blogowa dla dłubiących w BigData&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Warto śledzić też blogi poszczególnych osób:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;a href="https://juliasilge.com/"&gt;Julia Silge&lt;/a&gt; to współautorka pakietu &lt;em&gt;tidytext&lt;/em&gt; (i jednocześnie data scientist w Stack Overflow)&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://varianceexplained.org/"&gt;Variance Explained&lt;/a&gt; - blog drugiego współautora &lt;em&gt;tidytext&lt;/em&gt;&lt;/li&gt;&#10;&lt;li&gt;blog &lt;a href="http://www.masalmon.eu/"&gt;Maëlle Salmon&lt;/a&gt;, który kiedyś dodałem do RSSów (trafiłem pewnie w poszukiwaniach czegoś konkretnego albo z r-bloggers)&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Jednym z lepszych miejsc jest cała domena związana z RStudio i poszczególne jej subdomeny, przede wszystkim &lt;a href="https://blog.rstudio.com/"&gt;blog RStudio&lt;/a&gt; oraz &lt;a href="https://rviews.rstudio.com/"&gt;RViews&lt;/a&gt;. W ramach RStudio znajdziecie też dużo informacji o poszczególnych pakietach - strona zbiorcza jest &lt;a href="https://www.rstudio.com/products/rpackages/"&gt;tutaj&lt;/a&gt;.&#10;Z polskich blogów szczególnie polecam dwa:&lt;/p&gt;</description></item><item><title>Lista Przebojów Trójki</title><link>https://blog.prokulski.science/2017/08/25/lista-przebojow-trojki/</link><pubDate>Fri, 25 Aug 2017 22:05:45 +0000</pubDate><guid>https://blog.prokulski.science/2017/08/25/lista-przebojow-trojki/</guid><description>&lt;p&gt;Lista Przebojów Trójki to chyba najpopularniejsza lista przebojów w Polsce, a z pewnością najstarsza. Zobaczmy czego możemy się dowiedzieć z całej jej historii.&#10;Potrzebne będzie kilka pakietów R (do pobrania danych dodatkowo &lt;em&gt;rvest&lt;/em&gt;):&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;tidyverse&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;lubridate&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;ggrepel&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# dla ładnego umiejscowienia labelek na wykresach&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="pobranie-danych"&gt;Pobranie danych&lt;/h2&gt;&#10;&lt;p&gt;Skorzystamy z archiwum Listy Trójki zebranym na stronie &lt;a href="http://www.lp3.pl/"&gt;LP3.pl&lt;/a&gt; - klikając w kolejne numery notowań po prawej stronie widzimy, że zmienia się adres strony według schematu &lt;a href="http://www.lp3.pl/alpt.phtml?m=1&amp;amp;nn=XXX"&gt;http://www.lp3.pl/alpt.phtml?m=1&amp;amp;nn=XXX&lt;/a&gt; gdzie &lt;em&gt;XXX&lt;/em&gt; to kolejny numer (niekoniecznie notowania). Trzeba znaleźć największy numer (najnowsze notowanie) i przejść przez kolejne strony (kolejne &lt;em&gt;XXX&lt;/em&gt; od jeden do tej największej liczby).&#10;Analiza kodu HTML strony pozwala na wybranie odpowiednich jej fragmentów i tym samym zgromadzenie danych. Szczegółowym kodem nie będę zamęczał - znajduje się na &lt;a href="https://github.com/prokulski/LP3/blob/master/get_lp3_data.R"&gt;GitHubie&lt;/a&gt;. Pojawiają się pytania od Was jak &lt;em&gt;scrappować&lt;/em&gt; strony - być może przygotuję o tym kiedyś dedykowany wpis techniczny (choć wolę przygotowywać analizy :). Dane zapisałem w pliku lokalnym.&#10;Swoją drogą na &lt;a href="http://www.lp3.pl/"&gt;LP3.pl&lt;/a&gt; znajdziecie część z poniższych analiz.&lt;/p&gt;</description></item><item><title>Zmiany temperatury w czasie - animowany wykres kołowy</title><link>https://blog.prokulski.science/2017/08/10/animowany-wykres-kolowy/</link><pubDate>Thu, 10 Aug 2017 08:12:44 +0000</pubDate><guid>https://blog.prokulski.science/2017/08/10/animowany-wykres-kolowy/</guid><description>&lt;p&gt;Kilka dni temu karierę na stronach poświęconych wizualizacji danych robił filmik obrazujący zmiany temperatury na przestrzeni lat. Na stronie &lt;a href="http://fb.com/DaneAnalizy"&gt;Dane i Analizy&lt;/a&gt; obiecałem, że opiszę jak można coś takiego zrobić.&#10;Wspomniany filmik to&lt;/p&gt;&#10;&lt;p&gt;Jakiś czas zastanawiałem się jakie dane pokazać i zdecydowałem, że będzie to liczba odsłon najpopularniejszych tekstów z bloga który czytasz. Przy okazji dowiemy się jak za pomocą R dostać się do statystyk zebranych w Google Analitycs.&#10;Oczywiście jest do tego stosowny pakiet, ale wcześniej potrzebna jest pewna konfiguracja konta googlowego. Jak zwykle w przypadku API potrzebny jest klucz - w tym przypadku jest to para &lt;em&gt;Client ID&lt;/em&gt; i &lt;em&gt;Secret ID&lt;/em&gt;. Aby je uzyskać wystarczy wykonać kroki opisane chociażby &lt;a href="https://github.com/LucyMcGowan/Tutorials/blob/master/googleanalytics.Rmd"&gt;tutaj&lt;/a&gt;.&#10;Dodatkowo instalujemy pakiet &lt;strong&gt;RGoogleAnalytics&lt;/strong&gt;:&lt;/p&gt;</description></item><item><title>Ekstraklasa - analiza</title><link>https://blog.prokulski.science/2017/07/11/ekstraklasa_cz1/</link><pubDate>Tue, 11 Jul 2017 14:50:21 +0000</pubDate><guid>https://blog.prokulski.science/2017/07/11/ekstraklasa_cz1/</guid><description>&lt;p&gt;Zaczynamy nową serię - analizę i przede wszystkim przewidywania dotyczące rozgrywek w ramach piłkarskiej Ekstraklasy.&#10;Cykl będzie składał się z trzech części:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;w pierwszej przeprowadzimy analizę danych z historycznych rozgrywek na podstawie wyników meczów z sezonów 2008/09 do 2016/17&lt;/li&gt;&#10;&lt;li&gt;w drugiej części spróbujemy znaleźć model, który pozwoli na symulację rozgrywek oraz sprawdzimy jego skuteczność&lt;/li&gt;&#10;&lt;li&gt;zaś w ostatniej części - przygotowanym modelem wytypujemy wyniki na nadchodzący sezon 2017/18&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;&lt;strong&gt;Zapowiada się ciekawie, zatem do dzieła!&lt;/strong&gt; Tym razem będzie bez kodów R w treści posta, wszystkie zaś dostępne są na moim &lt;a href="https://github.com/prokulski/ekstraklasa"&gt;GitHubie&lt;/a&gt;.&#10;Historyczne dane pobrałem ze strony &lt;a href="http://www.hppn.pl"&gt;Historia Polskiej Piłki Nożnej&lt;/a&gt;, stosowny skrypt na GitHubie nazywa się &lt;a href="https://github.com/prokulski/ekstraklasa/blob/master/load_table.r"&gt;load_table.r&lt;/a&gt;.&#10;Dane zawierają informację o dacie meczu (i sezonie w którym mecz został rozegrany), drużynach i wyniku. Niestety nie znalazłem łatwych do zaadoptowania wyników z np. minutami meczu w których padają bramki - przez to analiza będzie nieco uboga. Ale może ciekawa?&#10;Na początek zobaczmy &lt;strong&gt;czy własne boisko sprzyja wygranej?&lt;/strong&gt; Uwaga - są to dane uśrednione ze wszystkich sezonów, jeśli Legia grała z Wisłą Kraków u siebie (grała 13 razy) to liczymy średnią liczbę bramek zdobytą przez oba zespoły i to traktujemy jako wynik takiego super-meczu.&lt;/p&gt;</description></item><item><title>Maszynka do czytania Twittera</title><link>https://blog.prokulski.science/2017/06/20/maszynka-do-czytania-twittera/</link><pubDate>Tue, 20 Jun 2017 12:57:10 +0000</pubDate><guid>https://blog.prokulski.science/2017/06/20/maszynka-do-czytania-twittera/</guid><description>&lt;p&gt;Bardzo lubię Twittera, który w Polsce jest trochę niedowartościowany. Według mnie to najszybsze źródło informacji, a przy okazji - przyjemne i wygodne w zdobywaniu danych do przeróżnych analiz.&#10;Najnowsze dane do jakich dotarłem (nie szukałem długo - jakieś 2 minuty) mówią o tym, że w Polsce z FB korzysta jakieś pięć razy więcej użytkowników niż z Twittera. Niby mało, ale jak zobaczymy jest to wystarczająco.&#10;&lt;a href="../../tags/twitter/"&gt;Analizowaliśmy już&lt;/a&gt; w oparciu o dane z Twittera &lt;a href="../../2017/02/27/oscary-2017-kto-wygral-bez-czytania-wiadomosci/"&gt;wyniki Oscarów&lt;/a&gt; oraz &lt;a href="../../2017/06/12/mecz-polska-rumunia-na-twitterze/"&gt;aktywność podczas meczu piłki nożnej&lt;/a&gt;. Nie ma jednak prostego sposobu (nie znam, może raczej tak), aby w krótkim czasie dotrzeć to tego co aktualnie dzieje się na Twitterze. &lt;strong&gt;Przygotujemy sobie więc odpowiednie narzędzie.&lt;/strong&gt;&lt;/p&gt;</description></item><item><title>Mecz Polska - Rumunia na Twitterze</title><link>https://blog.prokulski.science/2017/06/12/mecz-polska-rumunia-na-twitterze/</link><pubDate>Mon, 12 Jun 2017 11:00:36 +0000</pubDate><guid>https://blog.prokulski.science/2017/06/12/mecz-polska-rumunia-na-twitterze/</guid><description>&lt;p&gt;Wydarzenia sportowe (lub inne dziejące się tu i teraz) są bardzo wdzięcznym tematem analizy tego, co dzieje się w mediach społecznościowych. Jak wyglądał Twitter podczas meczu Polska - Rumunia?&lt;/p&gt;&#10;&lt;h3 id="przygotowanie-tokenu"&gt;Przygotowanie tokenu&lt;/h3&gt;&#10;&lt;p&gt;Aby zebrać dane z Twittera potrzebujemy zbudować aplikację, która wykorzysta API Twittera i jej tokenu. W samym R wykorzystamy pakiet &lt;strong&gt;&lt;a href="https://github.com/mkearney/rtweet"&gt;rtweet&lt;/a&gt;&lt;/strong&gt;. Koniec końców potrzebny nam jest klucz API (para &lt;em&gt;Consumer Key&lt;/em&gt; i &lt;em&gt;Consumer Sectet&lt;/em&gt;) - jak je zdobyć można przeczytać &lt;strong&gt;&lt;a href="https://mkearney.github.io/rtweet/articles/auth.html"&gt;tutaj&lt;/a&gt;&lt;/strong&gt; (z obrazkami). Odpowiednie wartości należy przypisać do zmiennych poniżej. Kod przygotuje nam token i zapisze w lokalnym pliku, dzięki temu w przyszłości będziemy mogli taki token wykorzystać:&lt;/p&gt;</description></item><item><title>Oceny filmów i ich przewidywanie</title><link>https://blog.prokulski.science/2017/06/08/oceny-filmow-i-ich-przewidywanie/</link><pubDate>Thu, 08 Jun 2017 13:59:55 +0000</pubDate><guid>https://blog.prokulski.science/2017/06/08/oceny-filmow-i-ich-przewidywanie/</guid><description>&lt;p&gt;Od czego zależą oceny filmów?&#10;Jak będzie oceniony film, który dopiero powstaje?&#10;Dawno temu, czyli gdzieś około roku, może nawet półtora temu, zebrałem z Filmwebu prawie całą ówczesną bazę danych o filmach. Wykorzystałem &lt;a href="https://github.com/nSolutionsPL/filmweb-api"&gt;biblioteki napisane w PHP&lt;/a&gt; korzystające z (nie)oficjalnego API Filmwebu budując skrypt, który dla kolejnych ID “produktów” (produktów, bo Filmweb ma nie tylko filmy, ale również seriale i gry) i pobierał odpowiednie informacje (do ID bodaj 770 tys.): rok produkcji filmu, jego polski i oryginalny tytuł, czas trwania, gatunki, twórców i obsadę oraz liczbę ocen i średnią ocenę (na moment pobrania danych). Powstało kilka plików CSV (pliki relacyjne) z dużą ilością danych. Dzisiaj z tego skorzystamy i pooglądamy jak zmieniał się przemysł filmowy.&#10;Pliki zgromadzone zostały w formie CSV, po wyczyszczeniu danych wpakowałem wszystko w jeden plik z danymi. Wczytajmy sobie te dane:&lt;/p&gt;</description></item><item><title>Sejm VII kadencji</title><link>https://blog.prokulski.science/2017/04/22/sejm-vii-kadencji/</link><pubDate>Sat, 22 Apr 2017 14:19:27 +0000</pubDate><guid>https://blog.prokulski.science/2017/04/22/sejm-vii-kadencji/</guid><description>&lt;p&gt;Jak znaleźć posłów do przejęcia z jednego klubu do drugiego?&#10;Czy posłowie głosują zgodnie z głosem lidera?&#10;Sprawdzimy dzisiaj jak wygląda rozkład sił w polskim Sejmie. Jak bardzo partie różnią się od siebie, komu z kim po drodze i czy są posłowie, którzy głosują inaczej niż lider?&#10;Wszystkie te informacje wydobędziemy moim ulubionym sposobem, czyli bez czytania. A tak na prawdę to bez wnikania w politykę, bez oglądania wiadomości. Jedynie na podstawie tego jak poszczególne osoby głosują w kolejnych głosowaniach.&#10;&lt;strong&gt;Jeśli nie interesują Cię technikalia - przejdź od razu do wyników&lt;/strong&gt;:&lt;/p&gt;</description></item></channel></rss>