<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>API on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/api/</link><description>Recent content in API on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 07 Sep 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/api/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM zwraca poprawny JSON i się myli. Plus: pathlib, benchmarki i marka osobista w IT</title><link>https://blog.prokulski.science/2026/09/07/llm-zwraca-poprawny-json-i-sie-myli-plus-pathlib-benchmarki-i-marka-osobista-w-it/</link><pubDate>Mon, 07 Sep 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/09/07/llm-zwraca-poprawny-json-i-sie-myli-plus-pathlib-benchmarki-i-marka-osobista-w-it/</guid><description>&lt;p&gt;W tym wydaniu dużo o narzędziach, które już pewnie masz w stosie, ale rzadko trafia się dobry materiał tłumaczący ich działanie od środka. Są tu teksty o Airflow 3, dbt, Marquezie i formatach serializacji, a każdy z nich ma konkretną tezę, nie tylko opis funkcji.&lt;/p&gt;&#10;&lt;p&gt;jak migracja z legacy ETL do dbt wygląda krok po kroku, dlaczego Parquet eliminuje do 80% narzutu I/O w porównaniu z CSV, co Marquez robi z Twoim data lineage i jak integruje się z OpenLineage.&lt;/p&gt;</description></item><item><title>Medallion pęka w szwach, agenci tracą kontekst... co z tym zrobić?</title><link>https://blog.prokulski.science/2026/07/27/medallion-peka-w-szwach-agenci-traca-kontekst-co-z-tym-zrobic/</link><pubDate>Mon, 27 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/27/medallion-peka-w-szwach-agenci-traca-kontekst-co-z-tym-zrobic/</guid><description>&lt;p&gt;Ten numer ma wyraźny środek ciężkości: agenci AI i to, co z nimi robić, kiedy wychodzisz poza pierwsze eksperymenty. Teksty o LangGraph - od &amp;ldquo;jak zbudować pierwszego agenta&amp;rdquo; po &amp;ldquo;co psuje się po kilku miesiącach&amp;rdquo; - tworzą razem coś w rodzaju mini-ścieżki, którą można przejść od razu albo wracać do poszczególnych etapów w miarę potrzeb. Uzupełnia je tekst o tym, jak zmienia się rola programisty, kiedy AI przejmuje pisanie kodu - i dlaczego to jest trudniejsze niż się wydaje.&lt;/p&gt;</description></item><item><title>Dashboard i agent muszą się zgadzać. Plus Kueue, Iceberg i kryzys jakości kodu przy 40 stopniach w cienu</title><link>https://blog.prokulski.science/2026/06/29/dashboard-i-agent-musza-sie-zgadzac-plus-kueue-iceberg-i-kryzys-jakosci-kodu-przy-40-stopniach-w-cienu/</link><pubDate>Mon, 29 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/29/dashboard-i-agent-musza-sie-zgadzac-plus-kueue-iceberg-i-kryzys-jakosci-kodu-przy-40-stopniach-w-cienu/</guid><description>&lt;p&gt;Witaj w pierwsym wakacyjnym wydaniu newslettera Dane i Analizy — przygotowanym w niedzielę wieczór, gdy Polska powoli stygła (ta, jasne&amp;hellip;) po tym, co meteorolodzy nazwali najgorętszym dniem w historii pomiarów. Nawet 40 stopni w cieniu. Skoro już jesteś przed ekranem zamiast przy wiatraczku, to dobrze trafiłeś — zebrałem dla Ciebie materiały, które warto przeczytać przy klimatyzacji lub choćby przy otwartym oknie.&lt;/p&gt;&#10;&lt;p&gt;W tym numerze sporo miejsca zajmują agenty AI — i to z różnych kątów. Dowiesz się, jak wyposażyć LLM w mózg data inżyniera, dlaczego Twój agent i dashboard mogą sobie wzajemnie zaprzeczać (i jak temu zaradzić architektonicznie), czym jest Agent Experience jako nowy wymiar projektowania API, a do tego jak AI wkracza do katalogów danych. Temat agentów w danych to nie hype — to realny kierunek, który warto rozumieć głębiej niż na poziomie demo.&lt;/p&gt;</description></item><item><title>Osiem wzorców potoków danych, Snowflake od środka i przedwakacyjny DevOps</title><link>https://blog.prokulski.science/2026/06/22/osiem-wzorcow-potokow-danych-snowflake-od-srodka-i-przedwakacyjny-devops/</link><pubDate>Mon, 22 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/22/osiem-wzorcow-potokow-danych-snowflake-od-srodka-i-przedwakacyjny-devops/</guid><description>&lt;p&gt;Rozpoczynamy ostatni tydzień roku szkolnego, co dla wielu oznacza początek letnich urlopów i chwilowe zwolnienie tempa w projektach. To idealny moment na uporządkowanie technicznego długu oraz wdrożenie usprawnień, które pozwolą Twoim systemom bezawaryjnie przetrwać czas wakacyjnej flauty. Warto skupić się na:&lt;/p&gt;&#10;&lt;p&gt;automatyzacji powtarzalnych zadań operacyjnych, przeglądzie konfiguracji bezpieczeństwa i zarządzania kluczami, refaktoryzacji krytycznych fragmentów kodu przed masowymi urlopami w zespole.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych i architektury przyglądamy się sprawdzonym wzorcom projektowym oraz zaawansowanym metodom skalowania przepływów. Zrozumienie relacji między różnymi modelami przetwarzania pozwala na budowanie systemów odpornych na nagłe skoki ruchu. W tym tygodniu dowiesz się więcej o:&lt;/p&gt;</description></item><item><title>Ponad połowa kodu z AI? Raport 2026 i symulatory Kubernetes</title><link>https://blog.prokulski.science/2026/06/08/ponad-polowa-kodu-z-ai-raport-2026-i-symulatory-kubernetes/</link><pubDate>Mon, 08 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/08/ponad-polowa-kodu-z-ai-raport-2026-i-symulatory-kubernetes/</guid><description>&lt;p&gt;W tym numerze przyglądamy się gwałtownej profesjonalizacji świata AI, gdzie agenty przestają być tylko ciekawostką, a właściwie są fundamentem codziennej pracy programistycznej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy najważniejszy raport roku (&lt;a href="https://2026.stateofai.dev/en-US"&gt;State of AI 2026&lt;/a&gt;), z którego wynika, że już ponad połowa kodu produkcyjnego pochodzi z systemów AI, pokazujemy protokół MCP jako kluczowy standard łączący modele z infrastrukturą oraz zalety natywnych agentów głosowych, i sprawdzamy, jak pliki SKILL.md pomagają skalować wsparcie AI w wielorepozytorialnych środowiskach Enterprise.&lt;/p&gt;</description></item><item><title>Czy AI Slop zaleje sieć? Plus Spark, Kafka i SQL</title><link>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</link><pubDate>Mon, 25 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/25/czy-ai-slop-zaleje-siec-plus-spark-kafka-i-sql/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz ich głębokiej integracji z codziennym workflow inżynierskim.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenty Playwright i protokół MCP automatyzują cykl życia błędu, od wykrycia po zgłoszenie w Jirze, pokazujemy, jak Claude Code i lokalne modele Qwen2.5 zmieniają zasady gry w analizie danych i budowaniu dashboardów, i sprawdzamy, ile &amp;ldquo;śmieciowego&amp;rdquo; AI (slop) faktycznie krąży w sieci i jak to wpływa na jakość informacji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze inżynierii danych skupiamy się na wydajności, optymalizacji kosztów i mądrym wyborze silników bazodanowych.&lt;/p&gt;</description></item><item><title>Agenty w produkcji, DuckDB na sterydach i kłamstwa Kubernetesowi</title><link>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</link><pubDate>Mon, 11 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na profesjonalizacji narzędzi AI w codziennej pracy inżynierskiej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak Databricks i Shopify wbudowują agentów AI bezpośrednio w swoje platformy, pokazujemy, dlaczego AI przestaje być dodatkiem, a staje się integralną warstwą systemów, i tłumaczymy zmianę podejścia: od prompt engineeringu do context engineeringu i pracy na głębszych warstwach modeli LLM.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu wracają do gry lekkie, lokalne silniki analityczne.&lt;/p&gt;&#10;&lt;p&gt;Przyglądamy się, jak DuckDB i Polars redefiniują wydajność pracy z danymi na pojedynczej maszynie, pokazujemy, kiedy lokalne przetwarzanie wygrywa z klasycznym podejściem cloud-first, a także wracamy do fundamentów: Kafka i Spark wciąż żyją, ale wymagają konkretnych checklist optymalizacyjnych przy skali produkcyjnej.&lt;/p&gt;</description></item><item><title>Od potoków danych w YAML po automatyzację SharePoint API</title><link>https://blog.prokulski.science/2026/05/04/od-potokow-danych-w-yaml-po-automatyzacje-sharepoint-api/</link><pubDate>Mon, 04 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/04/od-potokow-danych-w-yaml-po-automatyzacje-sharepoint-api/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na przełomowych zmianach w sposobie, w jaki systemy AI wchodzą w interakcję z naszym otoczeniem technologicznym.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy Model Context Protocol (MCP) – otwarty standard, który kończy erę pisania dedykowanych integracji, sprawdzamy, jak agenty AI płynnie komunikują się z bazami danych w modelu „plug-and-play”, i pokazujemy praktyczne wdrożenia budujące skalowalne ekosystemy sztucznej inteligencji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze Data Engineeringu i analityki dbt pozostaje centralnym punktem, ale jego rola ewoluuje w stronę pełnej automatyzacji.&lt;/p&gt;</description></item><item><title>Więcej niż podstawy: AI, lakehouse, zaawansowany SQL</title><link>https://blog.prokulski.science/2026/03/02/wiecej-niz-podstawy-ai-lakehouse-zaawansowany-sql/</link><pubDate>Mon, 02 Mar 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/03/02/wiecej-niz-podstawy-ai-lakehouse-zaawansowany-sql/</guid><description>&lt;p&gt;W dzisiejszym wydaniu eksplorujemy najnowsze trendy w świecie danych i AI – od inteligentnych agentów wspomagających pracę z kodem i platformami analitycznymi, przez zaawansowane techniki machine learning i tokenizacji, aż po praktyczne podejścia do architektury systemów i inżynierii danych.&lt;/p&gt;&#10;&lt;p&gt;Poznaj narzędzia, które realnie skracają czas developmentu, dowiedz się, jak wykorzystać embeddings w prognozowaniu szeregów czasowych, a także sprawdź, dlaczego PostgreSQL oferuje znacznie więcej niż podstawowe zapytania SQL. Nie zabraknie również praktycznych projektów z wykorzystaniem H3 do analiz geoprzestrzennych, przewodnika po architekturze lakehouse oraz wskazówek, jak unikać krytycznych błędów w API Pythona i pipeline&amp;rsquo;ach danych. Dla dla entuzjastów wizualizacji – profesjonalne wykresy w R oraz zasady projektowania efektywnych dashboardów.&lt;/p&gt;</description></item><item><title>Zero ETL i hackathon z Bielikiem</title><link>https://blog.prokulski.science/2026/02/09/zero-etl-i-hackathon-z-bielikiem/</link><pubDate>Mon, 09 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/09/zero-etl-i-hackathon-z-bielikiem/</guid><description>&lt;p&gt;W dzisiejszym wydaniu: architektura Zero ETL jako nowy standard w inżynierii danych (albo kolejny buzz word - różnie to bywa z nowościami), praktyczne zastosowania AI w zespołach data science, oraz ewolucja DuckDB w kierunku pełnoprawnego lakehouse.&lt;br&gt;&#10;Znalazłem też przegląd antywzorców w architekturach mikroserwisowych, strategie cache&amp;rsquo;owania w REST API i przewodnik po zarządzaniu ewolucją schematów w pipeline&amp;rsquo;ach strumieniowych (to potrafi być ból!).&lt;br&gt;&#10;Znajdziesz dzisiaj również frameworki analityczne dla e-commerce, techniki feature engineering w SQL dla szeregów czasowych oraz narzędzia do observability systemów ML w produkcji.&lt;/p&gt;</description></item><item><title>Rób produkcyjnie agentów AI, platformy danych i automatyzacje, które naprawdę dowożą</title><link>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</link><pubDate>Mon, 26 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/26/rob-produkcyjnie-agentow-ai-platformy-danych-i-automatyzacje-ktore-naprawde-dowoza/</guid><description>&lt;p&gt;To wydanie to mocny pakiet o tym, jak przestać bawić się w „demka” i zacząć budować produkcyjne systemy danych, AI i automatyzacji – od architektury agentów, przez hurtownie, po niskopoziomowe optymalizacje.&lt;/p&gt;&#10;&lt;p&gt;Znajdziesz tu blok tekstów o agentach AI (platformy, orkiestracja, pamięć, narzędzia, realne case’y typu monitoring w Slacku), który pokazuje, co trzeba dostarczyć, żeby agenci nie wybuchli przy pierwszym większym ruchu. Do tego zestaw materiałów o analityce i data engineeringu: dobre EDA, przetwarzanie danych geograficznych z DuckDB + GeoPandas, kontrakty danych, wzorce ETL/ELT (Snowflake + dbt + Airflow, migracja z Airflow do Databricks), patterny pod &lt;em&gt;AI‑ready pipelines&lt;/em&gt; i benchmark DuckDB vs Spark.&lt;/p&gt;</description></item><item><title>Agenci AI, skalowanie pipeline'ów i ewolucja Pythona</title><link>https://blog.prokulski.science/2026/01/19/agenci-ai-skalowanie-pipelineow-i-ewolucja-pythona/</link><pubDate>Mon, 19 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/19/agenci-ai-skalowanie-pipelineow-i-ewolucja-pythona/</guid><description>&lt;p&gt;W dzisiejszym wydaniu głęboko zanurzamy się w świat &lt;strong&gt;agentów AI i agentic AI&lt;/strong&gt;: od fundamentalnych rozróżnień między generatywną AI, agentami i podejściem agentycznym, przez praktyczne wyzwania bezpieczeństwa w postaci mapowania API, aż po optymalizację zarządzania kontekstem w Model Context Protocol. Nie zabraknie również solidnych podstaw machine learningu: kodowanie danych kategorycznych, Support Vector Machines oraz kompleksowy przegląd metod detekcji anomalii w Pythonie.&lt;/p&gt;&#10;&lt;p&gt;Na froncie &lt;strong&gt;inżynierii danych&lt;/strong&gt; pokazujemy, jak ewoluować od prostych crontabów do systemów obsługujących miliardy zdarzeń, jak wykorzystać DuckDB do szybkich analiz bez ciężkiej infrastruktury oraz dlaczego dokumentacja jako kod w dbt-checkpoint staje się silnikiem jakości danych. Praktyczny przewodnik end-to-end z darmowymi narzędziami oraz refleksje nad zawodem data engineera dopełniają obrazu codziennych wyzwań w tej dziedzinie.&lt;/p&gt;</description></item><item><title>Kryzys pracowniczy w branży + konferencja AI Dev 25</title><link>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</link><pubDate>Mon, 08 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się transformacji współczesnych architektur IT – od rosnącej konkurencji dla RESTa i mikroserwisów, przez natywną obsługę wektorów w Postgresie, aż po praktyczne wzorce partycjonowania Parquet. W sekcji AI i ML znajdziecie przewodnik po PyTorch dla chcących zacząć z sieciami neuronowymi i budowaniem własnych modeli AI. Znajdziecie też tekst o metodach interpretacji predykcji XGBoost z wykorzystaniem SHAP.&lt;/p&gt;&#10;&lt;p&gt;Dla programistów Pythona przygotowaliśmy materiały o walidacji outputów LLM z Pydantic, monitoringu FastAPI, zaawansowanych technikach pandas oraz nowym narzędziu &amp;ldquo;ty&amp;rdquo; do automatyzacji przepływów w chmurze. DevOpsi mogą sprawdzić tutorial wdrażania Spring Boot na Kubernetes, rozwiązanie problemu rozbieżności między środowiskami lokalnym a produkcyjnym oraz master class z tcpdump i Wireshark.&lt;/p&gt;</description></item><item><title>System design, bazy danych i praktyczny Python</title><link>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</link><pubDate>Mon, 10 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach projektowania i optymalizacji systemów danych.&lt;br&gt;&#10;Zaczynamy od architektury: poznasz sprawdzone metody nauki projektowania systemów oraz zajrzysz pod maskę infrastruktury OpenAI opartej na Kubernetes i Apache Kafka.&lt;br&gt;&#10;W sekcji baz danych znajdziesz spojrzenie na BigQuery z perspektywy programistów Pythona oraz dwanaście realnych przypadków migracji do DuckDB z konkretnymi oszczędnościami.&lt;/p&gt;&#10;&lt;p&gt;Miłośnicy Pythona znajdą też kilka wartościowych materiałów: od elegancji dekoratorów, przez biblioteki przewyższające Excela, po praktyczną migrację z PostgreSQL do MongoDB. Warto zerknąć na porównanie HTTPX z Requests (nie tylko w kontekście projektów LLM, ale po prostu na httpx jako nowocześniejszy pakiet) oraz omówienie narzędzia UV Toolchain do stabilizacji środowisk CI/CD.&lt;/p&gt;</description></item><item><title>Nowy dział low code</title><link>https://blog.prokulski.science/2025/10/06/nowy-dzial-low-code/</link><pubDate>Mon, 06 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/06/nowy-dzial-low-code/</guid><description>&lt;p&gt;Kolejny tydzień, kolejna porcja wiedzy z szerokiego świata danych i AI. Jak zwasze przed Tobą materiały, które sprawdzą się zarówno w codziennej pracy, jak i przy zgłębianiu nowych technologii.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zajmujesz się infrastrukturą i &lt;strong&gt;DevOps&lt;/strong&gt;, czekają na Ciebie praktyczne wzorce Dockerfile dla Pythona, które zredukują czas buildów do sekund, oraz dziewięć sprawdzonych technik autoskalowania w Kubernetes, które przetrwają piki ruchu. A dla fanów baz danych – przegląd rozszerzeń PostgreSQL, które działają jak supermoc, oraz porównanie architektur Snowflake, Oracle i PostgreSQL.&lt;/p&gt;</description></item><item><title>Polski tutorial z vide codingu + nierówności w globalnej adopcji AI - Newsletter Dane i Analizy (&amp;#x1f5d3; %Y-%m-%d)</title><link>https://blog.prokulski.science/2025/09/22/polski-tutorial-z-vide-codingu-nierownosci-w-globalnej-adopcji-ai-newsletter-dane-i-analizy--y-m-d/</link><pubDate>Mon, 22 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/22/polski-tutorial-z-vide-codingu-nierownosci-w-globalnej-adopcji-ai-newsletter-dane-i-analizy--y-m-d/</guid><description>&lt;p&gt;Jeśli dopiero zaczynasz przygodę z vibe codingiem i Claude Code, koniecznie obejrzyj 48-minutowy tutorial, który przeprowadzi Cię przez budowę kompletnej aplikacji. Dla bardziej zaawansowanych użytkowników są materiały o zarządzaniu serwerami MCP w produkcji oraz wyzwaniach związanych z governance w systemach autonomicznych.&lt;/p&gt;&#10;&lt;p&gt;Miłośnicy analizy danych znajdą praktyczne wskazówki dotyczące wizualizacji z wykorzystaniem Pythona i Seaborn, implementację XAI z biblioteką SHAP, a także 10 sprytnych trików do pracy z danymi kategorycznymi w scikit-learn. Szczególnie imponujący jest przypadek optymalizacji SQLite, gdzie wydajność wzrosła (jak twierdzi autor) z 19 tysięcy do 4,2 miliona zdarzeń na sekundę!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-07-07</title><link>https://blog.prokulski.science/2025/07/07/newsletter-dane-i-analizy-2025-07-07/</link><pubDate>Mon, 07 Jul 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/07/07/newsletter-dane-i-analizy-2025-07-07/</guid><description>&lt;p&gt;Ten tydzień przyniósł szczególnie bogate żniwo materiałów technicznych – po zwyczajowej analizie dziesiątek źródeł i setek (jeśli nie tysięcy) artykułów, udało się wyłonić zwyczajowe &amp;ldquo;około dwadzieścia&amp;rdquo; najważniejszych publikacji z obszaru data science, ML i AI. Rozkład tematyczny doskonale odzwierciedla aktualne trendy w branży (i zainteresowania Redaktora Naczelnego): dominuje Python i Data Engineering. Ale (poza zainteresowaniami Naczelnego) potwierdza to centralną rolę tych obszarów w nowoczesnych zagadnieniach związanych z danymi.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie interesujące są materiały dotyczące architektury systemów AI – od multi-agentowych rozwiązań Anthropic, przez unifikację ML na Ray w Pinterest, aż po praktyczne implementacje MLOps z pełnym monitoringiem. Widać wyraźnie, że branża przechodzi od eksperymentów do produkcyjnych, skalowalnych rozwiązań.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-30</title><link>https://blog.prokulski.science/2025/06/30/newsletter-dane-i-analizy-2025-06-30/</link><pubDate>Mon, 30 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/30/newsletter-dane-i-analizy-2025-06-30/</guid><description>&lt;p&gt;Dzisiaj w numerze od rewolucji w projektowaniu API po fundamentalne pytania o architekturę danych, od praktycznych implementacji AI po badania nad samopoczuciem programistów – każdy artykuł odkrywa nowe perspektywy na temat tego, jak sztuczna inteligencja przemienia nasze sposoby pracy.&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Era Agentów AI wymaga nowego podejścia do projektowania&lt;/strong&gt;&lt;br&gt;&#10;Jednym z kluczowych tematów tego numeru jest ewolucja API w kontekście rosnącej popularności agentów AI. Agenty AI zachowują się jak wątki - to boty zadaniowe uruchamiane w celu osiągnięcia określonego celu, co oznacza, że nasze dotychczasowe podejście do projektowania interfejsów programowych wymaga gruntownego przemyślenia. Czy nasze API są gotowe na świat, w którym konsumentami nie są już tylko ludzie, ale także inteligentne maszyny działające autonomicznie?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-16</title><link>https://blog.prokulski.science/2025/06/16/newsletter-dane-i-analizy-2025-06-16/</link><pubDate>Mon, 16 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/16/newsletter-dane-i-analizy-2025-06-16/</guid><description>&lt;p&gt;Mamy poniedziałek rano, więc zaparzaj kawę i przygotuj się na rozpoczęcie tygodnia z porcją wiedzy z świata danych i sztucznej inteligencji.&lt;/p&gt;&#10;&lt;p&gt;Witam przede wszystkich nowych subskrybentów! Zgodnie z obietnicą (warto śledzić moje social media): oto moja najnowsza książka mówiącej o tym, co trzeba umieć, aby pracować z danymi - od zupełnych podstaw w Excelu do dużych projektów data-inżynieryjnych, modeli AI czy dashboardów dla zarządów największych spółek.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://prokulski.science/temp/static/jak-zostac-analitykiem.pdf?utm_source=newsletter-dia-2025-06-16&amp;amp;utm_medium=mail-link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;img src="https://prokulski.science/temp/static/jak-zostac-analitykiem-small.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Książka na razie dostępna jest za darmo, więc należy się śpieszyć. To wersja 1.0.beta, więc wszystkie uwagi mile widziane!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-09</title><link>https://blog.prokulski.science/2025/06/09/newsletter-dane-i-analizy-2025-06-09/</link><pubDate>Mon, 09 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/09/newsletter-dane-i-analizy-2025-06-09/</guid><description>&lt;p&gt;Dzisiaj momentami jest grubo - na przykład matematyczna elegancja B-spline&amp;rsquo;ów. Ale jest też trochę praktyki w DuckDB. Jeśli myślisz, że świat danych to tylko nudne CSVki i niekończące się ETLe, ten numer (mam nadzieję) przekona Cię, że to naprawdę fascynująca dziedzina pełna niespodzianek.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie polecam zwrócić uwagę na historię firmya Tencent Music, która oszczędziła 80% kosztów przenosząc się z Elasticsearch na Apache Doris - to jeden z tych przypadków, gdy zmiana architektury naprawdę się opłaca. Z kolei dla miłośników optymalizacji opowieść o tym, jak Python API można przyspieszyć 10x bez przepisywania na Go czy Rust - czasem wystarczy po prostu dobrze pomyśleć!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-02</title><link>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</link><pubDate>Mon, 02 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</guid><description>&lt;p&gt;Ten tydzień przyniósł interesującą mieszankę praktycznych rozwiązań i technologicznych rewolucji. Od monitorowania nocnych maratonów chomików (to ta rewolucja, wiadomo) po architekturę Apache Spark - branża pokazuje, że innowacja kryje się w każdym zakątku.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie ciekawy jest trend odchodzenia od tradycyjnych rozwiązań na rzecz nowoczesnych alternatyw. Na przykład zamiast odpalać joby w cronie można wykorzystać Change Data Capture (CDC), a API-first podejście staje się standardem dla 74% zespołów. Apache Iceberg wygra wojnę formatów tabel, a FastAPI udowadnia, że Python może być równie wydajny co elegancki.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-28</title><link>https://blog.prokulski.science/2025/04/28/newsletter-dane-i-analizy-2025-04-28/</link><pubDate>Mon, 28 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/28/newsletter-dane-i-analizy-2025-04-28/</guid><description>&lt;p&gt;W tym tygodniu mam dla was wybuchową mieszankę materiałów - od głębokiego uczenia maszynowego i tutoriala pisania własnych RAGów, przez wizualizację danych geolokalizacyjnych, po optymalizację dashboardów.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie chciałbym zwrócić waszą uwagę na serię artykułów poświęconych Apache Airflow i Kafce - dwa narzędzia, które stały się nieodłącznym elementem nowoczesnych potoków danych. Znajdziecie dzisiaj zarówno wprowadzenie do zmian wdrożonych w Airflow w wersji 3.0, jak i praktyczne informacje o tym jak pisać wydajne DAGi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-07</title><link>https://blog.prokulski.science/2025/04/07/newsletter-dane-i-analizy-2025-04-07/</link><pubDate>Mon, 07 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/07/newsletter-dane-i-analizy-2025-04-07/</guid><description>&lt;p&gt;Dzisiaj &amp;ldquo;mapy rozwoju&amp;rdquo; - czyli listy zagadnień, które warto poznać, zgłębić, nauczyć się, aby rozwinąć się w danej dziedzinie. Dziedziny te oczywiście bliskie są tematom przewodnim tego newslettera - przetwarzaniu danych. Zatem jest &amp;ldquo;ścieżka rozwojowa&amp;rdquo; dla inżynierów danych oraz dla zajmujących się machine learningiem (i jego &amp;ldquo;operacjonalizacyjną&amp;rdquo; stroną - MLOps).&lt;/p&gt;&#10;&lt;p&gt;Ciekawe dla Ciebie mogą być również dwa świeże raporty (za 2024 rok) związane z bezpieczeństwem - jeden z CERT, więc bezpieczeństwo raczej ogólne. Drugi z Komisji Nadzoru Finansowego dotyczący instytucji finansowych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-24</title><link>https://blog.prokulski.science/2025/03/24/newsletter-dane-i-analizy-2025-03-24/</link><pubDate>Mon, 24 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/24/newsletter-dane-i-analizy-2025-03-24/</guid><description>&lt;p&gt;W dzisiejszym numerze analizujemy ewolucję systemów rekomendacji i wyszukiwania w erze LLM, prezentujemy zaawansowane techniki inżynierii danych, w tym potoki danych oparte na PostgreSQL oraz porównanie formatów data lake. Poruszamy również kwestię minimalizację liczby spotkań, a także przedstawiamy nowe narzędzia usprawniające pracę z Pythonem i bazami wektorowymi.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://eugeneyan.com//writing/recsys-llm/"&gt;&lt;strong&gt;Improving Recommendation Systems &amp;amp; Search in the Age of LLMs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Kompleksowa analiza transformacji systemów rekomendacji i wyszukiwania w kontekście dużych modeli językowych. Artykuł omawia zmiany w przemysłowych rozwiązaniach w ostatnim roku, skupiając się na architekturach multimodalnych, generowaniu danych wspomaganym przez LLM oraz technikach uczenia transferowego i destylacji.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-10</title><link>https://blog.prokulski.science/2025/03/10/newsletter-dane-i-analizy-2025-03-10/</link><pubDate>Mon, 10 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/10/newsletter-dane-i-analizy-2025-03-10/</guid><description>&lt;p&gt;Pod koniec lutego &amp;ldquo;ukazał&amp;rdquo; się zbiór danych (pochodzących najprawdopodobniej z serwisu rynekpierwotny.pl) zawierający całkiem sporo ofert nowych mieszkań (i nie tylko). Zbiór o tyle interesujący, że ze współrzędnymi oferowanych lokalizacji. Na &lt;a href="https://www.linkedin.com/feed/update/urn:li:activity:7302029418514857984/"&gt;LinkedIn&lt;/a&gt; wrzuciłem na szybko przygotowaną mapkę wynikającą z tego zbioru, ale planuję coś większego: e-mailowy cykl (3-4 maile, pewnie co tydzień) pokazujący co z tymi danymi można zrobić. Na pewno napiszę o tym w newsletterze, na pewno napiszę o tym na LinkedIn - zatem zapraszam do obserwowania. Na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;u Dane i Analizy&lt;/a&gt; też będzie o tym info, więc też warto obserwować.&lt;br&gt;&#10;Żeby było ciekawiej - dość podobny temat porusza jeden z dzisiejszych postów, jakie znajdziesz poniżej - ten o kebabach - to doskonały przykład praktycznego zastosowania analizy danych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-17</title><link>https://blog.prokulski.science/2025/02/17/newsletter-dane-i-analizy-2025-02-17/</link><pubDate>Mon, 17 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/17/newsletter-dane-i-analizy-2025-02-17/</guid><description>&lt;p&gt;Mam nadzieję, że Walentynki były udane? ;-) Może szukasz spóźnionego prezentu dla początkującego programisty (albo dla siebie) - mój nowy e-book o Pythonie (pobieranie danych z API, współpraca z bazą danych, aplikacja we Flasku), który zadebiutował właśnie 14 lutego, może być strzałem w dziesiątkę. Więcej informacji na &lt;a href="https://dane-i-analizy.salescrm.pl/e-book-budowa-aplikacji-walutowej/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;stronie książki&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu mam dla Ciebie solidną dawkę wiedzy z różnych obszarów analizy danych i programowania - jak zwykle zresztą. Szczególnie warto zwrócić uwagę na materiały dotyczące uczenia maszynowego - od budowy własnej biblioteki deep learning po praktyczną optymalizację modelu wykrywania oszustw. Dla osób zainteresowanych LLM, a w szczególności Transformerami - jest przystępne wyjaśnienie ich działania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-10</title><link>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</link><pubDate>Mon, 10 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</guid><description>&lt;p&gt;Zanim przejdę do sedna, czyli bieżącego numeru, mam dla Ciebie informację. Otóż za moment będzie dostępny kompleksowy e-book typu &lt;strong&gt;&amp;ldquo;od juniora do mida&amp;rdquo;&lt;/strong&gt;. Książka to projekt, który kompleksowo przeprowadza przez budowę aplikacji - od komunikacji z API, przez bazę danych, aż po konteneryzację. Bez pierdół teoretycznych, za to z mocnym naciskiem na praktykę. Szczegóły już niedługo w oddzielnym mailu, więc trzymajcie się blisko skrzynki odbiorczej!&lt;/p&gt;&#10;&lt;p&gt;A co Cię czeka w tym numerze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-27</title><link>https://blog.prokulski.science/2025/01/27/newsletter-dane-i-analizy-2025-01-27/</link><pubDate>Mon, 27 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/27/newsletter-dane-i-analizy-2025-01-27/</guid><description>&lt;p&gt;Na bieżący numer złapało się kilka ciekawych tematów. Warto zwrócić uwagę na tekst o systemach automatyzacji w Amazonie i Netfliksie - pokazuje podejście dużych firm do skalowalności i bezpieczeństwa. Dobry jest artykuł o &lt;em&gt;topic modeling&lt;/em&gt; z użyciem BERTopic i FASTopic - może się przydać przy przetwarzaniu skarg klientów.&lt;/p&gt;&#10;&lt;p&gt;Dla fanów Kafki znajdzie się materiał o konsumentach wiadomości, a dla pythonowców zestaw o wizualizacjach z Pythona w Power BI, budowaniu API gateway na FastAPI i poradnik &amp;ldquo;10 Tips to Become REALLY Good at Python&amp;rdquo;, gdzie w pół godziny Arjan mówi o tym, co jest najważniejsze przy nauce Pythona, od czego trzeba zacząć i co doskonalić na początku. Do tego jest też wideo dla początkujących adeptów Pandas.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-20</title><link>https://blog.prokulski.science/2025/01/20/newsletter-dane-i-analizy-2025-01-20/</link><pubDate>Mon, 20 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/20/newsletter-dane-i-analizy-2025-01-20/</guid><description>&lt;p&gt;Ten tydzień to głównie narzędzia i automatyzacja - od tworzenia wątków na Twitterze po sprzątanie plików. Jeśli szukasz sposobów na ulepszenie swojego warsztatu, to dobrze trafiłeś. Szczególnie ciekawe są dwa artykuły o pracy z API - jeden o Claude.ai (który coraz śmielej radzi sobie z analizą tekstu), drugi o tym jak zaprojektować klucze API, żeby nie wyglądały jak kot przebiegł po klawiaturze ;-)&lt;/p&gt;&#10;&lt;p&gt;Dla pythonistów garść praktycznych rozwiązań: radzenie sobie z zagnieżdżonymi strukturami danych przez Pydantic, wyciąganie tabel z PDFów (kto nigdy nie walczył z parsowaniem PDFa, niech pierwszy rzuci kamieniem).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-06</title><link>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</link><pubDate>Mon, 06 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</guid><description>&lt;p&gt;W dniu, gdy tradycyjnie Trzej Mędrcy dotarli do celu swojej podróży kierując się gwiazdą, ja przybywam z kolekcją wartościowych znalezisk ze świata Pythona i analizy danych. Mędrcy przynieśli złoto, kadzidło i mirrę - dzisiejsze wydanie niesie pakiet różnorodnych artykułów, które (mam nadzieję) okażą się równie cennymi darami dla Twojego rozwoju zawodowego.&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu znajdziesz standardowo kilka praktycznych materiałów z zakresu data science: od budowania systemu tradingowego opartego na średniej kroczącej, przez analizę szeregów czasowych, aż po wykorzystanie biblioteki statsmodels.&lt;br&gt;&#10;Dla osób zainteresowanych automatyzacją wdrożeń (i nie tylko) mamy podstawową dawkę wiedzy o GitHub Actions i skryptach bashowych, a na koniec dość klasyczna integracja FastAPI z Reactem.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-09</title><link>https://blog.prokulski.science/2024/12/09/newsletter-dane-i-analizy-2024-12-09/</link><pubDate>Mon, 09 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/09/newsletter-dane-i-analizy-2024-12-09/</guid><description>&lt;p&gt;Nie wiem czy korzystacie z list zakupów w aplikacjach do tego przewidzianych? To wygodne - cała rodzina dodaje na jedną listę to, co trzeba kupić, a potem jedna osoba (np. ojciec ;) jedzie do sklepu i przywozi te siaty&amp;hellip; U mnie taką aplikacją jest Listonic (i nie jest to reklama - apka ma trochę irytujących elementów). Aplikacja jest popularna, co pozwala jej twórcom na zgromadzenie dużej liczby &amp;ldquo;list zakupów&amp;rdquo; i przygotowanie na tej podstawie &lt;a href="https://media.listonic.com/raporty"&gt;ciekawych raportów&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-02</title><link>https://blog.prokulski.science/2024/12/02/newsletter-dane-i-analizy-2024-12-02/</link><pubDate>Mon, 02 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/02/newsletter-dane-i-analizy-2024-12-02/</guid><description>&lt;p&gt;Motywem przewodnim w dzisiejszym odcinku jest API. Jakich frameworków użyć (w Pythonie), czym od siebie się różnią? A może websocket?&lt;/p&gt;&#10;&lt;p&gt;Podobnie mamy w sekcji z praktycznymi projektami z zakresu analizy danych (nie zawsze tam o samą analizę chodzi - czasem bardziej o uczenie maszynowe niż analizowanie w rozumieniu tzw. EDA): wykrywanie wartości odstających w zbiorach.&lt;/p&gt;&#10;&lt;p&gt;Co tydzień przedstawiamy tutaj kilka projektów wykorzystujących analizę danych, machine learning czy też AI. Zamiast czekać kilkanaście tygodni (i liczyć że temat, który Cię interesuje się pojawi) możesz zerknąć na &lt;a href="https://www.geeksforgeeks.org/top-data-science-projects/"&gt;&lt;strong&gt;stronę&lt;/strong&gt;&lt;/a&gt; gdzie zgromadzono ponad 65 (może i 69, a więc prawie 70!) przykładowych projektów razem z kodem źródłowym. Boot-camp z ML? Niepotrzebny! Wystarczą te projekty&amp;hellip; oraz porządne doczytanie dlaczego tak a nie inaczej zrobiono to czy tamto.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-18</title><link>https://blog.prokulski.science/2024/11/18/newsletter-dane-i-analizy-2024-11-18/</link><pubDate>Mon, 18 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/18/newsletter-dane-i-analizy-2024-11-18/</guid><description>&lt;p&gt;Newslettery&amp;hellip; czy wiecie, że tylko nieco ponad 1/3 newsletterów ma swój drugi numer? Co 10-ty newsletter (precyzyjniej: 11%) ukazuje się dłużej niż 10 numerów. A jednocześnie 23-krotnie wzrosła liczba newsletterów od 2019 roku na platformie Substack. Tak mówi &lt;a href="https://reletter.com/blog/newsletter-fade/"&gt;źródło&lt;/a&gt; tych danych.&lt;/p&gt;&#10;&lt;p&gt;Nasz newsletter ma jakieś 3 lata (przynajmniej w redakcyjnym archiwum w serwisie &lt;a href="https://raindrop.io/"&gt;Raindrop.io&lt;/a&gt; gdzie zebrane są wszystkie teksty jest tag #newsletter_2021-11-15), co by znaczyło jakieś 150 wydań. W archiwum, bo były czasy przed budowaniem archiwum (kilkanaście tygodni na pewno), ale tak starych ludzi już nie ma&amp;hellip; :-)&lt;br&gt;&#10;Archiwum mówi też o ponad 3400 tysiącu tekstów 😮&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-04</title><link>https://blog.prokulski.science/2024/11/04/newsletter-dane-i-analizy-2024-11-04/</link><pubDate>Mon, 04 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/04/newsletter-dane-i-analizy-2024-11-04/</guid><description>&lt;p&gt;Odkrycie tego tygodnia: &lt;a href="https://bolt.new/"&gt;Bolt.new&lt;/a&gt;. Serwis, który korzystając modeli językowych przygotuje całą aplikację i - o ile jest ona frontendowa - pozwoli jednym guzikiem ją wdrożyć.&lt;br&gt;&#10;Testując to chwilę udało się po kilku dopytaniach przygotować kod, który daje GUI (dostępny przez WWW) do edycji obserwowanych kanałów na YouTube. Obserwowanie polega na tym, że jeśli pojawi się nowy film na kanale to wysyłana ma być informacja poprzez komunikator Signal (specjalnie, bo Signal nie ma API, trzeba wywoływać polecenie w konsoli). Powstały kod wzbogacony został o Dockerfile (razem z pobraniem odpowiedniej wersji Signala oraz potrzebnej mu Javy) i deployment na Kubernetesa. Kiedy wiemy co robimy i czego oczekujemy oraz potrafimy wyłapać błędy - na pewno ułatwia to pracę. I jeszcze jedno: zapytania pisałem po polsku (w ramach eksperymentu) i zostałem w pełni zrozumiany, chociaż odpowiedzi były po angielsku. Wynik działania &lt;a href="https://bolt.new/~/sb1-om42lv"&gt;tutaj&lt;/a&gt; &lt;em&gt;(mam nadzieję, że link zadziała)&lt;/em&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-28</title><link>https://blog.prokulski.science/2024/10/28/newsletter-dane-i-analizy-2024-10-28/</link><pubDate>Mon, 28 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/28/newsletter-dane-i-analizy-2024-10-28/</guid><description>&lt;p&gt;Jeden z tekstów, które znajdziecie poniżej mówi o tym, jak pobrać z YouTube wideo, wyciągnąć z niego dźwięk, a potem ten dźwięk przekształcić w zapis tekstowy (taki do czytania). Potem i tak nikt tego nie czyta&amp;hellip;&lt;/p&gt;&#10;&lt;p&gt;Niektórzy może czytają. A jeśli wolą jednak oglądać albo słuchać - dzisiaj przed Wami zapisy wideo z dwóch konferencji. Jedna to &amp;ldquo;Oh My Hack&amp;rdquo; odbywająca się w Polsce i skupiająca się na zagadnieniach związanych z bezpieczeństwem. Nagrania pochodzą z edycji, która miała miejsce w 2023 roku. Druga konferencja to coś nowszego - amsterdamska edycja PyData, z tego roku.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-23</title><link>https://blog.prokulski.science/2024/09/23/newsletter-dane-i-analizy-2024-09-23/</link><pubDate>Mon, 23 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/23/newsletter-dane-i-analizy-2024-09-23/</guid><description>&lt;p&gt;Dzisiaj nieco później niż zwykle, nieco skromniej i bez zbędnego lania wody. Taki eksperyment.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.datadriveninvestor.com/50-handpicked-github-repositories-to-master-data-science-skills-pro-recommended-8231c661e731"&gt;&lt;strong&gt;50 Handpicked GitHub Repositories to Master Data Science Skills&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Najlepszym sposobem na naukę jest praktyka. Własna - pisanie kodu, albo cudza - czytanie kodu. Aby ułatwić to drugie - zbiór materiałów.&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://itnext.io/feature-engineering-in-xgboost-a-practical-guide-7fbafa7dbdbd"&gt;&lt;strong&gt;Feature Engineering in XGBoost&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Więcej tutaj operacji na danych w Pandasie niż samego XGBoosta, ale o inżynierii cech nigdy za wiele.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/football-and-geometry-passing-networks-6e201ceff6ef"&gt;&lt;strong&gt;Football and Geometry&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Wprowadzenie do grafów na podstawie siatki podań piłkarzy podczas meczy.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-08-19</title><link>https://blog.prokulski.science/2024/08/19/newsletter-dane-i-analizy-2024-08-19/</link><pubDate>Mon, 19 Aug 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/08/19/newsletter-dane-i-analizy-2024-08-19/</guid><description>&lt;p&gt;Dzisiaj sporo materiałów z ulubionej chyba działki redaktora naczelnego, czyli coś o data engineeringu (najlepiej opakowanym w Pythona). Mamy więc bardzo fajny tekst o tym jak śledzić autobusy szkolne - w wielu polskich miastach pojazdy komunikacji miejskiej wyposażona są w nadajniki GPS, co pozwala na śledzenie ich w czasie rzeczywistym (warszawskie dane są dostępne na przykład &lt;a href="https://api.um.warszawa.pl/files/9fae6f84-4c81-476e-8450-6755c8451ccf.pdf"&gt;tutaj&lt;/a&gt; (link do dokumentacji w PDF) czy też ogólnie na &lt;a href="https://api.um.warszawa.pl/"&gt;stronie WWW&lt;/a&gt;).&lt;/p&gt;&#10;&lt;p&gt;Nieco więcej niż zwykle dzisiaj o języku R - o tym jak z jego pomocą szybko przygotować atrakcyjne dashboardy &lt;em&gt;z kodu&lt;/em&gt; oraz o tym, że mamy odpowiednik &lt;strong&gt;tidyverse&lt;/strong&gt; dla prac z modelami machine learning.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-08-12</title><link>https://blog.prokulski.science/2024/08/12/newsletter-dane-i-analizy-2024-08-12/</link><pubDate>Mon, 12 Aug 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/08/12/newsletter-dane-i-analizy-2024-08-12/</guid><description>&lt;p&gt;Używacie &lt;strong&gt;Postmana&lt;/strong&gt; do współpracy z API? Na przykład do testowania własnych usług albo rozpoznawania cudzych? &lt;strong&gt;Poznajcie&lt;/strong&gt; &lt;a href="https://github.com/usebruno/bruno/blob/main/docs/readme/readme_pl.md"&gt;&lt;strong&gt;Bruno&lt;/strong&gt;&lt;/a&gt; - alternatywę, w 100% offline i open soruce. Bruno jest oddzielną aplikacją (okienkową i w CLI) oraz dodatkiem do VSCode. Zamiast czytać możecie też zobaczyć &lt;a href="https://www.youtube.com/watch?v=b_ctmKlEOXg"&gt;kilkunastominutowe demo&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;&amp;ldquo;Czego powinniśmy się spodziewać, a co jest tylko szumem medialnym? Jaka jest różnica między obietnicą tej technologii a praktyczną rzeczywistością?&amp;rdquo;. Najnowszy artykuł Stephanie Kirmer (&lt;a href="https://towardsdatascience.com/economics-of-generative-ai-75f550288097"&gt;&lt;strong&gt;Ekonomia generatywnej AI&lt;/strong&gt;&lt;/a&gt;) przedstawia bezpośrednie, bezkompromisowe spojrzenie na biznesowe przypadki produktów AI oraz zadaje pytanie, o to jaki jest model biznesowy dla generatywnej AI, biorąc pod uwagę to, co wiemy dzisiaj o technologii i rynku?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-29</title><link>https://blog.prokulski.science/2024/07/29/newsletter-dane-i-analizy-2024-07-29/</link><pubDate>Mon, 29 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/29/newsletter-dane-i-analizy-2024-07-29/</guid><description>&lt;p&gt;Po zakończonym turnieju piłkarskim czas na igrzyska olimpijskie. Tu przynajmniej Polacy mają większe szanse. Ale w dzisiejszym numerze newslettera znajdziecie coś o analizie (głównie jako przestawieniu wyników w graficznej formie) spotkań piłkarskich - rozkładzie &lt;em&gt;gorących miejsc&lt;/em&gt; czy siatce podań.&lt;/p&gt;&#10;&lt;p&gt;W sekcji związanej z wizualizacją danych jest też tekst, który ma na celu inspirację. Jak pokazać dane biznesowe? A może coś widać po ich pokazaniu (trendy, kierunki w których należy działać?)? Zobacz koniecznie!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-22</title><link>https://blog.prokulski.science/2024/07/22/newsletter-dane-i-analizy-2024-07-22/</link><pubDate>Mon, 22 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/22/newsletter-dane-i-analizy-2024-07-22/</guid><description>&lt;p&gt;Tomek zwrócił się do mnie z prośbą o przekazanie informacji o jego książce (e-booku). Otóż napisał ogromną ilość tekstu (ze 100 stron) na temat tego jak budować projekty data science w Pythonie. Jak układać pliki w folderach, jak zarządzać wymaganiami, jak zarządzać prerekwizytami typu dane czy też wynikowe wykresy, predykcje, modele. Jest też o automatycznym formatowaniu i sprawdzaniu kodu przy użyciu Ruff oraz dość sporo o notatnikach Jupytera. Normalnie książka coś kosztuje (30 zł), ale dla Was - do 5 sierpnia - jest za darmo, o &lt;a href="https://cart.easy.tools/checkout/19955710/smart-structuring?promo=DANEIANALIZY"&gt;&lt;strong&gt;tutaj&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-01</title><link>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</link><pubDate>Mon, 01 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</guid><description>&lt;p&gt;Razem z początkiem lipca zwykle w mediach rozpoczyna się sezon ogórkowy. Upały dają się we znaki, &lt;em&gt;żar leje się z nieba&lt;/em&gt; (pozdrawiamy fanów &amp;ldquo;Hydrozagadki&amp;rdquo; oraz Asa!), jedyne o czym chce się myśleć to schłodzone napoje i leżenie w basenie.&lt;/p&gt;&#10;&lt;p&gt;Ale mimo tych przeciwności losu przed Wami kolejna porcja wiedzy w postaci ręcznie wybranych najlepszych tekstów o AI i ML plus okolicach związanych z przetwarzaniem danych jakie przewinęły się przez cały tydzień w różnych mediach czy też innych newsletterach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-03</title><link>https://blog.prokulski.science/2024/06/03/newsletter-dane-i-analizy-2024-06-03/</link><pubDate>Mon, 03 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/03/newsletter-dane-i-analizy-2024-06-03/</guid><description>&lt;p&gt;Po dłuższym weekendzie mocny w AI numer newslettera przed Tobą. Numer, który pokrywa takie obszary AI jak obraz, tekst oraz dźwięk.&lt;br&gt;&#10;W ramach obrazu mamy tutorial PyTorcha, ale dodatkowo być może zainteresuje Cię informacja, że modele rozpoznawania obiektów na obrazach YOLO dotarły już do wersji 10 - &lt;a href="https://andlukyane.com//blog/paper-review-yolov10"&gt;tutaj review&lt;/a&gt; &lt;em&gt;pejpera&lt;/em&gt; z opisem YOLOv10, w treści też linki do wytrenowanych modeli i kodu wykorzystujących te modele.&lt;/p&gt;&#10;&lt;p&gt;Oprócz AI kilka wskazówek, które mogą przydać się przy wyborach SQL czy NoSQL albo FastAPI czy Flask. Do tego aż dwa teksty o modelowaniu struktury danych w bazie, w tym bardzo konkretny (i obszerny) tutorial o kalendarzach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-27</title><link>https://blog.prokulski.science/2024/05/27/newsletter-dane-i-analizy-2024-05-27/</link><pubDate>Mon, 27 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/27/newsletter-dane-i-analizy-2024-05-27/</guid><description>&lt;p&gt;Dzisiaj krótko, bo tydzień krótszy i &amp;ldquo;nie ma czasu załadować taczek&amp;rdquo;. Może tak lepiej?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@busariajibola2001/customer-segmentation-rfm-analysis-de72f7385bf3"&gt;&lt;strong&gt;Customer Segmentation&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza RFM (Recency, Frequency and Monetary) wykorzystana do segmentacji klientów. Bardziej opis niż zajęcia praktyczne, a praktyka podana w excelu&lt;/p&gt;&#10;&lt;h3 id="architektura"&gt;#architektura&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@vutrinh274/how-twitter-processes-4-billion-events-in-real-time-daily-942db8f7d7b5"&gt;&lt;strong&gt;How Twitter processes 4 billion events in real-time daily&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Od architektury Lambda do Kappa&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pathtosenior.substack.com/p/3-reasons-why-you-might-want-to-use?sd=pf"&gt;&lt;strong&gt;3 Reasons Why You Might Want to Use Monolith Instead of Microservice&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czyżby odwrót od podejścia mikroserwisowego? A może tylko kilka szczególnych przypadków?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-04-29</title><link>https://blog.prokulski.science/2024/04/29/newsletter-dane-i-analizy-2024-04-29/</link><pubDate>Mon, 29 Apr 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/04/29/newsletter-dane-i-analizy-2024-04-29/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2024/04/how-to-run-llama-3-locally/"&gt;&lt;strong&gt;How to Run Llama 3 Locally?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;W zeszłym tygodniu nie było nic o Llama 3, zatem dzisiaj instrukcja jak ten najnowszy model językowy od Facebooka uruchomić lokalnie.&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://nobledynamic.com/posts/fabric-madness-4/"&gt;&lt;strong&gt;Fabric Madness: Experiments&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Eksperymenty z MLFlow spięte z MS Fabric&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.openriskmanagement.com/representing-matrices-as-json-objects-part-1/"&gt;&lt;strong&gt;Representing Matrices as JSON Objects&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy macierz można zapisać w JSONie? Pierwszy z serii artykułów na temat kompromisów pomiędzy macierzami a tym formatem plików&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/public-transport-accessibility-in-python-dbdeee99f36f"&gt;&lt;strong&gt;Public Transport Accessibility in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza danych geograficznych w Pythonie - dostępność komunikacji miejskiej w Budapeszcie. Ale może to być dostępność do restauracji, aptek czy paczkomatów&amp;hellip;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-04-22</title><link>https://blog.prokulski.science/2024/04/22/newsletter-dane-i-analizy-2024-04-22/</link><pubDate>Mon, 22 Apr 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/04/22/newsletter-dane-i-analizy-2024-04-22/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/create-an-ai-driven-movie-quiz-with-gemini-llm-python-fastapi-pydantic-rag-and-more-e15322be4f66"&gt;&lt;strong&gt;Create an AI-Driven Movie Quiz!&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Ciekawy projekt, który tworzy quiz wiedzy na temat filmów. Dane o filmach zebrane są z internetowej bazy, przetworzone przez mechanizmy AI, a cała zabawa odbywa się z wykorzystaniem API. Tekst opisuje projekt, a sam kod dostępny jest na GitHubie&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://levelup.gitconnected.com/solid-principles-applied-to-data-science-a76e74d6e2c1"&gt;&lt;strong&gt;SOLID Principles Applied to Data Science&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak zbudować standardowy proces MLowy (wczytanie danych, preprocessing, uczenie modelu i finalna predykcja na nowych danych) w zgrabną architekturę spełniającą zasady SOLID?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-04-15</title><link>https://blog.prokulski.science/2024/04/15/newsletter-dane-i-analizy-2024-04-15/</link><pubDate>Mon, 15 Apr 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/04/15/newsletter-dane-i-analizy-2024-04-15/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/data-and-beyond/mastering-exploratory-data-analysis-eda-everything-you-need-to-know-7e3b48d63a95"&gt;&lt;strong&gt;Mastering Exploratory Data Analysis (EDA)&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Usystematyzowane podejście do analizy danych, której celem jest odkrycie istotnych dla przyszłych modeli cech. Za każdym razem robi się to podobnie, więc - warto znać zasady.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/improving-generalization-in-survival-models-bb7bc045bfc6"&gt;&lt;strong&gt;Improving Generalization in Survival Models&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza przeżycia jako sposób na predykcję odejść pracowników.&lt;/p&gt;&#10;&lt;h3 id="architektura"&gt;#architektura&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.youtube.com/watch?v=qcJASFx-F5g"&gt;&lt;strong&gt;So You Want to Build An Event Driven System?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak zbudować system sterowany zdarzeniami? Jakie są korzyści z przyjęcia tego stylu architektury, jakie są wyzwania i niektóre kompromisy? Nagranie z konferencji [YouTube, 52 minuty, po angielsku]&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-03-04</title><link>https://blog.prokulski.science/2024/03/04/newsletter-dane-i-analizy-2024-03-04/</link><pubDate>Mon, 04 Mar 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/03/04/newsletter-dane-i-analizy-2024-03-04/</guid><description>&lt;p&gt;W tym tygodniu cała masa materiału związanego z prezentacją danych - jak je pokazać efektywnie, czytelnie i przy okazji jak to się robi w kodzie? Czytaj po kolei, a to mięsko w ostatniej sekcji.&lt;/p&gt;&#10;&lt;p&gt;Ponieważ głównym założeniem tego newslettera jest dzielenie się wiedzą - dzisiaj również coś o rozwoju kariery. Jak z juniora zostać seniorem? I co to oznacza być seniorem (w oczach juniora, ale też w rzeczywistości).&lt;/p&gt;&#10;&lt;p&gt;Na koniec dzisiejszych polecajek: kilka tekstów o milionach. Milionach szybko generowanych PDFów, milionach requestów do API i milionach wierszy w plikach CSV. Jak to optymalizować, żeby się szybko działo?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-02-19</title><link>https://blog.prokulski.science/2024/02/19/newsletter-dane-i-analizy-2024-02-19/</link><pubDate>Mon, 19 Feb 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/02/19/newsletter-dane-i-analizy-2024-02-19/</guid><description>&lt;p&gt;Ubiegły tydzień to nowość w postaci &lt;a href="https://openai.com/sora"&gt;Sora od OpenAI&lt;/a&gt; - generowanie wideo z promptów tekstowych. OpenAI sporo &lt;a href="https://openai.com/research/video-generation-models-as-world-simulators"&gt;pisze&lt;/a&gt; o technikaliach na swoich stronach. Najbliższy tydzień-dwa ubiegnie pod znakiem Sory, a jak otworzą dostęp szerzej&amp;hellip; &lt;strong&gt;to się dopiero zacznie!&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;Oczywiście Google nie pozostaje w tyle i prezentuje swojego bliźniaka: Gemini, z którego można też &lt;a href="https://pub.towardsai.net/get-started-with-google-gemini-pro-using-python-in-5-minutes-00700244f58a"&gt;korzystać via API&lt;/a&gt; (gdyby było inaczej nie miałoby to sensu w dzisiejszych realiach) oraz starają się nie tracić kroku na polu &lt;a href="https://lumiere-video.github.io/"&gt;text-to-video&lt;/a&gt; ze swoim Lumiere.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-22</title><link>https://blog.prokulski.science/2024/01/22/newsletter-dane-i-analizy-2024-01-22/</link><pubDate>Mon, 22 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/22/newsletter-dane-i-analizy-2024-01-22/</guid><description>&lt;p&gt;YOLO. Nie tylko &amp;ldquo;you only live once&amp;rdquo; ale - w kontekście ML/AI i computer vision - przede wszystkim modele do rozpoznawania obiektów na zdjęciach.&lt;br&gt;&#10;Doczekaliśmy się już kilku wersji algorytmu YOLO, każda kolejna jest szybsza, sprawniejsza, rozpoznająca więcej i lepiej. Na to właśnie idzie klikanie w światła drogowe albo autobusy w obrazkowych captcha ;-)&lt;br&gt;&#10;Więcej o kolejnych wersjach YOLO i ich architekturach dowiesz się z &lt;a href="https://learnopencv.com/mastering-all-yolo-models/"&gt;&lt;strong&gt;tekstu&lt;/strong&gt;&lt;/a&gt;, w którym dodatkowo znajdziesz linki do tego jak trenować i używać tych modeli.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-18</title><link>https://blog.prokulski.science/2023/12/18/newsletter-dane-i-analizy-2023-12-18/</link><pubDate>Mon, 18 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/18/newsletter-dane-i-analizy-2023-12-18/</guid><description>&lt;p&gt;Witam w najprawdopodobniej ostatnim numerze newslettera w tym roku. W przyszłym tygodniu mamy Boże Narodzenie, w kolejnym Nowy Rok - to raczej nie są momenty na przygotowywanie paczki artykułów o ML czy programowaniu ogólnie, raczej czas który lepiej poświęcić rodzinie, najbliższym albo najzwyczajniej odpoczynkowi od komputera.&lt;/p&gt;&#10;&lt;p&gt;Korzystając więc z okazji że &amp;ldquo;czytamy się&amp;rdquo; ostatni raz w tym roku chciałbym Wam życzyć tego co najlepsze, a przede wszystkim spokoju i odpoczynku. A już od stycznia - nowych projektów, nowej wiedzy, zdobywania kolejnych umiejętności.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-30</title><link>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</link><pubDate>Mon, 30 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</guid><description>&lt;p&gt;Dzisiaj trochę o mapkach, trochę o diagramach (takie &lt;em&gt;diagram as a code&lt;/em&gt; tylko dlaczego &lt;a href="https://jira.atlassian.com/browse/BCLOUD-18559"&gt;BitBucket nie potrafi wyświetlić Mermaid&lt;/a&gt; (ticket w Atlassianie jest &amp;ldquo;solved&amp;rdquo;! Ale zobaczcie jak ;-), a GitHub robi to z palcem&amp;hellip; to znaczy bez problemu?), a do tego sporo materiału video. Chyba też więcej niż zwykle treści po polsku (polecamy tekst Tomka Zielińskiego o &lt;em&gt;transportowaniu danych&lt;/em&gt; - może się przydać na spotkania rekrutacyjne, ja lubię zadawać analogiczne pytania).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-09</title><link>https://blog.prokulski.science/2023/10/09/newsletter-dane-i-analizy-2023-10-09/</link><pubDate>Mon, 09 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/09/newsletter-dane-i-analizy-2023-10-09/</guid><description>&lt;p&gt;Dzisiaj w likach znajdziecie ponad pięciogodzinny kurs VSCode (ale nie trzeba oglądać całego - wystarczy z niego wyjąć około 30-45 minut żeby mieć tak zwany komplecik w obrębie swoich zainteresowań). Dodatkowo polecam kurs użycia Postmana - chyba najlepszego narzędzia do współpracy z już gotowym API. Też nie trzeba oglądać całości (tym bardziej że całość to ponad 4 godziny), ale może coś ciekawego znajdziecie? Kurs &lt;a href="https://www.youtube.com/watch?v=zp5Jh2FIpF0"&gt;na YouTube&lt;/a&gt; a kanał &lt;a href="https://www.youtube.com/@freecodecamp"&gt;freeCodeCamp&lt;/a&gt; gorąco polecam! Do newstlettara trafia to co nowe, a masa tam dobrego sprzed lat.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-11</title><link>https://blog.prokulski.science/2023/09/11/newsletter-dane-i-analizy-2023-09-11/</link><pubDate>Mon, 11 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/11/newsletter-dane-i-analizy-2023-09-11/</guid><description>&lt;p&gt;Dzisiaj sporo materiałów wideo. Od prostych przewodników po kilkanaście minut (z czego &amp;ldquo;mięso&amp;rdquo; zajmuje do 5-10, a i to najwyżej) do dużego kursu na półtorej godziny. Trochę też o budowaniu czy może raczej ulepszaniu swojego środowiska pracy. Czy to w Linuxie czy to w VSCode. Ciekawostka, szok i niedowierzanie: oba te &amp;ldquo;zakresy tematyczne&amp;rdquo; (poprawa wygody pracy i wideo) mają części wspólne!&lt;/p&gt;&#10;&lt;p&gt;Dla tych którzy wierzą w &lt;a href="https://pl.wikipedia.org/wiki/Smugi_chemiczne"&gt;chemtrails&lt;/a&gt; też coś mamy ;-) a z całego tekstu, który znajdziecie niżej najlepszy i tak zawsze jest gotowy &lt;a href="https://www.kaggle.com/code/mnokno/getting-started-eda-model-train-submit"&gt;notebook z kodem&lt;/a&gt; (znowu Torch a nie TensorFlow - coś jest na rzeczy, prawda?)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-04</title><link>https://blog.prokulski.science/2023/09/04/newsletter-dane-i-analizy-2023-09-04/</link><pubDate>Mon, 04 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/04/newsletter-dane-i-analizy-2023-09-04/</guid><description>&lt;p&gt;Wiecie co jest największym problemem dla analityka danych w dużej organizacji? Jest ich kilka, ale podzielić można je na kilka obszarów:&lt;br&gt;&#10;znajdowanie danych zrozumienie danych uzyskanie dostępu do danych&lt;/p&gt;&#10;&lt;p&gt;Przeczytacie o tym w &lt;a href="https://towardsdatascience.com/5-common-data-governance-pain-points-for-analysts-data-scientists-8efe8a007ac2"&gt;5 Common Data Governance Pain Points for Analysts &amp;amp; Data Scientists&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;I jeszcze na to dochodzi podejście do organizacji zespołów zajmującymi się danymi. Centralnie? A może każdy osobno? O tym pisze SeattleDataGuy w &lt;a href="https://seattledataguy.substack.com/p/centralized-vs-decentralized-vs-federated"&gt;Centralized vs Decentralized vs Federated Data Teams&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-08-07</title><link>https://blog.prokulski.science/2023/08/07/newsletter-dane-i-analizy-2023-08-07/</link><pubDate>Mon, 07 Aug 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/08/07/newsletter-dane-i-analizy-2023-08-07/</guid><description>&lt;p&gt;Jakie bazy danych są popularne? Które są używane, a których programiści chcieliby użyć w swoim kolejnym projekcie? Między innymi takie pytania zadano w ankiecie &lt;strong&gt;State of Databases 2023&lt;/strong&gt;, której podsumowanie właśnie &lt;a href="https://stateofdb.com/databases"&gt;opublikowano&lt;/a&gt;. Takie ankiety są obrazem rynku - warto śledzić trendy, bo można z nich wywnioskować jakich narzędzi używają inni, w jakie warto inwestować (aby znaleźć pracowników albo pracę). Czy wyniki takich ankiet odpowiadają na pytanie &lt;em&gt;Która technologia jest najlepsza?&lt;/em&gt; - zdecydujcie sami.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-17</title><link>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</link><pubDate>Mon, 17 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</guid><description>&lt;p&gt;Gorąco polecam tekst &lt;a href="https://towardsdev.com/data-engineering-project-imdb-movie-analysis-3f79de2f4ce7"&gt;Data Engineering Project: IMDB Movie Analysis&lt;/a&gt; - przykład świetnego projektu pozyskiwania i przetwarzania danych.&lt;/p&gt;&#10;&lt;p&gt;A kiedy dane są już przetworzone - można je pokazać. Wspomniany tekst analizujący dane z IMDB też zawiera ten element, ale dzisiejsze wydanie pokazuje więcej takich przykładów czy też tutoriali. Mamy coś o rysowaniu wykresów (super jest &lt;a href="https://towardsdatascience.com/plotly-and-pandas-combining-forces-for-effective-data-visualization-2e2caad52de9"&gt;Plotly and Pandas: Combining Forces for Effective Data Visualization&lt;/a&gt;) ale też &lt;a href="https://nightingaledvs.com/data-journalism-colour-accessibility/"&gt;o kolorach i ich doborze&lt;/a&gt; do wykresów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://python.plainenglish.io/the-complete-guide-to-keras-loss-functions-776d319e729d"&gt;&lt;strong&gt;The Complete Guide to Keras Loss Functions&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy model uczy się tak, aby dopasować się do metryki, która weryfikuje czy działa on dobrze czy źle. Trzeba więc wiedzieć jak te metryki działają, aby osiągnąć to, czego chcemy. Tutaj znajdziesz informacje o metrykach dostępnych w TF&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-26</title><link>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</link><pubDate>Mon, 26 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</guid><description>&lt;p&gt;Rozpoczynamy pierwszy tydzień wakacji, ale to wcale nie oznacza, że newsletter ma urlop. Wręcz przeciwnie.&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym wydaniu kilka tekstów opisujących dobre praktyki i całe cykle tutorialowe: CRUD-woe API dla MongoDB czy też asynchroniczne mikroserwisy spięte Rabbitem. To dla tych średniozaawansowanych programistów (i tych, którzy chcą swoją wiedzę przenieść z poziomu juniorskiego na wyższy). Dla tych bardziej juniorów - korepetycje z Window Functions w SQLu i &amp;ldquo;rozpakowywujących&amp;rdquo; gwiazdek w Pythonie (mimo że to nie Gwiazdka, he he, zacny suchar).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-01</title><link>https://blog.prokulski.science/2023/05/01/newsletter-dane-i-analizy-2023-05-01/</link><pubDate>Mon, 01 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/01/newsletter-dane-i-analizy-2023-05-01/</guid><description>&lt;p&gt;Jak mówi Google &lt;em&gt;sesja główna matury 2023 rozpocznie się już 4 maja&lt;/em&gt; - zatem już w tym tygodniu.&lt;/p&gt;&#10;&lt;p&gt;Nie wiem ilu czytelników jest przed maturą (z przeprowadzonych dawno temu ankiet wynika, że bardziej jesteście na studiach lub zaraz je kończycie), ale jeśli ktoś zdaje w tym roku to życzę wszystkiego najlepszego.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zaś jesteście rzeczywiście pod koniec studiów to zapewne za węgłem czai się poszukiwanie pracy. Z tego okazji dzisiaj dwa teksty, które w obrębie tematyki tego newslettera krążą, a mogą pomóc przy szukaniu pracy. Może bardziej na rozmowie rekrutacyjnej. Pierwszy z nich to &lt;em&gt;&amp;ldquo;Machine Learning System Design Interview Cheat Sheet&amp;rdquo;&lt;/em&gt; zawierający dobrą listę pytań dla projektujących systemy ML (to jest cykl, konkretnie druga część, a inne znajdziecie pod kolejnymi linkami: &lt;a href="https://medium.com/analytics-vidhya/machine-learning-system-design-interview-cheat-sheet-part-1-bc3bc74eb16e"&gt;pierwsza&lt;/a&gt;, &lt;a href="https://medium.com/analytics-vidhya/machine-learning-system-design-interview-cheat-sheet-part-3-7c978577144e"&gt;trzecia&lt;/a&gt;, &lt;a href="https://medium.com/analytics-vidhya/machine-learning-system-design-interview-cheat-sheet-llms-part-4-90753072682b"&gt;czwarta&lt;/a&gt;), zaś &lt;em&gt;&amp;ldquo;30 Common CI/CD Interview Questions (with Answers)&amp;rdquo;&lt;/em&gt; skierowane jest bardziej do tych, którzy wolą wdrażać i utrzymywać oprogramowanie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-04-17</title><link>https://blog.prokulski.science/2023/04/10/newsletter-dane-i-analizy-2023-04-17/</link><pubDate>Mon, 10 Apr 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/04/10/newsletter-dane-i-analizy-2023-04-17/</guid><description>&lt;p&gt;&lt;a href="https://www.facebook.com/michal.jaskolski/posts/10159695720393003"&gt;&lt;strong&gt;Mój stary to fanatyk sztucznej inteligencji.&lt;/strong&gt;&lt;/a&gt;. Kto zna to zna, Michał przygotował (z użyciem AI) przeróbkę znanej copy-pasty Malcolma XD.&lt;br&gt;&#10;Ponieważ ChatGPT tak mocno rządzi w mediach ostatnio, dzisiaj specjalna sekcja na ten temat.&lt;/p&gt;&#10;&lt;p&gt;W tej dedykowanej sekcji przedstawiam więc kilka inspirujących tekstów, które pokazują drogę od tego w czym i jak ChatGPT może pomóc, do konkretnych rozwiązań zastępujących na przykład StackOverflow, aby na koniec pokazać jak wykorzystać API przygotowane przez OpenAI z poziomu kodu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-13</title><link>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</link><pubDate>Mon, 13 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</guid><description>&lt;p&gt;Wielokrotnie na łamach niniejszego newslettera poruszane były tematy związane z Apache Kafka. A to podejście architektoniczne z grubsza mówiące dlaczego Kafka jest fajna i przydatna, a to podejście developerskie - o tym jak wysyłać i konsumować wiadomości z Kafki. Często też trafiają się bardziej zaawansowane przykłady - traktujące Kafkę jako bazę danych (z ktable czy ksql), czasem uzupełnione o Spark Streaming czy inne dodatkowe narzędzia typu Trino.&lt;/p&gt;&#10;&lt;p&gt;Ale najczęściej chyba Kafka wykorzystywana jest do przesyłania komunikatów w podejściu &lt;em&gt;publish &amp;amp; subscribe&lt;/em&gt;. Są jednak przecież inne rozwiązania kolejkowe - Rabbit, czy na przykład MQTT popularne w rozwiązaniach Internet of Things. &lt;a href="https://emqx.medium.com/mqtt-and-kafka-f20d79d9dea4"&gt;Przeczytajcie o podobieństwach i różnicach Kafki z MQTT&lt;/a&gt; (tekst &lt;a href="https://medium.com/techieahead/kafka-vs-rabbitmq-comparison-61d7a7b425d7"&gt;Kafka vs Rabbit&lt;/a&gt; też oczywiście jest).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-27</title><link>https://blog.prokulski.science/2023/02/27/newsletter-dane-i-analizy-2023-02-27/</link><pubDate>Mon, 27 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/27/newsletter-dane-i-analizy-2023-02-27/</guid><description>&lt;p&gt;W dzisiejszym wydaniu najwięcej miejsca poświęcam wizualizacji danych i okolicach.&lt;/p&gt;&#10;&lt;p&gt;Kalibracja obrazu jest okolicą (bardzo odległą - w sumie oba tematy łączy tylko to, że mamy do czynienia z obrazem), jest też więc coś o tym. Kalibracja jest potrzebna przy problemach natury &lt;em&gt;computer vision&lt;/em&gt;, a takowy - w postaci maskowania obiektów na obrazie - też dzisiaj poruszamy.&lt;/p&gt;&#10;&lt;p&gt;W poprzednim tygodniu dużym powodzeniem cieszył się tekst o MLOps (jeśli boisz się, że umknęło - zerknij do &lt;a href="../../category/newsletter/"&gt;archiwum&lt;/a&gt;), więc dzisiaj kontynuacja, niejako na fali z poprzedniego tygodnia.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-02</title><link>https://blog.prokulski.science/2023/01/02/newsletter-dane-i-analizy-2023-01-02/</link><pubDate>Mon, 02 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/02/newsletter-dane-i-analizy-2023-01-02/</guid><description>&lt;p&gt;Witaj w pierwszym numerze newslettera &amp;ldquo;Dane i Analizy&amp;rdquo; w nowym roku! Mam nadzieję, że spędziłeś święta w miłym towarzystwie i jesteś gotowy na kolejne wyzwania w pracy. Albo spędziłaś i jesteś gotowa :)&lt;/p&gt;&#10;&lt;p&gt;W tym numerze polecam trzy artykuły, które mogą być pomocne w rozwoju Twoich umiejętności: &amp;ldquo;The Art of Writing Amazing REST APIs&amp;rdquo; to kompendium wiedzy dla tych, którzy chcą nauczyć się tworzyć skalowalne i łatwe w użyciu interfejsy sieciowe &amp;ldquo;Simple Parquet Tutorial and Best Practices&amp;rdquo; to zestaw porad dla tych, którzy chcą rozszerzyć swoje umiejętności związane z przetwarzaniem danych w formacie parquet &amp;ldquo;A Real-Time Streaming Project with Smartphone Data&amp;rdquo; to przewodnik po najlepszych praktykach związanych z przetwarzaniem danych z telefonów komórkowych w czasie rzeczywistym.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-27</title><link>https://blog.prokulski.science/2022/12/27/newsletter-dane-i-analizy-2022-12-27/</link><pubDate>Tue, 27 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/27/newsletter-dane-i-analizy-2022-12-27/</guid><description>&lt;p&gt;Święta, święta i po świętach. Nawet newsletter opóźniony specjalnie o jeden dzień, żebyście mogli w pełni od komputerów odpocząć :)&lt;/p&gt;&#10;&lt;p&gt;W ostatnim w 2022 roku numerze trochę mniej tekstów, ale to nie znaczy że są one słabszej jakości. Spora część dzisiejszego tortu to technologie big data, ale jest też coś o Pythonie i kilka ciekawostek ogólnych.&lt;/p&gt;&#10;&lt;p&gt;Najbardziej chyba polecam zestawienie w zmianie liczby ludności w i wokół polskich miast - książkowe wręcz przykłady suburbanizacji. Dobre jest też wyjaśnienie algorytmów boostingowych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-05</title><link>https://blog.prokulski.science/2022/12/05/newsletter-dane-i-analizy-2022-12-05/</link><pubDate>Mon, 05 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/05/newsletter-dane-i-analizy-2022-12-05/</guid><description>&lt;p&gt;Jak wygląda Mundial na Twitterze?&lt;/p&gt;&#10;&lt;p&gt;W kilka dni i właściwie w trzy osoby przygotowaliśmy dashboard pozwalający monitorować co się dzieje podczas meczów na Mundialu. Gdzie to zobaczyć? Na &lt;a href="https://mundial.achaja.org/"&gt;mundial.achaja.org&lt;/a&gt; (login: &lt;em&gt;robercik&lt;/em&gt;, hasło: &lt;em&gt;nicsieniestalo&lt;/em&gt;).&lt;br&gt;&#10;&lt;strong&gt;A jak to wszystko działa?&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;Skrypt w Pythonie zbiera dane z Twittera&lt;/p&gt;&#10;&lt;p&gt;API Twittera pozwala na podpięcie się pod strumień (dane same spływają, w czasie rzeczywistym, chociaż przy natłoku komunikatów zdarza się nawet 5-minutowy lag) którym przychodzą nowe obiekty - tweety taki &lt;em&gt;obiekt&lt;/em&gt; zawiera treść, tagi, informacje o tym w jakim języku napisany został tekst zbieramy więc te wszystkie twitty dla meczu po hashtagu, np. dla meczu Francja-Polska #FRAPOL oraz #POLFRA dodatkowo zbieramy tweety dla hashtagów ogólnych: #WorldCup #WorldCup2022 #FIFAWorldCup #QatarWorldCup2022 #Qatar2022&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-11-28</title><link>https://blog.prokulski.science/2022/11/28/newsletter-dane-i-analizy-2022-11-28/</link><pubDate>Mon, 28 Nov 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/11/28/newsletter-dane-i-analizy-2022-11-28/</guid><description>&lt;p&gt;Czarny Piątek co prawda za nami, ale wietrzenie magazynów bardzo się przyda. Tym bardziej, że w ankiecie sprzed bodaj dwóch tygodni przyznaliście, że więcej polecanych tekstów w jednym numerze jesteście w stanie przełknąć. Zatem wietrzymy i mamy więcej niż zwykle.&lt;/p&gt;&#10;&lt;p&gt;Ostatnio pokazywałem &lt;a href="https://prokulski.science/temp/static/nlt/mundial2022.jpeg"&gt;potencjalną drabinkę Mundialu&lt;/a&gt;, która już być może nieco nieaktualna, prawda? Od początku całej imprezy wpadają jednak &lt;em&gt;do wora&lt;/em&gt; dane z Twittera i między innymi &lt;a href="https://www.facebook.com/DaneAnalizy/posts/807311953943124"&gt;na fanpage&amp;rsquo;u pokazywałem&lt;/a&gt; przykładowe wykresy. Projekt jest dość prosty w przygotowaniu, jak znajdę czas to (mam nadzieję) w tym tygodniu opiszę z grubsza założenia.&lt;br&gt;&#10;Okazuje się, że &lt;strong&gt;big data&lt;/strong&gt; można robić w kilka dni. Mam w tym doświadczenie, może to &amp;ldquo;robi robotę&amp;rdquo;?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-24</title><link>https://blog.prokulski.science/2022/10/24/newsletter-dane-i-analizy-2022-10-24/</link><pubDate>Mon, 24 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/24/newsletter-dane-i-analizy-2022-10-24/</guid><description>&lt;p&gt;Dzisiejsze wydanie newslettera skupia się na szeregach czasowych. Szeregiem czasowym jest pewnie jakieś 60% danych, na pewno wszystkie zmieniające się w czasie. Tak więc liczba klientów w sklepie (albo stronie internetowej), wynik pomiarów z jakiegoś czujnika (temperatura) itd itp - wszystko to układa się w szeregi czasowe.&lt;/p&gt;&#10;&lt;p&gt;A takie szeregi pozwalają na przewidywanie przyszłości. Czasem jest to łatwe, czasem trudne (giełda to też w zasadzie szereg czasowy, a przewidywanie nie jest takie oczywiste). I trochę o tym dzisiaj.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-26</title><link>https://blog.prokulski.science/2022/09/26/newsletter-dane-i-analizy-2022-09-26/</link><pubDate>Mon, 26 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/26/newsletter-dane-i-analizy-2022-09-26/</guid><description>&lt;p&gt;Wracamy do rysowania wykresów, pobierania danych ze stron internetowych oraz robienia dashboardów (i raportów w Wordzie). To dzisiejsze główne punkty zainteresowań. Ale dla fanów rozwiązań big data też coś się znajdzie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://blog.platypush.tech/article/Automate-your-music-collection"&gt;&lt;strong&gt;Automate your music collection&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Znudziły Ci się playlisty Spofity? Ciągle słuchasz &amp;ldquo;ulubionych&amp;rdquo;? Być może Ci to odpowiada. Ale jeśli lubisz odkrywać nową muzykę to możesz czuć się jak w bańce. Albo wykorzystać historię odtwarzanych utworów oraz API serwisu Last.fm żeby poznać coś nowego&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-05</title><link>https://blog.prokulski.science/2022/09/05/newsletter-dane-i-analizy-2022-09-05/</link><pubDate>Mon, 05 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/05/newsletter-dane-i-analizy-2022-09-05/</guid><description>&lt;p&gt;Pod logiem Fundacji Apache aż roi się od projektów, a świat big data to pewnie w 90-95% Apache COŚ. Znamy Kafkę, znamy Apache Spark, Apache Hadoop. Dzisiaj przedstawiamy (w dziale BigData) kilkoro innych członków rodziny.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zaś mamy dużo mapek do wyświetlenia naszym klientom na stronie (bo na przykład monitorujemy każdy wypożyczony rower, hulajnogę czy samochód i mamy miliony wejść na stronę dziennie) to w dziale DevOps coś o rozwiązaniu open soruce, które może zmniejszyć nasze koszty.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-29</title><link>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</link><pubDate>Mon, 29 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</guid><description>&lt;p&gt;Uważni czytelnicy fanpage&amp;rsquo;a &lt;a href="https://fb.com/daneanalizy"&gt;Dane i Analizy&lt;/a&gt; już zapewne przeczytali mój nowy post o analizie tras rowerowych (heatmapa w nim prezentowana już nieaktualna), ale jeśli kogoś ominęło to &lt;a href="../../2022/08/22/strava-in-python/"&gt;&lt;strong&gt;zapraszam&lt;/strong&gt;&lt;/a&gt;. Pokazuję w nim:&lt;br&gt;&#10;jak przeczytać plik XML jak agregować dwuwymiarowe dane w NumPy jak agregować je w Pandas jak przygotować mapkę w Folium&lt;/p&gt;&#10;&lt;p&gt;A jak już tamten tekst znasz to dzisiaj też niemało do wyboru. Zapraszam do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://stackify.com/flask-vs-django-which-python-framework-is-better-for-machine-learning-apps/"&gt;&lt;strong&gt;Which Python Framework is Better for Machine Learning Apps?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Mamy jakiś nasz cudowny model, daje świetne wyniki, ale predykcje można dostać tylko uruchamiając skrypt z konsoli albo jeszcze gorzej w Jupyter Notebooku. Co zrobić, żeby było to użytecznie online&amp;rsquo;owe narzędzie? Opakować w API.&#10;Ale który pythonowy framework wybrać?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-22</title><link>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</link><pubDate>Mon, 22 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</guid><description>&lt;p&gt;Czy mniejsza liczba artykułów (nie wiem czy to zauważalne&amp;hellip;) to dla Was lepiej czy gorzej? Przeczytacie w związku z tym więcej (wszystkie?) czy tak samo jak zwykle 2-3, a reszta to nuda?&lt;/p&gt;&#10;&lt;p&gt;Dzisiejszy numer to nieco eksperyment ale - przyznajmy to szczerze - wynik sezonu wakacyjnego. Oj ciężko się zebrać do roboty, ciężko&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mlu-explain.github.io/"&gt;&lt;strong&gt;MLU-Explain&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działają lasy losowe? Co to jest krzywa ROC i AUC? Jeśli nie wiesz to ten serwis w przystępny, graficzny sposób pomoże to zrozumieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-13</title><link>https://blog.prokulski.science/2022/06/13/newsletter-dane-i-analizy-2022-06-13/</link><pubDate>Mon, 13 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/13/newsletter-dane-i-analizy-2022-06-13/</guid><description>&lt;p&gt;Jak być data scientistą w Pythonie?&lt;/p&gt;&#10;&lt;p&gt;import pandas as pd&lt;/p&gt;&#10;&lt;p&gt;i gotowe!&lt;/p&gt;&#10;&lt;p&gt;Żart oczywiście (taki familiadowy, ale kto boomerowi zabroni?), a o samym Pandasie polecam &lt;a href="https://youtu.be/t-8ZIWCRvP0"&gt;wystąpienie Jana Kantego Milczka z PyData w Bydgoszczy&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://eng.uber.com/ubers-real-time-document-check/"&gt;&lt;strong&gt;Uber’s Real-Time Document Check&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak Uber zrobił weryfikację na podstawie dokumentów typu dowód osobisty?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/intro-to-mlops-using-amazon-sagemaker-5a43b9161fa"&gt;&lt;strong&gt;Intro to MLOps Using Amazon SageMaker&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Co to MLOps i jak SageMaker pomaga? A chyba pomaga, skoro to najpopularniejsze tego typu narzędzie (tak przynajmniej wynika z case studies pokazywanych na konferencjach)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-23</title><link>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</link><pubDate>Mon, 23 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</guid><description>&lt;p&gt;Dzisiaj delikatnie więcej tematów bliższych &lt;em&gt;biznesowi&lt;/em&gt; niż IT - mierniki, jakość, zaangażowanie w pracę (to polecam każdemu). &lt;a href="https://prokulski.science"&gt;Dane i Analizy&lt;/a&gt; to też consulting tego typu rozwiązań - jeśli trzeba to zapraszam do kontaktu&lt;/p&gt;&#10;&lt;p&gt;Są też standardowo poradniki związane głównie z Pythonem i Big Data, ale znajdzie się też coś dla chcących zacząć poważniej pisać w Javie&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/greenlit-using-gpt-j-with-multi-task-learning-to-create-new-screenplays-54a2d04f761c"&gt;&lt;strong&gt;GreenLIT: Using GPT-J to Create Screenplays&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy sztuczna inteligencja może pisać scenariusze filmowe?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-xgboost-models-in-amazon-sagemaker-in-4-simple-steps-4eb3e104ee61"&gt;&lt;strong&gt;Train XGBoost Models in Amazon SageMaker in 4 Simple Steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak wykorzysać Amazon SageMaker do trenowania modeli w chmurze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-07</title><link>https://blog.prokulski.science/2022/03/07/newsletter-dane-i-analizy-2022-03-07/</link><pubDate>Mon, 07 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/07/newsletter-dane-i-analizy-2022-03-07/</guid><description>&lt;p&gt;Dzisiaj świetne teksty o feature selection czy projektowaniu i rozwijaniu API. O API to nawet komiks mamy :)&lt;/p&gt;&#10;&lt;p&gt;Przypominam też, że za chwilę (11 marca) startuje &lt;strong&gt;CuValley Hack&lt;/strong&gt; - hackathon, który organizowany jest przez #KGHM w ramach programu #DolinaMiedziowa.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cuvalley.com"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/cuvalley_900x500.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Uczestnicy skupią się na analizie danych oraz wykorzystaniu AI/ML w układach automatyki przemysłowej. Co Was czeka?&lt;br&gt;&#10;3 zadania i 120 000 PLN do wygrania! 40h kodowania tysiące dostępnych danych webinary, Keynote Speakerzy i duża dawka wiedzy&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-28</title><link>https://blog.prokulski.science/2022/02/28/newsletter-dane-i-analizy-2022-02-28/</link><pubDate>Mon, 28 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/28/newsletter-dane-i-analizy-2022-02-28/</guid><description>&lt;p&gt;Po raz drugi Dane i Analizy są patronem medialnym &lt;strong&gt;CuValley Hack&lt;/strong&gt;. To też druga edycja tego hackathonu, który organizowany jest przez #KGHM w ramach programu #DolinaMiedziowa.&lt;/p&gt;&#10;&lt;p&gt;Impreza startuje &lt;strong&gt;11 marca&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cuvalley.com"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/cuvalley_900x500.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Hackathon zrzesza otwarte umysły i pomysłowych specjalistów, którzy chcą tworzyć innowacyjne projekty dla polskiej miedzi. Uczestnicy skupią się na analizie danych oraz wykorzystaniu #AI, #MachineLearning czy #BigData w układach automatyki przemysłowej. Co Was czeka?&lt;br&gt;&#10;3 zadania, w których do wygrania wysokie nagrody pieniężne 40 godzin kodowania i networking na kanale Slack tysiące dostępnych danych webinary, Keynote Speakerzy, porządna dawka wiedzy i inspiracji!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-14</title><link>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</link><pubDate>Mon, 14 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</guid><description>&lt;p&gt;Dzisiaj coś trudniejszego niż MNIST oraz ściągawka z algorytmów grupowania elementów (clustering). Do tego ciekawy projekt wizualizacji danych z meczów piłki nożnej.&lt;/p&gt;&#10;&lt;p&gt;A jeśli myślisz o projektowaniu systemów a nie tylko o samej analizie danych to wykład Sławka Sobótki o Domain Driven Design powinien Cię uradować.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-google-cloud-machine-learning-apis-programmatically-in-python-part-1-430f608af6a5"&gt;&lt;strong&gt;Using Google Cloud Machine Learning APIs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak korzystać z interfejsów machine learning API od Google w Pythonie? Część pierwsza cyklu&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-fastai-to-classify-japanese-kanji-characters-47d7edd4d569"&gt;&lt;strong&gt;Using FastAI to classify Japanese kanji characters&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie pisanych ręcznie cyfr - czyli zbiór MNIST - to może być zbyt prosty problem dla adeptów sztuki nauki o danych&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-31</title><link>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</link><pubDate>Mon, 31 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</guid><description>&lt;p&gt;Dzisiaj &lt;em&gt;odcinek&lt;/em&gt; dość pythonowy, ale za to z obszernym tekstem o tworzeniu modeli w R - cały proces opisany po kolei. Polecam!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.pinecone.io/learn/nlp/?utm_medium=link&amp;amp;utm_source=data-elixir&amp;amp;utm_campaign=sponsored"&gt;&lt;strong&gt;Natural Language Processing (NLP) for Semantic Search&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Duża pozycja, która wprowadza w świat NLP&lt;/p&gt;&#10;&lt;h3 id="ciekawostki"&gt;#ciekawostki&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://opendatascience.com/what-does-a-data-driven-government-look-like/"&gt;&lt;strong&gt;What Does a Data-Driven Government Look Like?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Teoretycznie więcej danych to lepsze decyzje. Czy zarządzanie maistem albo państwem jest możliwe w oparciu o dane? Jak może to wyglądać?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ai-geospatial-wildfire-risk-prediction-8c6b1d415eb4"&gt;&lt;strong&gt;AI Geospatial Wildfire Risk Prediction&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przewidywanie zdarzeń związanych z geografią - pogoda, pożary - ciekawe zagadanienie, a często pomijane przy np. poradnikach ML.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-03</title><link>https://blog.prokulski.science/2022/01/03/newsletter-dane-i-analizy-2022-01-03/</link><pubDate>Mon, 03 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/03/newsletter-dane-i-analizy-2022-01-03/</guid><description>&lt;p&gt;Dzisiaj kilka tematów &amp;ldquo;pokrytych&amp;rdquo; nie tylko jednym tekstem. Mamy więc coś o modelach BERT plus automatycznie tworzenie tekstów przez GPT-3, mamy wizualizacje danych na mapach (w R i Pythonie). Mamy też cykl, który pozwoli na napisanie bota do np. CS:GO.&lt;/p&gt;&#10;&lt;p&gt;Na blogu od dawna nie było nowego tekstu (stąd podlinkoway niżej tekst o GPT-3 ;), ale jakieś rzeczy robię i publikuję. Zwykle jest tak, że energia opada po przygotowaniu działającego kodu. Tak jest z serwowaniem obrazków przez API (przy okazji te obrazki się generują) - sami zobaczcie do &lt;a href="https://github.com/prokulski/image_api_threads"&gt;&lt;strong&gt;repozytorium&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-20</title><link>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</link><pubDate>Mon, 20 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</guid><description>&lt;p&gt;To ostatni numer newslettera&amp;hellip; przed Bożym Narodzeniem.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym przede wszystkim życzę Ci spokoju, spędzenia mile czasu z najbliższymi, odpoczynku (też od komputerów) i jeszcze raz pieniędzy.&lt;/p&gt;&#10;&lt;p&gt;Do życzeń dołączam pythonową choinkę:&lt;/p&gt;&#10;&lt;p&gt;def holidaybush(n):&lt;br&gt;&#10;    for i in range(n):&lt;br&gt;&#10;        print((&amp;quot;+&amp;quot; * (i * 2 + 1)).center(n * 2 - 1))&lt;br&gt;&#10;    print(&amp;quot;+++&amp;quot;.center(n * 2 - 1))&lt;/p&gt;&#10;&lt;p&gt;holidaybush(15)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://glassboxmedicine.com/2019/09/15/best-use-of-train-val-test-splits-with-tips-for-medical-data/"&gt;&lt;strong&gt;Best Use of Train/Val/Test Splits, with Tips for Medical Data&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Modele, uczenie, dane treningowe, testowe, walidacyjne&amp;hellip; ale właściwie dlaczego tak?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-22</title><link>https://blog.prokulski.science/2021/11/22/newsletter-dane-i-analizy-2021-11-22/</link><pubDate>Mon, 22 Nov 2021 11:25:39 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/22/newsletter-dane-i-analizy-2021-11-22/</guid><description>&lt;p&gt;Szczęśliwcy ;) mogli już zobaczyć jak wygląda newsletter w nowej szacie graficznej wczoraj. Testowanie na produkcji to podstawa, niech pierwszy rzuci kamieniem&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych"&gt;#analiza_danych&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.evanmiller.org/how-not-to-sort-by-average-rating.html"&gt;&lt;strong&gt;How Not To Sort By Average Rating&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dlaczego sortowanie opinii po &amp;ldquo;zwykłej&amp;rdquo; średniej jest złe i jak je poprawić.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://mydataschool.com/blog/extract-paypal-data-from-api/"&gt;&lt;strong&gt;Extract data from PayPal API&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Wyjmijmy dane z PayPala i wstawmy do jakiejś hurtowni typu BigQuery. A potem już można analizować.&lt;br&gt;&#10;Ciekawy projekt ETLowy.&lt;/p&gt;&#10;&lt;h3 id="ciekawostki"&gt;#ciekawostki&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://boonepeter.github.io/posts/2020-11-10-spotify-codes/"&gt;&lt;strong&gt;How do Spotify Codes work?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Utwory (albumy i wykonacwy też) na Spotify są oznaczeni takim małym kodem - można go zeskanować i przejść do odpowiedniej piosenki (lub albumy albo wykonawcy). Jak to działa?&lt;br&gt;&#10;Fajne jeśli interesuje Cię budowanie graficznych kodów.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-23</title><link>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</link><pubDate>Sat, 23 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</guid><description>&lt;p&gt;&lt;a href="https://preettheman.medium.com/best-front-end-python-frameworks-in-2021-643d1df6922c"&gt;&lt;strong&gt;Best front-end Python frameworks in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Welcome back! Python is an awesome programming language with a ton of capability, one of these functions is building GUI’s (front-ends), so let’s talk about some of my favorite front-ends frameworks for Python. Now, Python is an awesome language for web development as well, if you want to see some sample websites you can build with Python, check out this article below: Let’s take a look at some (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-11</title><link>https://blog.prokulski.science/2021/10/11/newsletter-dane-i-analizy-2021-10-11/</link><pubDate>Mon, 11 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/11/newsletter-dane-i-analizy-2021-10-11/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/top-5-time-series-analytics-71a46fbda379?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Top 5 Time Series Analytics&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Learn about the top use-cases and techniques for time-series data Time is present in most of the data around us. From retail product sales data to financial stock price, to IoT sensor data, all have a notion of time in it. So mastering time-series analytics is going to make you master of the data science world The top 5 analytics which I will demonstrate here are Seasonality Detection to find (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-20</title><link>https://blog.prokulski.science/2021/09/20/newsletter-dane-i-analizy-2021-09-20/</link><pubDate>Mon, 20 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/20/newsletter-dane-i-analizy-2021-09-20/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/vlookup-implementation-in-python-in-three-simple-steps-93b5a290fd72"&gt;&lt;strong&gt;VLOOKUP implementation in Python in three simple steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Oftentimes, in the field of data analytics, it’s the data cleaning and processing that takes the most amount of time and effort. While the steps such as data cleaning, filtering, and pre-processing are generally under-evaluated or overlooked as compared to more juicy components such as the model development, it’s the quality of data that determines the quality of output. As it is rightly said, (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-13</title><link>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</link><pubDate>Mon, 13 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/still-using-the-os-module-in-python-this-alternative-is-remarkably-better-7d728ce22fb7"&gt;&lt;strong&gt;Still Using the OS Module in Python? This Alternative is Remarkably Better&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Python’s OS module is a nightmare for managing files and folders. You should try Pathlib. File and folder management with Python’s os module is a nightmare. Yet, it’s an essential part of every data science workflow. Saving reports, reading configuration files, you name it — there’s no way around it. Picture this — you spend weeks building an API around your model, and it works flawlessly, at (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-06</title><link>https://blog.prokulski.science/2021/09/06/newsletter-dane-i-analizy-2021-09-06/</link><pubDate>Mon, 06 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/06/newsletter-dane-i-analizy-2021-09-06/</guid><description>&lt;p&gt;&lt;a href="https://flowingdata.com/2021/09/03/everything-more-from-home/"&gt;&lt;strong&gt;How Much More Time We Spent at Home&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;We had to do more from home. Here&amp;rsquo;s how much everything shifted by total minutes in a day. Tags: home , time use&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/image-processing-tool-a1b8fe66c957?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A Comprehensive Guide to Image Processing: Using an OpenCV Tool&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Image Processing Essentials An image processing tool with OpenCV, QT Creator, and C++ As the last part of this series on the Image Processing flow, I want to present a simple Image Processing Tool implemented using OpenCV 3.2.0 on QT Creator (5.12.10) with C++ to apply almost all the Image Processing operations discussed in the previous posts. To be able to use it, it’s enough to build OpenCV (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-19</title><link>https://blog.prokulski.science/2021/07/19/newsletter-dane-i-analizy-2021-07-19/</link><pubDate>Mon, 19 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/19/newsletter-dane-i-analizy-2021-07-19/</guid><description>&lt;p&gt;&lt;a href="https://techblog.ing.pl/blog/dobry-zly-i-brzydki-pare-slow-o-pandas-udf-w-apache-spark"&gt;&lt;strong&gt;Dobry, zły i brzydki – Parę słów o Pandas UDF w Apache Spark | Tech Blog ING Bank Śląski&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Spark to bardzo użyteczne narzędzie do pracy z Big Data. Niestety, czasem brakuje mu pewnych funkcjonalności. Na szczęście twórcy wyszli na przeciw oczekiwaniom użytkowników, dodając Pandas UDF, dzięki czemu zachowując elastyczność Pythona nie tracimy na wydajności. Zobaczmy więc, czym są i jak (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/geocoding-in-python-a-complete-guide-d68a4faafdc6?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Geocoding in Python: A Complete Guide&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A step-by-step tutorial on geocoding with Python Continue reading on Towards Data Science »&lt;/p&gt;</description></item><item><title>Ile czasu marnujemy na spotkaniach?</title><link>https://blog.prokulski.science/2021/05/28/ile-czasu-marnujemy-na-spotkaniach/</link><pubDate>Fri, 28 May 2021 15:50:04 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/28/ile-czasu-marnujemy-na-spotkaniach/</guid><description>&lt;p&gt;Jak z poziomu Pythona dostać się do zawartości Outlooka (poczta, kalendarz)?&lt;/p&gt;&#10;&lt;p&gt;W niedawnym tekście opisałem drogę do aktualnego miejsca i zajęcia w pracy. Pisałem (chyba tak, &lt;a href="../../2021/05/09/jak-zostac-analitykiem/"&gt;sprawdź!&lt;/a&gt;), że sporo czasu zajmują mi spotkania? Sprawdźmy!&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="../../downloads/2021/05/estee-janssens-zni0zgb3bkQ-unsplash-scaled.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Photo by &lt;a href="https://unsplash.com/@esteejanssens"&gt;Estée Janssens&lt;/a&gt; on &lt;a href="https://unsplash.com/s/photos/calendar"&gt;Unsplash&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Poprzednio nie było też kodu, a przecież kod jest najciekawszy.&lt;/p&gt;&#10;&lt;p&gt;Gdzieś po drodze miałem styczność z VBA, a niedawno odkryłem, że w sumie z narzędziami MS Office można postępować dość podobnie z poziomu Pythona jak z poziomu VBA. Dzisiaj więc trochę o narzędziach MS Office &lt;em&gt;dotykanych&lt;/em&gt; Pythonem.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-10</title><link>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</link><pubDate>Mon, 10 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</guid><description>&lt;p&gt;&lt;a href="https://blog.dataiku.com/how-to-perform-basic-ml-serving-with-python-docker-kubernetes"&gt;&lt;strong&gt;How to Perform Basic ML Serving With Python, Docker, and Kubernetes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial provides a basic, step-by-step example of real-time serving a machine learning (ML) model as a REST API with Python, Docker, and Kubernetes. We’ll build a basic REST API with Python, test it locally with Docker, and deploy our API with Kubernetes. By the way, if you want to go faster, (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.r-bloggers.com/2021/05/dockerizing-shiny-applications/"&gt;&lt;strong&gt;Dockerizing Shiny Applications&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Docker provides isolation to applications. Images are immutable. Running multiple instances of the same image can serve many users at the same time. All these general advantages of containerized applications apply to Shiny apps too. The post Dockerizing Shiny Applications first appeared on (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Jak trzymać konfigurację skryptów?</title><link>https://blog.prokulski.science/2021/03/29/pliki-konfiguracyjne-python-r/</link><pubDate>Mon, 29 Mar 2021 16:06:13 +0000</pubDate><guid>https://blog.prokulski.science/2021/03/29/pliki-konfiguracyjne-python-r/</guid><description>&lt;p&gt;Jak trzymać konfigurację skryptów? Żeby było bezpiecznie i wygodnie?&#10;Przy prostych zadaniach konfiguracyjne parametry można (ale &lt;strong&gt;nie należy!&lt;/strong&gt;) trzymać &lt;em&gt;inline&lt;/em&gt; w kodzie. Ale lepiej w zmiennych (właściwie stałych) zdefiniowanych na początku pliku (i odpowiednio nazwanych, żeby wiedzieć że to stałe związane z konfiguracją). A najlepiej - w pliku zewnętrznym (lub zmiennych systemowych, ale tym się dzisiaj nie zajmiemy).&#10;&lt;img src="../../downloads/2021/03/ferenc-almasi-HfFoo4d061A-unsplash.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Photo by &lt;a href="https://unsplash.com/@flowforfrank"&gt;Ferenc Almasi&lt;/a&gt; on &lt;a href="https://unsplash.com/photos/HfFoo4d061A"&gt;Unsplash&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt; &#10;Dlaczego w pliku zewnętrznym? Z co najmniej dwóch powodów:&lt;/p&gt;</description></item><item><title>Które API szybsze - w Pythonie czy w R?</title><link>https://blog.prokulski.science/2020/06/05/api-python-api-r/</link><pubDate>Fri, 05 Jun 2020 15:48:33 +0000</pubDate><guid>https://blog.prokulski.science/2020/06/05/api-python-api-r/</guid><description>&lt;p&gt;Wiele razy czytałem opinie, że Python jest szybszy a R nie nadaje się na produkcję. Ale to opinie nie potwierdzone badaniami. Tutaj pierwsze badania na ten temat!&lt;/p&gt;&#10;&lt;p&gt;Testom podlegać będzie API zbudowane w R z użyciem frameworków &lt;strong&gt;&lt;a href="https://www.rplumber.io/"&gt;Plumber&lt;/a&gt;&lt;/strong&gt; i &lt;strong&gt;&lt;a href="https://restrserve.org/"&gt;RestRserve&lt;/a&gt;&lt;/strong&gt; oraz w Pythonie z użyciem &lt;strong&gt;&lt;a href="https://palletsprojects.com/p/flask/"&gt;Flask&lt;/a&gt;&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;Biorąc pod uwagę analizę danych i na przykład wnioskowanie czy predykcje oparte o te dane zarówno R jak i Python dobrze się sprawdzają. Mam nadzieję, że niejednokrotnie w ramach tego bloga pokazałem, że R jest idealny do analizy danych. A o Pythonie w tym samym kontekście pisze się wszędzie (i pewnie tutaj będzie też coraz więcej). Zatem czy warto wybierać pomiędzy tymi rozwiązaniami przy wdrożeniu na produkcję?&lt;/p&gt;</description></item><item><title>(py)Spark, Hadoop i HDFS - podstawy</title><link>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</link><pubDate>Thu, 09 Apr 2020 19:06:13 +0000</pubDate><guid>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</guid><description>&lt;p&gt;Dzisiaj zajmiemy się wykorzystaniem Sparka i Hadoopa do przetwarzania większej ilości danych. Oraz do budowania prostego modelu (regresji liniowej). Może jeszcze nie jest to big data, ale mechanizmy są identyczne jak w przypadku większej liczby danych. Wystarczy tylko tych danych więcej zgromadzić, zbudować większe środowisko (dużo serwerów) i… też będzie działało.&lt;/p&gt;&#10;&lt;p&gt;A w dodatku poznamy pakiet &lt;em&gt;faker&lt;/em&gt; który pozwoli nam na wygenerowanie sztucznych danych.&lt;/p&gt;&#10;&lt;h3 id="spark-i-hadoop"&gt;Spark i Hadoop&lt;/h3&gt;&#10;&lt;p&gt;&lt;strong&gt;Apache Spark&lt;/strong&gt; to rozwijana na zasadach open source platforma klastrowego przetwarzania danych, która ma interfejsy API dla takich języków programowania jak Scala, Python, Java i R.&lt;/p&gt;</description></item><item><title>Muzyka i data science</title><link>https://blog.prokulski.science/2020/03/24/muzyka-i-data-science/</link><pubDate>Tue, 24 Mar 2020 17:11:08 +0000</pubDate><guid>https://blog.prokulski.science/2020/03/24/muzyka-i-data-science/</guid><description>&lt;p&gt;Każdego dnia pojawia się nowa muzyka, w wielu różnych gatunkach. Jak wybrać to, czemu warto poświęcić czas?&lt;/p&gt;&#10;&lt;p&gt;Dodatkowo dowiemy się jakie znaczenie ma uczciwe przygotowanie danych.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="../../downloads/2020/03/franck-v-U3sOwViXhkY-unsplash-scaled.jpg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Zdjęcie na &lt;em&gt;okładce&lt;/em&gt;: &lt;a href="https://unsplash.com/@franckinjapan"&gt;Franck V. on Unsplash&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Gdybym miał powiedzieć co lubię najbardziej bez wątpienia byłaby to muzyka. Słucham dużo, nie wyobrażam sobie życia w ciszy. Ale mimo dostępu do nieskończonych (powiedzmy) zasobów muzycznych chociażby poprzez Spotify zauważyłem, że zamykam się w bańce już znanych wykonawców i utworów. A ja lubię odkrywać nowe dźwięki, tylko nie mam czasu (trochę też zbyt na to jestem leniwy) na szukanie nieznanych utworów czy wykonawców. Po co mam poświęcać kupę czasu na szukanie czegoś co mi się nie spodoba?&lt;/p&gt;</description></item><item><title>(Inteligentne) Raporty na żądanie</title><link>https://blog.prokulski.science/2019/08/07/raporty-na-zadanie/</link><pubDate>Wed, 07 Aug 2019 20:17:22 +0000</pubDate><guid>https://blog.prokulski.science/2019/08/07/raporty-na-zadanie/</guid><description>&lt;p&gt;Dzisiaj przygotujemy narzędzia do automatycznego generowania raportów, które będzie (quasi) inteligentnie odpowiadać na pytania zadane przez email.&lt;/p&gt;&#10;&lt;p&gt;Czyli jak pozbyć się upierdliwej pracy (i zająć się czymś innym)&lt;/p&gt;&#10;&lt;p&gt;Uwaga: wraz z aktualizacją pakietu &lt;em&gt;gmailr&lt;/em&gt; do wersji 1.0 prezentowany poniżej kod związany z logowaniem do konta może nie działać. Przeczytaj proszę &lt;a href="https://github.com/r-lib/gmailr"&gt;informacje&lt;/a&gt; o tym jak to zmienić Kod na &lt;a href="https://github.com/prokulski/automatic_reports"&gt;GitHubie&lt;/a&gt; powinien być ok.&lt;/p&gt;&#10;&lt;p&gt;Problem z jakim można się często spotkać w korporacjach to wysyłanie tych samych raportów mailem. Wyobraźmy sobie taki scenariusz:&lt;/p&gt;</description></item><item><title>Model jako API (w R)</title><link>https://blog.prokulski.science/2019/07/17/model-jako-api/</link><pubDate>Wed, 17 Jul 2019 13:19:18 +0000</pubDate><guid>https://blog.prokulski.science/2019/07/17/model-jako-api/</guid><description>&lt;p&gt;Budujemy model w R. Daje nawet dobre wyniki. Ale jak go użyć produkcyjnie? Gdyby tak pytać o wynik korzystając z API?&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj o tym jak przygotować w R web-serwis, czyli narzędzie które zapytane (w odpowiedni sposób) przez internet zwróci nam jakiś wynik. W naszym przypadku odpowiedzią będzie wynik działania modelu.&lt;/p&gt;&#10;&lt;p&gt;Zadanie podzielimy na kilka etapów:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;przygotowanie modelu&lt;/li&gt;&#10;&lt;li&gt;przygotowanie funkcji, które będą używać naszego modelu&lt;/li&gt;&#10;&lt;li&gt;web-service korzystający z tych funkcji&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="przygotowanie-modelu"&gt;Przygotowanie modelu&lt;/h3&gt;&#10;&lt;p&gt;Na warsztat weźmiemy bardzo prosty przykład i prosty model. Będziemy przewidywać gatunek &lt;a href="https://pl.wikipedia.org/wiki/Kosaciec"&gt;irysa&lt;/a&gt; na podstawie rozmiarów płatka (&lt;em&gt;petal&lt;/em&gt;) i kielicha (&lt;em&gt;sepal&lt;/em&gt;) - czyli wykorzystamy popularny w uczeniu maszynowym zbiór &lt;strong&gt;iris&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Spark, czyli opóźnienia pociągów</title><link>https://blog.prokulski.science/2018/12/21/spark-czyli-opoznienia-pociagow/</link><pubDate>Fri, 21 Dec 2018 14:52:21 +0000</pubDate><guid>https://blog.prokulski.science/2018/12/21/spark-czyli-opoznienia-pociagow/</guid><description>&lt;p&gt;Czy polskie pociągi są punktualne? To pytanie, na które poszukamy odpowiedzi, ale jest ono tylko przyczynkiem do dzisiejszego wpisu.&lt;/p&gt;&#10;&lt;p&gt;Chciałbym pokazać dzisiaj sposób znalezienia odpowiedzi, nawet nie samą odpowiedź. Skąd wziąć dane? Jak sobie z nimi poradzić? Czym je uzupełnić?&lt;/p&gt;&#10;&lt;h3 id="pozyskanie-danych"&gt;Pozyskanie danych&lt;/h3&gt;&#10;&lt;p&gt;W pierwszym odruchu pomyślałem o stronach PKP i webscrappingu. Ale na Twitterze mojego bota &lt;a href="https://twitter.com/rstatspl"&gt;@rstatspl&lt;/a&gt; obserwuje inny bot - &lt;a href="https://twitter.com/OpPociagow"&gt;@OpPociagow&lt;/a&gt;, który prezentuje ciekawe dane. Skoro prezentuje to je ma. Skoro ma, to gdzieś są. Chwila rozmowy z twórcą i uzyskujemy adres &lt;a href="http://ipa.lovethosetrains.com/"&gt;InfoPasażer Archiver - archiwum opóźnień pociągów&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Facebook w R</title><link>https://blog.prokulski.science/2018/10/16/facebook-w-r/</link><pubDate>Tue, 16 Oct 2018 15:04:18 +0000</pubDate><guid>https://blog.prokulski.science/2018/10/16/facebook-w-r/</guid><description>&lt;p&gt;Kto uważany jest za gwiazdę rozrywki 100-lecia niepodległej Polski?&#10;Takie pytanie pojawiło się w poniedziałek 15 października na &lt;a href="https://www.facebook.com/Karolina-Korwin-Piotrowska-180340042008871/"&gt;fanpage’u Karoliny Korwin-Piotrowskiej&lt;/a&gt;. Pani Karolina poprosiła o wpisywanie nazwisk w komentarzach. Oczywiście obudził się we mnie umysł &lt;em&gt;pragmatyczny&lt;/em&gt; i zapytał (siebie): &lt;strong&gt;ciekawe jak ona to ręcznie sobie policzy?&lt;/strong&gt;. Ludzie przecież będą wpisywać nazwiska jak leci a nie w jakiejś uporządkowanej formie.&#10;Bo ankietę można zrobić tak jak ta &lt;strong&gt;&lt;a href="http://shiny.prokulski.science/regiony/"&gt;majonezowo-ketchupowa&lt;/a&gt;&lt;/strong&gt; do której wypełnienia serdecznie namawiam! Jak będzie dużo głosów to będzie sensowny wynik. I opowieść jak to wszystko zostało zbudowane. Zajmie Ci to góra dwie minuty.&#10;Nie po to człowiek siedzi w internecie i analizie danych, żeby z takim problemem sobie nie poradził. A że w R jest dostępny pakiet &lt;strong&gt;Rfacebook&lt;/strong&gt; to zadanie policzenia głosów jest banalnie proste.&#10;Poza &lt;em&gt;Rfacebook&lt;/em&gt; przyda nam się kilka innych pakietów (w sumie standard):&lt;/p&gt;</description></item><item><title>Google Analytics w R</title><link>https://blog.prokulski.science/2018/09/26/google-analytics-w-r/</link><pubDate>Wed, 26 Sep 2018 16:16:34 +0000</pubDate><guid>https://blog.prokulski.science/2018/09/26/google-analytics-w-r/</guid><description>&lt;p&gt;Google Analytics to chyba najpopularniejszy sposób mierzenia ruchu na stronach internetowych. Można bardzo dużo &lt;em&gt;wyklikać&lt;/em&gt; w panelu, ale może zaistnieć potrzeba pobrania danych statystycznych do analiz, których GA nie daje. Dzisiaj dowiesz się jak zrobić to w języku R.&#10;Jak większość zadań, tak samo i to ma pomocny pakiet. Jak można się podziewać pakiet nazywa się &lt;strong&gt;&lt;a href="https://github.com/Tatvic/RGoogleAnalytics"&gt;RGoogleAnalytics&lt;/a&gt;&lt;/strong&gt; i dostępny jest poprzez instalację z GitHuba:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;devtools&lt;span style="color:#0550ae"&gt;::&lt;/span&gt;&lt;span style="color:#6639ba"&gt;install_github&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;Tatvic/RGoogleAnalytics&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Załadujmy więc go do R (razem z innymi pakietami) i do dzieła:&lt;/p&gt;</description></item><item><title>Gdzie są sklepy, drogi czy cokolwiek innego?</title><link>https://blog.prokulski.science/2018/08/10/wykorzystanie-open-street-map-w-r/</link><pubDate>Fri, 10 Aug 2018 18:49:05 +0000</pubDate><guid>https://blog.prokulski.science/2018/08/10/wykorzystanie-open-street-map-w-r/</guid><description>&lt;p&gt;Zastanawialiście się skąd wziąć listę wszystkich miejsc danego typu - na przykład przedszkola w Warszawie - i narysować je na mapie? Jeśli tak, to z tego postu dowiesz się jak to zrobić. Wpis techniczny, żadna tam analiza. Ale są mapki!&#10;Macie świadomość, że istnieje coś takiego jak Wikipedia, prawda? Zbiór haseł uzupełniany przez ochotników. Istnieje coś podobnego dla map i nazywa się &lt;a href="https://wiki.openstreetmap.org/"&gt;Open Street Map&lt;/a&gt;. Ludzie z całego świata dodają informacje o różnych obiektach na mapach - &lt;em&gt;budują&lt;/em&gt; drogi, &lt;em&gt;stawiają&lt;/em&gt; domki i tak dalej. Dane te można pokazać jako mapy, ale też przeszukiwać. W R mamy pakiet &lt;strong&gt;&lt;a href="https://ropensci.github.io/osmdata/"&gt;osmdata&lt;/a&gt;&lt;/strong&gt; (przygotowany przez zacną inicjatywę &lt;a href="https://ropensci.org/"&gt;rOpenSci&lt;/a&gt;, a jest opakowaniem dla &lt;a href="https://wiki.openstreetmap.org/wiki/Overpass_API"&gt;Overpass API&lt;/a&gt;), który umożliwi nam skorzystanie z tych informacji. W dalszej części do pokazania (na interaktywnych, przesuwanych i skalowanych) map użyjemy pakietu &lt;strong&gt;&lt;a href="http://rstudio.github.io/leaflet/"&gt;leaflet&lt;/a&gt;&lt;/strong&gt; (opierający się na bibliotece JavaScript &lt;a href="https://leafletjs.com/"&gt;Leaflet&lt;/a&gt;, który nota bene również korzysta z Open Street Map.&#10;Ciekawostka na marginesie: ostatnio Google zmienił drastycznie ceny używania Google Maps (ciekawy tekst na ten temat znajdziecie &lt;a href="https://www.gdziepolek.pl/blog/pozegnanie-z-google-maps"&gt;tutaj&lt;/a&gt;), zatem korzystanie z Open Street Map może być wybawieniem.&#10;Zaczniemy od wczytania odpowiednich bibliotek:&lt;/p&gt;</description></item><item><title>Dziewczyny z Sympatii - co widać na zdjęciach?</title><link>https://blog.prokulski.science/2018/07/30/dziewczyny-z-sympatii-czesc-2/</link><pubDate>Mon, 30 Jul 2018 16:34:30 +0000</pubDate><guid>https://blog.prokulski.science/2018/07/30/dziewczyny-z-sympatii-czesc-2/</guid><description>&lt;p&gt;Było już &lt;a href="../../2018/07/06/dziewczyny-z-sympatii/"&gt;o kobietach&lt;/a&gt; z Sympatii (i &lt;a href="../../2018/07/20/chlopaki-z-sympatii/"&gt;o panach&lt;/a&gt;), ale wszystko to było na podstawie informacji zawartych w profilu. Dzisiaj sięgniemy nieco głębiej.&#10;Zbierając profile zebraliśmy też linki do zdjęć. Korzystając z microsoftowego &lt;a href="https://azure.microsoft.com/pl-pl/services/cognitive-services/face/"&gt;Cognitive services Face API&lt;/a&gt; pobieramy cechy jakie udaje się rozpoznać na zdjęciach. Między innymi są to informacje o:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;wieku&lt;/li&gt;&#10;&lt;li&gt;płci&lt;/li&gt;&#10;&lt;li&gt;okularach&lt;/li&gt;&#10;&lt;li&gt;kolorze włosów&lt;/li&gt;&#10;&lt;li&gt;emocjach jakie wyraża twarz, na przykład czy osoba na zdjęciu się uśmiecha&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;W dużym uproszczeniu Face API to &lt;em&gt;bramka&lt;/em&gt; do wytrenowanego modelu (zapewne sieci neuronowej). Wrzucamy zdjęcie, a w odpowiedzi dostajemy kilka parametrów, które są wynikiem &lt;em&gt;porównania&lt;/em&gt; zdjęcia z tym czego sieć się nauczyła.&#10;Skrypt (jaki inne z tego cyklu) znajdziecie &lt;a href="https://github.com/prokulski/sympatia/"&gt;na githubie&lt;/a&gt;. Pobrałem tylko dane dla zdjęć pań, nie będzie odpowiednika tego samego wpisu dla panów.&#10;Zobaczmy co sztuczna inteligencja wyczytała ze zdjęć i jak to się ma do informacji podawanych w profilach przez ich właścicielki.&lt;/p&gt;</description></item><item><title>API, Feedly i R</title><link>https://blog.prokulski.science/2018/04/20/api-feedly-i-r/</link><pubDate>Fri, 20 Apr 2018 09:00:16 +0000</pubDate><guid>https://blog.prokulski.science/2018/04/20/api-feedly-i-r/</guid><description>&lt;p&gt;Jak zmusić R do korzystania z (dowolnego) API? Jak przygotować atrakcyjne tabelki w raportach?&#10;Nie tak dawno na &lt;a href="http://fb.com/DaneAnalizy"&gt;Dane i analizy&lt;/a&gt; wrzuciłem post z informacją, że Feedly ma API. Źródłem inspiracji był &lt;a href="https://rud.is/b/2018/04/04/exploring-r-bloggers-posts-with-the-feedly-api"&gt;post&lt;/a&gt; z bardzo fajnego &lt;a href="https://rud.is/b/"&gt;bloga&lt;/a&gt;, którego autor chyba pracuje nad biblioteką do R obsługującą API Feedly (tak to wygląda po opublikowanych przez niego fragmentach kodu).&#10;Niby nic szczególnego, ale od czasu śmierci Google Readera brakuje mi w czytnikach RSS jednej rzeczy: informacji o tym, których kanałów nie czytam. Google Reader miał to niejako wbudowane (był wskaźnik liczby przeczytanych postów do wszystkich opublikowanych w kanale), Feedly niestety tej informacji nie ma.&#10;Spróbujemy to samo uzyskać w &lt;strong&gt;&lt;a href="http://feedly.com"&gt;Feedly&lt;/a&gt;&lt;/strong&gt;, najpopularniejszym chyba czytniku RSS. Może na początek słówko wyjaśnienia &lt;strong&gt;co to jest czytnik RSS?&lt;/strong&gt;&#10;Większość z nas korzysta z internetu podobnie: przeglądamy wiadomości, Facebooka i Twittera (też jako źródło wiadomości), jakiegoś Instagrama czy Snapchata (to już magia dla mnie, zapewne w związku z wiekiem…). Jeśli coś nas zainteresuje w feedzie na Facebooku to przechodzimy na odpowiednią stronę, czytamy i wracamy. Podobnie jest z Twitterem. Do wiadomości najczęściej używamy jednego portalu. Problem pojawia się kiedy czytamy jakieś ulubione blogi i nie pamiętamy aby na nie wejść (a Facebook skutecznie usuwa nam z walla posty z odpowiednich stron). Albo jak potrzebujemy porównać wiadomości prezentowane przez Wyborczą, TVN z tym co pisze TVPInfo, Niezależna czy TV Republika. Poza tym nie ma czasu na czytanie nawet leadów, opinię o tekście można sobie wyrobić na podstawie samego tytułu, a jakże!&#10;&lt;strong&gt;Co zrobić? Z pomocą przychodzą właśnie &lt;a href="https://pl.wikipedia.org/wiki/Czytnik_kana%C5%82%C3%B3w"&gt;czytniki RSS&lt;/a&gt;.&lt;/strong&gt;&#10;Kanał RSS to takie pliczki XML na serwerach (najczęściej generowane automatycznie) z najnowszymi wpisami (lub ich skrótami) albo czymkolwiek innym (np. z najnowszymi ogłoszeniami z Allegro czy OLX - przydatna opcja jeśli śledzimy ogłoszenia z jakiejś kategorii, na przykład polujemy na aukcje z poszukiwanym winylem). Feedly to jeden z czytników tych kanałów. Cały myk polega na tym, że serwis co jakiś czas (jak często dowiemy się na przykładzie za chwilę) sprawdza kolejne kanały i zapisuje sobie nowości. A potem na jednej stronie widzimy skróty i linki do wszystkich kanałów. Ja mam jakieś 170 kanałów zapisanych w Feedly - nie dałbym rady codziennie ogarnąć tylu stron. Wystarczy za to 15 minut z Feedly i przegląd nowości mam z głowy.&#10;Dodatkowy plus czytnika jest taki, że nie musimy pamiętać co czytaliśmy - czytnik sam to oznacza. Ja robię tak, że przeglądam całość, czytam to co mnie interesuje (albo zaznaczam do przeczytania później - ta lista stale rośnie…), a resztę oznaczam jako przeczytane. I przy kolejnej sesji z Feedly nie miesza mi się to co nowe z tym co już czytałem (albo tylko tak oznaczyłem).&#10;Rozumiecie już ideę? Wszystkie serwisy (na które się zapiszemy) w jednym miejscu, w wygodnej aplikacji. Idealna sprawa.&#10;Ale przy większej liczbie obserwowanych kanałów rośnie liczba treści jaka wpada do czytnika. A części kanałów nie czytamy. Ja na przykład mam kategorię &lt;em&gt;Wiadomości - zagranica&lt;/em&gt;, gdzie pojawia się dużo treści (bo są tam najnowsze z CNN i BBC), a których czytam kilka… tytułów. Resztę oznaczam jako przeczytane.&#10;Wracając do celu całego ćwiczenia: &lt;strong&gt;chciałbym wiedzieć które kanały usunąć, żeby mi nie zaśmiecały feedu&lt;/strong&gt; - po co ma pojawiać się coś, czego i tak nie czytam?&#10;Zajmiemy się dzisiaj w związku z tym próbą rozwiązania tego problemu. Początek standardowy:&lt;/p&gt;</description></item><item><title>A lato było cieplejsze...</title><link>https://blog.prokulski.science/2018/03/27/lato-bylo-cieplejsze/</link><pubDate>Tue, 27 Mar 2018 10:22:04 +0000</pubDate><guid>https://blog.prokulski.science/2018/03/27/lato-bylo-cieplejsze/</guid><description>&lt;p&gt;Czy w Boże Narodzenie zawsze brakowało śniegu? Czy klimat się ociepla? Jak ciepło przepływa przez Polskę?&#10;Dzisiaj zajmiemy się pogodą. Sporo ciekawych zagadnień przed nami:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Skąd wziąć dane o pogodzie w Polsce?&lt;/li&gt;&#10;&lt;li&gt;Pory roku na przestrzeni lat - czy wiosna przychodzi szybciej? A może lat trwa krócej?&#10;&lt;ul&gt;&#10;&lt;li&gt;zobaczymy procentowy podział dni w roku na poszczególne pory roku (ile było dni wiosennych, a ile zimowych)&lt;/li&gt;&#10;&lt;li&gt;czy wiosna przychodzi coraz szybciej - jak kształtowała się temperatura w marcu na przestrzeni lat?&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;Czy klimat się ociepla?&#10;&lt;ul&gt;&#10;&lt;li&gt;jak wyglądały różnice w temperaturze na przestrzeni lat&lt;/li&gt;&#10;&lt;li&gt;czy poszczególne miesiące są coraz cieplejsze lub zimniejsze?&lt;/li&gt;&#10;&lt;li&gt;podobnie dla kolejnych dni - jak wyglądała liczba dni cieplejszych i zimniejszych niż średnia?&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;Czy jest różnica miedzy temperaturami w kraju?&#10;&lt;ul&gt;&#10;&lt;li&gt;przygotujemy animowane mapki temperatury dla 2017 roku&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;A kiedyś to było…&#10;&lt;ul&gt;&#10;&lt;li&gt;Boże Narodzenie ze śniegiem&lt;/li&gt;&#10;&lt;li&gt;w Lany Poniedziałek było cieplej&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h3 id="pobranie-danych"&gt;Pobranie danych&lt;/h3&gt;&#10;&lt;p&gt;Zanim przejdziemy do analizy potrzebujemy danych o pogodzie. Zgodnie z ustawą o dostępie do danych publicznych IMGW udostępnia dane historycznie na stronie &lt;a href="https://dane.imgw.pl/"&gt;https://dane.imgw.pl/&lt;/a&gt;. Dane aktualne są dostępne poprzez API, ale dane historyczne spakowane już niestety nie. Dostępne są w postaci spakowanych plików CSV, podzielone na kilkanaście katalogów. Do wszystkiego da się jednak dobrać.&#10;Aby skorzystać z tych zasobów należy każdy plik (archiwum) pobrać, rozpakować i wyciągnąć z niego dane. Aby nie operować na dużej liczbie plików przepiszemy je do bazy danych (w tym przypadku będzie to plikowa baza SQLite, chociaż może być dowolna - mySQL, PostgreSQL). &lt;a href="https://github.com/prokulski/Dane-IMGW/blob/master/get_imgw_arch.R"&gt;Skrypt przepisujący dane&lt;/a&gt; znajdziecie na moim githubie (jak i pozostałe poniżej zaprezentowane kody).&lt;/p&gt;</description></item><item><title>Jak zrobić twitterowego bota?</title><link>https://blog.prokulski.science/2018/03/21/jak-zrobic-twitterowego-bota/</link><pubDate>Wed, 21 Mar 2018 09:52:09 +0000</pubDate><guid>https://blog.prokulski.science/2018/03/21/jak-zrobic-twitterowego-bota/</guid><description>&lt;p&gt;Automaty rządzą naszym życiem. Czy tego chcemy czy nie. Szczególnie w sieciach społecznościowych, nawet podobno wygrały wybory prezydenckie w USA (ciekawe czy w Rosji też). Spróbujmy zatem samodzielnie napisać jakiś automat działający w social mediach. W R, chociaż można w czymkolwiek innym.&lt;/p&gt;&#10;&lt;p&gt;Przygotujemy automat (bota), który będzie na Twitterze publikował wybrane przez nas treści. Taki bot już istnieje - to @rstatspl. W tym wpisie znajdziecie informacje jak powstał.&#10;Bot &lt;strong&gt;&lt;a href="https://twitter.com/rstatspl"&gt;@rstatspl&lt;/a&gt;&lt;/strong&gt; robi trzy rzeczy:&lt;/p&gt;</description></item><item><title>Przez losowy las Spotify</title><link>https://blog.prokulski.science/2017/12/10/spotify-random-forest/</link><pubDate>Sun, 10 Dec 2017 10:16:32 +0000</pubDate><guid>https://blog.prokulski.science/2017/12/10/spotify-random-forest/</guid><description>&lt;p&gt;Czy &lt;em&gt;machine learning&lt;/em&gt; może pomóc w poszukiwaniu ulubionej muzyki?&#10;Dzisiaj zajmiemy się poszukiwaniem nowej muzyki. Już kiedyś &lt;a href="../../2017/03/09/poszukiwanie-nowej-muzyki/"&gt;o tym było w oparciu o LastFM&lt;/a&gt;, dzisiaj będzie w oparciu o Spotify. Taki szybki wpis.&#10;Na początek potrzebujemy kilku elementów:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;własnej aplikacji współpracującej z API Spotify - zbudować ją można zaczynając z &lt;a href="https://beta.developer.spotify.com/dashboard/applications"&gt;dashboardu Spotify&lt;/a&gt;, potrzebujemy numerku &lt;code&gt;client_id&lt;/code&gt; i &lt;code&gt;client_secret&lt;/code&gt;&lt;/li&gt;&#10;&lt;li&gt;te numerki wpisujemy do zmiennych o tych samych nazwach i zapisujemy sobie lokalnie (żeby nie przechowywać ich w kodzie) w pliku &lt;code&gt;spotify_cred.rda&lt;/code&gt;. W bardzo prosty sposób: &lt;code&gt;save(client_id, client_secret, file = &amp;quot;spotify_cred.rda&amp;quot;)&lt;/code&gt;&lt;/li&gt;&#10;&lt;li&gt;następnie budujemy kilka funkcji, których będziemy używać. Kod jest długi, nie warto go tutaj zamieszczać - znajdziecie go &lt;a href="https://github.com/prokulski/Spotify/blob/master/spotify_functions.R"&gt;na GitHubie&lt;/a&gt; (swoją drogą jest tam nieco więcej funkcji niż potrzeba, ale nie wszystkie skończone i działające)&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Uzbrojeni w taki zestaw zaczynamy od pozyskania tokenu:&lt;/p&gt;</description></item><item><title>Zmiany temperatury w czasie - animowany wykres kołowy</title><link>https://blog.prokulski.science/2017/08/10/animowany-wykres-kolowy/</link><pubDate>Thu, 10 Aug 2017 08:12:44 +0000</pubDate><guid>https://blog.prokulski.science/2017/08/10/animowany-wykres-kolowy/</guid><description>&lt;p&gt;Kilka dni temu karierę na stronach poświęconych wizualizacji danych robił filmik obrazujący zmiany temperatury na przestrzeni lat. Na stronie &lt;a href="http://fb.com/DaneAnalizy"&gt;Dane i Analizy&lt;/a&gt; obiecałem, że opiszę jak można coś takiego zrobić.&#10;Wspomniany filmik to&lt;/p&gt;&#10;&lt;p&gt;Jakiś czas zastanawiałem się jakie dane pokazać i zdecydowałem, że będzie to liczba odsłon najpopularniejszych tekstów z bloga który czytasz. Przy okazji dowiemy się jak za pomocą R dostać się do statystyk zebranych w Google Analitycs.&#10;Oczywiście jest do tego stosowny pakiet, ale wcześniej potrzebna jest pewna konfiguracja konta googlowego. Jak zwykle w przypadku API potrzebny jest klucz - w tym przypadku jest to para &lt;em&gt;Client ID&lt;/em&gt; i &lt;em&gt;Secret ID&lt;/em&gt;. Aby je uzyskać wystarczy wykonać kroki opisane chociażby &lt;a href="https://github.com/LucyMcGowan/Tutorials/blob/master/googleanalytics.Rmd"&gt;tutaj&lt;/a&gt;.&#10;Dodatkowo instalujemy pakiet &lt;strong&gt;RGoogleAnalytics&lt;/strong&gt;:&lt;/p&gt;</description></item><item><title>Najbardziej aktywni użytkownicy na stronach partii</title><link>https://blog.prokulski.science/2017/08/08/uzytkownicy_fanpage_partii/</link><pubDate>Tue, 08 Aug 2017 14:43:11 +0000</pubDate><guid>https://blog.prokulski.science/2017/08/08/uzytkownicy_fanpage_partii/</guid><description>&lt;p&gt;Kim są osoby najbardziej aktywne na fanpage’ach poszczególnych partii?&#10;Po &lt;strong&gt;&lt;a href="https://mierzynskamarketing.wordpress.com/2017/08/04/nie-wierz-politycznym-fanom-na-fb-manipulacje-w-sieci-cz-2/"&gt;artykule Anny Mierzyńskiej&lt;/a&gt;&lt;/strong&gt; a jeszcze bardziej (i wcześniej) po publikacji &lt;strong&gt;&lt;a href="http://comprop.oii.ox.ac.uk/2017/06/19/computational-propaganda-in-poland-false-amplifiers-and-the-digital-public-sphere/"&gt;wyników analizy naukowców z Oxfordu&lt;/a&gt;&lt;/strong&gt; na temat fake-newsów i kont-botów zapragnąłem zrobić dokładnie to samo. Sprawdzić jak bardzo prawdopodobne jest, że konta które są najbardziej aktywne są botami.&#10;&lt;strong&gt;Metodologia&lt;/strong&gt; jest stosunkowo prosta: trzeba wytypować najbardziej aktywne konta, sprawdzić ile osób mają w znajomych, co lajkują (jak często) i co podają dalej, jak dużo napisały postów i w jakim czasie (czy są młode czy stare). Na podstawie kilku wskaźników można określić z jakimś prawdopodobieństwem czy konto jest botem.&#10;Niestety, o ile na Twitterze większość informacji można pobrać, o tyle z Facebookiem jest już gorzej i niewiele się da wyciągnąć z API. Anna Mierzyńska swoją analizę przeprowadziła ręcznie. Ja nie lubię takiej dłubaniny, szczególnie jeśli są narzędzia.&#10;Podczas prób moja analiza obrała nieco inny kierunek (nie &lt;em&gt;Czy konto jest botem?&lt;/em&gt; a &lt;em&gt;Kim jest użytkownik?&lt;/em&gt;). Zobaczmy co wyszło.&#10;Na początku potrzebujemy danych. Wytypowałem osiem facebookowych stron partii pokazywanych w sondażach:&lt;/p&gt;</description></item><item><title>The Rolling Stones Tour</title><link>https://blog.prokulski.science/2017/07/25/the-rolling-stones-tour/</link><pubDate>Tue, 25 Jul 2017 10:39:50 +0000</pubDate><guid>https://blog.prokulski.science/2017/07/25/the-rolling-stones-tour/</guid><description>&lt;p&gt;&lt;em&gt;Po wolnej musi być szybka, takie są zasady muzykowania&lt;/em&gt; pada na koncertowej płycie &lt;strong&gt;Bolilol Tour&lt;/strong&gt; zespołu Illusion. Sprawdźmy czy tak jest na koncertach…&#10;…ale nie dokładnie to sprawdzimy. Inspiracją dla niniejszego postu jest wpis z 2011 roku o &lt;a href="http://cilekagaci.com/2011/11/30/metallica-on-stage/"&gt;utworach granych przez Metallicę na koncertach&lt;/a&gt;, szczególnie infografika, o której ów wpis jest. Infografika przedstawia popularność piosenek granych na koncertach.&#10;&lt;strong&gt;Skoro ktoś mógł to zrobić, to dlaczego nie ja?&lt;/strong&gt; Instrukcja jak zrobić to samo poniżej.&#10;Za źródło danych posłuży serwis &lt;a href="http://setlist.fm"&gt;Setlist.fm&lt;/a&gt;, w którym znaleźć można całą masę informacji o koncertach - przede wszystkim datę, miejsce i to co najbardziej interesująca - lista utworów. Dane pobierać będziemy przez API, do którego potrzebny jest klucz. Po założeniu konta w serwisie możemy sobie taki wygenerować. Z API rozmawiamy JSONem - dlatego poniżej biblioteka &lt;em&gt;jsonlite&lt;/em&gt; oraz &lt;em&gt;RCurl&lt;/em&gt; do odpytywania tegoż API.&lt;/p&gt;</description></item><item><title>Mecz Polska - Rumunia na Twitterze</title><link>https://blog.prokulski.science/2017/06/12/mecz-polska-rumunia-na-twitterze/</link><pubDate>Mon, 12 Jun 2017 11:00:36 +0000</pubDate><guid>https://blog.prokulski.science/2017/06/12/mecz-polska-rumunia-na-twitterze/</guid><description>&lt;p&gt;Wydarzenia sportowe (lub inne dziejące się tu i teraz) są bardzo wdzięcznym tematem analizy tego, co dzieje się w mediach społecznościowych. Jak wyglądał Twitter podczas meczu Polska - Rumunia?&lt;/p&gt;&#10;&lt;h3 id="przygotowanie-tokenu"&gt;Przygotowanie tokenu&lt;/h3&gt;&#10;&lt;p&gt;Aby zebrać dane z Twittera potrzebujemy zbudować aplikację, która wykorzysta API Twittera i jej tokenu. W samym R wykorzystamy pakiet &lt;strong&gt;&lt;a href="https://github.com/mkearney/rtweet"&gt;rtweet&lt;/a&gt;&lt;/strong&gt;. Koniec końców potrzebny nam jest klucz API (para &lt;em&gt;Consumer Key&lt;/em&gt; i &lt;em&gt;Consumer Sectet&lt;/em&gt;) - jak je zdobyć można przeczytać &lt;strong&gt;&lt;a href="https://mkearney.github.io/rtweet/articles/auth.html"&gt;tutaj&lt;/a&gt;&lt;/strong&gt; (z obrazkami). Odpowiednie wartości należy przypisać do zmiennych poniżej. Kod przygotuje nam token i zapisze w lokalnym pliku, dzięki temu w przyszłości będziemy mogli taki token wykorzystać:&lt;/p&gt;</description></item><item><title>Oceny filmów i ich przewidywanie</title><link>https://blog.prokulski.science/2017/06/08/oceny-filmow-i-ich-przewidywanie/</link><pubDate>Thu, 08 Jun 2017 13:59:55 +0000</pubDate><guid>https://blog.prokulski.science/2017/06/08/oceny-filmow-i-ich-przewidywanie/</guid><description>&lt;p&gt;Od czego zależą oceny filmów?&#10;Jak będzie oceniony film, który dopiero powstaje?&#10;Dawno temu, czyli gdzieś około roku, może nawet półtora temu, zebrałem z Filmwebu prawie całą ówczesną bazę danych o filmach. Wykorzystałem &lt;a href="https://github.com/nSolutionsPL/filmweb-api"&gt;biblioteki napisane w PHP&lt;/a&gt; korzystające z (nie)oficjalnego API Filmwebu budując skrypt, który dla kolejnych ID “produktów” (produktów, bo Filmweb ma nie tylko filmy, ale również seriale i gry) i pobierał odpowiednie informacje (do ID bodaj 770 tys.): rok produkcji filmu, jego polski i oryginalny tytuł, czas trwania, gatunki, twórców i obsadę oraz liczbę ocen i średnią ocenę (na moment pobrania danych). Powstało kilka plików CSV (pliki relacyjne) z dużą ilością danych. Dzisiaj z tego skorzystamy i pooglądamy jak zmieniał się przemysł filmowy.&#10;Pliki zgromadzone zostały w formie CSV, po wyczyszczeniu danych wpakowałem wszystko w jeden plik z danymi. Wczytajmy sobie te dane:&lt;/p&gt;</description></item><item><title>Partie polityczne i sport</title><link>https://blog.prokulski.science/2017/05/25/partie_sport/</link><pubDate>Thu, 25 May 2017 12:32:43 +0000</pubDate><guid>https://blog.prokulski.science/2017/05/25/partie_sport/</guid><description>&lt;p&gt;Czy preferencje polityczne mają jakiś związek z preferencjami sportowymi? Innymi słowy: czy jeśli lubię PSL to wolę piłkę nożną czy jednak bieganie?&#10;&lt;strong&gt;Stereotypowo&lt;/strong&gt; mogłoby to wyglądać tak: Nowoczesna to biegi, PiS - piłka nożna i podnoszenie ciężarów (przed tv, ciężary 500ml w puszce), Kukiz - wędkarstwo, PSL - wypas owiec. Koniec żartu, można się śmiać.&#10;A jak jest? Zrobimy eksperyment z dużą ilością danych. Facebook ma to od ręki, dlatego wykorzystamy publiczne informacje z tego właśnie źródła. Poza tym - te 2 miliardy użytkowników zostawia bardzo dużo informacji o sobie. Według &lt;a href="https://www.gemius.pl/agencje-aktualnosci/wyniki-badania-gemiuspbi-za-kwiecien-2017.html"&gt;badania Gemius/PBI za kwiecień 2017&lt;/a&gt; w Polsce z Facebooka korzysta 22.6 mln internautów (81.4% wszystkich, co ciekawe - zanotowano spadek o ponad 200 tys. m/m).&#10;&lt;strong&gt;Jak to zrobić?&lt;/strong&gt; Po pierwsze trzeba wytypować listę fanpage’y na podstawie których będziemy wyciągać wnioski. Skorzystałem z dwóch źródeł: własnej głowy (i sondaży poparcia) aby wytypować partie i z własnych rąk aby wyszukać ich fanpages na Facebooku. Druga strona równania to lista fanpage’y sportowych (dla mnie trudniejsze) - tutaj skorzystałem z raportów &lt;a href="http://sotrender.pl"&gt;Sotrender&lt;/a&gt;.&#10;&lt;strong&gt;Teraz metodologia.&lt;/strong&gt; Można na kilka sposobów. Na przykład biorąc listę fanów poszczególnych stron i szukając części wspólnych tych zbiorów. Tak będziemy działać. Problemem jest tylko jak uzyskać listę fanów? Kiedyś Facebook udostępniał poprzez API możliwość wywoływania zapytań FQL (to taki podobny do SQL język dla FB). Ale ograniczenia prywatności spowodowały, że to nie działa. Trzeba więc inaczej, co nieco zaburzy wyniki (trudno mi jednocześnie na szybko oszacować jak bardzo).&#10;Posty na stronach są publiczne, ludzie lajkują i komentują. Facebook udostępnia poprzez API dane o tych komentarzach i lajkach, w tym ID (oraz imię i nazwisko) użytkowników, którzy taką interakcję poczynili. Zatem weźmiemy posty każdej ze stron, dla każdego postu listę osób reagujących (policzymy tylko &lt;em&gt;like&lt;/em&gt; i &lt;em&gt;comment&lt;/em&gt; - bez &lt;em&gt;share&lt;/em&gt; oraz innych reakcji) na post. Tym sposobem nie będziemy mieć fanów (jest ich zapewne więcej niż wchodzących w interakcję - jaka to różnica wyjdzie po drodze; a jednocześnie na tych stronach można komentować i lajkować nie będąc jednocześnie fanem strony), ale coś podobnego. Może nawet lepszego (użytkownik zaangażowany jest cenniejszy niż bierny obserwator).&lt;/p&gt;</description></item><item><title>Nowa Europa (według k-means)</title><link>https://blog.prokulski.science/2017/04/19/nowa-europa-wedlug-k-means/</link><pubDate>Wed, 19 Apr 2017 13:53:09 +0000</pubDate><guid>https://blog.prokulski.science/2017/04/19/nowa-europa-wedlug-k-means/</guid><description>&lt;p&gt;Czy granice państw europejskich są wyznaczone poprawnie?&#10;Jak wyglądałyby gdyby użyć algorytmów?&lt;/p&gt;&#10;&lt;p&gt;Tak zrobimy - sprawdzimy jak algorytm k-średnich “rozdzieli” na poszczególne kraje miasta biorąc pod uwagę ich położenie geograficzne. I zobaczymy co się stanie jak w Europie będzie mniej państw (oczywiście hipotetycznie, oczywiście na podstawie algorytmu, a nie wojny o ziemię).&#10;Trochę o algorytmach &lt;a href="../../2017/03/07/kola-w-zbozu/"&gt;pisałem już wcześniej&lt;/a&gt;, tutaj użyjemy najprostszego z algorytmów - &lt;a href="https://pl.wikipedia.org/wiki/Algorytm_centroid%C3%B3w"&gt;k-średnich&lt;/a&gt;. Metoda będzie prosta - dla każdego miasta znajdziemy jego współrzędne, później na podstawie współrzędnych dokonamy klasyfikacji do nowych grup. Na początek tej samej ilości grup (państw) jaką mamy obecnie - sprawdzimy czy granice są “odpowiednie”. Później będziemy zmniejszać ilość “nowych państw”.&lt;/p&gt;</description></item><item><title>Tramwaje warszawskie</title><link>https://blog.prokulski.science/2017/04/12/tramwaje-warszawskie/</link><pubDate>Wed, 12 Apr 2017 08:54:46 +0000</pubDate><guid>https://blog.prokulski.science/2017/04/12/tramwaje-warszawskie/</guid><description>&lt;p&gt;Dzisiaj zajmiemy się ruchem tramwajów w Warszawie.&#10;Jak zmienia się ruch w ciągu dnia? Jakie i ile tramwajów jeździ po warszawskich torach?&#10;Inspiracją do tego wpisu jest &lt;a href="https://vimeo.com/211614670"&gt;filmik&lt;/a&gt; obrazujący podobne dane z Nowego Jorku.&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Ekstra, co nie?&lt;/strong&gt; Zrobimy to samo. Bo możemy, bo chcemy, bo potrafimy.&lt;/p&gt;&#10;&lt;h3 id="źródło-i-pobranie-danych"&gt;Źródło i pobranie danych&lt;/h3&gt;&#10;&lt;p&gt;Skorzystamy z otwartych danych, jakie dostępne są na stronie &lt;a href="https://api.um.warszawa.pl/"&gt;Otwarte dane po warszawsku&lt;/a&gt;. Na początek potrzebna będzie rejestracja na tej stronie i uzyskanie klucza API, który pozwoli na dostęp do różnych ciekawych danych jakie udostępnia Miasto Stołeczne Warszawa. Po uzyskaniu klucza API koniecznie będzie wpisanie jego wartości w miejsce &lt;strong&gt;NUMER_APIKEY&lt;/strong&gt; w poniższym kodzie.&lt;/p&gt;</description></item><item><title>Redakcje informacyjne na Facebooku</title><link>https://blog.prokulski.science/2017/03/18/redakcje-informacyjne-na-facebooku/</link><pubDate>Sat, 18 Mar 2017 09:31:57 +0000</pubDate><guid>https://blog.prokulski.science/2017/03/18/redakcje-informacyjne-na-facebooku/</guid><description>&lt;p&gt;Jak pracują redakcje serwisów informacyjnych na Facebooku?&#10;Kiedy publikują, jakiego rodzaju treści? Czy “cała prawda całą dobę” to prawda?&#10;Dobierzemy się do postów publikowanych przez redakcje informacyjne i zobaczymy jak wygląda obraz tych redakcji na Fejsie.&#10;Do tego celu użyjemy biblioteki &lt;em&gt;Rfacebook&lt;/em&gt;, której nie ma w CRANie, ale jest na GitHubie - jest sposób, aby i takie coś zainstalować w pakiecie R i korzystać tak samo jak z bibliotek z CRANa. Potrzebujemy biblioteki &lt;em&gt;devtools&lt;/em&gt;, przy pomocy której zainstalujemy &lt;em&gt;Rfacebook&lt;/em&gt;.&#10;Najpierw instalujemy &lt;em&gt;devtools&lt;/em&gt;:&lt;/p&gt;</description></item><item><title>Róbmy swoje, Panie Wojtku!</title><link>https://blog.prokulski.science/2017/03/16/robmy-swoje-panie-wojtku/</link><pubDate>Thu, 16 Mar 2017 14:22:03 +0000</pubDate><guid>https://blog.prokulski.science/2017/03/16/robmy-swoje-panie-wojtku/</guid><description>&lt;p&gt;Wczoraj wieczorem &lt;a href="http://kultura.gazeta.pl/kultura/7,114526,21265584,wojciech-mlynarski-legenda-polskiej-piosenki-i-kabaretu.html"&gt;zmarł&lt;/a&gt; Wojciech Młynarski.&#10;Zobaczmy czy był popularny - korzystając z Wikipedii.&#10;Za miarę popularności uznamy &lt;strong&gt;liczbę wyświetleń hasła poświęconemu &lt;a href="https://pl.wikipedia.org/wiki/Wojciech_M%C5%82ynarski"&gt;Panu Wojciechowi&lt;/a&gt; w polskiej Wikipedii&lt;/strong&gt;. Im bardziej osoba popularna, tym częściej poszukuje się o niej informacji. Założenie dość dobre, prawda? Chyba, że… tak - w przypadku ogólnego medialnego szumu wokół osoby (na przykład z powodu śmierci) ta miara zostaje zaburzona. Co też za chwilę zobaczycie.&#10;Potrzebne będzie kilka bibliotek - do obróbki danych &lt;em&gt;dplyr&lt;/em&gt; oraz &lt;em&gt;reshape2&lt;/em&gt;, do wykresów &lt;em&gt;ggplot2&lt;/em&gt;; &lt;em&gt;stringr&lt;/em&gt; przyda się do jednego przekształcenia ciągu znaków. Dane pobierzemy przez API w formacie JSON z serwisu &lt;a href="https://wikimedia.org"&gt;Wikimedia.org&lt;/a&gt; przy pomocy &lt;em&gt;httr&lt;/em&gt; i przekształcimy do formatu data.frame przez fromJSON() z biblioteki &lt;em&gt;jsonlite&lt;/em&gt;.&lt;/p&gt;</description></item><item><title>Poszukiwanie nowej muzyki</title><link>https://blog.prokulski.science/2017/03/09/poszukiwanie-nowej-muzyki/</link><pubDate>Thu, 09 Mar 2017 10:00:43 +0000</pubDate><guid>https://blog.prokulski.science/2017/03/09/poszukiwanie-nowej-muzyki/</guid><description>&lt;p&gt;Dzisiaj zajmiemy się poszukiwaniem nowej muzyki. Uwielbiam poznawać nową muzykę, poszukiwać nowych &lt;em&gt;smaków&lt;/em&gt; i cieszyć się nowymi odkryciami. Co prawda od kilku lat coraz trudniej znaleźć coś interesującego i innego. Albo są to &lt;em&gt;popłuczyny po Kornie&lt;/em&gt;, albo jakaś kolejna wersja wczesnego Coldplay (który z każdą nową płytą jest coraz dalej od mojego gustu).&#10;Do poszukiwań wykorzystamy to co już znamy i lubimy. Bo &lt;em&gt;najbardziej podobają mi się piosenki, które już raz słyszałem&lt;/em&gt;. W określeniu tego co znamy i lubimy pomoże LastFM. Serwis o którym pisałem przy okazji &lt;a href="../../2017/03/01/jesienna-deprecha/"&gt;analizy nastrojów muzycznych&lt;/a&gt; zbiera nasze &lt;em&gt;scrobble&lt;/em&gt; (przesłuchane utwory), ale posiadając tak dużo danych potrafi “polecić” coś od siebie. Algorytm polecający LastFM w dużym stopniu polega na porównywaniu gustów poszczególnych użytkowników, szukaniu podobieństw i wskazywaniu wykonawców pasujących do już znanych. Albo do innych wykonawców, mniej więcej na zasadzie: skoro dużo osób słucha Nirvany i Pearl Jam to te kapele są do siebie podobne. Oczywiście to nie jedyne cechy podobieństwa - są też tagi, lata działalności itp.&#10;Nie będę wchodził w algorytm LastFM, a wykorzystam dane jakie można z LastFM uzyskać. A z pomocą pakietu &lt;strong&gt;RLastFM&lt;/strong&gt; w łatwy sposób uzyskamy dostęp do API serwisu.&#10;Przygotowanie R do pracy to ewentualne zainstalowanie wspomnianego pakietu, uzyskanie klucza API z LastFM oraz załadowanie potrzebnych bibliotek (tutaj: dplyr, ggplot2, reshape2). Wszystko to opisałem w poście &lt;a href="../../2017/03/01/jesienna-deprecha/"&gt;“Jesienna deprecha”&lt;/a&gt;.&#10;Konfiguracja skryptu to 4 zmienne:&lt;/p&gt;</description></item><item><title>Jesienna deprecha</title><link>https://blog.prokulski.science/2017/03/01/jesienna-deprecha/</link><pubDate>Wed, 01 Mar 2017 16:35:06 +0000</pubDate><guid>https://blog.prokulski.science/2017/03/01/jesienna-deprecha/</guid><description>&lt;p&gt;&lt;em&gt;Mam znowu doła&#10;Znów pragnę śmierci&#10;Wracają stare lęki&#10;I nie mogę w nocy spać&lt;/em&gt;&#10;Czy “jesienna deprecha” ma odbicie w słuchanej muzyce?&#10;&lt;img src="../../downloads/2017/03/polovirus-300x270.jpg" alt=""&gt;Zacytowany na początku tekst to oczywiście piosenka &lt;a href="https://www.youtube.com/watch?v=YTxqaHrXgHQ"&gt;“Jesienna deprecha”&lt;/a&gt; Kur z niesamowitej płyty &lt;a href="https://pl.wikipedia.org/wiki/P.O.L.O.V.I.R.U.S."&gt;P.O.L.O.V.I.R.U.S.&lt;/a&gt;.&#10;Zadanie na dzisiaj to weryfikacja czy pora roku albo pora dnia mają wpływ na nastrój słuchanej muzyki. Ktoś może powiedzieć, że oczywiście, że tak, że jasne, że &lt;em&gt;“jesienią to ja tylko Radiohead i Portishead, a na wiosnę to ABBA, latem zaś Jamajka i Bob Marley”&lt;/em&gt;. Dowody? Historia przesłuchanych utworów, z datą i godziną? Ma?&#10;Ja mam. Serwis się nazywa &lt;a href="https://www.last.fm/"&gt;Last.FM&lt;/a&gt; i pozwala przy pomocy różnych wtyczek (albo bezpośredniego połączenia konta np. w Spotify z LastFM) zbierać statystyki. Jak się ma dane od tysięcy (tfu! &lt;a href="https://techcrunch.com/2016/09/01/43-million-passwords-hacked-in-last-fm-breach/"&gt;43 milionów&lt;/a&gt; - przynajmniej tak donosił TechCrunch, chociaż przy nieco innej okazji) słuchaczy muzyki, to można robić z nimi cuda. Można je też sprzedawać wytwórniom płytowym albo stacjom radiowym, dzięki czemu wiedzą co jest “na topie” bezpośrednio od użytkowników. I dzięki temu produkują, to co produkują. Można też dowiedzieć się, kto słucha muzyki przed oficjalną premierą płyty i ścigać takie osoby. Polecam hasło &lt;a href="https://en.wikipedia.org/wiki/Last.fm"&gt;Last.fm w angielskiej Wikipedii&lt;/a&gt;, o ile oczywiście nie znacie samego serwisu.&#10;Ale wracjamy do tematu. Potrzebna jest historia przesłuchanych utworów, którą weźmiemy z Last.fm. Użyjemy do tego pakietu, który został już wycofany z CRANa… Trzeba zainstalować ręcznie paczkę pobraną z &lt;a href="https://cran.r-project.org/src/contrib/Archive/RLastFM/RLastFM_0.1-5.tar.gz"&gt;archiwum CRANa&lt;/a&gt;.&#10;Potrzebny jest też klucz API dla LastFM - zdobyć można go na &lt;a href="http://www.last.fm/api/account/create"&gt;stronie API Last.fm&lt;/a&gt;, a jego wartość należy wpisać zmiennej &lt;strong&gt;lastkey&lt;/strong&gt;.&#10;Później dane z Last.fm będziemy łączyć z danymi ze Spotify (zwracanymi jako JSON) - stąd odpowiednie biblioteki.&lt;/p&gt;</description></item><item><title>Oscary 2017 - kto wygrał? Bez czytania wiadomości!</title><link>https://blog.prokulski.science/2017/02/27/oscary-2017-kto-wygral-bez-czytania-wiadomosci/</link><pubDate>Mon, 27 Feb 2017 15:44:51 +0000</pubDate><guid>https://blog.prokulski.science/2017/02/27/oscary-2017-kto-wygral-bez-czytania-wiadomosci/</guid><description>&lt;p&gt;Jak dowiedzieć się kto wygrał Oscara? Bez czytania wiadomości. W każdej z kategorii. Korzystając tylko z Twittera, ale bez czytania poszczególnych twittów! Da się?&#10;Oczywiście, że się da. Potrzebujemy tylko danych i odrobiny sprytu przy ich przetwarzaniu.&#10;Najpierw dane. Napisałem skrypt, który pobierał co 5 minut wszystkie nowe twitty z hashtagu &lt;a href="https://twitter.com/search?q=%23Oscars"&gt;#Oscars&lt;/a&gt; i zapisywał je w pliku “Oscars_hash.Rds” lokalnie na dysku. Sposobów na pobranie danych z Twittera jest wiele, ja wybrałem ten - najszybciej było mi napisać odpowiedni skrypcik (w R - mniej więcej robiący tyle: wyszukaj najnowsze twitty z określonym hasłem, dodaj je do już znalezionych) i po prostu zostawić komputer na noc.&#10;Te same dane można pobrać i wpakować do bazy danych.&#10;Można też przygotować skrypt, który pobierze wszystko na raz.&#10;Skrypt możecie przygotować sobie samodzielnie, zachęcam. Tak czy inaczej - w R polecam bibliotekę &lt;a href="https://cran.r-project.org/web/packages/twitteR/index.html"&gt;twitteR&lt;/a&gt;.&#10;Trzeba jednak liczyć się z ograniczeniami API Twittera - określona liczba zapytań w czasie, określona (maksymalna) liczba wyników zwracanych dla jednego zapytania. Z powodu tych ograniczeń dane przygotowane przeze mnie zawierają maksymalnie 3200 Twittów pobranych raz na 5 minut. Do naszej analizy to wystarczy. Poza tym - moją ideą przy prezentowaniu kolejnych postów jest pokazanie, że bez płacenia za jakiekolwiek dane można fajnie się pobawić i czegoś nauczyć.&#10;Dzisiaj korzystamy jak zazwyczaj z bibliotek &lt;em&gt;ggplot2&lt;/em&gt;, &lt;em&gt;dplyr&lt;/em&gt;, &lt;em&gt;lubridate&lt;/em&gt; oraz &lt;a href="http://tidytextmining.com/"&gt;tidytext&lt;/a&gt; do operacji na słowach. Fajna biblioteka, dużo przykładów, jeszcze się będziemy nią bawić.&#10;Pobieramy dane zapisane przez skrypty zapisujące to, co działo się na Twitterze i rozdzielamy czas opublikowania twittu na dzień, godzinę i minutę (po tym będziemy później szukać i grupować). Przy okazji wytniemy dane tylko dla 27 lutego (ceremonia była już 27 lutego naszego czasu), żeby nie ciągnąć za dużego ogona ze sobą.&lt;/p&gt;</description></item></channel></rss>