<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Wizualizacja on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/wizualizacja/</link><description>Recent content in Wizualizacja on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 16 Feb 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/wizualizacja/index.xml" rel="self" type="application/rss+xml"/><item><title>Lokalne AI, optymalizacja Kafki i analiza 50 tysięcy profili randkowych</title><link>https://blog.prokulski.science/2026/02/16/lokalne-ai-optymalizacja-kafki-i-analiza-50-tysiecy-profili-randkowych/</link><pubDate>Mon, 16 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/16/lokalne-ai-optymalizacja-kafki-i-analiza-50-tysiecy-profili-randkowych/</guid><description>&lt;p&gt;W dzisiejszym wydaniu łączymy praktyczne podejście do AI z fundamentami inżynierii danych. Zaczynamy od narzędzi agentowych – customizacji Claude Code dla Pythona (gdzie język jest przykładem - to samo można zrobić chociażby dla Javy) i OpenClaw jako lokalnego asystenta AI z pełną kontrolą nad danymi.&lt;/p&gt;&#10;&lt;p&gt;W sekcji ML znajdziecie automatyzację audytu katalogów z użyciem XGBoost, wprowadzenie do PyCaret (taka biblioteka auto-ml dla Pythona) oraz semantyczne wyszukiwanie obrazów łączące Gemini z Elasticsearch.&lt;/p&gt;</description></item><item><title>Zrób sobie lakehouse na laptopie</title><link>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</link><pubDate>Mon, 12 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/12/zrob-sobie-lakehouse-na-laptopie/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy z pogranicza AI, data engineeringu i praktyk inżynierskich. Szczególną uwagę poświęcamy agentom AI - od pisania skutecznych CLAUDE.md i budowy prostych agentów kodujących w 200 liniach, po zaawansowany monitoring autonomicznych systemów i wzorce projektowe dla inteligentnych aplikacji.&lt;/p&gt;&#10;&lt;p&gt;W sekcji data engineering znajdziesz konkretne rozwiązania: od wzorców partycjonowania przyspieszających zapytania, przez budowę lokalnego pipeline&amp;rsquo;u ELT z DuckDB i dbt (bez kosztów chmury), aż po kompletny przewodnik tworzenia lakehouse&amp;rsquo;a z Apache Iceberg, Trino i MinIO. Nie zabrakło też materiałów przygotowujących do rozmów rekrutacyjnych - 10 kluczowych tematów system design dla data engineerów w 2026 roku.&lt;/p&gt;</description></item><item><title>Kafka jest szybka, ale użyję Postgres</title><link>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</link><pubDate>Mon, 03 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się rozwiązaniom praktycznym z kilku kluczowych obszarów analizy i przetwarzania danych. Zaczynamy od fuzzy string matching i technik dopasowywania niedoskonałych tekstów, przechodzimy przez architekturę pipeline&amp;rsquo;ów ETL opartych na open source, aż po szczegóły integracji Kafka, Flink i Spark w systemach streamingowych.&lt;/p&gt;&#10;&lt;p&gt;W sekcji Python znajdziesz porównanie nowości w wersjach 3.13 i 3.14, kompleksowy przewodnik (a nawet dwa, aby niejako dopełnić wiedzę) po Pydantic oraz praktyczne wzorce projektowe dla FastAPI. Nie zabraknie też tematów związanych z optymalizacją PostgreSQL w aplikacjach czasu rzeczywistego, zarządzaniem kosztami w chmurze AWS oraz głęboko partycjonowanymi danymi w Apache Spark.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-28</title><link>https://blog.prokulski.science/2025/04/28/newsletter-dane-i-analizy-2025-04-28/</link><pubDate>Mon, 28 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/28/newsletter-dane-i-analizy-2025-04-28/</guid><description>&lt;p&gt;W tym tygodniu mam dla was wybuchową mieszankę materiałów - od głębokiego uczenia maszynowego i tutoriala pisania własnych RAGów, przez wizualizację danych geolokalizacyjnych, po optymalizację dashboardów.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie chciałbym zwrócić waszą uwagę na serię artykułów poświęconych Apache Airflow i Kafce - dwa narzędzia, które stały się nieodłącznym elementem nowoczesnych potoków danych. Znajdziecie dzisiaj zarówno wprowadzenie do zmian wdrożonych w Airflow w wersji 3.0, jak i praktyczne informacje o tym jak pisać wydajne DAGi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-17</title><link>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</link><pubDate>Mon, 17 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/17/newsletter-dane-i-analizy-2025-03-17/</guid><description>&lt;p&gt;Sztuczna inteligencja w praktyce: Zajrzyj do repozytorium z technikami Retrieval-Augmented Generation (RAG), gdzie krok po kroku poznasz ich implementację, lub dowiedz się, jak AI może usprawnić procesy rejestracji użytkowników i przegląd kodu. Nie zabrakło też przeglądu narzędzi AI, które mogą znacząco zwiększyć Twoją produktywność.&lt;/p&gt;&#10;&lt;p&gt;Praca z danymi: Od modelowania danych w SQL dla sektora detalicznego po przetwarzanie danych w Microsoft Fabric z wykorzystaniem bibliotek takich jak pandas czy duckdb – znajdziesz tu konkretne przykłady i wskazówki, jak efektywnie zarządzać danymi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-03</title><link>https://blog.prokulski.science/2025/03/03/newsletter-dane-i-analizy-2025-03-03/</link><pubDate>Mon, 03 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/03/newsletter-dane-i-analizy-2025-03-03/</guid><description>&lt;p&gt;Kto, w podziale na grupy zawodowe, używa najwięcej AI? Ciekawa &lt;a href="https://www.visualcapitalist.com/charted-which-jobs-are-using-ai-the-most/"&gt;wizualizacja&lt;/a&gt; na ten temat, oparta na zapytaniach do Claude. Spoiler: 37.2% zapytań dotyczy komputerów i matematyki (w tym rozwoju oprogramowania), co raczej nie dziwi.&lt;/p&gt;&#10;&lt;p&gt;Zastanawiałeś się kiedyś nad przejściem z SQL na NoSQL? Artykuł &lt;em&gt;&amp;ldquo;I Dropped SQL for NoSQL&amp;rdquo;&lt;/em&gt; opisuje, jak taka zmiana wpłynęła na wydajność aplikacji, obsługując pięciokrotnie większy ruch i dziesięciokrotnie szybsze zapytania. Jeśli jednak wolisz pozostać przy SQL, &lt;em&gt;&amp;ldquo;3 Foundational Principles for Writing Efficient SQL&amp;rdquo;&lt;/em&gt; przypomina o podstawowych zasadach, które pomogą Ci pisać wydajne i czytelne zapytania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-02</title><link>https://blog.prokulski.science/2024/12/02/newsletter-dane-i-analizy-2024-12-02/</link><pubDate>Mon, 02 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/02/newsletter-dane-i-analizy-2024-12-02/</guid><description>&lt;p&gt;Motywem przewodnim w dzisiejszym odcinku jest API. Jakich frameworków użyć (w Pythonie), czym od siebie się różnią? A może websocket?&lt;/p&gt;&#10;&lt;p&gt;Podobnie mamy w sekcji z praktycznymi projektami z zakresu analizy danych (nie zawsze tam o samą analizę chodzi - czasem bardziej o uczenie maszynowe niż analizowanie w rozumieniu tzw. EDA): wykrywanie wartości odstających w zbiorach.&lt;/p&gt;&#10;&lt;p&gt;Co tydzień przedstawiamy tutaj kilka projektów wykorzystujących analizę danych, machine learning czy też AI. Zamiast czekać kilkanaście tygodni (i liczyć że temat, który Cię interesuje się pojawi) możesz zerknąć na &lt;a href="https://www.geeksforgeeks.org/top-data-science-projects/"&gt;&lt;strong&gt;stronę&lt;/strong&gt;&lt;/a&gt; gdzie zgromadzono ponad 65 (może i 69, a więc prawie 70!) przykładowych projektów razem z kodem źródłowym. Boot-camp z ML? Niepotrzebny! Wystarczą te projekty&amp;hellip; oraz porządne doczytanie dlaczego tak a nie inaczej zrobiono to czy tamto.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-07</title><link>https://blog.prokulski.science/2024/10/07/newsletter-dane-i-analizy-2024-10-07/</link><pubDate>Mon, 07 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/07/newsletter-dane-i-analizy-2024-10-07/</guid><description>&lt;p&gt;Dzisiaj w newsletterze mały eksperyment. Być może każdego tygodnia Ty, jako odbiorca tego maila, cierpisz na nadmiar materiału, klęskę urodzaju. Jest tyle (zwykle około 20-25) tekstów, każdy chciałoby się przeczytać (wierzę w to&amp;hellip; nawinie?), ale w sumie otwierasz te kilkanaście zakładek i nie czytasz niczego. Bo za dużo, bo po angielsku (hint: wtyczka Google Translate do Chrome daje radę, serio - chociażby po to, żeby przeskanować tekst na szybko, czytać lepiej w oryginale - chociażby nazwy zmiennych nie są wówczas tłumaczone). Zatem jak w dobrej restauracji: krótkie menu oznacza większą selekcję.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-29</title><link>https://blog.prokulski.science/2024/01/29/newsletter-dane-i-analizy-2024-01-29/</link><pubDate>Mon, 29 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/29/newsletter-dane-i-analizy-2024-01-29/</guid><description>&lt;p&gt;Ostatnio we wstępie pisałem o tym, że do #devops wpadają wszystkie rzeczy związane z dokeryzacją, drobnymi programami i usprawnieniami używanymi w konsoli. Dzisiaj wprowadzam sekcję &lt;strong&gt;#DataEngineering&lt;/strong&gt;. Powód jest dość prosty: najciekawsze są takie projekty, gdzie dane pobieramy, przetwarzamy, przesyłamy, gromadzimy, potem znowu przetwarzamy i pokazujemy użytkownikowi końcowemu. Prawie każdy taki projekt obecnie wykorzystuje AirFlow, Pythona, Kafkę, jakieś narzędzia BI, jakiś storage w postaci bazy danych albo na przykład Hadoopa. I do czego przypiąć taki tekst? Właśnie do &amp;ldquo;inżynierii danych&amp;rdquo;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-18</title><link>https://blog.prokulski.science/2023/12/18/newsletter-dane-i-analizy-2023-12-18/</link><pubDate>Mon, 18 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/18/newsletter-dane-i-analizy-2023-12-18/</guid><description>&lt;p&gt;Witam w najprawdopodobniej ostatnim numerze newslettera w tym roku. W przyszłym tygodniu mamy Boże Narodzenie, w kolejnym Nowy Rok - to raczej nie są momenty na przygotowywanie paczki artykułów o ML czy programowaniu ogólnie, raczej czas który lepiej poświęcić rodzinie, najbliższym albo najzwyczajniej odpoczynkowi od komputera.&lt;/p&gt;&#10;&lt;p&gt;Korzystając więc z okazji że &amp;ldquo;czytamy się&amp;rdquo; ostatni raz w tym roku chciałbym Wam życzyć tego co najlepsze, a przede wszystkim spokoju i odpoczynku. A już od stycznia - nowych projektów, nowej wiedzy, zdobywania kolejnych umiejętności.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-08-14</title><link>https://blog.prokulski.science/2023/08/08/newsletter-dane-i-analizy-2023-08-14/</link><pubDate>Tue, 08 Aug 2023 00:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/08/08/newsletter-dane-i-analizy-2023-08-14/</guid><description>&lt;p&gt;Na początek &lt;a href="https://youtu.be/NwiI4y8PC9g"&gt;tutorial&lt;/a&gt; (YT, 30 minut, po polsku), tym razem z LLMami w roli głównej - o tym jak zbudować chatbota odpowiadającego na pytania z własnej bazy wiedzy. Bardzo fajny materiał, takich trochę brakuje - chłopaki opowiadają o tych najbardziej kluczowych kawałkach kodu a nie o podstawach. Rozumiesz o czym jest mowa, nie ma straty czasu na opowiadanie co do jest model albo funkcja w Pythonie ;-)&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj też &lt;a href="https://levelup.gitconnected.com/mlops-mastering-machine-learning-deployment-an-intro-to-docker-kubernetes-helm-and-modern-web-b14dd140a9bf"&gt;pelny proces MLOps&lt;/a&gt; - wprowadzenie zawierające wszystkie elementy. Super tekst na początek dla każdego DevOpsa który chce się zająć tematami ML oraz każdego data scientisty, który chce umieć nowocześnie wdrażać swoje modele.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-24</title><link>https://blog.prokulski.science/2023/07/24/newsletter-dane-i-analizy-2023-07-24/</link><pubDate>Mon, 24 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/24/newsletter-dane-i-analizy-2023-07-24/</guid><description>&lt;p&gt;Pisanie newsletterów (oraz postów na bloga) jest proste - robi się to mniej więcej tak:&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://rmoff.net/images/2023/07/07.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Obrazek ten pochodzi z &lt;a href="https://rmoff.net/2023/07/19/blog-writing-for-developers/?utm_source=daneianalizy_newsletter"&gt;wpisu Robina Moffatta&lt;/a&gt; (polecam jeśli myślisz o pisaniu bloga lub pojedynczych tekstów o programowaniu, albo po prostu dokumentacji). Proces wygląda tak samo - czy są wakacje czy ich nie ma.&lt;/p&gt;&#10;&lt;p&gt;A że jestem w trakcie urlopu to pozwólcie, że dzisiaj na tym zakończymy wstęp.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/using-a-keras-tuner-for-hyperparameter-tuning-of-a-tensorflow-model-41978f53111"&gt;&lt;strong&gt;Using a Keras Tuner for Hyperparameter Tuning of a TensorFlow Model&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Hyperband Tuner użyty do doboru najlepszych parametrów dla przygotowanego modelu opartego i sieć neuronową&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-17</title><link>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</link><pubDate>Mon, 17 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</guid><description>&lt;p&gt;Gorąco polecam tekst &lt;a href="https://towardsdev.com/data-engineering-project-imdb-movie-analysis-3f79de2f4ce7"&gt;Data Engineering Project: IMDB Movie Analysis&lt;/a&gt; - przykład świetnego projektu pozyskiwania i przetwarzania danych.&lt;/p&gt;&#10;&lt;p&gt;A kiedy dane są już przetworzone - można je pokazać. Wspomniany tekst analizujący dane z IMDB też zawiera ten element, ale dzisiejsze wydanie pokazuje więcej takich przykładów czy też tutoriali. Mamy coś o rysowaniu wykresów (super jest &lt;a href="https://towardsdatascience.com/plotly-and-pandas-combining-forces-for-effective-data-visualization-2e2caad52de9"&gt;Plotly and Pandas: Combining Forces for Effective Data Visualization&lt;/a&gt;) ale też &lt;a href="https://nightingaledvs.com/data-journalism-colour-accessibility/"&gt;o kolorach i ich doborze&lt;/a&gt; do wykresów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://python.plainenglish.io/the-complete-guide-to-keras-loss-functions-776d319e729d"&gt;&lt;strong&gt;The Complete Guide to Keras Loss Functions&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy model uczy się tak, aby dopasować się do metryki, która weryfikuje czy działa on dobrze czy źle. Trzeba więc wiedzieć jak te metryki działają, aby osiągnąć to, czego chcemy. Tutaj znajdziesz informacje o metrykach dostępnych w TF&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-20</title><link>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</link><pubDate>Mon, 20 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</guid><description>&lt;p&gt;Wiecie kto generuje najwięcej ruchu w internecie? Kiedyś to było porno i torrenty (albo inne sposoby wymiany plików peer-to-peer). Teraz układ wygląda jak na poniższym obrazku, przynajmniej według danych &lt;a href="https://www.statista.com/chart/15692/distribution-of-global-downstream-traffic/"&gt;opublikowanych&lt;/a&gt; przez serwis Statista.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://prokulski.science/temp/static/nlt/global_internet_traffic.jpeg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj bardzo dużo treści - oraz eksperyment - polskie tytuły (ale przeważnie angielskie teksty). Wśród tych tekstów sporo o Apache Spark i konkretnych wykorzystaniach albo rozwiązaniach konkretnych problemów.&lt;br&gt;&#10;Znajdziecie też kilka fajnych tekstów o różnego typu problemach rozwiązywanych przez analizę czy modele danych (rekomendacje w Netflixie, OHE i Pandas), gorąco polecam tekst o Apache Arrow.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-05</title><link>https://blog.prokulski.science/2022/09/05/newsletter-dane-i-analizy-2022-09-05/</link><pubDate>Mon, 05 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/05/newsletter-dane-i-analizy-2022-09-05/</guid><description>&lt;p&gt;Pod logiem Fundacji Apache aż roi się od projektów, a świat big data to pewnie w 90-95% Apache COŚ. Znamy Kafkę, znamy Apache Spark, Apache Hadoop. Dzisiaj przedstawiamy (w dziale BigData) kilkoro innych członków rodziny.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zaś mamy dużo mapek do wyświetlenia naszym klientom na stronie (bo na przykład monitorujemy każdy wypożyczony rower, hulajnogę czy samochód i mamy miliony wejść na stronę dziennie) to w dziale DevOps coś o rozwiązaniu open soruce, które może zmniejszyć nasze koszty.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-18</title><link>https://blog.prokulski.science/2022/07/18/newsletter-dane-i-analizy-2022-07-18/</link><pubDate>Mon, 18 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/18/newsletter-dane-i-analizy-2022-07-18/</guid><description>&lt;p&gt;W tym tygodniu sporo materiałów związanych z przygotowywaniem modelu danych w bazie - to istotne zagadnienie, warto się chociaż trochę w temacie orientować jeśli projektujemy coś co ma dane przechować (i potem je przekazać dalej albo przekształcić).&lt;/p&gt;&#10;&lt;p&gt;Tak też wyszło, że zebrało się kilka zagadnień związanych z przetwarzaniem tekstu w Pythonie oraz przetwarzaniem (np. poprzez OCR) całych dokumentów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ml-prediction-on-streaming-data-using-kafka-streams-1e4ebd21008"&gt;&lt;strong&gt;ML prediction on streaming data using Kafka Streams&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Najsmaczniejsze kąski w przetwarzaniu danych w czasie rzeczywistym są właśnie takie - jest strumień danych, na nim działają jakieś modele machine learningowe i o czymś decydują. Tutaj dowiesz się jak to zbudować w kilku krokach&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-27</title><link>https://blog.prokulski.science/2022/06/27/newsletter-dane-i-analizy-2022-06-27/</link><pubDate>Mon, 27 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/27/newsletter-dane-i-analizy-2022-06-27/</guid><description>&lt;p&gt;Gorąco&amp;hellip; &lt;a href="https://www.youtube.com/watch?v=CKTKbiZW38Y"&gt;&lt;em&gt;żar leje się z nieba, taka spiekota w mieście to piekło&lt;/em&gt; (niczym w Hydrozagadce)&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Zatem gorące materiały: wyniki ankiety StackOverflow, którą osobiście traktuję jako wyznacznik tego jakie technologie są obecnie używane na rynku, czego warto się uczyć i co trzeba potrafić aby swobodnie zmieniać pracę. Pakiet materiałów od Krzyśka Sopyły do nauki ML oraz rozwiązanie konkretnych zagadnień takich jak pipeline dla danych ze Stravy.&lt;/p&gt;&#10;&lt;p&gt;Weźmiecie udział &lt;em&gt;w pieszym rajdzie PPTK na odznakę nizinną?&lt;/em&gt; Nawet jeśli nie, pamiętajcie że &lt;em&gt;dobrze jest łączyć przyjemne z pożytecznym!&lt;/em&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-16</title><link>https://blog.prokulski.science/2022/05/16/newsletter-dane-i-analizy-2022-05-16/</link><pubDate>Mon, 16 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/16/newsletter-dane-i-analizy-2022-05-16/</guid><description>&lt;p&gt;Łączyłem kiedyś accesssowe VBA z R - da się, nawet spoko działa. A było to tak, że Access wypluwał dane do CSV - chyba za pośrednictwem Excela, nie pamiętam - potem R to mieliło i robiło wykres, który wstawiany był jako obrazek do raportu opartego na szablonie zrobionym w&amp;hellip; VBA piszącym do Excela. Jak to cudo odziedziczyłem to przepisałem na Shiny produkujące PDFa z RMarkdowna i potrzebujący sobie sami te raporty robili, a nie czekali aż ja ręcznie te accessowe cuda odpalę (i zablokuję sobie komputer, bo przecież &amp;ldquo;raporty się generują&amp;rdquo;). O tym jak łączyć Excela z R czy Pythonem przeczytacie dzisiaj.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-03</title><link>https://blog.prokulski.science/2022/01/03/newsletter-dane-i-analizy-2022-01-03/</link><pubDate>Mon, 03 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/03/newsletter-dane-i-analizy-2022-01-03/</guid><description>&lt;p&gt;Dzisiaj kilka tematów &amp;ldquo;pokrytych&amp;rdquo; nie tylko jednym tekstem. Mamy więc coś o modelach BERT plus automatycznie tworzenie tekstów przez GPT-3, mamy wizualizacje danych na mapach (w R i Pythonie). Mamy też cykl, który pozwoli na napisanie bota do np. CS:GO.&lt;/p&gt;&#10;&lt;p&gt;Na blogu od dawna nie było nowego tekstu (stąd podlinkoway niżej tekst o GPT-3 ;), ale jakieś rzeczy robię i publikuję. Zwykle jest tak, że energia opada po przygotowaniu działającego kodu. Tak jest z serwowaniem obrazków przez API (przy okazji te obrazki się generują) - sami zobaczcie do &lt;a href="https://github.com/prokulski/image_api_threads"&gt;&lt;strong&gt;repozytorium&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-01</title><link>https://blog.prokulski.science/2021/11/01/newsletter-dane-i-analizy-2021-11-01/</link><pubDate>Mon, 01 Nov 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/01/newsletter-dane-i-analizy-2021-11-01/</guid><description>&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2021/10/beginners-guide-to-automl-with-an-easy-autogluon-example/"&gt;&lt;strong&gt;Beginner’s Guide to AutoML with an Easy AutoGluon Example&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This article was published as a part of the Data Science Blogathon Machine Learning is popular and is being used everywhere for applications ranging from financial services to healthcare, marketing &amp;amp; advertising to manufacturing. Almost all industries seem to derive substantial benefit using some form of Machine Learning. Over the recent past, automation technology also […] The post (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/visualising-similarity-clusters-with-interactive-graphs-20a4b2a18534?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Visualising Similarity Clusters with Interactive Graphs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Take advantage of Python, Plotly, and NetworkX to create interactive graphs to find similarity clusters Let us assume, as a running example, that my data is composed of word embeddings of the English language. I want to gain insights about the word distribution in the embedding space, specifically, if there are any clusters of very similar words, if there are words that are completely different (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-23</title><link>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</link><pubDate>Sat, 23 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</guid><description>&lt;p&gt;&lt;a href="https://preettheman.medium.com/best-front-end-python-frameworks-in-2021-643d1df6922c"&gt;&lt;strong&gt;Best front-end Python frameworks in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Welcome back! Python is an awesome programming language with a ton of capability, one of these functions is building GUI’s (front-ends), so let’s talk about some of my favorite front-ends frameworks for Python. Now, Python is an awesome language for web development as well, if you want to see some sample websites you can build with Python, check out this article below: Let’s take a look at some (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-18</title><link>https://blog.prokulski.science/2021/10/18/newsletter-dane-i-analizy-2021-10-18/</link><pubDate>Mon, 18 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/18/newsletter-dane-i-analizy-2021-10-18/</guid><description>&lt;p&gt;&lt;a href="https://mihaisplace.blog/2021/10/03/the-state-of-web-scraping-in-2021/"&gt;&lt;strong&gt;The State Of Web Scraping in 2021 – Mihai&amp;rsquo;s Blog&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Author: Mihai Avram | Date: 10/02/2021 The area of web scraping has really expanded in the last few years, and it helps to know some of the main frameworks, protocols, and etiquette so that you can build the next awesome Web Scraping tool to revolutionize our world! Or maybe just your local neighborhood, or workgroup – that’s fine too. In this post, we will cover. What is web scraping? What are (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-27</title><link>https://blog.prokulski.science/2021/09/27/newsletter-dane-i-analizy-2021-09-27/</link><pubDate>Mon, 27 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/27/newsletter-dane-i-analizy-2021-09-27/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/t-sne-machine-learning-algorithm-a-great-tool-for-dimensionality-reduction-in-python-ec01552f1a1e?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;t-SNE Machine Learning Algorithm — A Great Tool for Dimensionality Reduction in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning t-SNE Machine Learning Algorithm — A Great Tool for Dimensionality Reduction in Python How to use t-Distributed Stochastic Neighbor Embedding (t-SNE) to visualize high-dimensionality data? t-SNE visualization with different perplexities. Gif image by  author . Intro A successful data scientist understands a wide range of Machine Learning algorithms and can explain the results to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-20</title><link>https://blog.prokulski.science/2021/09/20/newsletter-dane-i-analizy-2021-09-20/</link><pubDate>Mon, 20 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/20/newsletter-dane-i-analizy-2021-09-20/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/vlookup-implementation-in-python-in-three-simple-steps-93b5a290fd72"&gt;&lt;strong&gt;VLOOKUP implementation in Python in three simple steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Oftentimes, in the field of data analytics, it’s the data cleaning and processing that takes the most amount of time and effort. While the steps such as data cleaning, filtering, and pre-processing are generally under-evaluated or overlooked as compared to more juicy components such as the model development, it’s the quality of data that determines the quality of output. As it is rightly said, (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-13</title><link>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</link><pubDate>Mon, 13 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/still-using-the-os-module-in-python-this-alternative-is-remarkably-better-7d728ce22fb7"&gt;&lt;strong&gt;Still Using the OS Module in Python? This Alternative is Remarkably Better&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Python’s OS module is a nightmare for managing files and folders. You should try Pathlib. File and folder management with Python’s os module is a nightmare. Yet, it’s an essential part of every data science workflow. Saving reports, reading configuration files, you name it — there’s no way around it. Picture this — you spend weeks building an API around your model, and it works flawlessly, at (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-16</title><link>https://blog.prokulski.science/2021/08/16/newsletter-dane-i-analizy-2021-08-16/</link><pubDate>Mon, 16 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/16/newsletter-dane-i-analizy-2021-08-16/</guid><description>&lt;p&gt;&lt;a href="https://pub.towardsai.net/5-popular-machine-learning-algorithms-bbb7c7358fb2"&gt;&lt;strong&gt;5 Popular Machine Learning algorithms&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning Source: Image by GDJ on  Pixabay A machine learning algorithm is conceptually similar to any other algorithm in computer science. An ML algorithm is a data-driven process that is used to create a production-ready machine learning model. If you consider machine learning to be a train for accomplishing a job, then machine learning models are the engines that push the train. The (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-09</title><link>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</link><pubDate>Mon, 09 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-08</title><link>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</link><pubDate>Sun, 08 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-24</title><link>https://blog.prokulski.science/2021/05/24/newsletter-dane-i-analizy-2021-05-24/</link><pubDate>Mon, 24 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/24/newsletter-dane-i-analizy-2021-05-24/</guid><description>&lt;p&gt;&lt;a href="https://neptune.ai/blog/what-makes-a-successful-machine-learning-engineer-my-story"&gt;&lt;strong&gt;What Makes a Successful Machine Learning Engineer? My Story&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;You’ve been doing machine learning for quite a while, and you’re starting to notice that your workload throughout a project is not constant. There are highs, with tasks that require your full dedication, and lows, where you mostly supervise processes that you’ve previously launched. You can do a (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cmdlinetips.com/2021/05/tips-to-customize-text-color-font-size-in-ggplot2-with-element_text/"&gt;&lt;strong&gt;10 Tips to Cuztomize Text Color, Font, Size in ggplot2 with element_text()&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;ggplot2’s theme system give us a great control over how the “non-data” elements of a plot should look like. The theme system helps elevate the plot you make by making finer changes and make it easy to look better. ggplot2’s theme system comes with multiple element_ functions, element_text() (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-14</title><link>https://blog.prokulski.science/2021/05/14/newsletter-dane-i-analizy-2021-05-14/</link><pubDate>Fri, 14 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/14/newsletter-dane-i-analizy-2021-05-14/</guid><description>&lt;p&gt;&lt;a href="https://medium.com/swlh/a-modern-set-up-for-python-package-development-f60b27a26bd7"&gt;&lt;strong&gt;A Modern Set-up for Python Package Development&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;From dependency management to quality assurance, documentation, and CI/CD&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://blog.adnansiddiqi.me/create-your-first-sales-dashboard-in-apache-superset/"&gt;&lt;strong&gt;Create your first sales dashboard in Apache Superset&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Superset dashboard tutorial. A step by step guide about how to use Apache Superset to create an interactive e-commerce sales dashboard to track enterprise KPIs. A free and open-source business intelligence tool to create interactive sales dashboard&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://blog.adnansiddiqi.me/getting-started-with-elasticsearch-7-in-python/"&gt;&lt;strong&gt;Getting started with Elasticsearch 7 in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Learn the basics of Elasticsearch 7.x, its setup, and implementation in Python.&lt;/p&gt;</description></item><item><title>Analiza polskiego crowdfundingu na bazie Patronite.pl</title><link>https://blog.prokulski.science/2020/08/30/analiza-polskiego-crowdfoundingu-na-bazie-patronite-pl/</link><pubDate>Sun, 30 Aug 2020 15:45:49 +0000</pubDate><guid>https://blog.prokulski.science/2020/08/30/analiza-polskiego-crowdfoundingu-na-bazie-patronite-pl/</guid><description>&lt;p&gt;Zebrałem informacje o ponad 1700 profilach na Patronite.pl - wiem ile zarabiają, ilu mają patronów i za co patroni płacą. Dzielę się tymi informacjami z Wami w - być może - &lt;strong&gt;największej analizie polskiego crowdfoundingu!&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;&lt;a href="https://patronite.pl/"&gt;Patronite&lt;/a&gt;&lt;/strong&gt; zgodnie z informacją na &lt;a href="https://pl.wikipedia.org/wiki/Patronite"&gt;Wikipedii&lt;/a&gt; to założony w 2015 roku serwis wspomagający pozyskiwanie finansowania przez osoby twórcze. Podstawową formą działalności portalu jest pomoc w zdobywaniu comiesięcznego wsparcia od osób indywidualnych i instytucji.&lt;/p&gt;&#10;&lt;blockquote&gt;&#10;&lt;p&gt;Dla czystości tekstu pełny kod źródłowy znajdziecie w &lt;a href="https://github.com/prokulski/patronite_analiza"&gt;repozytorium&lt;/a&gt;&lt;/p&gt;</description></item><item><title>R-base, R-dplyr, R-data.table i Python</title><link>https://blog.prokulski.science/2018/05/23/r-i-python/</link><pubDate>Wed, 23 May 2018 15:44:07 +0000</pubDate><guid>https://blog.prokulski.science/2018/05/23/r-i-python/</guid><description>&lt;p&gt;Podstawy manipulacji danymi w tabelkach. W R (trzy wersje) oraz w Pythonie. Bo to pierwszy post z cyklu &lt;em&gt;idziemy w stronę Pythona&lt;/em&gt;.&#10;W dzisiejszym wpisie zajmiemy się podstawowymi operacjami na tabelach (data frame) z danymi. &lt;strong&gt;Dlaczego to jest ważne?&lt;/strong&gt; Są to najczęściej wykonywane operacje w trakcie analizy danych, bo przecież:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;dane trzeba wczytać &lt;em&gt;do komputera&lt;/em&gt;&lt;/li&gt;&#10;&lt;li&gt;czasem zmodyfikować, na przykład policzyć wartość na podstawie dwóch lub więcej kolumn&lt;/li&gt;&#10;&lt;li&gt;wybrać określone wiersze lub określone kolumny&lt;/li&gt;&#10;&lt;li&gt;połączyć jedną tabelę z inną&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Z tak przygotowanych danych można później na przykład narysować wykres czy też wrzucić je do modelu. I to jest wystarczające, na co dowodem jest pewnie z 70% moich wpisów z ostatnich 12 miesięcy (albo i więcej). Kolejne 20% wpisów to sposób pozyskania danych. 10% było pewnie o modelach wszelakich.&#10;Osobiście uważam, że w R nauczyłem się na tyle dużo, aby przejść na kolejny poziom. W pracy są to aplikacje w Shiny czy też panele w wykorzystaniem &lt;em&gt;flexdashboard&lt;/em&gt; (znowu: w obu przypadkach 70% pracy to manipulacja danymi w tabelkach), ale ciągnie mnie do Pythona. Gdybym zaczynał przygodę z machine learning czy data science to wybrałbym Pythona. Jednocześnie mam nadzieję, że dla osób znających jeden z języków niniejszy wpis będzie ciekawym wprowadzeniem w drugi język.&#10;Jeśli chodzi o R to zobaczymy jak wykonać podstawowe operacje wykorzystując standardowe możliwości R (R-base), wykorzystując pakiety &lt;em&gt;dplyr&lt;/em&gt; (wchodzący w skład ekosystemu &lt;em&gt;tidyverse&lt;/em&gt;) oraz &lt;em&gt;data.table&lt;/em&gt;. W przykładach dla Pythona będzie to &lt;em&gt;pandas&lt;/em&gt;.&#10;Dlaczego data.table? &lt;a href="https://github.com/Rdatatable/data.table/wiki/Benchmarks-%3A-Grouping"&gt;Porównanie prędkości&lt;/a&gt; pokazuje, że dla bardzo dużych tabel data.table jest najszybszy.&#10;Zaczniemy od wczytania odpowiednich bibliotek. W R oczywiście:&lt;/p&gt;</description></item><item><title>Przewidywanie pogody</title><link>https://blog.prokulski.science/2018/04/12/przewidywanie-pogody/</link><pubDate>Thu, 12 Apr 2018 08:42:57 +0000</pubDate><guid>https://blog.prokulski.science/2018/04/12/przewidywanie-pogody/</guid><description>&lt;p&gt;W &lt;a href="../../2018/03/27/lato-bylo-cieplejsze/"&gt;poprzednim odcinku&lt;/a&gt; zebraliśmy dane o pogodzie w Polsce od 1951 roku. Dzisiaj przygotujemy prognozę pogody. Ale przede wszystkim nauczymy się weryfikować modele.&#10;Mając zgromadzone dane o pogodzie z ponad 60 lat (1951-2017) możemy pokusić się o prognozowanie temperatury w przyszłości. Wykorzystamy trzy (właściwie dwa) modele dostępne &lt;em&gt;od ręki&lt;/em&gt; w popularnych bibliotekach R oraz zaprzęgniemy do prognozowania sieć neuronową.&#10;Zaczniemy od potrzebnych bibliotek:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;tidyverse&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;lubridate&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;DBI&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# pobieranie danych z bazy SQLite&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;forecast&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# na potrzeby modeli ARIMA i ETS/STLF&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;keras&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# na potrzeby LSTM w TensorFlow&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;corrgram&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# wykres korelacji&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Na początek pobieramy dane o średniej dziennej temperaturze wszystkich stacji w latach 2000-2016. Te dane potraktujemy jako dane treningowe. Dane z 2017 roku potraktujemy jako testowe.&lt;/p&gt;</description></item><item><title>2017 na blogu</title><link>https://blog.prokulski.science/2018/01/04/2017-na-blogu/</link><pubDate>Thu, 04 Jan 2018 13:40:32 +0000</pubDate><guid>https://blog.prokulski.science/2018/01/04/2017-na-blogu/</guid><description>&lt;p&gt;Koniec jednego roku i początek drugiego to zazwyczaj czas różnych zestawień, podsumowań i planów. To podsumujmy 2017.&#10;Tym razem obędzie się bez kodów źródłowych, bo powtarzałbym posty o pobieraniu danych z Google Analytics (&lt;a href="../../2017/08/10/animowany-wykres-kolowy/"&gt;było o tym tu&lt;/a&gt;) i Facebooka (o &lt;a href="../../2017/12/29/diagnoza-wataha-czy-belfer/"&gt;tutaj było&lt;/a&gt;). Mam jednak nadzieję, że zainteresuje Was takie spojrzenie na analitykę strony - odrobinę szersze niż same odsłonki (chociaż oparte głównie o odsłonki).&#10;Tak się dobrze składa, że regularne pisanie (powrót do niego) zacząłem &lt;a href="../../2017/02/23/wracam/"&gt;pod koniec lutego 2017&lt;/a&gt; więc w sumie cała &lt;em&gt;aktualna&lt;/em&gt; zawartość mieści się w 2017 roku. W sumie było to 58 postów (to częściej niż raz na tydzień). Najwięcej w marcu (9 postów), od sierpnia po 5 sztuk na miesiąc. Jeśli zaś chodzi o dni tygodnia - wygrywają ex aequo czwartek i piątek.&#10;Pierwszy wykres mówi nam kiedy (w jakich porach dnia) jest ruch na stronie. Każdy, kto chociaż raz analizował takie dane zna doskonale ten kształt:&#10;&lt;img src="../../downloads/2018/01/blogstat_00-1.png" alt=""&gt;&#10;&lt;strong&gt;Zacznijmy od najpopularniejszych stron.&lt;/strong&gt;&#10;Dane na wykresach i w tabelach poniżej będą prezentowane w postaci ścieżki do postu - dzięki temu zobaczymy zarówno datę jak i tytuł wpisu.&#10;&lt;img src="../../downloads/2018/01/blogstat_01-1.png" alt=""&gt;&#10;Najpopularniejszym postem był ten o analizie cen wynajmowanych mieszkań z początku kwietnia. Popularność &lt;em&gt;zrobiła&lt;/em&gt; się dzięki Wykopowi. Co ciekawe - wpisując w Google “mieszkanie do wynajęcia” trafić można na stronę Wykopu z linkiem do mojego postu. Wciąż mam kilka po kilka wejść dziennie na ten post. Swoją drogą kilka dni temu zrobiłem coś podobnego dla ogłoszeń dotyczących samochodów - może też opublikuję?&#10;Drugie miejsce zajmuje strona główna bloga (co nie jest dziwne), a trzecie - post, który mógł wzbudzić poruszenie w niektórych redakcjach portali. Ruch głównie z walla niejakiego Olsa.&#10;Oto lista (tym razem klikalna ;) najpopularniejszych (41) postów spośród 50 najpopularniejszych stron:&lt;/p&gt;</description></item><item><title>Mapy, mapy raz jeszcze</title><link>https://blog.prokulski.science/2017/12/22/mapy-w-r-rgeos/</link><pubDate>Fri, 22 Dec 2017 13:42:57 +0000</pubDate><guid>https://blog.prokulski.science/2017/12/22/mapy-w-r-rgeos/</guid><description>&lt;p&gt;W jakim województwie leży wskazany punkt?&#10;Dzisiaj zajmiemy się obszarami, głównie w oparciu o pakiet &lt;code&gt;rgeos&lt;/code&gt;. Wpis raczej techniczny.&#10;Po załadowaniu poniższych pakietów:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;rgdal&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;rgeos&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;tidyverse&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;broom&lt;span style="color:#1f2328"&gt;)&lt;/span&gt; &lt;span style="color:#57606a"&gt;# for tidy=fortify&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;przygotujemy sobie dwa testowe obszary, na których przykładzie zobaczymy jak działają wybrane funkcje z pakietu &lt;code&gt;rgeos&lt;/code&gt;.&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;poly1 &lt;span style="color:#0550ae"&gt;&amp;lt;-&lt;/span&gt; &lt;span style="color:#6639ba"&gt;SpatialPolygons&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;list&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;Polygons&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;list&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;Polygon&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;coords&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#6639ba"&gt;matrix&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;c&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;1&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;1&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;),&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ncol&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; byrow&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#cf222e"&gt;FALSE&lt;/span&gt;&lt;span style="color:#1f2328"&gt;))),&lt;/span&gt; ID&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#6639ba"&gt;c&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;a&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;)),&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; &lt;span style="color:#6639ba"&gt;Polygons&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;list&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;Polygon&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;coords&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#6639ba"&gt;matrix&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;c&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;3&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;3&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;),&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ncol&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; byrow&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#cf222e"&gt;FALSE&lt;/span&gt;&lt;span style="color:#1f2328"&gt;))),&lt;/span&gt; ID&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#6639ba"&gt;c&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;b&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;))))&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;poly2 &lt;span style="color:#0550ae"&gt;&amp;lt;-&lt;/span&gt; &lt;span style="color:#6639ba"&gt;SpatialPolygons&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;list&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;Polygons&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;list&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;Polygon&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;coords&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#6639ba"&gt;matrix&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#6639ba"&gt;c&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;1&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;1&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;0.5&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;3&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;3&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;),&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ncol&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#0550ae"&gt;2&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; byrow&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#cf222e"&gt;FALSE&lt;/span&gt;&lt;span style="color:#1f2328"&gt;))),&lt;/span&gt; ID&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#6639ba"&gt;c&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;c&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;))))&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Szczerze powiedziawszy &lt;em&gt;mechanika&lt;/em&gt; budowania &lt;em&gt;polygonów&lt;/em&gt; jest koszmarna, ale korzystając z przykładów w sieci udało się je przygotować :) Zobaczmy jak wyglądają nasze obszary:&lt;/p&gt;</description></item><item><title>Kalendarz z Policją</title><link>https://blog.prokulski.science/2017/10/14/kalendarz-z-policja/</link><pubDate>Sat, 14 Oct 2017 09:54:47 +0000</pubDate><guid>https://blog.prokulski.science/2017/10/14/kalendarz-z-policja/</guid><description>&lt;p&gt;W jednym z ostatnich odcinków “Ucha prezesa” było coś o tym, że teraz rząd ma mówić o tym, że jest bezpiecznie (zamiast “Przez osiem lat Polki i Polacy…”). Sprawdzimy zatem bezpieczeństwo na polskich drogach. Ale punktem wyjścia będzie specyficzny sposób pokazania danych dziennych.&lt;/p&gt;&#10;&lt;h2 id="widok-kalendarza"&gt;Widok kalendarza&lt;/h2&gt;&#10;&lt;p&gt;Dane dzienne (takie, które mają jedną wartość dla każdego dnia - na przykład średnia temperatura, liczba osób robiących zakupy w sklepie) można pokazać na różne sposoby. Można pokazać je jako wykres punktowy (lub liniowy, kiedy punkty są połączone) - wówczas widać na przykład “falkę” (o ile są cykliczne, na przykład w weekendy jest mniej kupujących niż w tygodniu). Można policzyć średnie (lub zastosować inne miary agregujące) dla każdego dnia tygodnia i wykorzystać najprostszy (i często najlepszy) wykres słupkowy. A można pokazać to samo w formie swego rodzaju heat-mapy rozpiętej na kalendarzu.&#10;Wykres taki ma sens jeśli chcemy pokazać, że w danym dniu tygodnia (i być może poszczególnych tygodniach roku) coś odbiega od normy z całego tygodnia (albo innych miesięcy). Czyli przykładowe weekendy są inne niż dni od poniedziałku do piątku.&#10;Jeśli interesują Cię tylko wyniki przeglądu statystyk policyjnych - &lt;strong&gt;przejdź do &lt;a href="#wypadki-drogowe"&gt;analizy&lt;/a&gt;&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Jak nauczyć się R? Co czytać?</title><link>https://blog.prokulski.science/2017/08/30/jak-nauczyc-sie-r-co-czytac/</link><pubDate>Wed, 30 Aug 2017 14:09:36 +0000</pubDate><guid>https://blog.prokulski.science/2017/08/30/jak-nauczyc-sie-r-co-czytac/</guid><description>&lt;p&gt;W listach pytacie o źródła wiedzy dotyczącej R. Dzisiaj kilka linków.&#10;Na początek agregaty, które mogą okazać się wystarczające:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;a href="https://www.r-bloggers.com/"&gt;R Bloggers&lt;/a&gt; - platforma zbierająca treści z wielu blogów&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://blog.revolutionanalytics.com/"&gt;Revolution Analytics&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://www.datasciencecentral.com/profiles/blog/list"&gt;Data Science Central&lt;/a&gt; - platforma blogowa dla dłubiących w BigData&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Warto śledzić też blogi poszczególnych osób:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;a href="https://juliasilge.com/"&gt;Julia Silge&lt;/a&gt; to współautorka pakietu &lt;em&gt;tidytext&lt;/em&gt; (i jednocześnie data scientist w Stack Overflow)&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="http://varianceexplained.org/"&gt;Variance Explained&lt;/a&gt; - blog drugiego współautora &lt;em&gt;tidytext&lt;/em&gt;&lt;/li&gt;&#10;&lt;li&gt;blog &lt;a href="http://www.masalmon.eu/"&gt;Maëlle Salmon&lt;/a&gt;, który kiedyś dodałem do RSSów (trafiłem pewnie w poszukiwaniach czegoś konkretnego albo z r-bloggers)&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Jednym z lepszych miejsc jest cała domena związana z RStudio i poszczególne jej subdomeny, przede wszystkim &lt;a href="https://blog.rstudio.com/"&gt;blog RStudio&lt;/a&gt; oraz &lt;a href="https://rviews.rstudio.com/"&gt;RViews&lt;/a&gt;. W ramach RStudio znajdziecie też dużo informacji o poszczególnych pakietach - strona zbiorcza jest &lt;a href="https://www.rstudio.com/products/rpackages/"&gt;tutaj&lt;/a&gt;.&#10;Z polskich blogów szczególnie polecam dwa:&lt;/p&gt;</description></item><item><title>Zmiany temperatury w czasie - animowany wykres kołowy</title><link>https://blog.prokulski.science/2017/08/10/animowany-wykres-kolowy/</link><pubDate>Thu, 10 Aug 2017 08:12:44 +0000</pubDate><guid>https://blog.prokulski.science/2017/08/10/animowany-wykres-kolowy/</guid><description>&lt;p&gt;Kilka dni temu karierę na stronach poświęconych wizualizacji danych robił filmik obrazujący zmiany temperatury na przestrzeni lat. Na stronie &lt;a href="http://fb.com/DaneAnalizy"&gt;Dane i Analizy&lt;/a&gt; obiecałem, że opiszę jak można coś takiego zrobić.&#10;Wspomniany filmik to&lt;/p&gt;&#10;&lt;p&gt;Jakiś czas zastanawiałem się jakie dane pokazać i zdecydowałem, że będzie to liczba odsłon najpopularniejszych tekstów z bloga który czytasz. Przy okazji dowiemy się jak za pomocą R dostać się do statystyk zebranych w Google Analitycs.&#10;Oczywiście jest do tego stosowny pakiet, ale wcześniej potrzebna jest pewna konfiguracja konta googlowego. Jak zwykle w przypadku API potrzebny jest klucz - w tym przypadku jest to para &lt;em&gt;Client ID&lt;/em&gt; i &lt;em&gt;Secret ID&lt;/em&gt;. Aby je uzyskać wystarczy wykonać kroki opisane chociażby &lt;a href="https://github.com/LucyMcGowan/Tutorials/blob/master/googleanalytics.Rmd"&gt;tutaj&lt;/a&gt;.&#10;Dodatkowo instalujemy pakiet &lt;strong&gt;RGoogleAnalytics&lt;/strong&gt;:&lt;/p&gt;</description></item><item><title>Analiza twórczości J.K.Rowling</title><link>https://blog.prokulski.science/2017/07/03/analiza-tworczosci-j-k-rowling/</link><pubDate>Mon, 03 Jul 2017 15:40:10 +0000</pubDate><guid>https://blog.prokulski.science/2017/07/03/analiza-tworczosci-j-k-rowling/</guid><description>&lt;p&gt;W ostatnich dwóch wpisach &lt;a href="../../2017/06/28/lubimy-czytac/"&gt;analizowaliśmy oceny książek&lt;/a&gt; na podstawie bazy z serwisu z recenzjami książek a także &lt;a href="../../2017/06/30/kto-napisal-te-ksiazke/"&gt;prowadziliśmy śledztwo&lt;/a&gt; polegające na szukaniu autora książki. Tym razem zajmiemy się twórczością jednej autorki.&#10;Tą autorką będzie &lt;a href="https://pl.wikipedia.org/wiki/J.K._Rowling"&gt;J.K. Rowling&lt;/a&gt;, autorka bestsellerowej &lt;a href="https://pl.wikipedia.org/wiki/Harry_Potter_(seria_powie%C5%9Bci)"&gt;serii o Harrym Potterze&lt;/a&gt; oraz kilku książek dla dorosłych wydanych pod pseudonimem Robert Galbraith.&#10;Podobnie jak w poprzedniej części potrzebujemy książek w plikach tekstowych. Analizować będziemy angielskie wersje książek (ze względu na analizę wydźwięku - ang. &lt;em&gt;sentiment&lt;/em&gt;. W przypadku języka polskiego trudno o słowniki tegoż wydźwięku). Na początek sprawdźmy jakie słowa w poszczególnych książkach są najbardziej popularne:&#10;&lt;img src="../../downloads/2017/07/word_cloud-1.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-2.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-3.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-4.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-5.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-6.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-7.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-8.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-9.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-10.png" alt=""&gt;&#10;&lt;img src="../../downloads/2017/07/word_cloud-11.png" alt=""&gt;&#10;Nie jest dziwnym, że w serii o Potterze najpopularniejsze słowo to “Harry”. Później kolejno imiona poszczególnych bohaterów (Ron, Hermione) ale też na przykład różdżka (&lt;em&gt;wand&lt;/em&gt;)&#10;Zobaczmy teraz jak długie są poszczególne książki - sprawdźmy &lt;strong&gt;liczbę zdań&lt;/strong&gt; w każdej z nich:&#10;&lt;img src="../../downloads/2017/07/phrases_01-1.png" alt=""&gt;&#10;oraz &lt;strong&gt;liczbę słów&lt;/strong&gt;:&#10;&lt;img src="../../downloads/2017/07/phrases_02-1.png" alt=""&gt;&#10;Słupki w obu przypadkach są podobne, co może prowadzić do wniosku, że średnio każde zdanie składa się z podobnej ilości wyrazów:&#10;&lt;img src="../../downloads/2017/07/phrases_03-1.png" alt=""&gt;&#10;Na powyższym wykresie pionowa czerwona linia oznacza medianę (połowa zdań ma więcej słów, a druga połowa - mniej) zaś niebieska - średnią. Jak widać Rowling właściwie w każdej książce pisze zdania o podobnej długości. Niektóre “kopy” są wyższe - to wynik objętości książki.&#10;Powyższa seria wykresów nie pozwala na szybkie i łatwe porównanie parametrów (średniej i mediany) pomiędzy poszczególnymi książkami. Ale wykres jak poniżej już tak:&#10;&lt;img src="../../downloads/2017/07/phrases_04-1.png" alt=""&gt;&#10;Tutaj wyraźnie widać, że zdania są właściwie prawie zawsze tej samej długości.&#10;Przeanalizujmy na razie samego Pottera. Zobaczmy &lt;strong&gt;kiedy&lt;/strong&gt; (w których momentach książki i w których książkach z serii) &lt;strong&gt;pojawiają się poszczególni bohaterowie&lt;/strong&gt;. Na podstawie chmurki popularnych słów (za chwilę wyjdzie też to w parach słów - bigramach) wytypowałem kilkanaście osób: Harry, Ron, Hermione, Hagrid, Malfoy, Snape, Dumbledore, Voldemort, Vernon, McGonagall, Trelawney, Umbridge, Petunia, Lupin. Zobaczmy:&#10;&lt;img src="../../downloads/2017/07/names_01-1.png" alt=""&gt;&#10;Harry oczywiście występuje cały czas. Ale na przykład Ron i Hermoine pojawiają się gdzieś w 1/3 pierwszej części - wtedy zapewne Harry przybywa do szkoły czarodziei. Tak na przykład Umbridge największy udział ma w części &lt;em&gt;Harry Potter i Zakon Feniksa&lt;/em&gt;, w której się pojawia. Petunia z kolei pojawia się na początku każdej z części, podobnie jak Vernon. Być może coś ich łączy?&#10;Na pewno coś łączy Hermonię, Rona, Snape’a czy Mafloy’a lub Hagrida.&#10;Sprawdźmy &lt;strong&gt;jak często pojawiają się&lt;/strong&gt; poszczególne &lt;strong&gt;imiona&lt;/strong&gt; (8 najczęściej występujących). Poniższy wykres obrazuje udział procentowy popularności określonego imienia wśród ósemki najpopularniejszych imion. Czyli - im częściej dane imię pojawia się w części tym wyżej ono znajduje się na wykresie.&#10;&lt;img src="../../downloads/2017/07/names_02-1.png" alt=""&gt;&#10;Bez zaskoczenia Harry dominuje całą serię - połowa należy do niego. Ciekawe jest coś innego - udział Rona spada w kolejnych częściach, a delikatnie rośnie udział Hermoine. Z kolei Dumbledore najbardziej aktywny jest w części &lt;em&gt;Harry Potter i Książę Półkrwi&lt;/em&gt;. Widać to też na wcześniejszym wykresie&#10;Sprawdźmy teraz &lt;strong&gt;gdzie odbywa się akcja&lt;/strong&gt; (albo o jakich miejscach mowa). Do wyboru mamy (angielskie nazwy): privet drive, diagon alley, hogwarts, azkaban, ministry of magic, grimmauld place.&#10;&lt;img src="../../downloads/2017/07/places_01-1.png" alt=""&gt;&#10;Ciekawostka - “privet drive” pojawia się w tych samych miejscach co Petunia. Coś Wam to mówi?&#10;Na koniec sprawdźmy jakie i &lt;strong&gt;jak często występują klątwy i zaklęcia&lt;/strong&gt; (jak na książkę o magii przystało)?&#10;&lt;img src="../../downloads/2017/07/cruse_01-1.png" alt=""&gt;&#10;Początkowo zbyt wiele nie czarują, ale im dalej w las tym sprawa wygląda poważniej.&#10;Czas na ciekawsze sprawy - czy książki (już wracamy do całej twórczości Rowling) są coraz bardziej “pozytywne” czy wręcz przeciwnie? “Pozytywne”, bo wydźwięk może być pozytywny lub negatywny (w skali -5 dla negatywnych do +5 dla pozytywnych). Miara polega na przypisaniu każdemu ze słów określonej wartości liczbowej wyrażającej emocje i ich zabarwienie jakie niosą ze sobą słowa.&#10;I tak najbardziej negatywne to m.in. &lt;em&gt;bastard&lt;/em&gt;, &lt;em&gt;cock&lt;/em&gt;, &lt;em&gt;cocksucker&lt;/em&gt; i tym podobne, wszystkie mają po -5 punktów. &lt;em&gt;ass&lt;/em&gt; jest już ładogniejsze - ma -4 punkty. Te pozytywne to na przykład &lt;em&gt;breathtaking&lt;/em&gt; czy &lt;em&gt;outstanding&lt;/em&gt; (po +5 punktów), albo &lt;em&gt;amazing&lt;/em&gt; (+4 punkty). Neutralne (0 punktów) to &lt;em&gt;some kind&lt;/em&gt;. W słowniku AFINN zawartym w pakiecie &lt;em&gt;tidytext&lt;/em&gt; jest 2476 słów. Nie za dużo, ale wystarczająco.&#10;Każde ze słów (w ramach konkretnego zdania) mamy opisane “punktem czasowym” - w którym zdaniu (lub inaczej mówiąc - w którym procencie) książki występuje. Możemy więc policzyć średnią z wydźwięku dla kolejnych “chwil” w książce i je narysować na wykresie. Pisałem o tym trochę &lt;a href="../../2017/03/03/pulp-fiction-analiza-filmu/"&gt;w drugiej części tekstu o Pulp Fiction&lt;/a&gt;, tam też znajdziecie ciekawy film z krótkim wykładem Kurtem Vonneguta. Polecam poszukać czegoś na temat “Arc of Story”, chociażby tekst &lt;em&gt;&lt;a href="http://blogs.discovermagazine.com/d-brief/2016/07/06/the-6-story-arcs-that-define-western-literature/"&gt;6 Story Arcs Define Western Literature, Data-Mining Study Reveals&lt;/a&gt;&lt;/em&gt; (gdzie nota bene jest wykres mniej więcej przypominający to co mamy tutaj - dotyczy książki &lt;em&gt;Harry Potter i Insygnia Śmierci&lt;/em&gt;).&#10;&lt;img src="../../downloads/2017/07/sentiment_01-1.png" alt=""&gt;&#10;Zobaczmy jeszcze czy wraz z postępem czasy pani Rowling używa w swoich książkach słów coraz bardziej pozytywnych czy negatywnych?&#10;&lt;img src="../../downloads/2017/07/sentiment_02-1.png" alt=""&gt;&#10;W bardzo dużym uproszczeniu - jest coraz bardziej mrocznie. Ale różnice są na poziomie ułamków punktów.&#10;Teraz - podobnie jak w przypadku śledztwa dotyczącego Remigiusza Mroza i Zygmunta Miłoszewskiego - sprawdźmy czy statystycznie rzecz biorąc wszystkie badane książki napisała Rowling?&#10;Na początek podzielimy książki na dwie grupy - o Harrym Potterze (podpisanych jako J.K.Rowling) i pozostałe (podpisanych pseudonimem Robert Galbraith). Dla każdego ze słów w ramach tych grup policzymy udział procentowy w całej grupie. Na koniec weźmiemy po 10% najbardziej popularnych słów z grup i policzymy współczynnik korelacji pomiędzy częstościami wystąpienia.&#10;Podobieństwo liczone w ten sposób daje nam wartość &lt;strong&gt;0.76&lt;/strong&gt;. To całkiem sporo, chociaż dla porównania &lt;a href="../../2017/06/30/kto-napisal-te-ksiazke/"&gt;w poprzednim poście&lt;/a&gt; autorstwo &lt;em&gt;Enklawy&lt;/em&gt; przypisaliśmy Mrozowi na podstawie współczynnika równego 0.88 a &lt;em&gt;Bezcennego&lt;/em&gt; przypisaliśmy Miłoszewskiemu ze współczynnikiem 0.83.&#10;Spróbujmy zatem inaczej - nie ma co się ograniczać do najpopularniejszych słów (tym bardziej, że bez filtrowania są to głównie imiona bohaterów i miejsca akcji), skoro można porównać każdą książkę z każdą na podstawie wszystkich wspólnych słów (i ich częstości występowania):&#10;&lt;img src="../../downloads/2017/07/author_02-1.png" alt=""&gt;&#10;Widać tutaj wyraźnie trzy obszary:&lt;/p&gt;</description></item><item><title>Lubimy czytać - coś o książkach</title><link>https://blog.prokulski.science/2017/06/28/lubimy-czytac/</link><pubDate>Wed, 28 Jun 2017 13:49:14 +0000</pubDate><guid>https://blog.prokulski.science/2017/06/28/lubimy-czytac/</guid><description>&lt;p&gt;Jakiś czas temu była &lt;a href="../../2017/06/08/oceny-filmow-i-ich-przewidywanie/"&gt;analiza ocen filmów&lt;/a&gt; (na podstawie bazy Filmwebu), obiecałem w różnych miejscach, że będzie też o książkach. Zatem sprawdźmy czego możemy się dowiedzieć z danych pobranych z serwisu &lt;a href="http://lubimyczytac.pl/"&gt;LubimyCzytać.pl&lt;/a&gt;.&#10;Przez kilka tygodni skrypt działający sobie grzecznie na serwerze pobierał stronę po stronie z serwisu, analizował zapisane na niej dane i przepisywał je sobie do lokalnego pliku (dane zgromadziłem w pliku &lt;em&gt;books_total.RDS&lt;/em&gt;, z którego za chwilę je wczytamy).&#10;I tutaj ciekawostka. Poprosiłem redakcję serwisu o przesłane danych, tak aby nie zapychać im serwerów. Poprosiłem jednocześnie zaznaczając, że chcę przygotować niniejszą analizę, a jeśli nie otrzymam danych - pobiorę je samodzielnie. Odmówiono mi. Żeby być miłym oszczędziłem serwery (swoje i cudze) i przed kolejnymi &lt;em&gt;hitami&lt;/em&gt; w stronę czekałem losową liczbę sekund (od 1 do 3). Warto to robić, &lt;strong&gt;warto być przyzwoitym&lt;/strong&gt;. Ale mimo wszystko nie udało się pobrać wszystkich danych (a ileż możecie czekać na nowy post?). Tak czy inaczej - mamy ponad 330 tysięcy wierszy.&#10;Wiersze zawierają informację o tytule książki, jej autora, wydawnictwo, datę wydania (skorzystamy tylko z roku), liczbie stron i kategorii do której dana książka została przypisana w serwisie. Dodatkowo - to co najbardziej ciekawe - mamy średnią ocenę, liczbę ocen oraz liczbę każdej z ocen przyznanych przez użytkownika (od 1 do 10 &lt;em&gt;gwiazdek&lt;/em&gt;). Gdzieś jest też znacznik w jakim języku jest książka. Fajne dane, można sobie porobić różne przekroje. I tak zrobimy.&#10;Zaczynamy oczywiście od przygotowania środowiska - wczytanie pakietów i danych:&lt;/p&gt;</description></item><item><title>Tramwajem po grafie</title><link>https://blog.prokulski.science/2017/05/17/tramwajem-po-grafie/</link><pubDate>Wed, 17 May 2017 15:09:13 +0000</pubDate><guid>https://blog.prokulski.science/2017/05/17/tramwajem-po-grafie/</guid><description>&lt;p&gt;Dzisiaj trochę o grafach. Po drodze na nie się powoływałem, czasem nawet jakieś można było zobaczyć.&#10;Ale co to są te grafy? Był &lt;a href="../../2017/03/07/kola-w-zbozu/"&gt;wpis “edukacyjny” o metodach klasyfikacji&lt;/a&gt;, czas na kolejny.&#10;&lt;a href="https://pl.wikipedia.org/wiki/Graf_(matematyka)"&gt;Grafy to stwory matematyczne&lt;/a&gt;, które przydatne są na przykład w analizie sieci społecznych (wykrywanie “grup wzajemnej adoracji” albo ważnych osób wokół których skupiają się inni), logistyce (planowanie tras transportu). My zajmiemy się warszawskimi tramwajami. Bo to sieć, jakby nie było.&#10;Dane o trasach pobrałem ze &lt;a href="http://warszawa.wikia.com/wiki/Kategoria:Linie_tramwajowe"&gt;strony Warszawa.wikia.com&lt;/a&gt; ręcznie przepisując (Ctrl-C + Ctrl-V plus trochę Ctrl-H oraz &lt;em&gt;USUŃ.ZBĘDNE.ODSTĘPY()&lt;/em&gt; w Excelu) do tabeli, w której w pierwszej kolumnie jest numer linii, a w drugiej - kolejne przystanki na tej linii (ich nazwy).&lt;/p&gt;</description></item><item><title>Nowe pojazdy w Polsce po roku 2010</title><link>https://blog.prokulski.science/2017/04/29/nowe-pojazdy-w-polsce-po-roku-2010/</link><pubDate>Sat, 29 Apr 2017 09:57:58 +0000</pubDate><guid>https://blog.prokulski.science/2017/04/29/nowe-pojazdy-w-polsce-po-roku-2010/</guid><description>&lt;p&gt;Gdzie rejestruje się najwięcej nowych samochodów?&#10;&lt;strong&gt;Jak to porównywać i pokazywać?&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj proste zadanie, ale wymagające nieco gimnastyki. Otóż sprawdzimy gdzie przybywa najwięcej nowych samochodów. Skorzystamy z danych &lt;a href="https://bdl.stat.gov.pl/BDL/dane/podgrup/temat"&gt;GUSu&lt;/a&gt; (precyzyjniej jest to Kategoria: TRANSPORT I ŁĄCZNOŚĆ, Grupa: POJAZDY, Podgrupa: Zarejestrowane nowe pojazdy samochodowe (dane kwartalne)).&#10;Pobieramy ręcznie plik CSV (dane dla wszystkich okresów i wszystkich lat, tylko samochody osobowe), pamiętając żeby przed pobraniem pliku przełączyć układ danych na “według TERYT” (klucz TERYT jest najlepszy do łączenia danych z mapami - pobranymi w plikach SHP z &lt;a href="http://www.codgik.gov.pl/index.php/darmowe-dane/prg.html"&gt;CODGiK&lt;/a&gt; - zdaje się, że &lt;a href="../../2017/03/30/szybka-mapka-z-miastami/"&gt;było już o tym&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Prognoza stopy bezrobocia na 2017-2018</title><link>https://blog.prokulski.science/2017/04/26/prognoza-stopy-bezrobocia-na-2017-2018/</link><pubDate>Wed, 26 Apr 2017 12:28:23 +0000</pubDate><guid>https://blog.prokulski.science/2017/04/26/prognoza-stopy-bezrobocia-na-2017-2018/</guid><description>&lt;p&gt;Jakie będzie bezrobocie za dwa lata?&#10;A właściwie - jak wyznaczyć przyszłe dane na podstawie historii?&#10;Dzisiaj zajmiemy się prostą (automatyczną) predykcją szeregów czasowych.&#10;Co to jest &lt;strong&gt;szereg czasowy&lt;/strong&gt;? Ano, zbiór danych przypisanych do kolejnych dat (chwil w czasie - będąc bardziej precyzyjnym). Może to być wartość akcji dzień po dniu, może to być temperatura (czy dowolne inne wartości opisujące pogodę) lub cokolwiek innego, co ma swoje wartości w kolejnych momentach czasu. My zajmiemy się stopą bezrobocia w Polsce.&#10;Skorzystamy z miesięcznych danych &lt;a href="http://stat.gov.pl/obszary-tematyczne/rynek-pracy/bezrobocie-rejestrowane/stopa-bezrobocia-w-latach-1990-2017,4,1.html"&gt;publikowanych przez GUS&lt;/a&gt;. Dane są w ładnej tabelce na stronie, można więc je łatwo z niej wyciągnąć.&lt;/p&gt;</description></item><item><title>Oscary 2017 - kto wygrał? Bez czytania wiadomości!</title><link>https://blog.prokulski.science/2017/02/27/oscary-2017-kto-wygral-bez-czytania-wiadomosci/</link><pubDate>Mon, 27 Feb 2017 15:44:51 +0000</pubDate><guid>https://blog.prokulski.science/2017/02/27/oscary-2017-kto-wygral-bez-czytania-wiadomosci/</guid><description>&lt;p&gt;Jak dowiedzieć się kto wygrał Oscara? Bez czytania wiadomości. W każdej z kategorii. Korzystając tylko z Twittera, ale bez czytania poszczególnych twittów! Da się?&#10;Oczywiście, że się da. Potrzebujemy tylko danych i odrobiny sprytu przy ich przetwarzaniu.&#10;Najpierw dane. Napisałem skrypt, który pobierał co 5 minut wszystkie nowe twitty z hashtagu &lt;a href="https://twitter.com/search?q=%23Oscars"&gt;#Oscars&lt;/a&gt; i zapisywał je w pliku “Oscars_hash.Rds” lokalnie na dysku. Sposobów na pobranie danych z Twittera jest wiele, ja wybrałem ten - najszybciej było mi napisać odpowiedni skrypcik (w R - mniej więcej robiący tyle: wyszukaj najnowsze twitty z określonym hasłem, dodaj je do już znalezionych) i po prostu zostawić komputer na noc.&#10;Te same dane można pobrać i wpakować do bazy danych.&#10;Można też przygotować skrypt, który pobierze wszystko na raz.&#10;Skrypt możecie przygotować sobie samodzielnie, zachęcam. Tak czy inaczej - w R polecam bibliotekę &lt;a href="https://cran.r-project.org/web/packages/twitteR/index.html"&gt;twitteR&lt;/a&gt;.&#10;Trzeba jednak liczyć się z ograniczeniami API Twittera - określona liczba zapytań w czasie, określona (maksymalna) liczba wyników zwracanych dla jednego zapytania. Z powodu tych ograniczeń dane przygotowane przeze mnie zawierają maksymalnie 3200 Twittów pobranych raz na 5 minut. Do naszej analizy to wystarczy. Poza tym - moją ideą przy prezentowaniu kolejnych postów jest pokazanie, że bez płacenia za jakiekolwiek dane można fajnie się pobawić i czegoś nauczyć.&#10;Dzisiaj korzystamy jak zazwyczaj z bibliotek &lt;em&gt;ggplot2&lt;/em&gt;, &lt;em&gt;dplyr&lt;/em&gt;, &lt;em&gt;lubridate&lt;/em&gt; oraz &lt;a href="http://tidytextmining.com/"&gt;tidytext&lt;/a&gt; do operacji na słowach. Fajna biblioteka, dużo przykładów, jeszcze się będziemy nią bawić.&#10;Pobieramy dane zapisane przez skrypty zapisujące to, co działo się na Twitterze i rozdzielamy czas opublikowania twittu na dzień, godzinę i minutę (po tym będziemy później szukać i grupować). Przy okazji wytniemy dane tylko dla 27 lutego (ceremonia była już 27 lutego naszego czasu), żeby nie ciągnąć za dużego ogona ze sobą.&lt;/p&gt;</description></item><item><title>Oskarowe nominacje i filmy</title><link>https://blog.prokulski.science/2007/02/23/oskarowe-nominacje-i-fimy/</link><pubDate>Fri, 23 Feb 2007 17:35:55 +0000</pubDate><guid>https://blog.prokulski.science/2007/02/23/oskarowe-nominacje-i-fimy/</guid><description>&lt;p&gt;U RAFiego przeczytałem &lt;a href="http://ja.rafi.pl/2007/02/23/oscartorrents/"&gt;króciutki wpis&lt;/a&gt; (właściwie tylko link) o serwisie poświęconym tegorocznym Oscarom. Takie prawie Oscary w wersji Web2.0 ;)&#10;Jest sobie lista, jest głosowanie. I co najciekawsze - są linki do torrentów z filmami (lub wyszukiwaczki tychże torrentów). &lt;a href="http://oscartorrents.com/"&gt;Piękna inicjatywa ;)&lt;/a&gt; Ciekawe czy dotrwa do rozdania nagród?&#10;Swoją drogą - ciekawe czy w dobie web2.0 panoszącego się wszędzie kiedyś zniknie coś takiego jak Akademia Filmowa i Oscary przyznawać będą np. internauci? Coś jak &lt;a href="http://imdb.com/chart/top"&gt;ranking&lt;/a&gt; na stronach IMDB.com, ale dla filmów z danego roku. Plus filmy do ściągnięcia (nawet za opłatą).&lt;/p&gt;</description></item></channel></rss>