<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Python on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/python/</link><description>Recent content in Python on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Tue, 22 Sep 2026 11:42:48 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/python/index.xml" rel="self" type="application/rss+xml"/><item><title>DuckDB 250x szybszy od Postgresa, 14 indeksów pod lupą i architektura MCP na produkcji</title><link>https://blog.prokulski.science/2026/09/22/duckdb-250x-szybszy-od-postgresa-14-indeksow-pod-lupa-i-architektura-mcp-na-produkcji/</link><pubDate>Tue, 22 Sep 2026 11:42:48 +0000</pubDate><guid>https://blog.prokulski.science/2026/09/22/duckdb-250x-szybszy-od-postgresa-14-indeksow-pod-lupa-i-architektura-mcp-na-produkcji/</guid><description>&lt;p&gt;W tym tygodniu (znowu) dużo konkretów: pomiary, decyzje architektoniczne i rzeczy, które wyglądają na dobre praktyki, dopóki ktoś nie zmierzy, co naprawdę robią. Jak indeks w Postgresie, który spowalnia 4-krotnie zamiast przyspieszać.&lt;/p&gt;&#10;&lt;p&gt;Tematy rozłożone między:&lt;/p&gt;&#10;&lt;p&gt;inżynierię danych (bazy, pipeline, data lake, migracje), systemy agentów AI i ich bezpieczeństwo, inżynierię oprogramowania (design doc, code review, monorepo), praktyczny Python i DevOps.&lt;/p&gt;&#10;&lt;p&gt;Przy okazji — tym razem pokusiłem się o polskie tytuły artykułów. Daj znać, czy to działa, czy jednak wolisz oryginalne angielskie. Odpowiedź na tego maila wystarczy.&lt;/p&gt;</description></item><item><title>LLM zwraca poprawny JSON i się myli. Plus: pathlib, benchmarki i marka osobista w IT</title><link>https://blog.prokulski.science/2026/09/07/llm-zwraca-poprawny-json-i-sie-myli-plus-pathlib-benchmarki-i-marka-osobista-w-it/</link><pubDate>Mon, 07 Sep 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/09/07/llm-zwraca-poprawny-json-i-sie-myli-plus-pathlib-benchmarki-i-marka-osobista-w-it/</guid><description>&lt;p&gt;W tym wydaniu dużo o narzędziach, które już pewnie masz w stosie, ale rzadko trafia się dobry materiał tłumaczący ich działanie od środka. Są tu teksty o Airflow 3, dbt, Marquezie i formatach serializacji, a każdy z nich ma konkretną tezę, nie tylko opis funkcji.&lt;/p&gt;&#10;&lt;p&gt;jak migracja z legacy ETL do dbt wygląda krok po kroku, dlaczego Parquet eliminuje do 80% narzutu I/O w porównaniu z CSV, co Marquez robi z Twoim data lineage i jak integruje się z OpenLineage.&lt;/p&gt;</description></item><item><title>Medallion pęka w szwach, agenci tracą kontekst... co z tym zrobić?</title><link>https://blog.prokulski.science/2026/07/27/medallion-peka-w-szwach-agenci-traca-kontekst-co-z-tym-zrobic/</link><pubDate>Mon, 27 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/27/medallion-peka-w-szwach-agenci-traca-kontekst-co-z-tym-zrobic/</guid><description>&lt;p&gt;Ten numer ma wyraźny środek ciężkości: agenci AI i to, co z nimi robić, kiedy wychodzisz poza pierwsze eksperymenty. Teksty o LangGraph - od &amp;ldquo;jak zbudować pierwszego agenta&amp;rdquo; po &amp;ldquo;co psuje się po kilku miesiącach&amp;rdquo; - tworzą razem coś w rodzaju mini-ścieżki, którą można przejść od razu albo wracać do poszczególnych etapów w miarę potrzeb. Uzupełnia je tekst o tym, jak zmienia się rola programisty, kiedy AI przejmuje pisanie kodu - i dlaczego to jest trudniejsze niż się wydaje.&lt;/p&gt;</description></item><item><title>ATS ocenia CV losowo, tmux ratuje deploy, VLM czyta wideo</title><link>https://blog.prokulski.science/2026/07/13/ats-ocenia-cv-losowo-tmux-ratuje-deploy-vlm-czyta-wideo/</link><pubDate>Mon, 13 Jul 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/07/13/ats-ocenia-cv-losowo-tmux-ratuje-deploy-vlm-czyta-wideo/</guid><description>&lt;p&gt;W tym wydaniu dużo o tym, jak AI wchodzi głębiej w infrastrukturę - i co z tego faktycznie wynika w praktyce. Mamy zarówno materiały pokazujące granice modeli językowych (ocena CV, rozumienie sarkazmu), jak i te, które pokazują, jak je sensownie wkomponować w działające systemy (logi, inference stack, MCP nad Postgresem).&lt;/p&gt;&#10;&lt;p&gt;Architektura i skalowanie: od powiadomień push przy milionie odbiorców, przez inference stack złożony z vLLM, KServe i llm-d, po zaawansowane materializacje w DWH, Data Engineering i semantic layer: dbt + Looker w pełnym cyklu, pięć paradygmatów modelowania danych i nowości z frontu LookML, Computer vision: OpenCV 5 bez PyTorcha, detekcja sylwetek z 0,16 ms latencją i scene graphy budowane przez VLM.&lt;/p&gt;</description></item><item><title>Dashboard i agent muszą się zgadzać. Plus Kueue, Iceberg i kryzys jakości kodu przy 40 stopniach w cienu</title><link>https://blog.prokulski.science/2026/06/29/dashboard-i-agent-musza-sie-zgadzac-plus-kueue-iceberg-i-kryzys-jakosci-kodu-przy-40-stopniach-w-cienu/</link><pubDate>Mon, 29 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/29/dashboard-i-agent-musza-sie-zgadzac-plus-kueue-iceberg-i-kryzys-jakosci-kodu-przy-40-stopniach-w-cienu/</guid><description>&lt;p&gt;Witaj w pierwsym wakacyjnym wydaniu newslettera Dane i Analizy — przygotowanym w niedzielę wieczór, gdy Polska powoli stygła (ta, jasne&amp;hellip;) po tym, co meteorolodzy nazwali najgorętszym dniem w historii pomiarów. Nawet 40 stopni w cieniu. Skoro już jesteś przed ekranem zamiast przy wiatraczku, to dobrze trafiłeś — zebrałem dla Ciebie materiały, które warto przeczytać przy klimatyzacji lub choćby przy otwartym oknie.&lt;/p&gt;&#10;&lt;p&gt;W tym numerze sporo miejsca zajmują agenty AI — i to z różnych kątów. Dowiesz się, jak wyposażyć LLM w mózg data inżyniera, dlaczego Twój agent i dashboard mogą sobie wzajemnie zaprzeczać (i jak temu zaradzić architektonicznie), czym jest Agent Experience jako nowy wymiar projektowania API, a do tego jak AI wkracza do katalogów danych. Temat agentów w danych to nie hype — to realny kierunek, który warto rozumieć głębiej niż na poziomie demo.&lt;/p&gt;</description></item><item><title>AI agenci, nudny backend i polskie głosy o architekturze hexagonalnej</title><link>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</link><pubDate>Mon, 18 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz powrotu do sprawdzonych, &amp;ldquo;nudnych&amp;rdquo; technologii.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenci AI i modele LLM (Claude, ChatGPT) ewoluują w stronę praktycznych narzędzi do budowania skillów i automatycznego naprawiania testów, pokazujemy, dlaczego architekci coraz częściej rezygnują ze złożonych baz grafowych na rzecz sprawdzonych ontologii SQL, i tłumaczymy, dlaczego w backendzie prostota i standaryzacja wygrywają z niepotrzebną innowacyjnością.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu skupiamy się na hybrydowym podejściu do analityki i optymalizacji kosztów.&lt;/p&gt;</description></item><item><title>Od potoków danych w YAML po automatyzację SharePoint API</title><link>https://blog.prokulski.science/2026/05/04/od-potokow-danych-w-yaml-po-automatyzacje-sharepoint-api/</link><pubDate>Mon, 04 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/04/od-potokow-danych-w-yaml-po-automatyzacje-sharepoint-api/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na przełomowych zmianach w sposobie, w jaki systemy AI wchodzą w interakcję z naszym otoczeniem technologicznym.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy Model Context Protocol (MCP) – otwarty standard, który kończy erę pisania dedykowanych integracji, sprawdzamy, jak agenty AI płynnie komunikują się z bazami danych w modelu „plug-and-play”, i pokazujemy praktyczne wdrożenia budujące skalowalne ekosystemy sztucznej inteligencji.&lt;/p&gt;&#10;&lt;p&gt;W obszarze Data Engineeringu i analityki dbt pozostaje centralnym punktem, ale jego rola ewoluuje w stronę pełnej automatyzacji.&lt;/p&gt;</description></item><item><title>Czy AI naprawi Twoje błędy na produkcji? Plus 25 materiałów o Data &amp; AI</title><link>https://blog.prokulski.science/2026/04/27/czy-ai-naprawi-twoje-bledy-na-produkcji-plus-25-materialow-o-data-ai/</link><pubDate>Mon, 27 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/27/czy-ai-naprawi-twoje-bledy-na-produkcji-plus-25-materialow-o-data-ai/</guid><description>&lt;p&gt;Dzisiejsze wydanie zdominowała dojrzałość systemów AI i ich przejście od prostego generowania kodu do pełnej orkiestracji procesów.&lt;/p&gt;&#10;&lt;p&gt;Mamy fascynujące studium przypadku AI, która samodzielnie diagnozuje i naprawia błędy na produkcji, sprawdzamy, jak autonomiczne agenty przejmują kontrolę nad cyklem życia eksperymentów ML, a także analizujemy model sub-agentów wspierających rolę Senior Staff Engineera w zarządzaniu złożonymi projektami.&lt;/p&gt;&#10;&lt;p&gt;W obszarze Data Engineeringu i analityki widać wyraźny trend w stronę profesjonalizacji i &lt;em&gt;utwardzania&lt;/em&gt; pipeline’ów (na przykład korzystając z Data Build Tool).&lt;/p&gt;</description></item><item><title>Lokalne AI, optymalizacja Kafki i analiza 50 tysięcy profili randkowych</title><link>https://blog.prokulski.science/2026/02/16/lokalne-ai-optymalizacja-kafki-i-analiza-50-tysiecy-profili-randkowych/</link><pubDate>Mon, 16 Feb 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/02/16/lokalne-ai-optymalizacja-kafki-i-analiza-50-tysiecy-profili-randkowych/</guid><description>&lt;p&gt;W dzisiejszym wydaniu łączymy praktyczne podejście do AI z fundamentami inżynierii danych. Zaczynamy od narzędzi agentowych – customizacji Claude Code dla Pythona (gdzie język jest przykładem - to samo można zrobić chociażby dla Javy) i OpenClaw jako lokalnego asystenta AI z pełną kontrolą nad danymi.&lt;/p&gt;&#10;&lt;p&gt;W sekcji ML znajdziecie automatyzację audytu katalogów z użyciem XGBoost, wprowadzenie do PyCaret (taka biblioteka auto-ml dla Pythona) oraz semantyczne wyszukiwanie obrazów łączące Gemini z Elasticsearch.&lt;/p&gt;</description></item><item><title>AI: "jednocześnie dużo mądrzejsze i dużo głupsze, niż się spodziewałem"</title><link>https://blog.prokulski.science/2026/01/05/ai-jednoczesnie-duzo-madrzejsze-i-duzo-glupsze-niz-sie-spodziewalem/</link><pubDate>Mon, 05 Jan 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/01/05/ai-jednoczesnie-duzo-madrzejsze-i-duzo-glupsze-niz-sie-spodziewalem/</guid><description>&lt;p&gt;W dzisiejszym wydaniu szeroki przegląd tego, co dzieje się na styku AI, danych i infrastruktury. Zajrzymy pod maskę architektur agentowych, gdzie bazy danych przejmują rolę pamięci długoterminowej i koordynują działanie systemów wieloagentowych. Zobaczymy, jak w praktyce działają autonomiczne pipeline&amp;rsquo;y AI — od generatora pomysłów biznesowych po systemy RAG obsługujące tysiące zapytań na sekundę.&lt;/p&gt;&#10;&lt;p&gt;Nie zabraknie konkretów z obszaru data engineeringu: hybrydowe tabele BigQuery z sekundową świeżością danych, otwarte formaty tabelaryczne (Delta Lake, Iceberg) i nowe możliwości DuckDB — od notebooków w przeglądarce po przetwarzanie terabajtów lokalnie. PostgreSQL również dostaje swoje pięć minut: od wewnętrznych mechanizmów recovery po niedoceniane funkcje, które warto znać.&lt;/p&gt;</description></item><item><title>System design, bazy danych i praktyczny Python</title><link>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</link><pubDate>Mon, 10 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/10/system-design-bazy-danych-i-praktyczny-python/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych aspektach projektowania i optymalizacji systemów danych.&lt;br&gt;&#10;Zaczynamy od architektury: poznasz sprawdzone metody nauki projektowania systemów oraz zajrzysz pod maskę infrastruktury OpenAI opartej na Kubernetes i Apache Kafka.&lt;br&gt;&#10;W sekcji baz danych znajdziesz spojrzenie na BigQuery z perspektywy programistów Pythona oraz dwanaście realnych przypadków migracji do DuckDB z konkretnymi oszczędnościami.&lt;/p&gt;&#10;&lt;p&gt;Miłośnicy Pythona znajdą też kilka wartościowych materiałów: od elegancji dekoratorów, przez biblioteki przewyższające Excela, po praktyczną migrację z PostgreSQL do MongoDB. Warto zerknąć na porównanie HTTPX z Requests (nie tylko w kontekście projektów LLM, ale po prostu na httpx jako nowocześniejszy pakiet) oraz omówienie narzędzia UV Toolchain do stabilizacji środowisk CI/CD.&lt;/p&gt;</description></item><item><title>Kafka jest szybka, ale użyję Postgres</title><link>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</link><pubDate>Mon, 03 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się rozwiązaniom praktycznym z kilku kluczowych obszarów analizy i przetwarzania danych. Zaczynamy od fuzzy string matching i technik dopasowywania niedoskonałych tekstów, przechodzimy przez architekturę pipeline&amp;rsquo;ów ETL opartych na open source, aż po szczegóły integracji Kafka, Flink i Spark w systemach streamingowych.&lt;/p&gt;&#10;&lt;p&gt;W sekcji Python znajdziesz porównanie nowości w wersjach 3.13 i 3.14, kompleksowy przewodnik (a nawet dwa, aby niejako dopełnić wiedzę) po Pydantic oraz praktyczne wzorce projektowe dla FastAPI. Nie zabraknie też tematów związanych z optymalizacją PostgreSQL w aplikacjach czasu rzeczywistego, zarządzaniem kosztami w chmurze AWS oraz głęboko partycjonowanymi danymi w Apache Spark.&lt;/p&gt;</description></item><item><title>Język polski najlepszy do promptowania?</title><link>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</link><pubDate>Mon, 27 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/27/jezyk-polski-najlepszy-do-promptowania/</guid><description>&lt;p&gt;W dzisiejszym wydaniu dominują tematy związane z infrastrukturą danych i narzędziami AI. Szczególnie polecam artykuł o benchmarku ONERULER – okazuje się, że język polski najlepiej radzi sobie z analizą długich kontekstów w modelach językowych!&lt;/p&gt;&#10;&lt;p&gt;Jeśli budujesz pipeline&amp;rsquo;y danych, znajdziesz praktyczne przewodniki po open table formats (Iceberg, Delta Lake), kompletnej konfiguracji Docker+Airflow+dbt+Postgres oraz wzorcach SQL w DuckDB. Dla zainteresowanych Kafką – materiały o wysokiej dostępności na GKE Autopilot i alternatywie w postaci BufStream z silniejszymi gwarancjami spójności.&lt;/p&gt;</description></item><item><title>Sporo Streamlit i tutoriali budowania Agnetów AI</title><link>https://blog.prokulski.science/2025/09/08/sporo-streamlit-i-tutoriali-budowania-agnetow-ai-newsletter-dane-i-analizy--y-m-d/</link><pubDate>Mon, 08 Sep 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/09/08/sporo-streamlit-i-tutoriali-budowania-agnetow-ai-newsletter-dane-i-analizy--y-m-d/</guid><description>&lt;p&gt;Gdy jedni wciąż zastanawiają się, czy warto eksperymentować z agentami AI, inni już budują kompletne systemy analityczne z Pydantic-AI i Streamlit. Gdy niektóre zespoły mierzą się z podstawową konfiguracją Kafki, inne optymalizują przepustowość na poziomie miliona wiadomości na sekundę. Między innymi o tym dzisiaj.&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Rewolucja agentów AI&lt;/strong&gt; - od zera do działającego agenta z LangGraph, plus praktyczne połączenie Streamlit z Pydantic-AI do analizy danych. To nie są już tylko proof-of-concept, to konkretne narzędzia robocze.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-07-07</title><link>https://blog.prokulski.science/2025/07/07/newsletter-dane-i-analizy-2025-07-07/</link><pubDate>Mon, 07 Jul 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/07/07/newsletter-dane-i-analizy-2025-07-07/</guid><description>&lt;p&gt;Ten tydzień przyniósł szczególnie bogate żniwo materiałów technicznych – po zwyczajowej analizie dziesiątek źródeł i setek (jeśli nie tysięcy) artykułów, udało się wyłonić zwyczajowe &amp;ldquo;około dwadzieścia&amp;rdquo; najważniejszych publikacji z obszaru data science, ML i AI. Rozkład tematyczny doskonale odzwierciedla aktualne trendy w branży (i zainteresowania Redaktora Naczelnego): dominuje Python i Data Engineering. Ale (poza zainteresowaniami Naczelnego) potwierdza to centralną rolę tych obszarów w nowoczesnych zagadnieniach związanych z danymi.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie interesujące są materiały dotyczące architektury systemów AI – od multi-agentowych rozwiązań Anthropic, przez unifikację ML na Ray w Pinterest, aż po praktyczne implementacje MLOps z pełnym monitoringiem. Widać wyraźnie, że branża przechodzi od eksperymentów do produkcyjnych, skalowalnych rozwiązań.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-16</title><link>https://blog.prokulski.science/2025/06/16/newsletter-dane-i-analizy-2025-06-16/</link><pubDate>Mon, 16 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/16/newsletter-dane-i-analizy-2025-06-16/</guid><description>&lt;p&gt;Mamy poniedziałek rano, więc zaparzaj kawę i przygotuj się na rozpoczęcie tygodnia z porcją wiedzy z świata danych i sztucznej inteligencji.&lt;/p&gt;&#10;&lt;p&gt;Witam przede wszystkich nowych subskrybentów! Zgodnie z obietnicą (warto śledzić moje social media): oto moja najnowsza książka mówiącej o tym, co trzeba umieć, aby pracować z danymi - od zupełnych podstaw w Excelu do dużych projektów data-inżynieryjnych, modeli AI czy dashboardów dla zarządów największych spółek.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://prokulski.science/temp/static/jak-zostac-analitykiem.pdf?utm_source=newsletter-dia-2025-06-16&amp;amp;utm_medium=mail-link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;img src="https://prokulski.science/temp/static/jak-zostac-analitykiem-small.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Książka na razie dostępna jest za darmo, więc należy się śpieszyć. To wersja 1.0.beta, więc wszystkie uwagi mile widziane!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-09</title><link>https://blog.prokulski.science/2025/06/09/newsletter-dane-i-analizy-2025-06-09/</link><pubDate>Mon, 09 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/09/newsletter-dane-i-analizy-2025-06-09/</guid><description>&lt;p&gt;Dzisiaj momentami jest grubo - na przykład matematyczna elegancja B-spline&amp;rsquo;ów. Ale jest też trochę praktyki w DuckDB. Jeśli myślisz, że świat danych to tylko nudne CSVki i niekończące się ETLe, ten numer (mam nadzieję) przekona Cię, że to naprawdę fascynująca dziedzina pełna niespodzianek.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie polecam zwrócić uwagę na historię firmya Tencent Music, która oszczędziła 80% kosztów przenosząc się z Elasticsearch na Apache Doris - to jeden z tych przypadków, gdy zmiana architektury naprawdę się opłaca. Z kolei dla miłośników optymalizacji opowieść o tym, jak Python API można przyspieszyć 10x bez przepisywania na Go czy Rust - czasem wystarczy po prostu dobrze pomyśleć!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-02</title><link>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</link><pubDate>Mon, 02 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</guid><description>&lt;p&gt;Ten tydzień przyniósł interesującą mieszankę praktycznych rozwiązań i technologicznych rewolucji. Od monitorowania nocnych maratonów chomików (to ta rewolucja, wiadomo) po architekturę Apache Spark - branża pokazuje, że innowacja kryje się w każdym zakątku.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie ciekawy jest trend odchodzenia od tradycyjnych rozwiązań na rzecz nowoczesnych alternatyw. Na przykład zamiast odpalać joby w cronie można wykorzystać Change Data Capture (CDC), a API-first podejście staje się standardem dla 74% zespołów. Apache Iceberg wygra wojnę formatów tabel, a FastAPI udowadnia, że Python może być równie wydajny co elegancki.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-26</title><link>https://blog.prokulski.science/2025/05/26/newsletter-dane-i-analizy-2025-05-26/</link><pubDate>Mon, 26 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/26/newsletter-dane-i-analizy-2025-05-26/</guid><description>&lt;p&gt;Witajcie w kolejnym numerze, który przypomina mi swego rodzaju podróż przez świat danych - od praktycznych problemów po filozoficzne rozważania o przyszłości naszej branży.&lt;/p&gt;&#10;&lt;p&gt;Zaczynamy od fundamentów: jak radzić sobie z brakującymi danymi (bo zawsze jest ich za mało, czasem jest ich za dużo ale są wybrakowane), dlaczego UUIDy mogą zabijać PostgreSQLa, i jak Uber (dzisiaj dużo o nim) radzi sobie z backupami petabajtów danych. To te rzeczy, które każdy z nas prędzej czy później musi ogarnąć, ale rzadko kto mówi o nich głośno na spotkaniach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-05-12</title><link>https://blog.prokulski.science/2025/05/12/newsletter-dane-i-analizy-2025-05-12/</link><pubDate>Mon, 12 May 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/05/12/newsletter-dane-i-analizy-2025-05-12/</guid><description>&lt;p&gt;Przed Tobą starannie wyselekcjonowane materiały z całego internetu, które pomogą Ci być na bieżąco ze światem danych, AI i programowania. Z ponad 500 źródeł, które wpadły do sitka w tym tygodniu, wybrałem te najbardziej wartościowe i inspirujące.&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu znajdziesz sporo praktycznych materiałów o Pythonie - od łączenia z bazami danych, przez wielowątkowe przetwarzanie z Joblib, po kolejkowanie zadań z Procrastinate. Dla miłośników AI, LLMów i RAGów są teksty o budowaniu własnych systemów przetwarzania dokumentów oraz optymalizacji pipeline&amp;rsquo;ów RAG.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-28</title><link>https://blog.prokulski.science/2025/04/28/newsletter-dane-i-analizy-2025-04-28/</link><pubDate>Mon, 28 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/28/newsletter-dane-i-analizy-2025-04-28/</guid><description>&lt;p&gt;W tym tygodniu mam dla was wybuchową mieszankę materiałów - od głębokiego uczenia maszynowego i tutoriala pisania własnych RAGów, przez wizualizację danych geolokalizacyjnych, po optymalizację dashboardów.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie chciałbym zwrócić waszą uwagę na serię artykułów poświęconych Apache Airflow i Kafce - dwa narzędzia, które stały się nieodłącznym elementem nowoczesnych potoków danych. Znajdziecie dzisiaj zarówno wprowadzenie do zmian wdrożonych w Airflow w wersji 3.0, jak i praktyczne informacje o tym jak pisać wydajne DAGi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-21</title><link>https://blog.prokulski.science/2025/04/21/newsletter-dane-i-analizy-2025-04-21/</link><pubDate>Mon, 21 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/21/newsletter-dane-i-analizy-2025-04-21/</guid><description>&lt;p&gt;Pomimo trwających świąt (chociaż już za moment &lt;em&gt;&amp;ldquo;święta, święta i po świętach&amp;rdquo;&lt;/em&gt;) dość obfita paczka materiałów leci do Ciebie.&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj praktyczne zastosowania &lt;em&gt;computer vision&lt;/em&gt; w śledzeniu piłkarzy oraz implementację mechanizmu uwagi z architektury Transformer, pokazując jak zaawansowane modele mogą być budowane od podstaw. Dla tych, którzy podkręcają zapytania SQL - coś o ich optymalizacji w PostgreSQL. Do tego oraz kompleksowy przewodnik po budowie nowoczesnych hurtowni danych.&lt;/p&gt;&#10;&lt;p&gt;Deweloperzy znajdą wartościowe treści dotyczące automatyzacji procesów z wykorzystaniem Jenkins i integracji z GitHubem, a także automatyzacji przeglądów kodu przy pomocy modeli LLM. W sekcji Python szereg praktycznych narzędzi - od integracji JWT z FastAPI, przez korzystanie z biblioteki HTTPX, po wizualizację danych z Excela przy użyciu Dash.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-14</title><link>https://blog.prokulski.science/2025/04/14/newsletter-dane-i-analizy-2025-04-14/</link><pubDate>Mon, 14 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/14/newsletter-dane-i-analizy-2025-04-14/</guid><description>&lt;p&gt;Ciepłe powitanie dla wszystkich nowych czytelników, którzy dołączyli razem z cyklem o analizie danych z rynku pierwotnego nieruchomości! Cieszę się, że tu jesteście. A jeśli ktoś nie zna tego cyklu - zapraszam na stronę, &lt;a href="https://www.subscribepage.com/python_data_science/?utm_source=mail-2025-04-14&amp;amp;utm_medium=dia-nlt&amp;amp;utm_campaign=newsletter-dia"&gt;gdzie można się zapisać&lt;/a&gt;. Za zupełną darmoszkę.&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu przygotowałem zestaw materiałów, które odzwierciedlają dynamiczny rozwój świata AI, analizy danych i programowania. Szczególnie interesujące wydają się nowinki z pogranicza multimodalnych modeli AI, gdzie można własnoręcznie zbudować odpowiednik GPT-4o, oraz projekt analizujący trendy w segmentach sponsorskich na YouTube.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-04-07</title><link>https://blog.prokulski.science/2025/04/07/newsletter-dane-i-analizy-2025-04-07/</link><pubDate>Mon, 07 Apr 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/04/07/newsletter-dane-i-analizy-2025-04-07/</guid><description>&lt;p&gt;Dzisiaj &amp;ldquo;mapy rozwoju&amp;rdquo; - czyli listy zagadnień, które warto poznać, zgłębić, nauczyć się, aby rozwinąć się w danej dziedzinie. Dziedziny te oczywiście bliskie są tematom przewodnim tego newslettera - przetwarzaniu danych. Zatem jest &amp;ldquo;ścieżka rozwojowa&amp;rdquo; dla inżynierów danych oraz dla zajmujących się machine learningiem (i jego &amp;ldquo;operacjonalizacyjną&amp;rdquo; stroną - MLOps).&lt;/p&gt;&#10;&lt;p&gt;Ciekawe dla Ciebie mogą być również dwa świeże raporty (za 2024 rok) związane z bezpieczeństwem - jeden z CERT, więc bezpieczeństwo raczej ogólne. Drugi z Komisji Nadzoru Finansowego dotyczący instytucji finansowych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-31</title><link>https://blog.prokulski.science/2025/03/31/newsletter-dane-i-analizy-2025-03-31/</link><pubDate>Mon, 31 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/31/newsletter-dane-i-analizy-2025-03-31/</guid><description>&lt;p&gt;Hit minionego tygodnia to MCP (Model Context Protocol). Jest to otwarty standard opracowany przez firmę Anthropic w listopadzie 2024 roku, który umożliwia ustandaryzowaną integrację modeli sztucznej inteligencji z zewnętrznymi źródłami danych i narzędziami. Jego główne cechy to:&lt;/p&gt;&#10;&lt;p&gt;Standaryzacja połączeń między AI a zewnętrznymi zasobami Dwukierunkowa komunikacja w czasie rzeczywistym Dynamiczne wykrywanie dostępnych narzędzi i kontekstu Optymalizacja dla dużych modeli językowych (LLM)&lt;/p&gt;&#10;&lt;p&gt;Architektura MCP składa się z kilku kluczowych komponentów:&lt;/p&gt;&#10;&lt;p&gt;Host - główna aplikacja AI zarządzająca klientami MCP Klienci MCP - pośrednicy łączący hosta z serwerami MCP Serwery MCP - lekkie programy udostępniające funkcjonalności poprzez MCP&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-24</title><link>https://blog.prokulski.science/2025/03/24/newsletter-dane-i-analizy-2025-03-24/</link><pubDate>Mon, 24 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/24/newsletter-dane-i-analizy-2025-03-24/</guid><description>&lt;p&gt;W dzisiejszym numerze analizujemy ewolucję systemów rekomendacji i wyszukiwania w erze LLM, prezentujemy zaawansowane techniki inżynierii danych, w tym potoki danych oparte na PostgreSQL oraz porównanie formatów data lake. Poruszamy również kwestię minimalizację liczby spotkań, a także przedstawiamy nowe narzędzia usprawniające pracę z Pythonem i bazami wektorowymi.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://eugeneyan.com//writing/recsys-llm/"&gt;&lt;strong&gt;Improving Recommendation Systems &amp;amp; Search in the Age of LLMs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Kompleksowa analiza transformacji systemów rekomendacji i wyszukiwania w kontekście dużych modeli językowych. Artykuł omawia zmiany w przemysłowych rozwiązaniach w ostatnim roku, skupiając się na architekturach multimodalnych, generowaniu danych wspomaganym przez LLM oraz technikach uczenia transferowego i destylacji.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-03</title><link>https://blog.prokulski.science/2025/03/03/newsletter-dane-i-analizy-2025-03-03/</link><pubDate>Mon, 03 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/03/newsletter-dane-i-analizy-2025-03-03/</guid><description>&lt;p&gt;Kto, w podziale na grupy zawodowe, używa najwięcej AI? Ciekawa &lt;a href="https://www.visualcapitalist.com/charted-which-jobs-are-using-ai-the-most/"&gt;wizualizacja&lt;/a&gt; na ten temat, oparta na zapytaniach do Claude. Spoiler: 37.2% zapytań dotyczy komputerów i matematyki (w tym rozwoju oprogramowania), co raczej nie dziwi.&lt;/p&gt;&#10;&lt;p&gt;Zastanawiałeś się kiedyś nad przejściem z SQL na NoSQL? Artykuł &lt;em&gt;&amp;ldquo;I Dropped SQL for NoSQL&amp;rdquo;&lt;/em&gt; opisuje, jak taka zmiana wpłynęła na wydajność aplikacji, obsługując pięciokrotnie większy ruch i dziesięciokrotnie szybsze zapytania. Jeśli jednak wolisz pozostać przy SQL, &lt;em&gt;&amp;ldquo;3 Foundational Principles for Writing Efficient SQL&amp;rdquo;&lt;/em&gt; przypomina o podstawowych zasadach, które pomogą Ci pisać wydajne i czytelne zapytania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-17</title><link>https://blog.prokulski.science/2025/02/17/newsletter-dane-i-analizy-2025-02-17/</link><pubDate>Mon, 17 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/17/newsletter-dane-i-analizy-2025-02-17/</guid><description>&lt;p&gt;Mam nadzieję, że Walentynki były udane? ;-) Może szukasz spóźnionego prezentu dla początkującego programisty (albo dla siebie) - mój nowy e-book o Pythonie (pobieranie danych z API, współpraca z bazą danych, aplikacja we Flasku), który zadebiutował właśnie 14 lutego, może być strzałem w dziesiątkę. Więcej informacji na &lt;a href="https://dane-i-analizy.salescrm.pl/e-book-budowa-aplikacji-walutowej/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;stronie książki&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;W tym tygodniu mam dla Ciebie solidną dawkę wiedzy z różnych obszarów analizy danych i programowania - jak zwykle zresztą. Szczególnie warto zwrócić uwagę na materiały dotyczące uczenia maszynowego - od budowy własnej biblioteki deep learning po praktyczną optymalizację modelu wykrywania oszustw. Dla osób zainteresowanych LLM, a w szczególności Transformerami - jest przystępne wyjaśnienie ich działania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-10</title><link>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</link><pubDate>Mon, 10 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</guid><description>&lt;p&gt;Zanim przejdę do sedna, czyli bieżącego numeru, mam dla Ciebie informację. Otóż za moment będzie dostępny kompleksowy e-book typu &lt;strong&gt;&amp;ldquo;od juniora do mida&amp;rdquo;&lt;/strong&gt;. Książka to projekt, który kompleksowo przeprowadza przez budowę aplikacji - od komunikacji z API, przez bazę danych, aż po konteneryzację. Bez pierdół teoretycznych, za to z mocnym naciskiem na praktykę. Szczegóły już niedługo w oddzielnym mailu, więc trzymajcie się blisko skrzynki odbiorczej!&lt;/p&gt;&#10;&lt;p&gt;A co Cię czeka w tym numerze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-03</title><link>https://blog.prokulski.science/2025/02/03/newsletter-dane-i-analizy-2025-02-03/</link><pubDate>Mon, 03 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/03/newsletter-dane-i-analizy-2025-02-03/</guid><description>&lt;p&gt;Dzisiaj różnorodne tematy: od pracy z bazami danych, przez harmonogramowanie zadań w Dockerze, aż po integrację nowoczesnych modeli LLM w aplikacjach Python. Nie zabraknie także praktycznych wskazówek dotyczących testowania kodu oraz efektywnego zarządzania danymi w projektach ML.&lt;/p&gt;&#10;&lt;p&gt;Warte zwrócenia uwagi w tym wydaniu:&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Getting Started with ChromaDB&lt;/strong&gt; - Odkryj możliwości bazy danych ChromaDB i naucz się, jak efektywnie jej używać. &lt;strong&gt;Docker + Cron&lt;/strong&gt; - Dowiedz się, jak zintegrować harmonogramowanie zadań w Dockerze. &lt;strong&gt;Getting Started with fzf&lt;/strong&gt; - Poznaj fzf i jego zastosowania w codziennej pracy. &lt;strong&gt;Integrating DeepSeek into your Python Applications&lt;/strong&gt; - Przewodnik po integracji DeepSeek w aplikacjach Python. &lt;strong&gt;Unit Testing for Data Science with Python&lt;/strong&gt; - Wprowadzenie do testów jednostkowych w kontekście nauki o danych. &lt;strong&gt;Dynamic Forms with Flask&lt;/strong&gt; - Jak tworzyć dynamiczne formularze w aplikacjach webowych przy użyciu Flask.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-27</title><link>https://blog.prokulski.science/2025/01/27/newsletter-dane-i-analizy-2025-01-27/</link><pubDate>Mon, 27 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/27/newsletter-dane-i-analizy-2025-01-27/</guid><description>&lt;p&gt;Na bieżący numer złapało się kilka ciekawych tematów. Warto zwrócić uwagę na tekst o systemach automatyzacji w Amazonie i Netfliksie - pokazuje podejście dużych firm do skalowalności i bezpieczeństwa. Dobry jest artykuł o &lt;em&gt;topic modeling&lt;/em&gt; z użyciem BERTopic i FASTopic - może się przydać przy przetwarzaniu skarg klientów.&lt;/p&gt;&#10;&lt;p&gt;Dla fanów Kafki znajdzie się materiał o konsumentach wiadomości, a dla pythonowców zestaw o wizualizacjach z Pythona w Power BI, budowaniu API gateway na FastAPI i poradnik &amp;ldquo;10 Tips to Become REALLY Good at Python&amp;rdquo;, gdzie w pół godziny Arjan mówi o tym, co jest najważniejsze przy nauce Pythona, od czego trzeba zacząć i co doskonalić na początku. Do tego jest też wideo dla początkujących adeptów Pandas.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-13</title><link>https://blog.prokulski.science/2025/01/13/newsletter-dane-i-analizy-2025-01-13/</link><pubDate>Mon, 13 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/13/newsletter-dane-i-analizy-2025-01-13/</guid><description>&lt;p&gt;Mam dla Ciebie nową porcję ciekawych tekstów, artykułów, zestawień i tutoriali – jak zwykle trochę o Pythonie, trochę o analizie danych, no i oczywiście coś o AI i ML. Ale spokojnie, nie wszystko tutaj to programowanie (chociaż wiadomo, że to nasz główny temat :). Znajdziesz tu materiały dla każdego: od tych, którzy dopiero zaczynają, po treści dla bardziej zaawansowanych.&lt;br&gt;&#10;Oto, co między innymi znajdziesz dzisiaj poniżej:&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Sztuczna inteligencja i uczenie maszynowe&lt;/strong&gt; – rozpocznij rok od 50 najważniejszych materiałów o AI w 2025 roku, dowiedz się, jak zoptymalizować modele takie jak YOLOv8 na małych urządzeniach, i poznaj sposób na tworzenie asystentów AI do analizy rynków surowcowych. A może zainspiruje Cię budowa medycznego chatbota lub wykorzystanie MLFlow w agnostycznym podejściu do zarządzania modelami? &lt;strong&gt;Analiza danych i inżynieria danych&lt;/strong&gt; – zanurz się w zaawansowanych technikach SQL dla niestrukturalnych danych, poznaj tajniki przetwarzania strumieniowego z użyciem Apache Spark, Kafka i Airflow, a także odkryj różnice między Elasticsearch a Apache Doris w analizie danych w czasie rzeczywistym. &lt;strong&gt;Python w praktyce&lt;/strong&gt; – dowiedz się, jak stworzyć system powiadomień z FastAPI, pracować z danymi przestrzennymi za pomocą GeoAlchemy, czy automatycznie generować diagramy architektury z kodu. Tu mała zapowiedź (bo jak się powie publicznie to ciąży taka motywacja &amp;ldquo;przecież obiecałem&amp;rdquo;), niejako przy okazji. Szykuję ebooka, który poprowadzi Cię krok po kroku przez projekt budowy aplikacji w Pythonie. Co więcej, w ebooku zajmiemy się naprawdę praktycznymi zadaniami, które odciążają od nudnej pracy. Wspólnie stworzymy dwie aplikacje, ucząc się po drodze, jak wykorzystywać usługi sieciowe, jak działać z bazami danych, i jak efektywnie wyświetlać zapisane dane. A żeby było co wyświetlać – sami stworzymy bazę danych, do której będziemy dodawać informacje! Ciekawe? Więcej szczegółów być może już za tydzień. Wypatruj! &lt;strong&gt;Bezpieczeństwo i ciekawostki&lt;/strong&gt; – przeanalizuj globalne statystyki dotyczące otwartego portu 80, odkryj sposoby, w jakie Uber oszczędza czas dzięki Text-to-SQL, i sprawdź, jak korzystać z YouTube prosto z terminala. Inne inspiracje – od katalogów danych i ich obserwowalności po trendy marketingowe według TikToka – każdy znajdzie coś dla siebie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-01-06</title><link>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</link><pubDate>Mon, 06 Jan 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/01/06/newsletter-dane-i-analizy-2025-01-06/</guid><description>&lt;p&gt;W dniu, gdy tradycyjnie Trzej Mędrcy dotarli do celu swojej podróży kierując się gwiazdą, ja przybywam z kolekcją wartościowych znalezisk ze świata Pythona i analizy danych. Mędrcy przynieśli złoto, kadzidło i mirrę - dzisiejsze wydanie niesie pakiet różnorodnych artykułów, które (mam nadzieję) okażą się równie cennymi darami dla Twojego rozwoju zawodowego.&lt;/p&gt;&#10;&lt;p&gt;W tym wydaniu znajdziesz standardowo kilka praktycznych materiałów z zakresu data science: od budowania systemu tradingowego opartego na średniej kroczącej, przez analizę szeregów czasowych, aż po wykorzystanie biblioteki statsmodels.&lt;br&gt;&#10;Dla osób zainteresowanych automatyzacją wdrożeń (i nie tylko) mamy podstawową dawkę wiedzy o GitHub Actions i skryptach bashowych, a na koniec dość klasyczna integracja FastAPI z Reactem.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-30</title><link>https://blog.prokulski.science/2024/12/30/newsletter-dane-i-analizy-2024-12-30/</link><pubDate>Mon, 30 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/30/newsletter-dane-i-analizy-2024-12-30/</guid><description>&lt;p&gt;&lt;em&gt;Wskazówki nieubłaganie odmierzają czas, do umownego końca stulecia i tysiąclecia pozostały niespełna trzy tygodnie&amp;hellip;&lt;/em&gt; - tak swoją ostatnią audycję rozpoczął Tomasz Beksiński, a w tym roku mija 25 lat od jego śmierci. Pewnie dlatego dużo na jego temat przewija się przez internet.&lt;/p&gt;&#10;&lt;p&gt;To pożegnanie Tomka cytowane tutaj to tylko zabieg literacki, więc nie należy się obawiać o redaktora naczelnego. W rzeczywistości kończymy 2024 rok – czas pełen przełomów w świecie danych, uczenia maszynowego i technologii. Przed Tobą ostatni w tym roku numer newsletter, z kolejnymi (mam nadzieję) inspiracjami, projektami i ciekawostkami, które pomogą zamknąć ten rok z przytupem i może rozbudzą pomysły na nadchodzący 2025.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-23</title><link>https://blog.prokulski.science/2024/12/23/newsletter-dane-i-analizy-2024-12-23/</link><pubDate>Mon, 23 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/23/newsletter-dane-i-analizy-2024-12-23/</guid><description>&lt;p&gt;Im bliżej roku tym więcej podsumowań roku. Ale podsumowania były w zeszłym numerze (kto przegapił może zobaczyć do &lt;a href="../../2024/12/16/newsletter-dane-i-analizy-2024-12-16/"&gt;archiwum&lt;/a&gt;).&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj zaś ze względu na zbliżające się święta mniej materiału niż zwykle. Bo trzeba odpocząć od komputerów, spędzić czas z najbliższymi, wyjść na spacer, porzucać się śnieżkami&amp;hellip; no może tutaj się zapędzamy nieco (patrząc na prognozę pogody).&lt;br&gt;&#10;Odstawcie modele ML, dostawcie Python, Sparki i Kafki, zajmijcie się uszkami w barszczu i prezentami spod choinki. No, ewentualnie może być Pinot&amp;hellip; ale bardziej Pinot Noir niż Apache Pinot.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-09</title><link>https://blog.prokulski.science/2024/12/09/newsletter-dane-i-analizy-2024-12-09/</link><pubDate>Mon, 09 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/09/newsletter-dane-i-analizy-2024-12-09/</guid><description>&lt;p&gt;Nie wiem czy korzystacie z list zakupów w aplikacjach do tego przewidzianych? To wygodne - cała rodzina dodaje na jedną listę to, co trzeba kupić, a potem jedna osoba (np. ojciec ;) jedzie do sklepu i przywozi te siaty&amp;hellip; U mnie taką aplikacją jest Listonic (i nie jest to reklama - apka ma trochę irytujących elementów). Aplikacja jest popularna, co pozwala jej twórcom na zgromadzenie dużej liczby &amp;ldquo;list zakupów&amp;rdquo; i przygotowanie na tej podstawie &lt;a href="https://media.listonic.com/raporty"&gt;ciekawych raportów&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-12-02</title><link>https://blog.prokulski.science/2024/12/02/newsletter-dane-i-analizy-2024-12-02/</link><pubDate>Mon, 02 Dec 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/12/02/newsletter-dane-i-analizy-2024-12-02/</guid><description>&lt;p&gt;Motywem przewodnim w dzisiejszym odcinku jest API. Jakich frameworków użyć (w Pythonie), czym od siebie się różnią? A może websocket?&lt;/p&gt;&#10;&lt;p&gt;Podobnie mamy w sekcji z praktycznymi projektami z zakresu analizy danych (nie zawsze tam o samą analizę chodzi - czasem bardziej o uczenie maszynowe niż analizowanie w rozumieniu tzw. EDA): wykrywanie wartości odstających w zbiorach.&lt;/p&gt;&#10;&lt;p&gt;Co tydzień przedstawiamy tutaj kilka projektów wykorzystujących analizę danych, machine learning czy też AI. Zamiast czekać kilkanaście tygodni (i liczyć że temat, który Cię interesuje się pojawi) możesz zerknąć na &lt;a href="https://www.geeksforgeeks.org/top-data-science-projects/"&gt;&lt;strong&gt;stronę&lt;/strong&gt;&lt;/a&gt; gdzie zgromadzono ponad 65 (może i 69, a więc prawie 70!) przykładowych projektów razem z kodem źródłowym. Boot-camp z ML? Niepotrzebny! Wystarczą te projekty&amp;hellip; oraz porządne doczytanie dlaczego tak a nie inaczej zrobiono to czy tamto.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-11</title><link>https://blog.prokulski.science/2024/11/11/newsletter-dane-i-analizy-2024-11-11/</link><pubDate>Mon, 11 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/11/newsletter-dane-i-analizy-2024-11-11/</guid><description>&lt;p&gt;Święto lasu słuchajcie! I to nie chodzi wcale o to, że dzisiaj mamy Narodowe Święto Niepodległości, ale o to, że w newsletterze mało o Pythonie! Więcej mamy w działce &amp;ldquo;DevOps&amp;rdquo; (która nie tylko o procesach CI/CD jest, ale też o tym jak pisać - i w tym numerze też debuggować - skrypty w Bashu) niż programowania przepływów danych czy innych finezyjnych (mniej lub bardziej) sztuczek w Pandas albo DuckDB&amp;hellip;&lt;/p&gt;&#10;&lt;p&gt;Za to dowozi dzisiaj sekcja opisująca nieco bardziej teoretycznie zagadnienia ML-owe. Chyba dobrze, co?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-04</title><link>https://blog.prokulski.science/2024/11/04/newsletter-dane-i-analizy-2024-11-04/</link><pubDate>Mon, 04 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/04/newsletter-dane-i-analizy-2024-11-04/</guid><description>&lt;p&gt;Odkrycie tego tygodnia: &lt;a href="https://bolt.new/"&gt;Bolt.new&lt;/a&gt;. Serwis, który korzystając modeli językowych przygotuje całą aplikację i - o ile jest ona frontendowa - pozwoli jednym guzikiem ją wdrożyć.&lt;br&gt;&#10;Testując to chwilę udało się po kilku dopytaniach przygotować kod, który daje GUI (dostępny przez WWW) do edycji obserwowanych kanałów na YouTube. Obserwowanie polega na tym, że jeśli pojawi się nowy film na kanale to wysyłana ma być informacja poprzez komunikator Signal (specjalnie, bo Signal nie ma API, trzeba wywoływać polecenie w konsoli). Powstały kod wzbogacony został o Dockerfile (razem z pobraniem odpowiedniej wersji Signala oraz potrzebnej mu Javy) i deployment na Kubernetesa. Kiedy wiemy co robimy i czego oczekujemy oraz potrafimy wyłapać błędy - na pewno ułatwia to pracę. I jeszcze jedno: zapytania pisałem po polsku (w ramach eksperymentu) i zostałem w pełni zrozumiany, chociaż odpowiedzi były po angielsku. Wynik działania &lt;a href="https://bolt.new/~/sb1-om42lv"&gt;tutaj&lt;/a&gt; &lt;em&gt;(mam nadzieję, że link zadziała)&lt;/em&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-28</title><link>https://blog.prokulski.science/2024/10/28/newsletter-dane-i-analizy-2024-10-28/</link><pubDate>Mon, 28 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/28/newsletter-dane-i-analizy-2024-10-28/</guid><description>&lt;p&gt;Jeden z tekstów, które znajdziecie poniżej mówi o tym, jak pobrać z YouTube wideo, wyciągnąć z niego dźwięk, a potem ten dźwięk przekształcić w zapis tekstowy (taki do czytania). Potem i tak nikt tego nie czyta&amp;hellip;&lt;/p&gt;&#10;&lt;p&gt;Niektórzy może czytają. A jeśli wolą jednak oglądać albo słuchać - dzisiaj przed Wami zapisy wideo z dwóch konferencji. Jedna to &amp;ldquo;Oh My Hack&amp;rdquo; odbywająca się w Polsce i skupiająca się na zagadnieniach związanych z bezpieczeństwem. Nagrania pochodzą z edycji, która miała miejsce w 2023 roku. Druga konferencja to coś nowszego - amsterdamska edycja PyData, z tego roku.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-21</title><link>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</link><pubDate>Mon, 21 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</guid><description>&lt;p&gt;OpenAI ze swoim modelem w wersji o1 wróciło na szczyt listy przebojów w kategorii LLM. Garść firm zajmujących się GenAI zaczyna generować poważne przychody. Co jeszcze dzieje się na rynku AI w 2024 roku? Jaki jest &amp;ldquo;Stan AI w 2024&amp;rdquo;? O tym dowiecie się z raportu, do którego link poniżej, w sekcji AI/ML.&lt;/p&gt;&#10;&lt;p&gt;Sporo w tym wydaniu o bazach danych (co najmniej dwa razy pojawia się Postgres i Redis, ale są też inne rozwiązania: wektorowa &lt;a href="https://milvus.io/"&gt;Milvus&lt;/a&gt;, &lt;a href="https://www.influxdata.com/"&gt;InfluxDB&lt;/a&gt; do szeregów czasowych, grafowa &lt;a href="https://neo4j.com/"&gt;Neo4j&lt;/a&gt;, dobrze znany stałym czytelnikom &lt;a href="https://duckdb.org/"&gt;DuckDB&lt;/a&gt;oraz &lt;a href="https://tile38.com/"&gt;Tile38&lt;/a&gt; do zadań geo).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-14</title><link>https://blog.prokulski.science/2024/10/14/newsletter-dane-i-analizy-2024-10-14/</link><pubDate>Mon, 14 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/14/newsletter-dane-i-analizy-2024-10-14/</guid><description>&lt;p&gt;Kolejny dzień (no, może miesiąc) i kolejna wersja modelu YOLO - czyli modelu do detekcji obiektów na obrazach? Mniej więcej. &lt;a href="https://docs.ultralytics.com/models/yolo11/"&gt;Zobacz&lt;/a&gt; co nowego w wersji 11, a nieco przykładów i szersza informacja o tym jak to wykorzystać niżej, w dziale AI/ML. Tym razem nie tylko rozpoznawanie obiektów, ale też rozpoznawanie pozy (gdzie ręce, nogi, gdzie &lt;em&gt;głowa, ramiona, kolana, pięty, Kola napięty&amp;hellip;&lt;/em&gt; #mspanc), segmentacja obrazu czy też jego klasyfikacja. Co ciekawe - twórcy idą w stronę nie tyle rozpoznawania elementów na statycznych obrazkach do na wideo - co właściwie jest tym samym tylko szybciej (nawet tylko po kilkanaście milisekund na klatkę!).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-23</title><link>https://blog.prokulski.science/2024/09/23/newsletter-dane-i-analizy-2024-09-23/</link><pubDate>Mon, 23 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/23/newsletter-dane-i-analizy-2024-09-23/</guid><description>&lt;p&gt;Dzisiaj nieco później niż zwykle, nieco skromniej i bez zbędnego lania wody. Taki eksperyment.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.datadriveninvestor.com/50-handpicked-github-repositories-to-master-data-science-skills-pro-recommended-8231c661e731"&gt;&lt;strong&gt;50 Handpicked GitHub Repositories to Master Data Science Skills&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Najlepszym sposobem na naukę jest praktyka. Własna - pisanie kodu, albo cudza - czytanie kodu. Aby ułatwić to drugie - zbiór materiałów.&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://itnext.io/feature-engineering-in-xgboost-a-practical-guide-7fbafa7dbdbd"&gt;&lt;strong&gt;Feature Engineering in XGBoost&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Więcej tutaj operacji na danych w Pandasie niż samego XGBoosta, ale o inżynierii cech nigdy za wiele.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/football-and-geometry-passing-networks-6e201ceff6ef"&gt;&lt;strong&gt;Football and Geometry&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Wprowadzenie do grafów na podstawie siatki podań piłkarzy podczas meczy.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-09</title><link>https://blog.prokulski.science/2024/09/09/newsletter-dane-i-analizy-2024-09-09/</link><pubDate>Mon, 09 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/09/newsletter-dane-i-analizy-2024-09-09/</guid><description>&lt;p&gt;W tym tygodniu prowadzę szkolenie (a w zeszłym prowadziłem przykładowo konkurs na imprezie firmowej - więc &lt;em&gt;&amp;ldquo;szkolenia, prelekcje, podcasty, śluby, chrzciny i pogrzeby&amp;rdquo;&lt;/em&gt; są w ofercie &lt;a href="https://prokulski.science/"&gt;Dane i Analizy&lt;/a&gt; :), więc nieco mniej czasu na przygotowanie newslettera - wybaczcie zatem, że bez standardowego wstępu. Liczę jednak na to, że dobór materiałów na zadowalającym poziomie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://python.plainenglish.io/evaluating-handwritten-digit-recognition-models-insights-and-observations-74dcc0841ffe"&gt;&lt;strong&gt;Evaluating Handwritten digital Recognition Models&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;MNIST to jeden z najpopularniejszych zbiorów danych. Porównanie modeli rozpoznających ręcznie pisane cyfry (i tu zbiorem nie jest MNIST).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-09-02</title><link>https://blog.prokulski.science/2024/09/02/newsletter-dane-i-analizy-2024-09-02/</link><pubDate>Mon, 02 Sep 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/09/02/newsletter-dane-i-analizy-2024-09-02/</guid><description>&lt;p&gt;Od kilku tygodni (może bardziej kilkunastu dni?) na LinkedIn widać pochwały dla &lt;a href="https://bielik.ai/"&gt;Bielika&lt;/a&gt; - polskiego czat-bota opracowanego na bazie modelu Mistral-7B. &lt;a href="https://cyberdefence24.pl/technologie/bielik-wyladowal-sprawdzilismy-jak-dziala-polski-chatbot"&gt;Tutaj&lt;/a&gt; możecie poczytać swego rodzaju &lt;em&gt;test&lt;/em&gt; tego modelu. Polecamy własne eksperymenty (ciekawym jest prompt &amp;ldquo;Przygotuj dialog pomiędzy Janem i Marią, dwojgiem polskich emerytów spotykających się pomiędzy apteką a sklepem spożywczym&amp;rdquo; - ChatGPT, Cloude, Gemini - próbujcie, kto da bardziej &amp;ldquo;polską&amp;rdquo; odpowiedź). Co ważne - Bielik w wersji 2.2 jest dostępny na licencji Apache 2.0, która pozwala na swobodne używanie, modyfikowanie i redystrybucję oprogramowania, w tym w celach komercyjnych. Jedynym wymaganiem jest zachowanie oryginalnej licencji i noty prawnej przy każdej redystrybucji.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-08-05</title><link>https://blog.prokulski.science/2024/08/05/newsletter-dane-i-analizy-2024-08-05/</link><pubDate>Mon, 05 Aug 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/08/05/newsletter-dane-i-analizy-2024-08-05/</guid><description>&lt;p&gt;W maju bieżącego roku ponad 65 tysięcy programistów odpowiedziało na coroczną ankietę StackOverflow dotyczącą kodowania, technologii i narzędzi, których używają i chcą się nauczyć, sztucznej inteligencji i doświadczenia programistów w pracy. &lt;a href="https://survey.stackoverflow.co/2024/"&gt;Tutaj znajdziesz wyniki.&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;W sekcji poświęconej AirFlow znajdziecie porównanie tego narzędzia do orkiestracji zadań z &lt;a href="https://netflixtechblog.com/maestro-netflixs-workflow-orchestrator-ee13a06f9c78"&gt;Maestro&lt;/a&gt; od Netflixa. &lt;a href="https://github.com/Netflix/maestro"&gt;Tutaj&lt;/a&gt; znajdziesz repo z kodem do instalacji. Z kolei mocna dzisiaj sekcja DevOps zawiera kilka przydatnych narzędzi, nie tylko związanych z jako takim DevOpsem, ale też przydanych dla innych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-22</title><link>https://blog.prokulski.science/2024/07/22/newsletter-dane-i-analizy-2024-07-22/</link><pubDate>Mon, 22 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/22/newsletter-dane-i-analizy-2024-07-22/</guid><description>&lt;p&gt;Tomek zwrócił się do mnie z prośbą o przekazanie informacji o jego książce (e-booku). Otóż napisał ogromną ilość tekstu (ze 100 stron) na temat tego jak budować projekty data science w Pythonie. Jak układać pliki w folderach, jak zarządzać wymaganiami, jak zarządzać prerekwizytami typu dane czy też wynikowe wykresy, predykcje, modele. Jest też o automatycznym formatowaniu i sprawdzaniu kodu przy użyciu Ruff oraz dość sporo o notatnikach Jupytera. Normalnie książka coś kosztuje (30 zł), ale dla Was - do 5 sierpnia - jest za darmo, o &lt;a href="https://cart.easy.tools/checkout/19955710/smart-structuring?promo=DANEIANALIZY"&gt;&lt;strong&gt;tutaj&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-15</title><link>https://blog.prokulski.science/2024/07/15/newsletter-dane-i-analizy-2024-07-15/</link><pubDate>Mon, 15 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/15/newsletter-dane-i-analizy-2024-07-15/</guid><description>&lt;p&gt;W minionym tygodniu miałem przyjemność prowadzić szkolenie z podstaw Pythona. I korzystając z okazji, przy okazji omawiania zagadnień typu czytanie z pliku, listy, słowniki, listy słowników, iteracje po listach słowników i czyszczenie danych wraz z ekipą szkoloną przygotowaliśmy podsumowanie meczu Anglia - Holandia&amp;hellip; na podstawie historycznych spotkań, znalezionych gdzieś w sieci. Nieco pociąłem nagranie, i wpadło &lt;a href="https://www.youtube.com/watch?v=cetmeK7rS78"&gt;na YouTube&lt;/a&gt;. Niecałe pół godziny, live coding na żywca, w upalny dzień, z dusznej salki.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-01</title><link>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</link><pubDate>Mon, 01 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/01/newsletter-dane-i-analizy-2024-07-01/</guid><description>&lt;p&gt;Razem z początkiem lipca zwykle w mediach rozpoczyna się sezon ogórkowy. Upały dają się we znaki, &lt;em&gt;żar leje się z nieba&lt;/em&gt; (pozdrawiamy fanów &amp;ldquo;Hydrozagadki&amp;rdquo; oraz Asa!), jedyne o czym chce się myśleć to schłodzone napoje i leżenie w basenie.&lt;/p&gt;&#10;&lt;p&gt;Ale mimo tych przeciwności losu przed Wami kolejna porcja wiedzy w postaci ręcznie wybranych najlepszych tekstów o AI i ML plus okolicach związanych z przetwarzaniem danych jakie przewinęły się przez cały tydzień w różnych mediach czy też innych newsletterach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-17</title><link>https://blog.prokulski.science/2024/06/17/newsletter-dane-i-analizy-2024-06-17/</link><pubDate>Mon, 17 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/17/newsletter-dane-i-analizy-2024-06-17/</guid><description>&lt;p&gt;W minionym tygodniu miało swoją premierę narzędzie, które w ramach GenAI potrafi ożywić zdjęcia. Mowa o &lt;a href="https://lumalabs.ai/dream-machine"&gt;Luma&lt;/a&gt;. Oczywiście pojawiło się już kilka &lt;a href="https://sztucznainteligencjablog.pl/blog/ozywione-memy-za-pomoca-luma-ai-dream-machine/"&gt;ożywionych memów&lt;/a&gt; albo &lt;a href="https://www.linkedin.com/posts/matthieulorrain_genai-music-lumaai-activity-7207754739105574912-nMfJ"&gt;okładek płyt&lt;/a&gt;. W ciekawą idzie to stronę&amp;hellip; Pamiętajcie jednak, że zanim wrzucicie w tego typu maszynki swoje prywatne zdjęcia żeby przeczytać regulamin (ten z LumaLabs AI na wiele im pozwala).&lt;/p&gt;&#10;&lt;p&gt;W minionym tygodniu rozpoczęło się też Euro 2024 i to pewnie części z Was zajmuje sporo czasu. Szkoda tylko, że FiveThirtyEight.com przestało się zajmować sportem - bardzo fajne modele predykcyjne mieli na temat sportu. Za to (przed startem turnieju) swoje predykcje przygotował &lt;a href="https://eurosport.tvn24.pl/pilka-nozna/euro-2024/2024/analiza-szans-polski-w-euro-2024.-znamy-mistrza-i-rewelacje-euro-2024_sto10194122/story.shtml"&gt;Eurosport&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-10</title><link>https://blog.prokulski.science/2024/06/10/newsletter-dane-i-analizy-2024-06-10/</link><pubDate>Mon, 10 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/10/newsletter-dane-i-analizy-2024-06-10/</guid><description>&lt;p&gt;Dzisiaj dwa ciekawe teksty o technikach OSINTowych - czyli jak z publicznie dostępnych informacji dotrzeć do czegoś więcej. Na przykład do informacji &lt;a href="https://frontstory.pl/penthouse-daniel-obajtek-budapeszt-orlen/"&gt;gdzie ktoś faktycznie jest&lt;/a&gt; (chociaż mówi inaczej) co jest nieco zabawą podobną do serwisu &lt;a href="https://www.geoguessr.com/pl"&gt;GeoGuesser&lt;/a&gt; (interesująca zabawa, zacznij od map ze znanej Ci okolicy) - na przykładzie &lt;a href="https://zaufanatrzeciastrona.pl/post/na-tropie-szmydta-czyli-jak-znalezc-bialoruskiego-szpiega/"&gt;szpiegów&lt;/a&gt;. Może jeszcze na dokładkę coś &lt;a href="https://devszczepaniak.pl/osint-pozyskiwanie-informacji-z-wykorzystaniem-map/"&gt;o szukaniu informacji z wykorzystaniem map&lt;/a&gt;?&lt;br&gt;&#10;Tyle o szukaniu. A o ukrywaniu? No na przykład &lt;a href="https://bishopfox.com/blog/unredacter-tool-never-pixelation"&gt;pikselowanie tekstu&lt;/a&gt; na obrazkach umieszczanych w sieci nie ma większego sensu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-03</title><link>https://blog.prokulski.science/2024/06/03/newsletter-dane-i-analizy-2024-06-03/</link><pubDate>Mon, 03 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/03/newsletter-dane-i-analizy-2024-06-03/</guid><description>&lt;p&gt;Po dłuższym weekendzie mocny w AI numer newslettera przed Tobą. Numer, który pokrywa takie obszary AI jak obraz, tekst oraz dźwięk.&lt;br&gt;&#10;W ramach obrazu mamy tutorial PyTorcha, ale dodatkowo być może zainteresuje Cię informacja, że modele rozpoznawania obiektów na obrazach YOLO dotarły już do wersji 10 - &lt;a href="https://andlukyane.com//blog/paper-review-yolov10"&gt;tutaj review&lt;/a&gt; &lt;em&gt;pejpera&lt;/em&gt; z opisem YOLOv10, w treści też linki do wytrenowanych modeli i kodu wykorzystujących te modele.&lt;/p&gt;&#10;&lt;p&gt;Oprócz AI kilka wskazówek, które mogą przydać się przy wyborach SQL czy NoSQL albo FastAPI czy Flask. Do tego aż dwa teksty o modelowaniu struktury danych w bazie, w tym bardzo konkretny (i obszerny) tutorial o kalendarzach.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-27</title><link>https://blog.prokulski.science/2024/05/27/newsletter-dane-i-analizy-2024-05-27/</link><pubDate>Mon, 27 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/27/newsletter-dane-i-analizy-2024-05-27/</guid><description>&lt;p&gt;Dzisiaj krótko, bo tydzień krótszy i &amp;ldquo;nie ma czasu załadować taczek&amp;rdquo;. Może tak lepiej?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@busariajibola2001/customer-segmentation-rfm-analysis-de72f7385bf3"&gt;&lt;strong&gt;Customer Segmentation&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza RFM (Recency, Frequency and Monetary) wykorzystana do segmentacji klientów. Bardziej opis niż zajęcia praktyczne, a praktyka podana w excelu&lt;/p&gt;&#10;&lt;h3 id="architektura"&gt;#architektura&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@vutrinh274/how-twitter-processes-4-billion-events-in-real-time-daily-942db8f7d7b5"&gt;&lt;strong&gt;How Twitter processes 4 billion events in real-time daily&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Od architektury Lambda do Kappa&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pathtosenior.substack.com/p/3-reasons-why-you-might-want-to-use?sd=pf"&gt;&lt;strong&gt;3 Reasons Why You Might Want to Use Monolith Instead of Microservice&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czyżby odwrót od podejścia mikroserwisowego? A może tylko kilka szczególnych przypadków?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-20</title><link>https://blog.prokulski.science/2024/05/20/newsletter-dane-i-analizy-2024-05-20/</link><pubDate>Mon, 20 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/20/newsletter-dane-i-analizy-2024-05-20/</guid><description>&lt;p&gt;Dzisiaj w sekcji poświęconej językowi R mamy tekst, w którym w atrakcyjny, animowany sposób pokazano kilka podstawowych operacji na ramkach danych (albo jak kto woli - tabelkach, np. w bazie danych). Jeśli nie wiesz jak działają operacje grupowania, agregacji czy łączenia danych - po tych przykładach nie powinno być z tym problemu.&lt;/p&gt;&#10;&lt;p&gt;Jeśli już przy bazach danych jesteśmy - powraca DuckDB, bo to jest cudo. Tym razem m.in. porównanie ze Sparkiem.&lt;br&gt;&#10;Od Sparka niedaleko zaś do ogólnie pojętego big data - w tej sekcji kompletny przewodnik jak zbudować cały zestaw do strumieniowego przetwarzania danych: czyli pełne środowisko zawierające Kafkę, Schema Registry, Kafka Connect, ksql i co tam jeszcze wokoło potrzebne.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-13</title><link>https://blog.prokulski.science/2024/05/13/newsletter-dane-i-analizy-2024-05-13/</link><pubDate>Mon, 13 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/13/newsletter-dane-i-analizy-2024-05-13/</guid><description>&lt;p&gt;Które narzędzie do generowania grafik - Dall-E czy Midjourney - poradzi sobie lepiej? &lt;a href="https://ai.plainenglish.io/dall-e-vs-midjourney-comparison-c9897efedd14"&gt;Zobacz porównanie&lt;/a&gt;, a jak już wiesz co wygrało - u Artura Kurasińskiego znajdziesz &lt;a href="https://www.hellomidjourney.pl/"&gt;potężny poradnik&lt;/a&gt; jak promptować zwycięzcę.&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;1 Billion Row Challenge&lt;/strong&gt; - to jest big data, nie jakieś arkusze Excela i kilkanaście tysięcy wierszy. Jak sobie poradzą różne implementacje oparte na Pythonie i ewentualnych dodatkowych narzędziach? Skroluj do odpowiedniej sekcji, bardzo ciekawe porównanie i kilka fajnych sposobów na optymalizację!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-04-29</title><link>https://blog.prokulski.science/2024/04/29/newsletter-dane-i-analizy-2024-04-29/</link><pubDate>Mon, 29 Apr 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/04/29/newsletter-dane-i-analizy-2024-04-29/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2024/04/how-to-run-llama-3-locally/"&gt;&lt;strong&gt;How to Run Llama 3 Locally?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;W zeszłym tygodniu nie było nic o Llama 3, zatem dzisiaj instrukcja jak ten najnowszy model językowy od Facebooka uruchomić lokalnie.&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://nobledynamic.com/posts/fabric-madness-4/"&gt;&lt;strong&gt;Fabric Madness: Experiments&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Eksperymenty z MLFlow spięte z MS Fabric&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.openriskmanagement.com/representing-matrices-as-json-objects-part-1/"&gt;&lt;strong&gt;Representing Matrices as JSON Objects&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy macierz można zapisać w JSONie? Pierwszy z serii artykułów na temat kompromisów pomiędzy macierzami a tym formatem plików&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/public-transport-accessibility-in-python-dbdeee99f36f"&gt;&lt;strong&gt;Public Transport Accessibility in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Analiza danych geograficznych w Pythonie - dostępność komunikacji miejskiej w Budapeszcie. Ale może to być dostępność do restauracji, aptek czy paczkomatów&amp;hellip;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-04-22</title><link>https://blog.prokulski.science/2024/04/22/newsletter-dane-i-analizy-2024-04-22/</link><pubDate>Mon, 22 Apr 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/04/22/newsletter-dane-i-analizy-2024-04-22/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/create-an-ai-driven-movie-quiz-with-gemini-llm-python-fastapi-pydantic-rag-and-more-e15322be4f66"&gt;&lt;strong&gt;Create an AI-Driven Movie Quiz!&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Ciekawy projekt, który tworzy quiz wiedzy na temat filmów. Dane o filmach zebrane są z internetowej bazy, przetworzone przez mechanizmy AI, a cała zabawa odbywa się z wykorzystaniem API. Tekst opisuje projekt, a sam kod dostępny jest na GitHubie&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://levelup.gitconnected.com/solid-principles-applied-to-data-science-a76e74d6e2c1"&gt;&lt;strong&gt;SOLID Principles Applied to Data Science&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak zbudować standardowy proces MLowy (wczytanie danych, preprocessing, uczenie modelu i finalna predykcja na nowych danych) w zgrabną architekturę spełniającą zasady SOLID?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-03-11</title><link>https://blog.prokulski.science/2024/03/11/newsletter-dane-i-analizy-2024-03-11/</link><pubDate>Mon, 11 Mar 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/03/11/newsletter-dane-i-analizy-2024-03-11/</guid><description>&lt;p&gt;Chłodzenie procesora - jak robi to inżynier? Jeden pójdzie do sklepu czy serwisu i po prostu kupi &amp;ldquo;mocne&amp;rdquo; chłodzenie, a drugi - poświęci &amp;ldquo;nieco&amp;rdquo; czasu na napisanie kodu zbierającego dane z różnych czujników, zbuduje dashboard w Grafanie i na podstawie tego co jest na wykresach odpowiednio &amp;ldquo;pokręci śrubkami&amp;rdquo;. Mamy o tym tekst dzisiaj, znajdziesz go w &lt;strong&gt;Ciekawostkach&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;W sekcji o bazach danych znajdziesz coś o DuckdB (znowu&amp;hellip; pewien Maciej podejrzewa że mam jakiś procent od DuckDB&amp;hellip; ale to serio świetne narzędzie!) czytającym dane z Open Street Map, przy okazji o samym formacie danych OSM. DuckDB za darmo, OSM za darmo, czego chcieć więcej? Zerkaj w sekcję &lt;strong&gt;Bazy danych&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-02-26</title><link>https://blog.prokulski.science/2024/02/26/newsletter-dane-i-analizy-2024-02-26/</link><pubDate>Mon, 26 Feb 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/02/26/newsletter-dane-i-analizy-2024-02-26/</guid><description>&lt;p&gt;Skupiamy się w tym tygodniu na zagadnieniach związanych z budowaniem rozwiązań skonteneryzowanych. Mamy więc coś o Dockerze i pakowaniu do niego naszych aplikacji (napisanych w różnych językach, żeby było &amp;ldquo;dla każdego coś miłego&amp;rdquo;), coś (może nieco więcej niż &amp;ldquo;coś&amp;rdquo;) o Kubernetesie - bo to kolejny krok, a wydaje się to być nieco zakręcone. Do tego garść tricków i porad związanych z tymi zagadnieniami, chociażby o nieznanych (albo raczej: nie używanych) opcjach Gita. Ale to dla prawdziwych wyjadaczy.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-02-19</title><link>https://blog.prokulski.science/2024/02/19/newsletter-dane-i-analizy-2024-02-19/</link><pubDate>Mon, 19 Feb 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/02/19/newsletter-dane-i-analizy-2024-02-19/</guid><description>&lt;p&gt;Ubiegły tydzień to nowość w postaci &lt;a href="https://openai.com/sora"&gt;Sora od OpenAI&lt;/a&gt; - generowanie wideo z promptów tekstowych. OpenAI sporo &lt;a href="https://openai.com/research/video-generation-models-as-world-simulators"&gt;pisze&lt;/a&gt; o technikaliach na swoich stronach. Najbliższy tydzień-dwa ubiegnie pod znakiem Sory, a jak otworzą dostęp szerzej&amp;hellip; &lt;strong&gt;to się dopiero zacznie!&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;Oczywiście Google nie pozostaje w tyle i prezentuje swojego bliźniaka: Gemini, z którego można też &lt;a href="https://pub.towardsai.net/get-started-with-google-gemini-pro-using-python-in-5-minutes-00700244f58a"&gt;korzystać via API&lt;/a&gt; (gdyby było inaczej nie miałoby to sensu w dzisiejszych realiach) oraz starają się nie tracić kroku na polu &lt;a href="https://lumiere-video.github.io/"&gt;text-to-video&lt;/a&gt; ze swoim Lumiere.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-08</title><link>https://blog.prokulski.science/2024/01/08/newsletter-dane-i-analizy-2024-01-08/</link><pubDate>Mon, 08 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/08/newsletter-dane-i-analizy-2024-01-08/</guid><description>&lt;p&gt;Dzisiaj w ramach wstępu - pakiet specjalny, pakiet linków dodatkowych, bo każdy z początkujących data scientistów przechodzi przez podobne zagadnienia. Najpierw uczymy się wczytywać dane, potem je filtrować i przekształcać.&lt;/p&gt;&#10;&lt;p&gt;Często przekształcenia polegają na przejściu wiersz po wierszu w naszych danych. Jak już umiemy nieco programować to - dla przykładu pandasowy iterrows() wydaje się być dobrym rozwiązaniem. Przecież dla każdego wiersza w naszej tabeli powinniśmy wykonać jakąś operację. No, ale nie zawsze pętle mają sens i &lt;a href="https://www.kaggle.com/code/youssef19/how-to-eliminate-loops-from-your-python-code"&gt;ten notebook&lt;/a&gt; pokazuje jak się ich pozbyć, chociaż akurat nie w pandasowych tabelkach. No, ale nie po to wymyślono w Pythonie listy, żeby z nich nie korzystać! Często są bardzo szybkie i naprawdę wygodne!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-01-02</title><link>https://blog.prokulski.science/2024/01/02/newsletter-dane-i-analizy-2024-01-02/</link><pubDate>Tue, 02 Jan 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/01/02/newsletter-dane-i-analizy-2024-01-02/</guid><description>&lt;p&gt;Nowy Rok to dramatyczny okres&amp;hellip;&lt;br&gt;&#10;Dla siłowni i klubów fitness - bo kolejki, bo tłumy, bo góry pieniędzy od klientów.&lt;br&gt;&#10;Dla wystawców kart abonamentowych do tychże siłowni (typu multisport) - bo najniższe zyski w ciągu roku.&lt;br&gt;&#10;A dla większej części społeczeństwa (tej andrzejowej większej połowy Adamczychy) to czas postanowień noworocznych. I jeśli macie jakieś postanowienia, to być może tekst &lt;a href="https://kozyrkov.medium.com/how-to-design-resolutions-that-work-according-to-a-decision-scientist-extended-version-47c38bbb7198"&gt;The Advanced Manual of Self-Improvement&lt;/a&gt; Wam się przyda w ich dotrzymaniu?&lt;br&gt;&#10;Medium.com twierdzi, że to &lt;em&gt;48 min read&lt;/em&gt;, więc wersja nieco krótsza &lt;a href="https://bit.ly/quaesita_badreso"&gt;tutaj&lt;/a&gt;. Tak, to Medium.com, więc 5 dolarów za miesiąc, majątek cały. Ale w tym roku jeszcze nie było że &amp;ldquo;eldorado w IT się skończyło&amp;rdquo;, więc się (zapewne) nie skończyło ;-)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-11</title><link>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</link><pubDate>Mon, 11 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</guid><description>&lt;p&gt;Miniony tydzień to uruchomienie nowej wersji asysstenta AI od Google, czyli Gemini (w miejsce Barda). Sam model mówi o sobie, że &lt;em&gt;&amp;ldquo;jestem zarówno Bardem, jak i Gemini. Bard to nazwa użytkownika, którą wykorzystuję do interakcji z użytkownikami, podczas gdy Gemini to nazwa platformy AI, na której jestem oparty&amp;rdquo;&lt;/em&gt;.&lt;br&gt;&#10;&lt;a href="https://deepmind.google/technologies/gemini/#introduction"&gt;Przedstawienie projektu&lt;/a&gt; (przez twórców) mówi o lepszych wynikach od ChataGPT v4 w prawie każdym mierniku., ale niby ma to dostęp do najnowszej wiedzy, ale jednak &lt;a href="https://g.co/bard/share/c0633f7cd6ac"&gt;taki sobie&lt;/a&gt;. Z literaturą nieco starszą radzi sobie&amp;hellip; &lt;a href="https://g.co/bard/share/21dc6e2f9212"&gt;sami zobaczcie&lt;/a&gt;. Słowacki i &amp;ldquo;Wesele&amp;rdquo;? to mogłoby być ciekawe, ale wolę wersję Wyspiańskiego (a filmową od Wajdy stawiam tuż za wajdowską &amp;ldquo;Ziemią obiecaną&amp;rdquo;). Czyli też zmyśla.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-04</title><link>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</link><pubDate>Mon, 04 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</guid><description>&lt;p&gt;W poprzednim tygodniu przeczytać mogliście króciutkie podsumowanie Data Science Summit, a tam stwierdzenie, że dużo się mówi o Streamlit jako sposobie na &lt;em&gt;PoC-owanie&lt;/em&gt; prezentacji danych. Świat obecnie idzie również w stronę streamingu i obsługi tak przesyłanych danych - głównie Flinkiem. I na Flinku skupia się dzisiejszy numer naszego newslettera.&lt;/p&gt;&#10;&lt;p&gt;Ciekawy jest też niespełna półgodzinne nagranie prezentujące możliwości DuckDB w kontekście danych przestrzennych pozyskanych z Open Street Maps. Chwilę bawiłem się DuckDB ale w połączeniu ze sporymi zbiorami geo (zapisanymi w ShapeFile&amp;rsquo;ach) i śmiga to wspaniale. Jedyny minus - to baza plikowa, więc średnio do użycia w przypadku dostępu przez wiele aplikacji na raz. Ale jako element w procesie &lt;em&gt;data engineeringu&lt;/em&gt; może się bardzo przydać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-27</title><link>https://blog.prokulski.science/2023/11/27/newsletter-dane-i-analizy-2023-11-27/</link><pubDate>Mon, 27 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/27/newsletter-dane-i-analizy-2023-11-27/</guid><description>&lt;p&gt;W minionym tygodniu miałem okazję być uczestnikiem konferencji &lt;strong&gt;Data Science Summit&lt;/strong&gt;. Moje obserwacje są dość proste (ale przyznam, że interesowały mnie ścieżki bliższe data engineering niż data science czy wręcz precyzyjnie LLM):&lt;br&gt;&#10;budowanie modeli przestało być zagadnieniem zagadnieniem jest ich wdrażanie, utrzymywanie, sprawianie by szybko działały i były łatwe do podmiany na swoje lepsze wersje a więc &lt;strong&gt;znaczenie ma MLOps&lt;/strong&gt; hasło &lt;em&gt;data mesh&lt;/em&gt; straciło impakt - nadal mówi się o tym, że dane to powinien być produkt, że ważny jest &amp;ldquo;demokratyczny dostęp do danych&amp;rdquo;, ale nie ma takiego hype jak rok temu dużo mówi się o Streamlit jako narzędziu do szybkiego budowania dedykowanych rozwiązań do prezentacji danych (i interakcji z nimi), właściwie obok dedykowanych narzędzi BI (PowerBI, MS Fabric, Tableau) Streamlit był jedynym rozwiązaniem open source&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-11-13</title><link>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</link><pubDate>Mon, 13 Nov 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/11/13/newsletter-dane-i-analizy-2023-11-13/</guid><description>&lt;p&gt;Za chwilę w świat pójdą pierwsze odcinki nowego podcastu przygotowanego przez zespół Big Data &amp;amp; AI PZU: &lt;strong&gt;#SilniwIT o technologiach&lt;/strong&gt;. To seria, w ramach której rozmawiam (wspólnie z Tomkiem z zespołu Fabryki Sztucznej Inteligencji) z gośćmi o szeroko pojętej sztucznej inteligencji. Wypatrujcie postów na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;FB&lt;/a&gt;, &lt;a href="https://www.linkedin.com/company/daneianalizy/"&gt;LinkedIn&lt;/a&gt; i pewnie w przyszłym newsletterze - mam nadzieję, że jak na amatorów - daliśmy radę. Staraliśmy się ucinać korpo-gadkę, powinno być interesująco ;-)&lt;/p&gt;&#10;&lt;p&gt;Wcześniej możecie posłuchać podsumowania z pierwszej konferencji OpenAI (firmy, która stworzyła ChatGPT) dla developerów w podcaście &lt;a href="https://podcasters.spotify.com/pod/show/artur-kurasinski/episodes/Podsumowanie-OpenAI-DevDay-2023-e2bles4"&gt;Technofobia&lt;/a&gt; Artura Kurasińskiego.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-30</title><link>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</link><pubDate>Mon, 30 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</guid><description>&lt;p&gt;Dzisiaj trochę o mapkach, trochę o diagramach (takie &lt;em&gt;diagram as a code&lt;/em&gt; tylko dlaczego &lt;a href="https://jira.atlassian.com/browse/BCLOUD-18559"&gt;BitBucket nie potrafi wyświetlić Mermaid&lt;/a&gt; (ticket w Atlassianie jest &amp;ldquo;solved&amp;rdquo;! Ale zobaczcie jak ;-), a GitHub robi to z palcem&amp;hellip; to znaczy bez problemu?), a do tego sporo materiału video. Chyba też więcej niż zwykle treści po polsku (polecamy tekst Tomka Zielińskiego o &lt;em&gt;transportowaniu danych&lt;/em&gt; - może się przydać na spotkania rekrutacyjne, ja lubię zadawać analogiczne pytania).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-23</title><link>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</link><pubDate>Mon, 23 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</guid><description>&lt;p&gt;Lubię DuckDB i lubię AirFlow. Kafka jest naturalnym sposobem na przesyłanie danych między systemami czy też mikroserwisami. Stąd też dzisiaj kilka tekstów zahaczających o te wszystkie technologie.&lt;/p&gt;&#10;&lt;p&gt;Dodatkowo trochę z obszaru zarządzania - zarówno opis typowego projektu data science jak i metryka opisująca stabilność kolejki prac.&lt;/p&gt;&#10;&lt;p&gt;No i trochę o mapkach, bo mapki są fajne.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-softmax-regression-for-multi-class-label-with-python-782a34283894"&gt;&lt;strong&gt;Fully Explained Softmax Regression for Multi-Class Label with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Klasyfikacja do wielu klas - o co tutaj chodzi? Przewodnik dla początkujących&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-16</title><link>https://blog.prokulski.science/2023/10/16/newsletter-dane-i-analizy-2023-10-16/</link><pubDate>Mon, 16 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/16/newsletter-dane-i-analizy-2023-10-16/</guid><description>&lt;p&gt;Dzisiaj dwa raporty o AI. Pierwszy to bardziej zbiór krótkich esejów&amp;hellip; gdzie prawie każdy prowadzi do rozbudowanego notebooka z szerszym komentarzem, wykresami i - jak to w Kaggle bywa - kodem. W Kaggle, bo to &lt;a href="https://www.kaggle.com/AI-Report-2023"&gt;&lt;strong&gt;AI Report 2023&lt;/strong&gt;&lt;/a&gt; od Kaggle właśnie.&lt;/p&gt;&#10;&lt;p&gt;Drugi raport to State of &lt;a href="https://www.stateof.ai/"&gt;&lt;strong&gt;AI Report 2023&lt;/strong&gt;&lt;/a&gt; od Air Street Capital. To opublikowany już szósty raz roczny raport o stanie sztucznej inteligencji. Ponad 160 stron, obejmujących:&lt;/p&gt;&#10;&lt;p&gt;Badania: Przełomy technologiczne i ich możliwości Przemysł: Obszary komercyjnego zastosowania sztucznej inteligencji i jej wpływ na biznes Polityka: regulacje dotyczące sztucznej inteligencji, jej implikacje gospodarcze i ewoluująca geopolityka sztucznej inteligencji Bezpieczeństwo: identyfikacja i łagodzenie katastrofalnych zagrożeń, jakie mogą dla nas stanowić przyszłe wysoce wydajne systemy sztucznej inteligencji Prognozy: to, w co wierzymy, że się wydarzy, oraz przegląd wyników, aby zachować uczciwość&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-09</title><link>https://blog.prokulski.science/2023/10/09/newsletter-dane-i-analizy-2023-10-09/</link><pubDate>Mon, 09 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/09/newsletter-dane-i-analizy-2023-10-09/</guid><description>&lt;p&gt;Dzisiaj w likach znajdziecie ponad pięciogodzinny kurs VSCode (ale nie trzeba oglądać całego - wystarczy z niego wyjąć około 30-45 minut żeby mieć tak zwany komplecik w obrębie swoich zainteresowań). Dodatkowo polecam kurs użycia Postmana - chyba najlepszego narzędzia do współpracy z już gotowym API. Też nie trzeba oglądać całości (tym bardziej że całość to ponad 4 godziny), ale może coś ciekawego znajdziecie? Kurs &lt;a href="https://www.youtube.com/watch?v=zp5Jh2FIpF0"&gt;na YouTube&lt;/a&gt; a kanał &lt;a href="https://www.youtube.com/@freecodecamp"&gt;freeCodeCamp&lt;/a&gt; gorąco polecam! Do newstlettara trafia to co nowe, a masa tam dobrego sprzed lat.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-25</title><link>https://blog.prokulski.science/2023/09/25/newsletter-dane-i-analizy-2023-09-25/</link><pubDate>Mon, 25 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/25/newsletter-dane-i-analizy-2023-09-25/</guid><description>&lt;p&gt;W tym tygodniu stawiam na potoki przetwarzające dane i pokazujące je finalnie w jakimś dashboardzie. To najczęstsza robota w korporacjach, szczególnie w zespołach &amp;ldquo;raportowych&amp;rdquo;. Dlatego gorąco polecam dzisiejszy dział &amp;ldquo;Analiza danych - projekty&amp;rdquo;.&lt;/p&gt;&#10;&lt;p&gt;Przy przetwarzaniu danych częstym krokiem jest analiza tego co przychodzi. Można użyć narzędzi BI, można ręcznie rzeźbić kod, a można skorzystać z Data Wranglera - dodatku do VSCode, w którym poszczególne kroki pochodzą z takiego niby wizarda, a w efekcie dostajemy gotowy kod. No trzeba to &lt;a href="https://www.youtube.com/watch?v=KrzcV1c1W1U"&gt;zobaczyć&lt;/a&gt; (10 minut filmu z dość specyficznym akcentem, ale nie takim jak myślicie), a potem można &lt;a href="https://marketplace.visualstudio.com/items?itemName=ms-toolsai.datawrangler"&gt;zainstalować&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-18</title><link>https://blog.prokulski.science/2023/09/18/newsletter-dane-i-analizy-2023-09-18/</link><pubDate>Mon, 18 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/18/newsletter-dane-i-analizy-2023-09-18/</guid><description>&lt;p&gt;Dziś polecam gorąco dwa teksty, dość obszerne.&lt;/p&gt;&#10;&lt;p&gt;Pierwszy to świetny i darmowy kurs &lt;strong&gt;spaCy&lt;/strong&gt; - chyba najlepszej obecnie biblioteki służącej do przetwarzania tekstu w Pythonie (z bogatą biblioteką słowników w różnych językach)&lt;/p&gt;&#10;&lt;p&gt;Drugi to cykl (link prowadzi do jego środka) opowiadający o budowaniu aplikacji do zamawiania usług: zaczyna się od FastAPI przyjmującego zamówienia, Kafka jako potok na dane, Apache Pinot jako hurtownia danych i aplikacja-dashboard napisany za pomocą Dash.&lt;/p&gt;&#10;&lt;p&gt;A żeby nie było za łatwo - musisz samodzielnie przeczytać całą poniższą listę, aby te dwa teksty odkryć. Dzięki temu może znajdziesz jeszcze coś ciekawego?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-11</title><link>https://blog.prokulski.science/2023/09/11/newsletter-dane-i-analizy-2023-09-11/</link><pubDate>Mon, 11 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/11/newsletter-dane-i-analizy-2023-09-11/</guid><description>&lt;p&gt;Dzisiaj sporo materiałów wideo. Od prostych przewodników po kilkanaście minut (z czego &amp;ldquo;mięso&amp;rdquo; zajmuje do 5-10, a i to najwyżej) do dużego kursu na półtorej godziny. Trochę też o budowaniu czy może raczej ulepszaniu swojego środowiska pracy. Czy to w Linuxie czy to w VSCode. Ciekawostka, szok i niedowierzanie: oba te &amp;ldquo;zakresy tematyczne&amp;rdquo; (poprawa wygody pracy i wideo) mają części wspólne!&lt;/p&gt;&#10;&lt;p&gt;Dla tych którzy wierzą w &lt;a href="https://pl.wikipedia.org/wiki/Smugi_chemiczne"&gt;chemtrails&lt;/a&gt; też coś mamy ;-) a z całego tekstu, który znajdziecie niżej najlepszy i tak zawsze jest gotowy &lt;a href="https://www.kaggle.com/code/mnokno/getting-started-eda-model-train-submit"&gt;notebook z kodem&lt;/a&gt; (znowu Torch a nie TensorFlow - coś jest na rzeczy, prawda?)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-04</title><link>https://blog.prokulski.science/2023/09/04/newsletter-dane-i-analizy-2023-09-04/</link><pubDate>Mon, 04 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/04/newsletter-dane-i-analizy-2023-09-04/</guid><description>&lt;p&gt;Wiecie co jest największym problemem dla analityka danych w dużej organizacji? Jest ich kilka, ale podzielić można je na kilka obszarów:&lt;br&gt;&#10;znajdowanie danych zrozumienie danych uzyskanie dostępu do danych&lt;/p&gt;&#10;&lt;p&gt;Przeczytacie o tym w &lt;a href="https://towardsdatascience.com/5-common-data-governance-pain-points-for-analysts-data-scientists-8efe8a007ac2"&gt;5 Common Data Governance Pain Points for Analysts &amp;amp; Data Scientists&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;I jeszcze na to dochodzi podejście do organizacji zespołów zajmującymi się danymi. Centralnie? A może każdy osobno? O tym pisze SeattleDataGuy w &lt;a href="https://seattledataguy.substack.com/p/centralized-vs-decentralized-vs-federated"&gt;Centralized vs Decentralized vs Federated Data Teams&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-08-28</title><link>https://blog.prokulski.science/2023/08/28/newsletter-dane-i-analizy-2023-08-28/</link><pubDate>Mon, 28 Aug 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/08/28/newsletter-dane-i-analizy-2023-08-28/</guid><description>&lt;p&gt;Zgodnie z zapowiedzią - w miniony czwartek opowiadałem trochę o AI i nie tylko podczas wywiadu zorganizowanego przez &lt;a href="https://www.facebook.com/SzkolnaGieldaPracy"&gt;Szkolną Giełdę Pracy&lt;/a&gt;. Transmisja live została nagrana i można obejrzeć &lt;a href="https://www.facebook.com/SzkolnaGieldaPracy/videos/1298839254079331"&gt;nagranie&lt;/a&gt; (gadam dużo i szybko, jakieś 45 minut).&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.facebook.com/SzkolnaGieldaPracy/videos/1298839254079331"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/kto_stoi_za_ai.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Świat już nigdy nie będzie taki sam. &lt;a href="https://techcommunity.microsoft.com/t5/microsoft-365-blog/introducing-python-in-excel-the-best-of-both-worlds-for-data/ba-p/3905482"&gt;Excel z Pythonem&lt;/a&gt; - to &lt;em&gt;sensacja&lt;/em&gt; minionego tygodnia. To &lt;a href="https://youtu.be/FbBXtqtRnWU?si=I0jWRtVAMrbk0U43"&gt;wideo&lt;/a&gt; pokazuje jak to działa. Kto będzie przepisywał to wszystko co powstało w VBA?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://python.plainenglish.io/deepfake-face-swap-in-video-with-pytorch-and-opencv-88e497e50ddd"&gt;&lt;strong&gt;DeepFake Face-Swap in Video with Pytorch and OpenCV&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działa uproszczona wersja narzędzia DeepFakeLab do zamiany twarzy w wideo? Z fragmentami kodu&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-08-14</title><link>https://blog.prokulski.science/2023/08/08/newsletter-dane-i-analizy-2023-08-14/</link><pubDate>Tue, 08 Aug 2023 00:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/08/08/newsletter-dane-i-analizy-2023-08-14/</guid><description>&lt;p&gt;Na początek &lt;a href="https://youtu.be/NwiI4y8PC9g"&gt;tutorial&lt;/a&gt; (YT, 30 minut, po polsku), tym razem z LLMami w roli głównej - o tym jak zbudować chatbota odpowiadającego na pytania z własnej bazy wiedzy. Bardzo fajny materiał, takich trochę brakuje - chłopaki opowiadają o tych najbardziej kluczowych kawałkach kodu a nie o podstawach. Rozumiesz o czym jest mowa, nie ma straty czasu na opowiadanie co do jest model albo funkcja w Pythonie ;-)&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj też &lt;a href="https://levelup.gitconnected.com/mlops-mastering-machine-learning-deployment-an-intro-to-docker-kubernetes-helm-and-modern-web-b14dd140a9bf"&gt;pelny proces MLOps&lt;/a&gt; - wprowadzenie zawierające wszystkie elementy. Super tekst na początek dla każdego DevOpsa który chce się zająć tematami ML oraz każdego data scientisty, który chce umieć nowocześnie wdrażać swoje modele.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-08-07</title><link>https://blog.prokulski.science/2023/08/07/newsletter-dane-i-analizy-2023-08-07/</link><pubDate>Mon, 07 Aug 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/08/07/newsletter-dane-i-analizy-2023-08-07/</guid><description>&lt;p&gt;Jakie bazy danych są popularne? Które są używane, a których programiści chcieliby użyć w swoim kolejnym projekcie? Między innymi takie pytania zadano w ankiecie &lt;strong&gt;State of Databases 2023&lt;/strong&gt;, której podsumowanie właśnie &lt;a href="https://stateofdb.com/databases"&gt;opublikowano&lt;/a&gt;. Takie ankiety są obrazem rynku - warto śledzić trendy, bo można z nich wywnioskować jakich narzędzi używają inni, w jakie warto inwestować (aby znaleźć pracowników albo pracę). Czy wyniki takich ankiet odpowiadają na pytanie &lt;em&gt;Która technologia jest najlepsza?&lt;/em&gt; - zdecydujcie sami.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-31</title><link>https://blog.prokulski.science/2023/07/31/newsletter-dane-i-analizy-2023-07-31/</link><pubDate>Mon, 31 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/31/newsletter-dane-i-analizy-2023-07-31/</guid><description>&lt;p&gt;Lubicie jazdę na rowerze? Sama jazda to przyjemność, ale równie ciekawe jest obserwowanie wyścigu zawodowców - na przykład Tour de France. Znakomity w swoich tekstach o danych The New York Times przygotował &lt;a href="https://www.nytimes.com/interactive/2023/07/23/upshot/tour-de-france-amateurs.html?unlocked_article_code=XuLPI_E4EuiXBI5jzl5OHdqM8m4oQHyPPx9tgaFTFNB8JymStmub9AcNzObcpo7FAIOmkH-Ph5wXVKFhkZ0Y96Z6vNb3FqJt5DoQj_gWfMsO6Md5KZtkU6Pu_W3gGhnrTF28Idi6KmIwWgBO-NlyDet-GKBP-3Bbgyc9M00Yxf3pu2wYkexkTxJvOYjE4GQ06tIlMxWP_vm2gcjF4CNC-ucTt5m90WgMg4U_viq0awHYBGC6CNShc9XfKKxURzl6qAI0bBPs8t8MJxCBtKEkVQdAk4Xs1PUlIXrBrvfaSHAc9l4Lt4HOC4Y9rtkd8a_FGehKlr19YNjbCSZKsMVPvFyK_MqY5HrGvYZR4iN3ZcY&amp;amp;smid=url-share"&gt;porównanie jak szybko jedzie grupa amatorów i czołówka kolarzy z Tour de France&lt;/a&gt;. Dane zebrano ze Stravy (w tekście znajdziecie linki do tras, a co za tym idzie do profili np. Tadeja Pogacara). Mając bardzo dużo przejazdów dziennikarze przygotowali interesujące wizualizacje i porównania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-24</title><link>https://blog.prokulski.science/2023/07/24/newsletter-dane-i-analizy-2023-07-24/</link><pubDate>Mon, 24 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/24/newsletter-dane-i-analizy-2023-07-24/</guid><description>&lt;p&gt;Pisanie newsletterów (oraz postów na bloga) jest proste - robi się to mniej więcej tak:&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://rmoff.net/images/2023/07/07.png" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Obrazek ten pochodzi z &lt;a href="https://rmoff.net/2023/07/19/blog-writing-for-developers/?utm_source=daneianalizy_newsletter"&gt;wpisu Robina Moffatta&lt;/a&gt; (polecam jeśli myślisz o pisaniu bloga lub pojedynczych tekstów o programowaniu, albo po prostu dokumentacji). Proces wygląda tak samo - czy są wakacje czy ich nie ma.&lt;/p&gt;&#10;&lt;p&gt;A że jestem w trakcie urlopu to pozwólcie, że dzisiaj na tym zakończymy wstęp.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/using-a-keras-tuner-for-hyperparameter-tuning-of-a-tensorflow-model-41978f53111"&gt;&lt;strong&gt;Using a Keras Tuner for Hyperparameter Tuning of a TensorFlow Model&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Hyperband Tuner użyty do doboru najlepszych parametrów dla przygotowanego modelu opartego i sieć neuronową&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-17</title><link>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</link><pubDate>Mon, 17 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/17/newsletter-dane-i-analizy-2023-07-17/</guid><description>&lt;p&gt;Gorąco polecam tekst &lt;a href="https://towardsdev.com/data-engineering-project-imdb-movie-analysis-3f79de2f4ce7"&gt;Data Engineering Project: IMDB Movie Analysis&lt;/a&gt; - przykład świetnego projektu pozyskiwania i przetwarzania danych.&lt;/p&gt;&#10;&lt;p&gt;A kiedy dane są już przetworzone - można je pokazać. Wspomniany tekst analizujący dane z IMDB też zawiera ten element, ale dzisiejsze wydanie pokazuje więcej takich przykładów czy też tutoriali. Mamy coś o rysowaniu wykresów (super jest &lt;a href="https://towardsdatascience.com/plotly-and-pandas-combining-forces-for-effective-data-visualization-2e2caad52de9"&gt;Plotly and Pandas: Combining Forces for Effective Data Visualization&lt;/a&gt;) ale też &lt;a href="https://nightingaledvs.com/data-journalism-colour-accessibility/"&gt;o kolorach i ich doborze&lt;/a&gt; do wykresów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://python.plainenglish.io/the-complete-guide-to-keras-loss-functions-776d319e729d"&gt;&lt;strong&gt;The Complete Guide to Keras Loss Functions&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy model uczy się tak, aby dopasować się do metryki, która weryfikuje czy działa on dobrze czy źle. Trzeba więc wiedzieć jak te metryki działają, aby osiągnąć to, czego chcemy. Tutaj znajdziesz informacje o metrykach dostępnych w TF&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-10</title><link>https://blog.prokulski.science/2023/07/10/newsletter-dane-i-analizy-2023-07-10/</link><pubDate>Mon, 10 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/10/newsletter-dane-i-analizy-2023-07-10/</guid><description>&lt;p&gt;Myślisz, że analitycy danych już nie będą potrzebni? Dlaczego? Bo pojawił się Code Interpreter, a jeśli nie wiesz o co chodzi to przeczytaj koniecznie o nim (i o tym jak go używać!) &lt;a href="https://www.oneusefulthing.org/p/what-ai-can-do-with-a-toolbox-getting"&gt;tutaj (&amp;ldquo;What AI can do with a toolbox&amp;hellip; Getting started with Code Interpreter&amp;rdquo;)&lt;/a&gt; oraz &lt;a href="https://www.oneusefulthing.org/p/it-is-starting-to-get-strange"&gt;tutaj (&amp;ldquo;It is starting to get strange&amp;rdquo;)&lt;/a&gt;. Code Interpreter jest dostępny w planie &amp;ldquo;ChatGPT Plus&amp;rdquo;.&lt;/p&gt;&#10;&lt;p&gt;I ten temat, te dwa teksty to chyba najciekawszy materiał w tym tygodniu. Gdyby było mało - poniżej kilka kolejnych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-03</title><link>https://blog.prokulski.science/2023/07/03/newsletter-dane-i-analizy-2023-07-03/</link><pubDate>Mon, 03 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/03/newsletter-dane-i-analizy-2023-07-03/</guid><description>&lt;p&gt;Wzorce projektowe ułatwiają pracę. Kod jest bardziej czytelny, łatwiej go rozbudować i nie trzeba przebudowywać całej aplikacji. Tych wzorców jest bardzo dużo, możesz zacząć od &amp;ldquo;top 10&amp;rdquo; opisanych w artykule &lt;a href="https://pub.towardsai.net/10-underrated-software-patterns-every-ml-engineer-should-know-92e702b96407"&gt;&amp;ldquo;10 Underrated Software Patterns Every ML Engineer Should Know&amp;rdquo;&lt;/a&gt;, który patrzy na wzorce projektowe przez pryzmat projektów machine learning.&lt;/p&gt;&#10;&lt;p&gt;Jeśli zaś potrzebujesz przykładu kodu to dobre wprowadzenie daje tekst &lt;a href="https://python.plainenglish.io/structural-design-patterns-a-comprehensive-guide-for-developers-c0cde4a86319"&gt;&amp;ldquo;Structural Design Patterns: A Comprehensive Guide for Developers&amp;rdquo;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Największą jednak i darmową bazą, obejmującą kilka języków (angielski, niemiecki, polski też&amp;hellip; a nie! - o języki programowania chodzi: C#, C++, Go, Java, PHP, Python, Ruby, Rust, Swift oraz TypeScript) jest strona &lt;a href="https://refactoring.guru/pl/design-patterns/"&gt;&lt;strong&gt;Refactoring.Guru&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-26</title><link>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</link><pubDate>Mon, 26 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</guid><description>&lt;p&gt;Rozpoczynamy pierwszy tydzień wakacji, ale to wcale nie oznacza, że newsletter ma urlop. Wręcz przeciwnie.&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym wydaniu kilka tekstów opisujących dobre praktyki i całe cykle tutorialowe: CRUD-woe API dla MongoDB czy też asynchroniczne mikroserwisy spięte Rabbitem. To dla tych średniozaawansowanych programistów (i tych, którzy chcą swoją wiedzę przenieść z poziomu juniorskiego na wyższy). Dla tych bardziej juniorów - korepetycje z Window Functions w SQLu i &amp;ldquo;rozpakowywujących&amp;rdquo; gwiazdek w Pythonie (mimo że to nie Gwiazdka, he he, zacny suchar).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-19</title><link>https://blog.prokulski.science/2023/06/19/newsletter-dane-i-analizy-2023-06-19/</link><pubDate>Mon, 19 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/19/newsletter-dane-i-analizy-2023-06-19/</guid><description>&lt;p&gt;W dzisiejszym numerze znajdziecie link do niezbyt długiego filmu pokazującego jak korzystać z Midjourney - czyli narzędzia do generowania hiperrealistycznych grafik. Robi wrażenie (Midjourney, nie sam filmik), pochłonęło mnie na kilka godzin wczoraj&amp;hellip; tylu nieistniejących dziewczyn dawno nie widziałem ;-) a zabawa w zmiany stylu przednia!&lt;/p&gt;&#10;&lt;p&gt;Oczywiście ktoś takie Midjourney musiał przygotować wcześniej i nauczyć tą sztuczną inteligencję tych wszystkich sztuczek. Zapewne te osoby musiały zacząć od podstaw, a te znajdziecie w kursie od IBM, opublikowanym na YouTube.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-29</title><link>https://blog.prokulski.science/2023/05/29/newsletter-dane-i-analizy-2023-05-29/</link><pubDate>Mon, 29 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/29/newsletter-dane-i-analizy-2023-05-29/</guid><description>&lt;p&gt;Dość przekrojowo dzisiaj.&lt;/p&gt;&#10;&lt;p&gt;Najciekasze według mnie tekstu to ten o sensownym nadawaniu gwiazdek produktom (ile razy filtrowaliście produkty w sklepie internetowym przed kupnem po najlepszej ocenie i okazywało się, że z &amp;ldquo;piątką&amp;rdquo; jest tylko jeden?), ten o SoftMax (nie przeraź się równaniami na początku, chociaż może podstawy matematyczne są akutat dla Ciebie cenne?).&lt;/p&gt;&#10;&lt;p&gt;Bardzo dajny jest też dział Python - od rzeczy prostych typu wiele wykresów na jednym obrazku do modelu (no&amp;hellip;) informującego o tym że akcje należy kupić albo sprzedać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-15</title><link>https://blog.prokulski.science/2023/05/15/newsletter-dane-i-analizy-2023-05-15/</link><pubDate>Mon, 15 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/15/newsletter-dane-i-analizy-2023-05-15/</guid><description>&lt;p&gt;Wielokrotnie w newsletterze znalazły się teksty mówiące o wykorzystaniu Snowflake, BigQuery czy Databricks. Dzisiaj przyszedł jednak czas na szybkie wprowadzenie do tych narzędzi - jak zacząć z nich korzystać? Jak stworzyć konto, jak załadować pierwsze dane?&lt;/p&gt;&#10;&lt;p&gt;A wiecie, że narzędzia Microsoftu - na przykład Excel (poprzez VBA) czy też PowerBI potrafią współpracować z zewnętrznymi skryptami napisanymi w Pythonie albo R? Jeśli nie, to poniżej znajdziecie przykłady takiej współpracy. Swoją drogą - pewnie już ze dwa lata mija od plotek o wprowadzeniu Pythona do Excela&amp;hellip; ale coś nie widać zmiany.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-04-17</title><link>https://blog.prokulski.science/2023/04/10/newsletter-dane-i-analizy-2023-04-17/</link><pubDate>Mon, 10 Apr 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/04/10/newsletter-dane-i-analizy-2023-04-17/</guid><description>&lt;p&gt;&lt;a href="https://www.facebook.com/michal.jaskolski/posts/10159695720393003"&gt;&lt;strong&gt;Mój stary to fanatyk sztucznej inteligencji.&lt;/strong&gt;&lt;/a&gt;. Kto zna to zna, Michał przygotował (z użyciem AI) przeróbkę znanej copy-pasty Malcolma XD.&lt;br&gt;&#10;Ponieważ ChatGPT tak mocno rządzi w mediach ostatnio, dzisiaj specjalna sekcja na ten temat.&lt;/p&gt;&#10;&lt;p&gt;W tej dedykowanej sekcji przedstawiam więc kilka inspirujących tekstów, które pokazują drogę od tego w czym i jak ChatGPT może pomóc, do konkretnych rozwiązań zastępujących na przykład StackOverflow, aby na koniec pokazać jak wykorzystać API przygotowane przez OpenAI z poziomu kodu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-20</title><link>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</link><pubDate>Mon, 20 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</guid><description>&lt;p&gt;Wiecie kto generuje najwięcej ruchu w internecie? Kiedyś to było porno i torrenty (albo inne sposoby wymiany plików peer-to-peer). Teraz układ wygląda jak na poniższym obrazku, przynajmniej według danych &lt;a href="https://www.statista.com/chart/15692/distribution-of-global-downstream-traffic/"&gt;opublikowanych&lt;/a&gt; przez serwis Statista.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://prokulski.science/temp/static/nlt/global_internet_traffic.jpeg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj bardzo dużo treści - oraz eksperyment - polskie tytuły (ale przeważnie angielskie teksty). Wśród tych tekstów sporo o Apache Spark i konkretnych wykorzystaniach albo rozwiązaniach konkretnych problemów.&lt;br&gt;&#10;Znajdziecie też kilka fajnych tekstów o różnego typu problemach rozwiązywanych przez analizę czy modele danych (rekomendacje w Netflixie, OHE i Pandas), gorąco polecam tekst o Apache Arrow.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-13</title><link>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</link><pubDate>Mon, 13 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/13/newsletter-dane-i-analizy-2023-03-13/</guid><description>&lt;p&gt;Wielokrotnie na łamach niniejszego newslettera poruszane były tematy związane z Apache Kafka. A to podejście architektoniczne z grubsza mówiące dlaczego Kafka jest fajna i przydatna, a to podejście developerskie - o tym jak wysyłać i konsumować wiadomości z Kafki. Często też trafiają się bardziej zaawansowane przykłady - traktujące Kafkę jako bazę danych (z ktable czy ksql), czasem uzupełnione o Spark Streaming czy inne dodatkowe narzędzia typu Trino.&lt;/p&gt;&#10;&lt;p&gt;Ale najczęściej chyba Kafka wykorzystywana jest do przesyłania komunikatów w podejściu &lt;em&gt;publish &amp;amp; subscribe&lt;/em&gt;. Są jednak przecież inne rozwiązania kolejkowe - Rabbit, czy na przykład MQTT popularne w rozwiązaniach Internet of Things. &lt;a href="https://emqx.medium.com/mqtt-and-kafka-f20d79d9dea4"&gt;Przeczytajcie o podobieństwach i różnicach Kafki z MQTT&lt;/a&gt; (tekst &lt;a href="https://medium.com/techieahead/kafka-vs-rabbitmq-comparison-61d7a7b425d7"&gt;Kafka vs Rabbit&lt;/a&gt; też oczywiście jest).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-06</title><link>https://blog.prokulski.science/2023/03/06/newsletter-dane-i-analizy-2023-03-06/</link><pubDate>Mon, 06 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/06/newsletter-dane-i-analizy-2023-03-06/</guid><description>&lt;p&gt;Prosty zestaw danych - tylko 6 liczb, po dwie dla 6 kategorii, każda z kategorii dodatkowo podzielona na 2 lata. Na ile sposobów można takie dane pokazać? Kilka, prawda? Bo ileż można wymyślać? I faktycznie - czasem jest &lt;em&gt;nawymyślane&lt;/em&gt; nieco do przesady. Ale &lt;a href="https://100.datavizproject.com/"&gt;&lt;strong&gt;ta strona&lt;/strong&gt;&lt;/a&gt; pokazuje aż 100 (słownie: sto!) przykładów wizualizacji tych 6 liczb. Fascynujące, inspirujące i&amp;hellip; zdumiewające?&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj też sporo w sekcji o analizie danych. Dwa ciekawe pakiety (&lt;a href="https://greatexpectations.io/"&gt;Great Expectations&lt;/a&gt; oraz &lt;a href="https://www.nannyml.com/"&gt;NannyML&lt;/a&gt;) plus wręcz zbiór ułatwiaczy EDA. Dodatkowo bardzo fajny projekt rozpoznawania szachów (i możliwych ruchów) oraz wieloręki bandyta - sposób na optymalizację testów typu A/B przy ograniczonym budżecie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-27</title><link>https://blog.prokulski.science/2023/02/27/newsletter-dane-i-analizy-2023-02-27/</link><pubDate>Mon, 27 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/27/newsletter-dane-i-analizy-2023-02-27/</guid><description>&lt;p&gt;W dzisiejszym wydaniu najwięcej miejsca poświęcam wizualizacji danych i okolicach.&lt;/p&gt;&#10;&lt;p&gt;Kalibracja obrazu jest okolicą (bardzo odległą - w sumie oba tematy łączy tylko to, że mamy do czynienia z obrazem), jest też więc coś o tym. Kalibracja jest potrzebna przy problemach natury &lt;em&gt;computer vision&lt;/em&gt;, a takowy - w postaci maskowania obiektów na obrazie - też dzisiaj poruszamy.&lt;/p&gt;&#10;&lt;p&gt;W poprzednim tygodniu dużym powodzeniem cieszył się tekst o MLOps (jeśli boisz się, że umknęło - zerknij do &lt;a href="../../category/newsletter/"&gt;archiwum&lt;/a&gt;), więc dzisiaj kontynuacja, niejako na fali z poprzedniego tygodnia.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-20</title><link>https://blog.prokulski.science/2023/02/20/newsletter-dane-i-analizy-2023-02-20/</link><pubDate>Mon, 20 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/20/newsletter-dane-i-analizy-2023-02-20/</guid><description>&lt;p&gt;Jak wyglądać będzie świat kiedy GPT-3 będzie pisać teksty? Mniej więcej tak jak wygląda Medium.com. Clickbaitowe tytuły, mało merytorycznej treści. Jeśli brać pod uwagę teksty mówiące ogólnie rzecz biorąc o IT to dodatkowo długie wprowadzenia (zawsze mniej więcej o tym samym: czym jest Kafka, czym jest AirFlow, czym jest Docker), potem dwa akapity o banalnym do rozwiązania problemie i to wszystko.&lt;/p&gt;&#10;&lt;p&gt;Może to przeziębienie trwające już za długo, może kryzys wieku średniego ;-) albo za dużo zajęć i rzeczy do zrobienia tu i teraz, ale szczerze mówiąc jestem zmęczony, głównie internetem - wszędzie to samo, wszystko miałkie, wszystko wtórne. Dlatego, żeby tego wszystkiego Wam oszczędzić do dzisiejszego newslettera wstępnie wybrałem około 50 artykułów. Ile przeszło selekcję? Widzicie poniżej. Ile z nich jest godnych uwagi i na prawdę coś ciekawego wnosi? To musicie ocenić sami.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-06</title><link>https://blog.prokulski.science/2023/02/06/newsletter-dane-i-analizy-2023-02-06/</link><pubDate>Mon, 06 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/06/newsletter-dane-i-analizy-2023-02-06/</guid><description>&lt;p&gt;Dzisiaj nieco zagadnień teoretycznych. Dobór odpowiedniego rozkładu do istniejących danych, metody tropienia ile tak na prawdę mamy &amp;ldquo;klastrów&amp;rdquo; (grup) w danych.&lt;/p&gt;&#10;&lt;p&gt;Sporo też o GPT-3, a raczej jego wykorzystaniu w różny sposób (od pisania książek do pisania&amp;hellip; rozszerzeń do Chrome). Niespodziewanie dzisiaj rozrósł się dział dedykowany Apache Kafka.&lt;/p&gt;&#10;&lt;p&gt;Na koniec coś o wizualizacji, na przykład szpilki pokazujące gdzie mieszkają ludzie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://machinelearningmastery.com/building-a-multiclass-classification-model-in-pytorch/"&gt;&lt;strong&gt;Building a Multiclass Classification Model in PyTorch&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PyTorch zdobywa rynek AI spychając w cień TensorFlow. Jeśli więc zamierzasz się przesiadać - ten tutorial o prostej klasyfikacji może się przydać&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-30</title><link>https://blog.prokulski.science/2023/01/30/newsletter-dane-i-analizy-2023-01-30/</link><pubDate>Mon, 30 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/30/newsletter-dane-i-analizy-2023-01-30/</guid><description>&lt;p&gt;Dzisiaj na początek trochę o orkiestracji za pomocą Apache Airflow. Zobaczymy co potrafi to narzędzie w zakresie sterowania pobieraniem danych i jak sprawuje się na produkcji.&lt;/p&gt;&#10;&lt;p&gt;A jak już mamy pobrane dane to możemy z nimi coś zrobić korzystając z jednej z bibliotek pythonowych. Albo policzyć jakieś modele i z ich pomocą przeanalizować na przykład klientów i ich drogę przez koszyk zakupowy.&lt;/p&gt;&#10;&lt;p&gt;W sumie - u laików - synonimem słowa &amp;ldquo;model&amp;rdquo; jest &amp;ldquo;sztuczna inteligencja&amp;rdquo;. A jak sztuczna inteligencja to może od razu ChatGPT (z którego już dzieciaki korzystają żeby pisać prace domowe)?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-23</title><link>https://blog.prokulski.science/2023/01/23/newsletter-dane-i-analizy-2023-01-23/</link><pubDate>Mon, 23 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/23/newsletter-dane-i-analizy-2023-01-23/</guid><description>&lt;p&gt;Dzisiaj sporo materiałów edukacyjnych, konkretnych przykładów i rozwiązań (przynajmniej takie mam nadzieję, że tak zostaną przez Was odebrane).&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cuvalley.com/?utm_source=dia_newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/cuvalley_2023.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Przypominam, że &lt;a href="https://cuvalley.com/?utm_source=dia_newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;&lt;strong&gt;CuValley Hack&lt;/strong&gt;&lt;/a&gt;, hackathon organizowany przez #KGHM, startuje już w tym tygodniu - 27.01!&lt;/p&gt;&#10;&lt;p&gt;Co Was czeka: 4 zadania i 127 500 PLN do wygrania! 40h kodowania analiza danych, #AI, #MachineLearning, #BigData webinary, Keynote Speakerzy i duża dawka wiedzy&lt;/p&gt;&#10;&lt;p&gt;Szczegóły (na przykład zadania) i darmowa rejestracja na stronie &lt;a href="https://cuvalley.com/?utm_source=dia_newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;&lt;strong&gt;www.cuvalley.com&lt;/strong&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Dane i Analizy to patron społecznościowy, a ten konkretny konkurs to spełnienie mojej idei hackathonu: dane z przemysłu i rozwiązania dla przemysłu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-09</title><link>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</link><pubDate>Mon, 09 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</guid><description>&lt;p&gt;W pierwszym pełnym tygodniu nowego roku wracamy ze standardowym zestawem materiałów.&lt;/p&gt;&#10;&lt;p&gt;Jest więc coś o machine learningu (dobry jest tekst o YOLOv5, przede wszystkim pokazujący że nie tylko TensorFlow obowiązuje w domenie deep learning), sporo ciekawostek ocierających się o NLP i analizę tekstu. Jest gotowy przepis na pobieranie danych z Kafki i zapisywanie w Mongo.&lt;/p&gt;&#10;&lt;p&gt;Na koniec zapraszam na &lt;a href="https://cuvalley.com/?utm_source=dia_newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;&lt;strong&gt;CuValley Hack&lt;/strong&gt;&lt;/a&gt;! To trzecia edycja hackathonu organizowanego przez KGHM w ramach programu &lt;em&gt;Dolina Miedziowa&lt;/em&gt;. To przyznam szczerze spełnienie mojej idei hackathonu: dane wprost z przemysłu i konkretne problemy (zobacz na stronie jakie są zadania) do rozwiązania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-19</title><link>https://blog.prokulski.science/2022/12/19/newsletter-dane-i-analizy-2022-12-19/</link><pubDate>Mon, 19 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/19/newsletter-dane-i-analizy-2022-12-19/</guid><description>&lt;p&gt;Po Mundialu, można się rozejść. W tym tygodniu lekkie wytchnienie, potem święta, święta i po świętach.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym życzę Państwu wszystkiego najlepszego, rodzinnych, spokojnych świąt. Odstawcie modele ML, dostawcie Flinki, Sparki i Kafki, zajmijcie się uszkami w barszczu i prezentami spod choinki. No, może być Pinot&amp;hellip; Pinot Noir.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/10-commonly-used-loss-functions-explained-with-python-code-59967e1f3c8d"&gt;&lt;strong&gt;10 Commonly Used Loss Functions Explained with Python Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Loss Function czy też bardziej swojsko &amp;ldquo;funkcja straty&amp;rdquo; to taka funkcja, która jest minimalizowana przez algorytm ML. A jakie mogą to być funkcje?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-05</title><link>https://blog.prokulski.science/2022/12/05/newsletter-dane-i-analizy-2022-12-05/</link><pubDate>Mon, 05 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/05/newsletter-dane-i-analizy-2022-12-05/</guid><description>&lt;p&gt;Jak wygląda Mundial na Twitterze?&lt;/p&gt;&#10;&lt;p&gt;W kilka dni i właściwie w trzy osoby przygotowaliśmy dashboard pozwalający monitorować co się dzieje podczas meczów na Mundialu. Gdzie to zobaczyć? Na &lt;a href="https://mundial.achaja.org/"&gt;mundial.achaja.org&lt;/a&gt; (login: &lt;em&gt;robercik&lt;/em&gt;, hasło: &lt;em&gt;nicsieniestalo&lt;/em&gt;).&lt;br&gt;&#10;&lt;strong&gt;A jak to wszystko działa?&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;Skrypt w Pythonie zbiera dane z Twittera&lt;/p&gt;&#10;&lt;p&gt;API Twittera pozwala na podpięcie się pod strumień (dane same spływają, w czasie rzeczywistym, chociaż przy natłoku komunikatów zdarza się nawet 5-minutowy lag) którym przychodzą nowe obiekty - tweety taki &lt;em&gt;obiekt&lt;/em&gt; zawiera treść, tagi, informacje o tym w jakim języku napisany został tekst zbieramy więc te wszystkie twitty dla meczu po hashtagu, np. dla meczu Francja-Polska #FRAPOL oraz #POLFRA dodatkowo zbieramy tweety dla hashtagów ogólnych: #WorldCup #WorldCup2022 #FIFAWorldCup #QatarWorldCup2022 #Qatar2022&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-11-28</title><link>https://blog.prokulski.science/2022/11/28/newsletter-dane-i-analizy-2022-11-28/</link><pubDate>Mon, 28 Nov 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/11/28/newsletter-dane-i-analizy-2022-11-28/</guid><description>&lt;p&gt;Czarny Piątek co prawda za nami, ale wietrzenie magazynów bardzo się przyda. Tym bardziej, że w ankiecie sprzed bodaj dwóch tygodni przyznaliście, że więcej polecanych tekstów w jednym numerze jesteście w stanie przełknąć. Zatem wietrzymy i mamy więcej niż zwykle.&lt;/p&gt;&#10;&lt;p&gt;Ostatnio pokazywałem &lt;a href="https://prokulski.science/temp/static/nlt/mundial2022.jpeg"&gt;potencjalną drabinkę Mundialu&lt;/a&gt;, która już być może nieco nieaktualna, prawda? Od początku całej imprezy wpadają jednak &lt;em&gt;do wora&lt;/em&gt; dane z Twittera i między innymi &lt;a href="https://www.facebook.com/DaneAnalizy/posts/807311953943124"&gt;na fanpage&amp;rsquo;u pokazywałem&lt;/a&gt; przykładowe wykresy. Projekt jest dość prosty w przygotowaniu, jak znajdę czas to (mam nadzieję) w tym tygodniu opiszę z grubsza założenia.&lt;br&gt;&#10;Okazuje się, że &lt;strong&gt;big data&lt;/strong&gt; można robić w kilka dni. Mam w tym doświadczenie, może to &amp;ldquo;robi robotę&amp;rdquo;?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-11-14</title><link>https://blog.prokulski.science/2022/11/14/newsletter-dane-i-analizy-2022-11-14/</link><pubDate>Mon, 14 Nov 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/11/14/newsletter-dane-i-analizy-2022-11-14/</guid><description>&lt;p&gt;Dziękuję przede wszystkim za wypełnienie ankiety! Chyba najbardziej za średnią ocen &lt;strong&gt;8.7&lt;/strong&gt;. Jeśli nie wypełniłaś/wypełniłeś jeszcze ankietki to poszukaj maila z minionej środy i przeklikaj w te trzy minutki kilka pytań. Pomoże w rozwoju newslettera, część uwag już wziąłem sobie do serca.&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj szerokie spektrum tematów. Starałem się, aby każdy z tekstów które tutaj trafiły porządnie zgłębiały temat, a nie były zwykłym &amp;ldquo;baitem&amp;rdquo;. Mam nadzieję, że udało się wybrać to najsmaczniejsze. Szczerze mówiąc z około 90 potencjalnych kandydatów tylko te przeszły selekcję.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-11-07</title><link>https://blog.prokulski.science/2022/11/07/newsletter-dane-i-analizy-2022-11-07/</link><pubDate>Mon, 07 Nov 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/11/07/newsletter-dane-i-analizy-2022-11-07/</guid><description>&lt;p&gt;Dzisiaj poniedziałek, ale w środę po południu przyjdzie do Ciebie &lt;strong&gt;mail z ankietą&lt;/strong&gt;. To 6 prostych pytań, które pomogą w rozwoju newslettera. Dawno nie było ankiety, widzę statystyki tego co czytacie, ale statystyki to jedno, a odczucie prawdziwego czytelniak to drugie :) Ankieta sprowadza się do klikania, zajmuje 2-3 minuty, zachęcam do wypełnienia.&lt;/p&gt;&#10;&lt;p&gt;A dzisiaj jeszcze standardowo - dużo treści na przeróżne tematy :). Dzisiaj na prawdę &lt;strong&gt;dużo&lt;/strong&gt; (drugie tyle czeka w garażu, mam przynieść?).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-31</title><link>https://blog.prokulski.science/2022/10/31/newsletter-dane-i-analizy-2022-10-31/</link><pubDate>Mon, 31 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/31/newsletter-dane-i-analizy-2022-10-31/</guid><description>&lt;p&gt;Poprzednie wydanie newslettera skupiało się na szeregach czasowych (zobacz w &lt;a href="../../2022/10/24/newsletter-dane-i-analizy-2022-10-24/"&gt;archiwum&lt;/a&gt;). Dla odmiany dzisiaj coś o analizie koszykowej - czyli co z czym się kupuje i co z tego wynika? Przykłady w kliku językach programowania znajdziecie niżej, w dedykowanej sekcji.&lt;/p&gt;&#10;&lt;p&gt;Nieco standardowo, albo może raczej - tradycyjnie - sporą część publikowanych dzisiaj tekstów mówi o technologiach streamingowych i big data. Zatem jest o rodzinie i znajomych Apache: Kafka, Spark, Iceberg, gdzieś przewinął się chyba też Flink. Czy to są interesujące dla Was tematy? A może rysowanie mapek jest ciekawsze? ;-)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-24</title><link>https://blog.prokulski.science/2022/10/24/newsletter-dane-i-analizy-2022-10-24/</link><pubDate>Mon, 24 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/24/newsletter-dane-i-analizy-2022-10-24/</guid><description>&lt;p&gt;Dzisiejsze wydanie newslettera skupia się na szeregach czasowych. Szeregiem czasowym jest pewnie jakieś 60% danych, na pewno wszystkie zmieniające się w czasie. Tak więc liczba klientów w sklepie (albo stronie internetowej), wynik pomiarów z jakiegoś czujnika (temperatura) itd itp - wszystko to układa się w szeregi czasowe.&lt;/p&gt;&#10;&lt;p&gt;A takie szeregi pozwalają na przewidywanie przyszłości. Czasem jest to łatwe, czasem trudne (giełda to też w zasadzie szereg czasowy, a przewidywanie nie jest takie oczywiste). I trochę o tym dzisiaj.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-10</title><link>https://blog.prokulski.science/2022/10/10/newsletter-dane-i-analizy-2022-10-10/</link><pubDate>Mon, 10 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/10/newsletter-dane-i-analizy-2022-10-10/</guid><description>&lt;p&gt;Dzisiaj prawdziwa bomba na początek - szczegółowy esej na temat wykorzystania uczenia maszynowego na rynku akcji. Tekst obejmuje projekt systemu, który konsekwentnie pokonywał S&amp;amp;P 500, dopóki nie został zamknięty w lipcu 2022 roku. Jest tu wiele, w tym dyskusja na temat dynamiki rynku, podejścia do modelowania, stosu technologicznego, inżynierii funkcji, pipeline ML i nie tylko. Czyta się długo, ale warto! &lt;a href="https://principiamundi.com/posts/didact-anatomy/"&gt;&lt;strong&gt;Didact AI: The anatomy of an ML-powered stock picking engine&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Poza tym sporo dzisiaj materiałów o przetwarzaniu tekstu (na róźnym poziomie zaawansowania), kilka &lt;em&gt;przydasiów&lt;/em&gt; do Apache Kafka, nauka SQLAlchemy (czyli &lt;em&gt;jak w Pythonie gadać z bazami danych&lt;/em&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-03</title><link>https://blog.prokulski.science/2022/10/03/newsletter-dane-i-analizy-2022-10-03/</link><pubDate>Mon, 03 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/03/newsletter-dane-i-analizy-2022-10-03/</guid><description>&lt;p&gt;W tym tygodniu nieco mniejsza liczba tekstów, ale chyba bardziej rozbudowanych niż zwykle.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie polecam tekst pierwszy &lt;a href="https://opendatascience.com/2022-data-science-research-round-up-highlighting-ml-dl-nlp-more/"&gt;2022 Data Science Research Round-Up&lt;/a&gt;, ale też przykłady i porównanie różnych algorytmów do &lt;em&gt;topic modelingu&lt;/em&gt; czy też całą praktycznie sekcję poświęconą Pythonowi.&lt;/p&gt;&#10;&lt;p&gt;Być może ktoś z Was przegapił na fanpage&amp;rsquo;u &lt;a href="https://fb.com/daneanalizy"&gt;Dane i analizy&lt;/a&gt;: &lt;a href="https://app.rasgoml.com/sql"&gt;klikalny generator zapytań SQL&lt;/a&gt; - świetna sprawa do nauki ale też zapewne może przyspieszyć pracę.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://opendatascience.com/2022-data-science-research-round-up-highlighting-ml-dl-nlp-more/"&gt;&lt;strong&gt;2022 Data Science Research Round-Up&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przegląd najciekaszych zagadnień związanych z machine learning. deep learnig, NLP z ostatnich miesięcy. Tylko wstęp, każde opisane jest dalej w podlinkowanych materiałach&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-26</title><link>https://blog.prokulski.science/2022/09/26/newsletter-dane-i-analizy-2022-09-26/</link><pubDate>Mon, 26 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/26/newsletter-dane-i-analizy-2022-09-26/</guid><description>&lt;p&gt;Wracamy do rysowania wykresów, pobierania danych ze stron internetowych oraz robienia dashboardów (i raportów w Wordzie). To dzisiejsze główne punkty zainteresowań. Ale dla fanów rozwiązań big data też coś się znajdzie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://blog.platypush.tech/article/Automate-your-music-collection"&gt;&lt;strong&gt;Automate your music collection&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Znudziły Ci się playlisty Spofity? Ciągle słuchasz &amp;ldquo;ulubionych&amp;rdquo;? Być może Ci to odpowiada. Ale jeśli lubisz odkrywać nową muzykę to możesz czuć się jak w bańce. Albo wykorzystać historię odtwarzanych utworów oraz API serwisu Last.fm żeby poznać coś nowego&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-12</title><link>https://blog.prokulski.science/2022/09/12/newsletter-dane-i-analizy-2022-09-12/</link><pubDate>Mon, 12 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/12/newsletter-dane-i-analizy-2022-09-12/</guid><description>&lt;p&gt;Z dzisiejszej paczki tekstów wybranych z całego tygodnia chyba najbardziej podoba mi się ten o gerrymandering - czyli takim dobraniu kształtu okręgów wyborczych aby wygrało konkretne ugrupowanie. To ważny problem, cieszę się że są mechanizmy (pokazane w artykule) do dowodzenia że takie czy inne granice okręgów są sprzyjające jednej czy innej stronie. Ale najbardziej podoba mi się sposób prezentacji treści. The Washington Post (New York Times też) inwestuje w przygotowanie treści i to daje efekty. Kto w Polsce w tak atrakcyjny (i dedykowany tematowi) podaje treść?.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-29</title><link>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</link><pubDate>Mon, 29 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/29/newsletter-dane-i-analizy-2022-08-29/</guid><description>&lt;p&gt;Uważni czytelnicy fanpage&amp;rsquo;a &lt;a href="https://fb.com/daneanalizy"&gt;Dane i Analizy&lt;/a&gt; już zapewne przeczytali mój nowy post o analizie tras rowerowych (heatmapa w nim prezentowana już nieaktualna), ale jeśli kogoś ominęło to &lt;a href="../../2022/08/22/strava-in-python/"&gt;&lt;strong&gt;zapraszam&lt;/strong&gt;&lt;/a&gt;. Pokazuję w nim:&lt;br&gt;&#10;jak przeczytać plik XML jak agregować dwuwymiarowe dane w NumPy jak agregować je w Pandas jak przygotować mapkę w Folium&lt;/p&gt;&#10;&lt;p&gt;A jak już tamten tekst znasz to dzisiaj też niemało do wyboru. Zapraszam do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://stackify.com/flask-vs-django-which-python-framework-is-better-for-machine-learning-apps/"&gt;&lt;strong&gt;Which Python Framework is Better for Machine Learning Apps?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Mamy jakiś nasz cudowny model, daje świetne wyniki, ale predykcje można dostać tylko uruchamiając skrypt z konsoli albo jeszcze gorzej w Jupyter Notebooku. Co zrobić, żeby było to użytecznie online&amp;rsquo;owe narzędzie? Opakować w API.&#10;Ale który pythonowy framework wybrać?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-22</title><link>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</link><pubDate>Mon, 22 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</guid><description>&lt;p&gt;Czy mniejsza liczba artykułów (nie wiem czy to zauważalne&amp;hellip;) to dla Was lepiej czy gorzej? Przeczytacie w związku z tym więcej (wszystkie?) czy tak samo jak zwykle 2-3, a reszta to nuda?&lt;/p&gt;&#10;&lt;p&gt;Dzisiejszy numer to nieco eksperyment ale - przyznajmy to szczerze - wynik sezonu wakacyjnego. Oj ciężko się zebrać do roboty, ciężko&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mlu-explain.github.io/"&gt;&lt;strong&gt;MLU-Explain&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działają lasy losowe? Co to jest krzywa ROC i AUC? Jeśli nie wiesz to ten serwis w przystępny, graficzny sposób pomoże to zrozumieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-08</title><link>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</link><pubDate>Mon, 08 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</guid><description>&lt;p&gt;Wakacje za półmetkiem, więc tematy w dzisiejszym newsletterze tak pół na pół.&lt;/p&gt;&#10;&lt;p&gt;Z jednej strony mamy ciężkie rzeczy: nowe naukowe &lt;em&gt;pejpery&lt;/em&gt; czy omówienie algorytmu grupowania przestrzennego opartego na gęstości. Ale z drugiej - automatyzację w Excelu czy kilka(naście) inspiracji dotyczących prezentowania danych.&lt;/p&gt;&#10;&lt;p&gt;Dla tych zaś co lubią wdrażanie i Kubernetesy - też coś się znajdzie, chociażby cluster na malinach ;-)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/6-papers-every-modern-data-scientist-must-read-1d0e708becd"&gt;&lt;strong&gt;6 Papers Every Modern Data Scientist Must Read&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przegląd prasy (publikacji naukowych) dla prawdziwych nerdów AI/ML. Jaki &amp;ldquo;pejper&amp;rdquo; czytasz dzisiaj?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-01</title><link>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</link><pubDate>Mon, 01 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</guid><description>&lt;p&gt;Dzisiaj nieco więcej materiałów z krainy &amp;ldquo;ops&amp;rdquo; w świecie &amp;ldquo;devops&amp;rdquo;. Warto znać obie ziemie, żeby nie mieć problemu chociażby z uruchomieniem kilku aplikacji (dockerowymi) pod różnymi ścieżkami na jednej domenie. Dlatego warto zajrzeć do tekstów o Nginx.&lt;/p&gt;&#10;&lt;p&gt;Ale sprawy związane z analizowaniem danych czy też ich przetwarzaniem w celu przewidywania przyszłości tradycyjnie też są na poniższej liście interesujących artykułów z minionego tygodnia.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://miroslawmamczur.pl/czym-jest-i-jak-zbadac-dryft-modelu-model-drift/"&gt;&lt;strong&gt;Czym jest i jak zbadać dryft modelu (model drift)?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dryft modelu odnosi się do spadku wydajności modelu z powodu zmian danych i relacji między zmiennymi wejściowymi i wyjściowymi&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-25</title><link>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</link><pubDate>Mon, 25 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/25/newsletter-dane-i-analizy-2022-07-25/</guid><description>&lt;p&gt;Wakacje wakacjami, ale te kilka godzin poświęciłem specjalnie dla Was aby przygotować dzisiejsze wydanie newslettera.&lt;/p&gt;&#10;&lt;p&gt;Pamiętacie &lt;strong&gt;Wojny Rdzeniowe&lt;/strong&gt;? Dla tych, którzy nie bardzo - &lt;a href="https://informatykzakladowy.pl/wojny-rdzeniowe-czyli-core-wars/"&gt;ciekawy tekst&lt;/a&gt; (po polsku, co rzadkie tutaj ;) opowiadający historię tych&amp;hellip; hmmm&amp;hellip; konkursów? zawodów?&lt;/p&gt;&#10;&lt;p&gt;A gdyby tak przygotować wewnętrzne rozgrywki tego typu? Co o tym sądzicie? Piszcie!&lt;/p&gt;&#10;&lt;p&gt;Zamiast jednak programować można klikać. Jeśli ktoś jest zwolennnikiem no-code to pewnie zainteresuje się &lt;a href="https://betterprogramming.pub/top-8-no-code-machine-learning-platforms-you-should-use-in-2020-1d1801300dd0"&gt;przeglądem platform&lt;/a&gt; tego typu przeznaczonych do zadań machine learningu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-27</title><link>https://blog.prokulski.science/2022/06/27/newsletter-dane-i-analizy-2022-06-27/</link><pubDate>Mon, 27 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/27/newsletter-dane-i-analizy-2022-06-27/</guid><description>&lt;p&gt;Gorąco&amp;hellip; &lt;a href="https://www.youtube.com/watch?v=CKTKbiZW38Y"&gt;&lt;em&gt;żar leje się z nieba, taka spiekota w mieście to piekło&lt;/em&gt; (niczym w Hydrozagadce)&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Zatem gorące materiały: wyniki ankiety StackOverflow, którą osobiście traktuję jako wyznacznik tego jakie technologie są obecnie używane na rynku, czego warto się uczyć i co trzeba potrafić aby swobodnie zmieniać pracę. Pakiet materiałów od Krzyśka Sopyły do nauki ML oraz rozwiązanie konkretnych zagadnień takich jak pipeline dla danych ze Stravy.&lt;/p&gt;&#10;&lt;p&gt;Weźmiecie udział &lt;em&gt;w pieszym rajdzie PPTK na odznakę nizinną?&lt;/em&gt; Nawet jeśli nie, pamiętajcie że &lt;em&gt;dobrze jest łączyć przyjemne z pożytecznym!&lt;/em&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-20</title><link>https://blog.prokulski.science/2022/06/20/newsletter-dane-i-analizy-2022-06-20/</link><pubDate>Mon, 20 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/20/newsletter-dane-i-analizy-2022-06-20/</guid><description>&lt;p&gt;Długi weekend się przedłużył&amp;hellip; ale zgodnie z planem (a nie że &amp;ldquo;melanż poniósł za daleko&amp;rdquo; ;-). Newsletter przygotowany, a (prawie) jednodniowe opóźnienie nie powinno zmienić Waszego stosunku do zawartości. Odrobina tęsknoty (mam nadzieję) nikomu jeszcze nie zaszkodziła.&lt;/p&gt;&#10;&lt;p&gt;Deszcz pada w całym kraju, zapraszam zatem do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/analytics-vidhya/fundamentals-of-mlops-part-4-tracking-with-mlflow-deployment-with-fastapi-61614115436"&gt;&lt;strong&gt;Model Tracking with MLFlow &amp;amp; Deployment with FastAPI&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Fajny tutorial pokazujący jak śledzić wyniki modelu przez MLFlow oraz serwować ten najlepszy przez FastAPI&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-13</title><link>https://blog.prokulski.science/2022/06/13/newsletter-dane-i-analizy-2022-06-13/</link><pubDate>Mon, 13 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/13/newsletter-dane-i-analizy-2022-06-13/</guid><description>&lt;p&gt;Jak być data scientistą w Pythonie?&lt;/p&gt;&#10;&lt;p&gt;import pandas as pd&lt;/p&gt;&#10;&lt;p&gt;i gotowe!&lt;/p&gt;&#10;&lt;p&gt;Żart oczywiście (taki familiadowy, ale kto boomerowi zabroni?), a o samym Pandasie polecam &lt;a href="https://youtu.be/t-8ZIWCRvP0"&gt;wystąpienie Jana Kantego Milczka z PyData w Bydgoszczy&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://eng.uber.com/ubers-real-time-document-check/"&gt;&lt;strong&gt;Uber’s Real-Time Document Check&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak Uber zrobił weryfikację na podstawie dokumentów typu dowód osobisty?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/intro-to-mlops-using-amazon-sagemaker-5a43b9161fa"&gt;&lt;strong&gt;Intro to MLOps Using Amazon SageMaker&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Co to MLOps i jak SageMaker pomaga? A chyba pomaga, skoro to najpopularniejsze tego typu narzędzie (tak przynajmniej wynika z case studies pokazywanych na konferencjach)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-06</title><link>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</link><pubDate>Mon, 06 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</guid><description>&lt;p&gt;W tym tygodniu sporo rozwiązań big data&amp;rsquo;owych i ciekawostek ogólnie związanych z przetwarzaniem danych.&lt;/p&gt;&#10;&lt;p&gt;Ale jeśli interesuje Cię coś bardziej &amp;ldquo;biznesowego&amp;rdquo;, w szczególności jak &lt;em&gt;projektuje się produkty&lt;/em&gt; to gorąco polecam rozmowę z Marcinem Zarembą o projektowaniu autobookingu w Dobrym Mechaniku oraz dodatkowo &lt;a href="https://marcinzaremba.pl/2022/05/12/jak-powstawal-autobooking/?utm_source=newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;tekst o tymże&lt;/a&gt; u Marcina na blogu. Świetny case study, serio serio.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-mask-rcnn-net-for-object-detection-in-60-lines-of-code-9b6bbff292c3"&gt;&lt;strong&gt;Train Mask R-CNN Net for Object Detection in 60 Lines of Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie obiektów na zdjęciach - jak to działa?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-23</title><link>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</link><pubDate>Mon, 23 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/23/newsletter-dane-i-analizy-2022-05-23/</guid><description>&lt;p&gt;Dzisiaj delikatnie więcej tematów bliższych &lt;em&gt;biznesowi&lt;/em&gt; niż IT - mierniki, jakość, zaangażowanie w pracę (to polecam każdemu). &lt;a href="https://prokulski.science"&gt;Dane i Analizy&lt;/a&gt; to też consulting tego typu rozwiązań - jeśli trzeba to zapraszam do kontaktu&lt;/p&gt;&#10;&lt;p&gt;Są też standardowo poradniki związane głównie z Pythonem i Big Data, ale znajdzie się też coś dla chcących zacząć poważniej pisać w Javie&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/greenlit-using-gpt-j-with-multi-task-learning-to-create-new-screenplays-54a2d04f761c"&gt;&lt;strong&gt;GreenLIT: Using GPT-J to Create Screenplays&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy sztuczna inteligencja może pisać scenariusze filmowe?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-xgboost-models-in-amazon-sagemaker-in-4-simple-steps-4eb3e104ee61"&gt;&lt;strong&gt;Train XGBoost Models in Amazon SageMaker in 4 Simple Steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak wykorzysać Amazon SageMaker do trenowania modeli w chmurze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-16</title><link>https://blog.prokulski.science/2022/05/16/newsletter-dane-i-analizy-2022-05-16/</link><pubDate>Mon, 16 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/16/newsletter-dane-i-analizy-2022-05-16/</guid><description>&lt;p&gt;Łączyłem kiedyś accesssowe VBA z R - da się, nawet spoko działa. A było to tak, że Access wypluwał dane do CSV - chyba za pośrednictwem Excela, nie pamiętam - potem R to mieliło i robiło wykres, który wstawiany był jako obrazek do raportu opartego na szablonie zrobionym w&amp;hellip; VBA piszącym do Excela. Jak to cudo odziedziczyłem to przepisałem na Shiny produkujące PDFa z RMarkdowna i potrzebujący sobie sami te raporty robili, a nie czekali aż ja ręcznie te accessowe cuda odpalę (i zablokuję sobie komputer, bo przecież &amp;ldquo;raporty się generują&amp;rdquo;). O tym jak łączyć Excela z R czy Pythonem przeczytacie dzisiaj.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-25</title><link>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</link><pubDate>Mon, 25 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</guid><description>&lt;p&gt;Dzisiaj zapraszam na duży pakiet związany z Apache Spark - od instalacji, poprzez stosunkowo mało zaawansowane tutoriale, a na debugowaniu i optymalizacji zapytań skończywszy.&lt;/p&gt;&#10;&lt;p&gt;Standardowo jest też trochę Pythona (na przykład świetny kurs spaCy - ale to fani &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;a Dane i Analizy&lt;/a&gt; już znają czy też coś o wzorcach projektowych albo aplikacjach wielowątkowych), a w części &amp;ldquo;analiza danych&amp;rdquo; dość przekrojowe zagadnienia (np. &lt;em&gt;computer vision&lt;/em&gt; bez sieci neuronowych - dość sprytne podejście do tematu zajętych miejsc parkingowych).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-11</title><link>https://blog.prokulski.science/2022/04/11/newsletter-dane-i-analizy-2022-04-11/</link><pubDate>Mon, 11 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/11/newsletter-dane-i-analizy-2022-04-11/</guid><description>&lt;p&gt;Trochę mniej artykułów, ale jeden z nich to potężny kolos (ten o SHAP). Do tego bardzo fajne porady dla początkujących w Pythonie i ciekawe koncepcje w świecie big data (jakby ktoś chciał postawić klaster to jest o tym poradnik).&lt;/p&gt;&#10;&lt;p&gt;Zaś w przyszłym tygodniu zrobimy sobie przerwę świąteczną - polewajcie się wodą za tydzień (oby pogoda dopisała), a nie zajmujcie się komputerami. Wesołych Świąt!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/revisiting-mnist-with-fresh-eyes-36f9d19a75d1"&gt;&lt;strong&gt;Revisiting MNIST with Fresh Eyes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Każdy kto próbował machine learningu albo deep learningu (w szczególności sieci CNN) zetknął się ze zbiorem ręcznie pisanych cyfr MNIST. Tutaj inne podejście do znanego problemu&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-04</title><link>https://blog.prokulski.science/2022/04/04/newsletter-dane-i-analizy-2022-04-04/</link><pubDate>Mon, 04 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/04/newsletter-dane-i-analizy-2022-04-04/</guid><description>&lt;p&gt;Dzisiaj skupiamy się na Kafce i innych kolejkach (MQTT, Redis). Trochę też o długu technologicznym (i nie tylko) oraz wytłumaczenie o co chodzi z tymi &lt;em&gt;@property&lt;/em&gt; czy &lt;em&gt;@staticmethod&lt;/em&gt; w Pythonie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/machine-learning-pipeline-with-ploomber-pycaret-and-mlflow-db6e76ee8a10"&gt;&lt;strong&gt;Machine Learning Pipeline with Ploomber, PyCaret and MLFlow&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Cały &amp;ldquo;rurociąg&amp;rdquo; związany z uczeniem maszynowym, od początku do końca, od czyszczenia danychy do uczenia modeli&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/machine-learning-rules-of-thumb-b50232b4b2f8"&gt;&lt;strong&gt;Machine Learning Rules of Thumb&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Po co wymyślać koło od początku skoro jest kilka dobrych i sprawdzonych sposobów na pierwsze kroki w przygotowywaniu modelu ML?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-28</title><link>https://blog.prokulski.science/2022/03/28/newsletter-dane-i-analizy-2022-03-28/</link><pubDate>Mon, 28 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/28/newsletter-dane-i-analizy-2022-03-28/</guid><description>&lt;p&gt;Połowa dzisiejszych materiałów to konkretne projekty związane z danymi. Albo wyciąganie informacji z rachunków z przejazdy Uberem, albo realtime&amp;rsquo;owe wizualizacje tego co co się zmienia w Wikipedii, albo big data w Big Query. Plus raport Stanford AI Index Report&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/artefact-engineering-and-data-science/is-facebook-prophet-suited-for-doing-good-predictions-in-a-real-world-project-44be1fe4ce91"&gt;&lt;strong&gt;Is Facebook Prophet suited for doing good predictions in a real-world project?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak biblioteka Prophet do prognozowania szeregów czasowych sprawdza się w realnych zastosowaniach?&lt;/p&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/@ali.soleymani.co/stop-using-random-forest-feature-importances-take-this-intuitive-approach-instead-4335205b933f"&gt;&lt;strong&gt;Stop using random forest feature importances&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Skąd wiecie, że dana cecha jest istona w Waszym modelu? &amp;ldquo;feature importances&amp;rdquo; z lasów losowych ma pewne niedociąnięcia o których warto wiedzieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-21</title><link>https://blog.prokulski.science/2022/03/21/newsletter-dane-i-analizy-2022-03-21/</link><pubDate>Mon, 21 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/21/newsletter-dane-i-analizy-2022-03-21/</guid><description>&lt;p&gt;Podoba nie rozpieszcza, nie ma czasu na pisanie. Mam nadzieję, że znajdziecie czas na czytanie :)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2022/03/end-to-end-hotel-booking-cancellation-machine-learning-model/"&gt;&lt;strong&gt;End-to-End Hotel Booking Cancellation Machine Learning Model&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Czy gość przyjedzie do naszego pokoju hotelowego czy nie przyjedzie? Jak buduje się modele, które potrafią odpowiedzieć na takie pytania? Znajomity tutorial&lt;/p&gt;&#10;&lt;h3 id="big_data"&gt;#big_data&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mherzog01.medium.com/a-spark-streaming-pipeline-with-microservices-c2cfc42dda9f"&gt;&lt;strong&gt;A Spark Streaming pipeline with microservices&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Spark, Kafka i uczenie maszynowe w tle - takie projekty lubimy!&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://selectfrom.dev/querying-kafka-topics-using-presto-5f1bb915a918"&gt;&lt;strong&gt;Querying Kafka Topics Using Presto&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A gdyby tak pytać topików kafkowych tak jak bazę danych?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-14</title><link>https://blog.prokulski.science/2022/03/14/newsletter-dane-i-analizy-2022-03-14/</link><pubDate>Mon, 14 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/14/newsletter-dane-i-analizy-2022-03-14/</guid><description>&lt;p&gt;Mam nadzieję, że wiosna nadchodzi wielkimi krokami, więc dzisiaj trochę lżejszy dobór tematów.&lt;/p&gt;&#10;&lt;p&gt;Koniecznie zobacz nagranie z webinaru u Vladimira o BI i ML!&lt;/p&gt;&#10;&lt;p&gt;Polecam też zainteresować się Mermaid - rozszerzeniem do Markdown pozwalającym rysować diagramy. Da się też eksportować je później do np. PDFów - istnieje odpowiedni &lt;a href="https://github.com/raghur/mermaid-filter"&gt;dodatek do pandoc&lt;/a&gt;. A o Meramind wiem od &lt;a href="https://www.youtube.com/watch?v=JiQmpA474BY"&gt;Arjana i jego filmu&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.youtube.com/watch?v=ANEJADyAyOE"&gt;&lt;strong&gt;Business Intelligence z Machine Learning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Zapis ciekawego webinaru łączącego oba wspominane w tytule zagadnienia&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-21</title><link>https://blog.prokulski.science/2022/02/21/newsletter-dane-i-analizy-2022-02-21/</link><pubDate>Mon, 21 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/21/newsletter-dane-i-analizy-2022-02-21/</guid><description>&lt;p&gt;Dzisiaj sporo rzeczy związanych z Wordle - bo to jest świetny poligon doświadczalny na analizę danych i kombinatorykę, ale też ciekawe są wyniki tego jak ludzie grają w tę grę (poniżej link do artykułu na ten temat).&lt;/p&gt;&#10;&lt;p&gt;Świetny jest też tekst Maćka &lt;a href="https://wiadrodanych.pl/bazy-danych/elasticsearch/jak-wykryc-phishing/"&gt;Jak wykryć phishing&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Dla początkujących adeptów Pythona kilka solidnych podstaw - warto prześledzić wszystko z dzisiejszej sekcji &lt;strong&gt;#python_junior&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/bentoml-create-an-ml-powered-prediction-service-in-minutes-23d135d6ca76"&gt;&lt;strong&gt;Create an ML Powered Prediction Service in Minutes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Prosty i szybki sposób na umieszczanie modeli machine learningowych na produkcji&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-14</title><link>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</link><pubDate>Mon, 14 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</guid><description>&lt;p&gt;Dzisiaj coś trudniejszego niż MNIST oraz ściągawka z algorytmów grupowania elementów (clustering). Do tego ciekawy projekt wizualizacji danych z meczów piłki nożnej.&lt;/p&gt;&#10;&lt;p&gt;A jeśli myślisz o projektowaniu systemów a nie tylko o samej analizie danych to wykład Sławka Sobótki o Domain Driven Design powinien Cię uradować.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-google-cloud-machine-learning-apis-programmatically-in-python-part-1-430f608af6a5"&gt;&lt;strong&gt;Using Google Cloud Machine Learning APIs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak korzystać z interfejsów machine learning API od Google w Pythonie? Część pierwsza cyklu&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-fastai-to-classify-japanese-kanji-characters-47d7edd4d569"&gt;&lt;strong&gt;Using FastAI to classify Japanese kanji characters&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie pisanych ręcznie cyfr - czyli zbiór MNIST - to może być zbyt prosty problem dla adeptów sztuki nauki o danych&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-07</title><link>https://blog.prokulski.science/2022/02/07/newsletter-dane-i-analizy-2022-02-07/</link><pubDate>Mon, 07 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/07/newsletter-dane-i-analizy-2022-02-07/</guid><description>&lt;p&gt;Dzisiaj &lt;em&gt;lajtowo&lt;/em&gt;, ale najbardziej polecam coś co mogliście przegapić wczoraj na &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;u&lt;/a&gt; - &lt;a href="https://www.youtube.com/watch?v=v68zYyaEmEA"&gt;&lt;strong&gt;wideo&lt;/strong&gt;&lt;/a&gt; o tym jak pomóc sobie grając w Wordle albo raczej jaka matematyka stoi za wyborem kolejnych słów. Jest też &lt;a href="https://github.com/3b1b/videos/blob/master/_2022/wordle.py"&gt;kod w repo&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://datascienceplus.com/topic-modeling-and-latent-dirichlet-allocation-lda/"&gt;&lt;strong&gt;Topic Modeling and Latent Dirichlet Allocation (LDA)&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;O czym są poszczególne tekstów w zbiorze tekstów? &amp;ldquo;Topic modeling&amp;rdquo; oparty o LDA pozwala to określić, a ten tekst wprowadza w zagadnienie na przykładzie kodu w Pythonie&lt;/p&gt;&#10;&lt;h3 id="big_data"&gt;#big_data&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://engineering.linkedin.com/blog/2022/darwin--data-science-and-artificial-intelligence-workbench-at-li"&gt;&lt;strong&gt;DARWIN: Data Science and Artificial Intelligence Workbench at LinkedIn&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak LinkedIn buduje swoją platformę danych i ich analiz?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-31</title><link>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</link><pubDate>Mon, 31 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</guid><description>&lt;p&gt;Dzisiaj &lt;em&gt;odcinek&lt;/em&gt; dość pythonowy, ale za to z obszernym tekstem o tworzeniu modeli w R - cały proces opisany po kolei. Polecam!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.pinecone.io/learn/nlp/?utm_medium=link&amp;amp;utm_source=data-elixir&amp;amp;utm_campaign=sponsored"&gt;&lt;strong&gt;Natural Language Processing (NLP) for Semantic Search&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Duża pozycja, która wprowadza w świat NLP&lt;/p&gt;&#10;&lt;h3 id="ciekawostki"&gt;#ciekawostki&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://opendatascience.com/what-does-a-data-driven-government-look-like/"&gt;&lt;strong&gt;What Does a Data-Driven Government Look Like?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Teoretycznie więcej danych to lepsze decyzje. Czy zarządzanie maistem albo państwem jest możliwe w oparciu o dane? Jak może to wyglądać?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ai-geospatial-wildfire-risk-prediction-8c6b1d415eb4"&gt;&lt;strong&gt;AI Geospatial Wildfire Risk Prediction&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przewidywanie zdarzeń związanych z geografią - pogoda, pożary - ciekawe zagadanienie, a często pomijane przy np. poradnikach ML.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-24</title><link>https://blog.prokulski.science/2022/01/24/newsletter-dane-i-analizy-2022-01-24/</link><pubDate>Mon, 24 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/24/newsletter-dane-i-analizy-2022-01-24/</guid><description>&lt;p&gt;W ostatnim tygodniu na sile przybrała moda na &lt;strong&gt;Wordle&lt;/strong&gt;. Co to? To taka gra podobna do znanego od lat &amp;lsquo;70 XX wieku &lt;a href="https://pl.wikipedia.org/wiki/Mastermind_(gra_planszowa)"&gt;Masterminda&lt;/a&gt;. Trzeba w 6 ruchach odgadnąć sześcioliterowe słowo. Jedyne podpowiedzi to kolor:&lt;br&gt;&#10;zielony = odpowiednia litera stoi w odpowiednim miejscu, żółty = odpowiednia litera stoi na złym miejscu, czarny = &lt;em&gt;to zła litera jest&lt;/em&gt; (parafrazując pewnego aktora z pewnego filmu).&lt;/p&gt;&#10;&lt;p&gt;Gra w wersji oryginalnej (angielskiej) dostępna jest &lt;a href="https://www.powerlanguage.co.uk/wordle/"&gt;tej na stronie&lt;/a&gt;. Oczywiście jest też wersja z &lt;a href="https://literalnie.fun/"&gt;polskimi słowami&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-17</title><link>https://blog.prokulski.science/2022/01/17/newsletter-dane-i-analizy-2022-01-17/</link><pubDate>Mon, 17 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/17/newsletter-dane-i-analizy-2022-01-17/</guid><description>&lt;p&gt;Dzisiaj więcej o &lt;em&gt;data engineering&lt;/em&gt; i nowym buzz wordzie z tej okolicy: &lt;strong&gt;data mesh&lt;/strong&gt; a także seria polecanych kanałów. Trochę też o architekturze systemów - wywiad z architektem i coś o tym czy mikroserwisy są lepsze niż monolityczne byty.&lt;/p&gt;&#10;&lt;p&gt;Interesują Cię takie tematy? Czy jednak żywy kod i konkretne problemy analizy cyferek to lepsze &lt;em&gt;mięso&lt;/em&gt;?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://levelup.gitconnected.com/auto-detect-anything-with-custom-named-entity-recognition-ner-c89d6562e8e9"&gt;&lt;strong&gt;Auto-Detect Anything With Custom Named Entity Recognition (NER)&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie nazw własnych z wykorzystaniem SpaCy&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-10</title><link>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</link><pubDate>Mon, 10 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</guid><description>&lt;p&gt;Koniec przerw świątecznych, koniec długich weekendów, czas wracać do pracy.&lt;/p&gt;&#10;&lt;p&gt;Dla mnie osobiście rok zaczął się zabawą z Raspberry Pi i próbwaniem co to cudo potrafi. Nigdzie nie ma Raspberry Pi 4, więc zadowoliłem się na start Pi Zero. Mały, ale wariat - używam do PiHole oraz staram się podglądać co robi w nocy kot. Jak? A no tym prostym &lt;a href="https://github.com/prokulski/rasppi_motion_capture/blob/main/main.py"&gt;skryptem&lt;/a&gt; i kamerką podłączoną po USB.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/11-dimensionality-reduction-techniques-you-should-know-in-2021-dcb9500d388b"&gt;&lt;strong&gt;11 Dimensionality reduction techniques you should know in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;11 metod na redukcję rozmiarów Twoich danych. Ale zmniejszenie wielkości to nie jedyne zastosowanie - przy redukcji wymiarów często odsłaniają się ukryte informacje&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-27</title><link>https://blog.prokulski.science/2021/12/27/newsletter-dane-i-analizy-2021-12-27/</link><pubDate>Mon, 27 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/27/newsletter-dane-i-analizy-2021-12-27/</guid><description>&lt;p&gt;To ostatni numer newslettera&amp;hellip; w tym roku. Czy ten sam dowcip (o ostatnim numerze newslettera) działa dwa razy? Wątpię. Ale dobry suchar po całej masie pierogów, sałatek i ciast może okazać się zbawienny. Tak wiem - jest czerstwo, zatem zgodnie z planem ;-)&lt;/p&gt;&#10;&lt;p&gt;Przed Tobą ostatnia w tym roku dawka interesujących tekstów, nieco skromniejsza niż zwykle, ale liczę na to że również atrakcyjna.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2015/11/easy-methods-deal-categorical-variables-predictive-modeling/"&gt;&lt;strong&gt;How to Deal With Categorical Variable in Predictive Modeling&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak radzić sobie ze zmiennymi kategorycznymi w danych? Kilka przydatnych metod&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-20</title><link>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</link><pubDate>Mon, 20 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/20/newsletter-dane-i-analizy-2021-12-20/</guid><description>&lt;p&gt;To ostatni numer newslettera&amp;hellip; przed Bożym Narodzeniem.&lt;/p&gt;&#10;&lt;p&gt;W związku z tym przede wszystkim życzę Ci spokoju, spędzenia mile czasu z najbliższymi, odpoczynku (też od komputerów) i jeszcze raz pieniędzy.&lt;/p&gt;&#10;&lt;p&gt;Do życzeń dołączam pythonową choinkę:&lt;/p&gt;&#10;&lt;p&gt;def holidaybush(n):&lt;br&gt;&#10;    for i in range(n):&lt;br&gt;&#10;        print((&amp;quot;+&amp;quot; * (i * 2 + 1)).center(n * 2 - 1))&lt;br&gt;&#10;    print(&amp;quot;+++&amp;quot;.center(n * 2 - 1))&lt;/p&gt;&#10;&lt;p&gt;holidaybush(15)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://glassboxmedicine.com/2019/09/15/best-use-of-train-val-test-splits-with-tips-for-medical-data/"&gt;&lt;strong&gt;Best Use of Train/Val/Test Splits, with Tips for Medical Data&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Modele, uczenie, dane treningowe, testowe, walidacyjne&amp;hellip; ale właściwie dlaczego tak?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-06</title><link>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</link><pubDate>Mon, 06 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</guid><description>&lt;p&gt;Na Mikołajki przegląd internetu pod kątem danych, ich analiz i sposobów programowania oraz wdrażania zaprogramowanych rozwiązań.&lt;br&gt;&#10;Najciekawszym dla początkujących będzie pewnie zbiór ponad 200 tekstów zgromadzonych w jednym miejscu na różne tematy związane z machine learingiem (to prawdę mówiąc trochę jak &lt;a href="https://thecleverprogrammer.com/machine-learning/"&gt;spis treści jednego bloga&lt;/a&gt;), a bardziej doświadczeni dowiedzą się jak połączyć C++ z Pythonem. Są też ciekawe teksty o R (i Shiny), co się ostatnio dość rzadko zdarzało.&lt;/p&gt;&#10;&lt;p&gt;Skoro jesteśmy przy R - w piątek (10 grudnia) zaś konferencja &lt;strong&gt;WhyR?&lt;/strong&gt; - rezerwujcie sobie czas, bo materiału sporo (co widać po zaplanowanych streamingach na YouTube). Więcej szczegółów na stronie imprezy &lt;a href="https://2021.whyr.pl/"&gt;2021.whyr.pl&lt;/a&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-29</title><link>https://blog.prokulski.science/2021/11/29/newsletter-dane-i-analizy-2021-11-29/</link><pubDate>Mon, 29 Nov 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/29/newsletter-dane-i-analizy-2021-11-29/</guid><description>&lt;p&gt;Po &lt;em&gt;testach na produkcji&lt;/em&gt; z poprzedniego tygodnia przybyło Was równo pięćdziesiąt! Dzięki za zaufanie, mam nadzieję że niniejsze wydanie &lt;a href="../../category/newsletter/?utm_source=dia_nlt&amp;amp;utm_medium=archive_link"&gt;newslettera Dane i Analizy&lt;/a&gt; (jest archiwum!) Was nie rozczaruje i pozostaniecie wiernymi czytelnikami.&lt;/p&gt;&#10;&lt;p&gt;A dzisiaj sporo materiału, na nowo pokuładanego - liczę, że taki układ ułatwi Wam poruszanie się po newsletterze i docieranie do tych najbardziej interesujących treści. Po migracji na serwis &lt;a href="https://raindrop.io"&gt;Raindrop.io&lt;/a&gt; (polecam, nie mam w tym żadnego interesu) łatwiejsze dla mnie stało się przygotowanie newslettera, w tym - co chyba najważniejsze - ręczne wybieranie materiałów i ich opisywanie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-22</title><link>https://blog.prokulski.science/2021/11/22/newsletter-dane-i-analizy-2021-11-22/</link><pubDate>Mon, 22 Nov 2021 11:25:39 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/22/newsletter-dane-i-analizy-2021-11-22/</guid><description>&lt;p&gt;Szczęśliwcy ;) mogli już zobaczyć jak wygląda newsletter w nowej szacie graficznej wczoraj. Testowanie na produkcji to podstawa, niech pierwszy rzuci kamieniem&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych"&gt;#analiza_danych&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.evanmiller.org/how-not-to-sort-by-average-rating.html"&gt;&lt;strong&gt;How Not To Sort By Average Rating&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dlaczego sortowanie opinii po &amp;ldquo;zwykłej&amp;rdquo; średniej jest złe i jak je poprawić.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://mydataschool.com/blog/extract-paypal-data-from-api/"&gt;&lt;strong&gt;Extract data from PayPal API&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Wyjmijmy dane z PayPala i wstawmy do jakiejś hurtowni typu BigQuery. A potem już można analizować.&lt;br&gt;&#10;Ciekawy projekt ETLowy.&lt;/p&gt;&#10;&lt;h3 id="ciekawostki"&gt;#ciekawostki&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://boonepeter.github.io/posts/2020-11-10-spotify-codes/"&gt;&lt;strong&gt;How do Spotify Codes work?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Utwory (albumy i wykonacwy też) na Spotify są oznaczeni takim małym kodem - można go zeskanować i przejść do odpowiedniej piosenki (lub albumy albo wykonawcy). Jak to działa?&lt;br&gt;&#10;Fajne jeśli interesuje Cię budowanie graficznych kodów.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-08</title><link>https://blog.prokulski.science/2021/11/08/newsletter-dane-i-analizy-2021-11-08/</link><pubDate>Mon, 08 Nov 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/08/newsletter-dane-i-analizy-2021-11-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/orchestrate-a-data-science-project-in-python-with-prefect-e69c61a49074?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Orchestrate a Data Science Project in Python With Prefect&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Optimize Your Data Science Workflow in a Few Lines of Code Motivation As a data scientist, why should you care about optimizing your data science workflow? Let’s start with an example of a basic data science project. Imagine you were working with an Iris dataset. You started with building functions to process your data. &lt;a href="https://medium.com/media/e479ca8deb87434b1859864118ec3bcc/href"&gt;https://medium.com/media/e479ca8deb87434b1859864118ec3bcc/href&lt;/a&gt; After defining (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/dealing-with-dates-in-pandas-6-common-operations-you-should-know-1ea6057c6f4f"&gt;&lt;strong&gt;Dealing With Dates in Pandas — 6 Common Operations You Should Know&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dealing With Dates in Pandas — 6 Common Operations You Should Know Never confused with dates again, hopefully. Besides texts and numbers, dates are a very common data type in our datasets. When we use Pandas to process dates, it’s definitely not the most straightforward task for most data scientists. When I began to use Pandas, I wasn’t familiar with date-related features, so every time when I (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-01</title><link>https://blog.prokulski.science/2021/11/01/newsletter-dane-i-analizy-2021-11-01/</link><pubDate>Mon, 01 Nov 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/01/newsletter-dane-i-analizy-2021-11-01/</guid><description>&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2021/10/beginners-guide-to-automl-with-an-easy-autogluon-example/"&gt;&lt;strong&gt;Beginner’s Guide to AutoML with an Easy AutoGluon Example&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This article was published as a part of the Data Science Blogathon Machine Learning is popular and is being used everywhere for applications ranging from financial services to healthcare, marketing &amp;amp; advertising to manufacturing. Almost all industries seem to derive substantial benefit using some form of Machine Learning. Over the recent past, automation technology also […] The post (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/visualising-similarity-clusters-with-interactive-graphs-20a4b2a18534?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Visualising Similarity Clusters with Interactive Graphs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Take advantage of Python, Plotly, and NetworkX to create interactive graphs to find similarity clusters Let us assume, as a running example, that my data is composed of word embeddings of the English language. I want to gain insights about the word distribution in the embedding space, specifically, if there are any clusters of very similar words, if there are words that are completely different (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-25</title><link>https://blog.prokulski.science/2021/10/25/newsletter-dane-i-analizy-2021-10-25/</link><pubDate>Mon, 25 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/25/newsletter-dane-i-analizy-2021-10-25/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/optimize-ml-modeling-using-a-timing-decorator-2b113c6b60d9"&gt;&lt;strong&gt;Optimize ML modeling using a timing decorator&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Record the execution time of ML training using timing decorators and use it for productive data science and ML optimization Image source : Pixabay (Free to use) Why measuring time is important We can go on and provide hundreds of arguments and quotes showing why the act of measurement is important in science and technology. Here is a powerful one, One accurate measurement is worth a thousand (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-23</title><link>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</link><pubDate>Sat, 23 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/23/newsletter-dane-i-analizy-2021-10-23/</guid><description>&lt;p&gt;&lt;a href="https://preettheman.medium.com/best-front-end-python-frameworks-in-2021-643d1df6922c"&gt;&lt;strong&gt;Best front-end Python frameworks in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Welcome back! Python is an awesome programming language with a ton of capability, one of these functions is building GUI’s (front-ends), so let’s talk about some of my favorite front-ends frameworks for Python. Now, Python is an awesome language for web development as well, if you want to see some sample websites you can build with Python, check out this article below: Let’s take a look at some (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-18</title><link>https://blog.prokulski.science/2021/10/18/newsletter-dane-i-analizy-2021-10-18/</link><pubDate>Mon, 18 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/18/newsletter-dane-i-analizy-2021-10-18/</guid><description>&lt;p&gt;&lt;a href="https://mihaisplace.blog/2021/10/03/the-state-of-web-scraping-in-2021/"&gt;&lt;strong&gt;The State Of Web Scraping in 2021 – Mihai&amp;rsquo;s Blog&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Author: Mihai Avram | Date: 10/02/2021 The area of web scraping has really expanded in the last few years, and it helps to know some of the main frameworks, protocols, and etiquette so that you can build the next awesome Web Scraping tool to revolutionize our world! Or maybe just your local neighborhood, or workgroup – that’s fine too. In this post, we will cover. What is web scraping? What are (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-11</title><link>https://blog.prokulski.science/2021/10/11/newsletter-dane-i-analizy-2021-10-11/</link><pubDate>Mon, 11 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/11/newsletter-dane-i-analizy-2021-10-11/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/top-5-time-series-analytics-71a46fbda379?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Top 5 Time Series Analytics&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Learn about the top use-cases and techniques for time-series data Time is present in most of the data around us. From retail product sales data to financial stock price, to IoT sensor data, all have a notion of time in it. So mastering time-series analytics is going to make you master of the data science world The top 5 analytics which I will demonstrate here are Seasonality Detection to find (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-04</title><link>https://blog.prokulski.science/2021/10/04/newsletter-dane-i-analizy-2021-10-04/</link><pubDate>Mon, 04 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/04/newsletter-dane-i-analizy-2021-10-04/</guid><description>&lt;p&gt;&lt;a href="https://gist.github.com/Adricarpin/a004fe0edd5b72eab193c7904dbdae8c"&gt;&lt;strong&gt;MLOps with Docker and Jenkins: Automating Machine Learning Pipelines&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to containerize your ML models with Docker and automate a Pipeline with Jenkins&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/performing-deduplication-with-record-linkage-and-supervised-learning-b01a66cc6882"&gt;&lt;strong&gt;Performing Deduplication with Record Linkage and Supervised Learning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Identifying duplicate records with a machine-learning approach Introduction Most data are recorded manually by humans and most often is not reviewed, not synchronized, and simply because there were mistakes made such as typos. Think for a second, have you ever filled out the same form twice before but with a slight difference in your address? For example, you submitted a form like this (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-27</title><link>https://blog.prokulski.science/2021/09/27/newsletter-dane-i-analizy-2021-09-27/</link><pubDate>Mon, 27 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/27/newsletter-dane-i-analizy-2021-09-27/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/t-sne-machine-learning-algorithm-a-great-tool-for-dimensionality-reduction-in-python-ec01552f1a1e?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;t-SNE Machine Learning Algorithm — A Great Tool for Dimensionality Reduction in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning t-SNE Machine Learning Algorithm — A Great Tool for Dimensionality Reduction in Python How to use t-Distributed Stochastic Neighbor Embedding (t-SNE) to visualize high-dimensionality data? t-SNE visualization with different perplexities. Gif image by  author . Intro A successful data scientist understands a wide range of Machine Learning algorithms and can explain the results to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-20</title><link>https://blog.prokulski.science/2021/09/20/newsletter-dane-i-analizy-2021-09-20/</link><pubDate>Mon, 20 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/20/newsletter-dane-i-analizy-2021-09-20/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/vlookup-implementation-in-python-in-three-simple-steps-93b5a290fd72"&gt;&lt;strong&gt;VLOOKUP implementation in Python in three simple steps&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Oftentimes, in the field of data analytics, it’s the data cleaning and processing that takes the most amount of time and effort. While the steps such as data cleaning, filtering, and pre-processing are generally under-evaluated or overlooked as compared to more juicy components such as the model development, it’s the quality of data that determines the quality of output. As it is rightly said, (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-13</title><link>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</link><pubDate>Mon, 13 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/13/newsletter-dane-i-analizy-2021-09-13/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/still-using-the-os-module-in-python-this-alternative-is-remarkably-better-7d728ce22fb7"&gt;&lt;strong&gt;Still Using the OS Module in Python? This Alternative is Remarkably Better&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Python’s OS module is a nightmare for managing files and folders. You should try Pathlib. File and folder management with Python’s os module is a nightmare. Yet, it’s an essential part of every data science workflow. Saving reports, reading configuration files, you name it — there’s no way around it. Picture this — you spend weeks building an API around your model, and it works flawlessly, at (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-09-06</title><link>https://blog.prokulski.science/2021/09/06/newsletter-dane-i-analizy-2021-09-06/</link><pubDate>Mon, 06 Sep 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/09/06/newsletter-dane-i-analizy-2021-09-06/</guid><description>&lt;p&gt;&lt;a href="https://flowingdata.com/2021/09/03/everything-more-from-home/"&gt;&lt;strong&gt;How Much More Time We Spent at Home&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;We had to do more from home. Here&amp;rsquo;s how much everything shifted by total minutes in a day. Tags: home , time use&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/image-processing-tool-a1b8fe66c957?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A Comprehensive Guide to Image Processing: Using an OpenCV Tool&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Image Processing Essentials An image processing tool with OpenCV, QT Creator, and C++ As the last part of this series on the Image Processing flow, I want to present a simple Image Processing Tool implemented using OpenCV 3.2.0 on QT Creator (5.12.10) with C++ to apply almost all the Image Processing operations discussed in the previous posts. To be able to use it, it’s enough to build OpenCV (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-23</title><link>https://blog.prokulski.science/2021/08/23/newsletter-dane-i-analizy-2021-08-23/</link><pubDate>Mon, 23 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/23/newsletter-dane-i-analizy-2021-08-23/</guid><description>&lt;p&gt;&lt;a href="https://gist.github.com/24939c89f67e5950bf00f5ddcc08ff97"&gt;&lt;strong&gt;Scala is like Python 4&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Although it’s fundamentally closer to Java, Scala has clearly taken a lot of influence from Python in terms of style and functionality. As someone who has written Python code for ~7 years now, playing around with Scala feels surprisingly familiar, but it’s more akin to using a statically typed and compiled version of Python 3. Obviously, they’re very different languages, b ut if you’re an (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-16</title><link>https://blog.prokulski.science/2021/08/16/newsletter-dane-i-analizy-2021-08-16/</link><pubDate>Mon, 16 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/16/newsletter-dane-i-analizy-2021-08-16/</guid><description>&lt;p&gt;&lt;a href="https://pub.towardsai.net/5-popular-machine-learning-algorithms-bbb7c7358fb2"&gt;&lt;strong&gt;5 Popular Machine Learning algorithms&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning Source: Image by GDJ on  Pixabay A machine learning algorithm is conceptually similar to any other algorithm in computer science. An ML algorithm is a data-driven process that is used to create a production-ready machine learning model. If you consider machine learning to be a train for accomplishing a job, then machine learning models are the engines that push the train. The (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-09</title><link>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</link><pubDate>Mon, 09 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-08</title><link>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</link><pubDate>Sun, 08 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-02</title><link>https://blog.prokulski.science/2021/08/02/newsletter-dane-i-analizy-2021-08-02/</link><pubDate>Mon, 02 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/02/newsletter-dane-i-analizy-2021-08-02/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/how-to-use-yield-in-python-5f1fbb864f94"&gt;&lt;strong&gt;How To Use “yield” in Python?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Python Generator — from basic to advanced usage Continue reading on Towards Data Science »&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/10-best-practices-to-write-readable-and-maintainable-sql-code-427f6bb98208"&gt;&lt;strong&gt;10 Best Practices to Write Readable and Maintainable SQL Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to write SQL queries that your team can easily read and maintain? It’s easy to mess with SQL without proper guidelines. Since everybody in your team might have their own habits of writing SQL, you can quickly end up with a confusing code that nobody understands. You probably realized the importance of following a set of good practices. May this article give you the guidance you’re (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-31</title><link>https://blog.prokulski.science/2021/07/31/newsletter-dane-i-analizy-2021-07-31/</link><pubDate>Sat, 31 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/31/newsletter-dane-i-analizy-2021-07-31/</guid><description>&lt;p&gt;&lt;a href="https://medium.com/geekculture/how-to-model-time-between-events-using-the-exponential-gamma-and-poisson-distributions-4b058a357a55"&gt;&lt;strong&gt;How to Model Time Between Events Using the Exponential, Gamma, and Poisson Distributions&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to model time-to-event and ‘time between events’ on real data using the Exponential Family to optimize returns of time driven investments. Screenshots from within the article. Usually, when we have time as a variable on a dataset, we can model other variables reflected in time itself, whether we apply Time Series Analysis or just use time to cut our data and apply continual ML or S tate Space (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-26</title><link>https://blog.prokulski.science/2021/07/26/newsletter-dane-i-analizy-2021-07-26/</link><pubDate>Mon, 26 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/26/newsletter-dane-i-analizy-2021-07-26/</guid><description>&lt;p&gt;&lt;a href="http://datasciencein.pl/ocena-modeli-klasyfikacyjnych-od-tablicy-pomylek-do-f1/"&gt;&lt;strong&gt;Ocena modeli klasyfikacyjnych - od tablicy pomyłek do F1 - Data science in pl&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Zrozumieć modele klasyfikacyjne. Tablica pomyłek, czułość, swoistość precyzja i F1 - opis i intuicyjne przykłady.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/word-embedding-techniques-word2vec-and-tf-idf-explained-c5d02e34d08?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Word Embedding Techniques: Word2Vec and TF-IDF Explained&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;The words need to be made meaningful for machine learning or deep learning algorithms. Therefore, they must be expressed numerically. Algorithms such as One Hot Encoding, TF-IDF, Word2Vec, FastText enable words to be expressed mathematically as word embedding techniques used to solve such problems. (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-19</title><link>https://blog.prokulski.science/2021/07/19/newsletter-dane-i-analizy-2021-07-19/</link><pubDate>Mon, 19 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/19/newsletter-dane-i-analizy-2021-07-19/</guid><description>&lt;p&gt;&lt;a href="https://techblog.ing.pl/blog/dobry-zly-i-brzydki-pare-slow-o-pandas-udf-w-apache-spark"&gt;&lt;strong&gt;Dobry, zły i brzydki – Parę słów o Pandas UDF w Apache Spark | Tech Blog ING Bank Śląski&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Spark to bardzo użyteczne narzędzie do pracy z Big Data. Niestety, czasem brakuje mu pewnych funkcjonalności. Na szczęście twórcy wyszli na przeciw oczekiwaniom użytkowników, dodając Pandas UDF, dzięki czemu zachowując elastyczność Pythona nie tracimy na wydajności. Zobaczmy więc, czym są i jak (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/geocoding-in-python-a-complete-guide-d68a4faafdc6?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Geocoding in Python: A Complete Guide&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A step-by-step tutorial on geocoding with Python Continue reading on Towards Data Science »&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-12</title><link>https://blog.prokulski.science/2021/07/12/newsletter-dane-i-analizy-2021-07-12/</link><pubDate>Mon, 12 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/12/newsletter-dane-i-analizy-2021-07-12/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/what-is-mlops-everything-you-must-know-to-get-started-523f2d0b8bd8"&gt;&lt;strong&gt;What is MLOps — Everything You Must Know to Get Started | by Harshit Tyagi&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A complete walkthrough of ML systems development lifecycle and need for MLOps Until recently, all of us were learning about software development lifecycle(SDLC) and how it goes from requirement elicitation → designing → development → testing → deployment → all the way down to maintenance. We (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://neptune.ai/blog/vectorization-techniques-in-nlp-guide"&gt;&lt;strong&gt;Vectorization Techniques in NLP [Guide] - neptune.ai&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Natural Language is how we, humans, exchange ideas and opinions. There are two main mediums for natural language – speech and text.  Listening and reading are effortless for a healthy human, but they’re difficult for a machine learning algorithm. That’s why scientists had to come up with Natural (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-05</title><link>https://blog.prokulski.science/2021/07/05/newsletter-dane-i-analizy-2021-07-05/</link><pubDate>Mon, 05 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/05/newsletter-dane-i-analizy-2021-07-05/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/create-a-dashboard-to-track-anything-with-plotly-and-dash-f9a5234d548b"&gt;&lt;strong&gt;How to Create a Dashboard to Track Anything With Plotly And Dash&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Or “How I stopped using third-party apps to track my investments”! It’s really easy to get started with your own template. Spoiler alert: this is not my actual portfolio! Ever since I started investing my hard-earned money, I was obsessed with having some sort of dashboard or tool that would allow (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/state-of-the-art-of-speech-synthesis-at-the-end-of-may-2021-6ace4fd512f2"&gt;&lt;strong&gt;State Of The Art of Speech Synthesis at the End of May 2021 | by Patrick Meyer | Jun, 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Thoughts and Theory Presentation of the state of the art in speech synthesis research at the end of May 2021 with a focus on deep learning technologies. I present a synthesis of 71 publications and give you the keys to understand the underlying concepts. Voice is the most natural way we have to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-28</title><link>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</link><pubDate>Mon, 28 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</guid><description>&lt;p&gt;&lt;a href="https://erdavis.com/2021/06/26/average-colors-of-the-world/"&gt;&lt;strong&gt;Average colors of the world&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;I wrote that I wanted to expand creatively beyond maps in 2021, but here we are, halfway in, and half my posts are maps. In my defense, I made these last year and just haven’t gotten around to posting them yet! They’ve been sitting in a folder since December, mocking me. It’s time to get […]&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/4-tricks-to-use-python-f-strings-more-efficiently-4f389e890514?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;4 Tricks to Use Python F-strings More Efficiently&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Have full control over what you print out. String interpolation is a way to embed variables into strings. It makes it easy to manipulate and enrich strings. Thus, the print statements are much more powerful with string interpolation. Formatted string literals, also known as f-strings, are a highly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-21</title><link>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</link><pubDate>Mon, 21 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</guid><description>&lt;p&gt;&lt;a href="https://jellyfish.tech/implementation-of-common-design-patterns-in-python/"&gt;&lt;strong&gt;Implementation of Top Design Patterns in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;*according to developer &amp;amp; software architect with 9+ years of experience&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/a-hands-on-demo-of-analyzing-big-data-with-spark-68cb6600a295?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A hands-on demo of analyzing big data with Spark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Scan a novel, calculate pi, and run regression on 50 million rows Conclusions This post was a deep dive on using Spark to process big data. We started with an overview of distributed computing before counting the frequency of each letter in Dostoyevsky’s War and Peace , estimating π with randomly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-14</title><link>https://blog.prokulski.science/2021/06/14/newsletter-dane-i-analizy-2021-06-14/</link><pubDate>Mon, 14 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/14/newsletter-dane-i-analizy-2021-06-14/</guid><description>&lt;p&gt;&lt;a href="https://chollinger.com/blog/2021/04/raspberry-pi-gardening-monitoring-a-vegetable-garden-using-a-raspberry-pi-part-1/"&gt;&lt;strong&gt;Raspberry Pi Gardening: Monitoring a Vegetable Garden using a Raspberry Pi - Part 1&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;On how growing vegetables is more complicated how it looks, why bad soldering still works, on moving individual bits around, and what I learned about using technology where one probably does not need technology.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/air-piano-using-opencv-and-python-298cb22097d9?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Air Piano using OpenCV and Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Play the piano by just moving your fingers in the air! Taken from Unsplash My inspiration to make an “Air Piano” Recently I visited my cousin and she had been trying to learn piano for quite some time. However, due to the pandemic, her teacher could not come home and they were practising through (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-07</title><link>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</link><pubDate>Mon, 07 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/3-examples-that-show-the-unlimited-flexibility-of-pyspark-319ab22d5a?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;3 Examples That Show The Unlimited Flexibility of PySpark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A combination of Python and SQL but easier than both Spark is an analytics engine used for large-scale data processing. It lets you spread both data and computations over clusters to achieve a substantial performance increase. It is easier than ever to collect, transfer, and store data. Hence, we (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cmdlinetips.com/2021/06/row-wise-operations-in-r/"&gt;&lt;strong&gt;Row-wise operations in R: compute row means in tidyverse&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial shows how to perform row-wise operations in R using tidyverse. We will use three key functions, rowwise(), c_across() and rowMeans() to perform to perform row-wise operations on a dataframe. rowwise() and c_across() functions are from dplyr. rowwise() function is available in dplyr (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-31</title><link>https://blog.prokulski.science/2021/05/31/newsletter-dane-i-analizy-2021-05-31/</link><pubDate>Mon, 31 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/31/newsletter-dane-i-analizy-2021-05-31/</guid><description>&lt;p&gt;&lt;a href="https://gursimar27.medium.com/containers-the-actual-mechanism-behind-the-technology-and-why-kubernetes-depreciated-docker-74b3f2e51cd6"&gt;&lt;strong&gt;Containers: The actual mechanism behind the technology and why Kubernetes depreciated Docker&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;In this article, we will be covering all the details about containers i.e. how they actually work behind the scene and all the parts it… Continue reading on Medium »&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-hierarchical-clustering-with-python-ebb256317b50"&gt;&lt;strong&gt;Fully Explained Hierarchical Clustering with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Programming Agglomerative clustering in unsupervised machine learning Hierarchical clustering. A photo by Author In this article, we will discuss hierarchical clustering algorithms in unsupervised machine learning. This algorithm is based on the splitting and merging of nested clusters. The linkage (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-24</title><link>https://blog.prokulski.science/2021/05/24/newsletter-dane-i-analizy-2021-05-24/</link><pubDate>Mon, 24 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/24/newsletter-dane-i-analizy-2021-05-24/</guid><description>&lt;p&gt;&lt;a href="https://neptune.ai/blog/what-makes-a-successful-machine-learning-engineer-my-story"&gt;&lt;strong&gt;What Makes a Successful Machine Learning Engineer? My Story&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;You’ve been doing machine learning for quite a while, and you’re starting to notice that your workload throughout a project is not constant. There are highs, with tasks that require your full dedication, and lows, where you mostly supervise processes that you’ve previously launched. You can do a (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cmdlinetips.com/2021/05/tips-to-customize-text-color-font-size-in-ggplot2-with-element_text/"&gt;&lt;strong&gt;10 Tips to Cuztomize Text Color, Font, Size in ggplot2 with element_text()&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;ggplot2’s theme system give us a great control over how the “non-data” elements of a plot should look like. The theme system helps elevate the plot you make by making finer changes and make it easy to look better. ggplot2’s theme system comes with multiple element_ functions, element_text() (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-14</title><link>https://blog.prokulski.science/2021/05/14/newsletter-dane-i-analizy-2021-05-14/</link><pubDate>Fri, 14 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/14/newsletter-dane-i-analizy-2021-05-14/</guid><description>&lt;p&gt;&lt;a href="https://medium.com/swlh/a-modern-set-up-for-python-package-development-f60b27a26bd7"&gt;&lt;strong&gt;A Modern Set-up for Python Package Development&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;From dependency management to quality assurance, documentation, and CI/CD&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://blog.adnansiddiqi.me/create-your-first-sales-dashboard-in-apache-superset/"&gt;&lt;strong&gt;Create your first sales dashboard in Apache Superset&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Superset dashboard tutorial. A step by step guide about how to use Apache Superset to create an interactive e-commerce sales dashboard to track enterprise KPIs. A free and open-source business intelligence tool to create interactive sales dashboard&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://blog.adnansiddiqi.me/getting-started-with-elasticsearch-7-in-python/"&gt;&lt;strong&gt;Getting started with Elasticsearch 7 in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Learn the basics of Elasticsearch 7.x, its setup, and implementation in Python.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-10</title><link>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</link><pubDate>Mon, 10 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</guid><description>&lt;p&gt;&lt;a href="https://blog.dataiku.com/how-to-perform-basic-ml-serving-with-python-docker-kubernetes"&gt;&lt;strong&gt;How to Perform Basic ML Serving With Python, Docker, and Kubernetes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial provides a basic, step-by-step example of real-time serving a machine learning (ML) model as a REST API with Python, Docker, and Kubernetes. We’ll build a basic REST API with Python, test it locally with Docker, and deploy our API with Kubernetes. By the way, if you want to go faster, (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.r-bloggers.com/2021/05/dockerizing-shiny-applications/"&gt;&lt;strong&gt;Dockerizing Shiny Applications&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Docker provides isolation to applications. Images are immutable. Running multiple instances of the same image can serve many users at the same time. All these general advantages of containerized applications apply to Shiny apps too. The post Dockerizing Shiny Applications first appeared on (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-03</title><link>https://blog.prokulski.science/2021/05/03/newsletter-dane-i-analizy-2021-05-03/</link><pubDate>Mon, 03 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/03/newsletter-dane-i-analizy-2021-05-03/</guid><description>&lt;p&gt;&lt;a href="https://www.enterprisedb.com/blog/comparison-joins-mongodb-vs-postgresql"&gt;&lt;strong&gt;Comparison of JOINS: MongoDB vs. PostgreSQL | EDB&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This is the second in a continuing series comparing MongoDB capabilities with those of Postgres. The first post covered “Schema Later Considered Harmful.”&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-machine-learning-to-predict-customers-next-purchase-day-7895ad49b4db"&gt;&lt;strong&gt;Using Machine Learning to Predict Customers Next Purchase Day&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning model to predict whether customers will make their next purchase after a certain period. Image by Mediamodifier and can be accessed  here . Introduction If there is one major lesson that those in the retail business have learnt from the SARS-CoV-2 pandemic, it is the demand to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Data Science Summit 2020</title><link>https://blog.prokulski.science/2020/09/18/dssconf-2020/</link><pubDate>Fri, 18 Sep 2020 11:48:55 +0000</pubDate><guid>https://blog.prokulski.science/2020/09/18/dssconf-2020/</guid><description>&lt;p&gt;16 października (piątek), odbędzie się IV edycja konferencji Data Science Summit&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://DSSconf.pl"&gt;&lt;img src="../../downloads/2020/09/DSS20_1200x628-1024x536.png" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;em&gt;Post to informacja prasowa, a niniejszy blog oraz fanpage &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;Dane i Analizy&lt;/a&gt; to patroni medialni konferencji.&lt;/em&gt;&lt;/p&gt;&#10;&lt;p&gt;DSS to największe w Polsce wydarzenie o tematyce data science adresowane do wszystkich osób związanych lub zainteresowanych szybko rozwijającym się obszarem przetwarzania, analizy i wizualizacji danych oraz uczelnia maszynowego.&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Data Science Summit 2020&lt;/strong&gt; to przede wszystkim ponad 12 równoległych ścieżek tematycznych i ponad 100 prezentacji prowadzonych przez najbardziej pożądanych ekspertów z Polski i zagranicy.&lt;/p&gt;</description></item><item><title>Promocja na książki</title><link>https://blog.prokulski.science/2020/07/11/promocja-na-ksiazki/</link><pubDate>Sat, 11 Jul 2020 10:03:15 +0000</pubDate><guid>https://blog.prokulski.science/2020/07/11/promocja-na-ksiazki/</guid><description>&lt;p&gt;Jeszcze tylko do poniedziałku 13.07 &lt;strong&gt;&lt;a href="https://helion.pl/page/14029A/promocja/8850"&gt;promka wakacyjna&lt;/a&gt;&lt;/strong&gt; w Helionie, łapcie póki są porządne rabaty!&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Deep learning z Kerasem w Pythonie, a konkretnie pozycja &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/delepy.htm"&gt;Deep Learning. Praca z językiem Python i biblioteką Keras&lt;/a&gt;&lt;/strong&gt; i wersja dla R: &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/delerk.htm"&gt;Deep Learning. Praca z językiem R i biblioteką Keras&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Ponoć najlepsza książka do nauki Pythona &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/autopy.htm"&gt;Automatyzacja nudnych zadań z Pythonem. Nauka programowania&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Oraz dla równowagi - najlepsza książka do nauki R: &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/jezrkv.htm"&gt;Język R. Kompletny zestaw narzędzi dla analityków danych&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Analiza danych to też SQL, zatem &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/pksql3.htm"&gt;Praktyczny kurs SQL&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Najlepszym środowiskiem do pracy jest mimo wszystko Linux - podstawy złapiesz dzięki &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/linkp5.htm"&gt;Linux. Komendy i polecenia&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;&#10;&lt;li&gt;Ale nie wszystko musisz mieć zainstalowane na jakimś serwerze - są rozwiązania kontenerowe, więc &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/docke2.htm"&gt;Docker. Praktyczne zastosowania&lt;/a&gt;&lt;/strong&gt; może okazać się dobrym pomysłem.&lt;/li&gt;&#10;&lt;li&gt;Chyba, że wolisz pozostać w świecie Excela, wówczas przyda Ci się &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/e19bib.htm"&gt;Biblia Excela&lt;/a&gt;&lt;/strong&gt;. Sposobem na przejście do bardziej zaawansowanych technik jest Power Query, w korporacjach przyda się więc &lt;strong&gt;&lt;a href="https://helion.pl/view/14029A/poquex.htm"&gt;Power Query w Excelu i Power BI. Zbieranie i przekształcanie danych&lt;/a&gt;&lt;/strong&gt;.&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Więcej książek w ramach promocji znajdziecie &lt;a href="https://helion.pl/page/14029A/promocja/8850"&gt;na stronie&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Które API szybsze - w Pythonie czy w R?</title><link>https://blog.prokulski.science/2020/06/05/api-python-api-r/</link><pubDate>Fri, 05 Jun 2020 15:48:33 +0000</pubDate><guid>https://blog.prokulski.science/2020/06/05/api-python-api-r/</guid><description>&lt;p&gt;Wiele razy czytałem opinie, że Python jest szybszy a R nie nadaje się na produkcję. Ale to opinie nie potwierdzone badaniami. Tutaj pierwsze badania na ten temat!&lt;/p&gt;&#10;&lt;p&gt;Testom podlegać będzie API zbudowane w R z użyciem frameworków &lt;strong&gt;&lt;a href="https://www.rplumber.io/"&gt;Plumber&lt;/a&gt;&lt;/strong&gt; i &lt;strong&gt;&lt;a href="https://restrserve.org/"&gt;RestRserve&lt;/a&gt;&lt;/strong&gt; oraz w Pythonie z użyciem &lt;strong&gt;&lt;a href="https://palletsprojects.com/p/flask/"&gt;Flask&lt;/a&gt;&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;Biorąc pod uwagę analizę danych i na przykład wnioskowanie czy predykcje oparte o te dane zarówno R jak i Python dobrze się sprawdzają. Mam nadzieję, że niejednokrotnie w ramach tego bloga pokazałem, że R jest idealny do analizy danych. A o Pythonie w tym samym kontekście pisze się wszędzie (i pewnie tutaj będzie też coraz więcej). Zatem czy warto wybierać pomiędzy tymi rozwiązaniami przy wdrożeniu na produkcję?&lt;/p&gt;</description></item><item><title>(py)Spark, Hadoop i HDFS - podstawy</title><link>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</link><pubDate>Thu, 09 Apr 2020 19:06:13 +0000</pubDate><guid>https://blog.prokulski.science/2020/04/09/spark-hadoop-hdfs/</guid><description>&lt;p&gt;Dzisiaj zajmiemy się wykorzystaniem Sparka i Hadoopa do przetwarzania większej ilości danych. Oraz do budowania prostego modelu (regresji liniowej). Może jeszcze nie jest to big data, ale mechanizmy są identyczne jak w przypadku większej liczby danych. Wystarczy tylko tych danych więcej zgromadzić, zbudować większe środowisko (dużo serwerów) i… też będzie działało.&lt;/p&gt;&#10;&lt;p&gt;A w dodatku poznamy pakiet &lt;em&gt;faker&lt;/em&gt; który pozwoli nam na wygenerowanie sztucznych danych.&lt;/p&gt;&#10;&lt;h3 id="spark-i-hadoop"&gt;Spark i Hadoop&lt;/h3&gt;&#10;&lt;p&gt;&lt;strong&gt;Apache Spark&lt;/strong&gt; to rozwijana na zasadach open source platforma klastrowego przetwarzania danych, która ma interfejsy API dla takich języków programowania jak Scala, Python, Java i R.&lt;/p&gt;</description></item><item><title>Instagram - zbieranie danych i bot</title><link>https://blog.prokulski.science/2019/03/27/instagram-w-r/</link><pubDate>Wed, 27 Mar 2019 14:28:51 +0000</pubDate><guid>https://blog.prokulski.science/2019/03/27/instagram-w-r/</guid><description>&lt;p&gt;Konto na Instagramie mam od kwietnia 2012 roku, ale nie zajmuje on mojego czasu (nie zaglądam tam wcale). Kiedyś chciałem sprawdzić czy zdjęcia z tagu #warszawa są zrobione w Warszawie, ale nie sprawdziłem… Do dzisiaj.&lt;/p&gt;&#10;&lt;p&gt;Tekst &lt;strong&gt;&lt;a href="https://medium.com/@chrisbuetti/how-i-eat-for-free-in-nyc-using-python-automation-artificial-intelligence-and-instagram-a5ed8a1e2a10"&gt;How I Eat For Free in NYC Using Python, Automation, Artificial Intelligence, and Instagram&lt;/a&gt;&lt;/strong&gt; który robi furorę w ostatnich dniach sprawił, że wreszcie ruszyłem tyłek i zająłem się tematem. Kilka miesięcy temu widziałem tutorial &lt;strong&gt;&lt;a href="https://www.youtube.com/watch?v=BGU2X5lrz9M"&gt;How to Get Instagram Followers/Likes Using Python&lt;/a&gt;&lt;/strong&gt;, dzisiaj spróbujemy w R.&lt;/p&gt;</description></item><item><title>Google Analytics w R</title><link>https://blog.prokulski.science/2018/09/26/google-analytics-w-r/</link><pubDate>Wed, 26 Sep 2018 16:16:34 +0000</pubDate><guid>https://blog.prokulski.science/2018/09/26/google-analytics-w-r/</guid><description>&lt;p&gt;Google Analytics to chyba najpopularniejszy sposób mierzenia ruchu na stronach internetowych. Można bardzo dużo &lt;em&gt;wyklikać&lt;/em&gt; w panelu, ale może zaistnieć potrzeba pobrania danych statystycznych do analiz, których GA nie daje. Dzisiaj dowiesz się jak zrobić to w języku R.&#10;Jak większość zadań, tak samo i to ma pomocny pakiet. Jak można się podziewać pakiet nazywa się &lt;strong&gt;&lt;a href="https://github.com/Tatvic/RGoogleAnalytics"&gt;RGoogleAnalytics&lt;/a&gt;&lt;/strong&gt; i dostępny jest poprzez instalację z GitHuba:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;devtools&lt;span style="color:#0550ae"&gt;::&lt;/span&gt;&lt;span style="color:#6639ba"&gt;install_github&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;Tatvic/RGoogleAnalytics&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Załadujmy więc go do R (razem z innymi pakietami) i do dzieła:&lt;/p&gt;</description></item><item><title>Stawiamy własny serwer</title><link>https://blog.prokulski.science/2018/06/14/serwer-vps-dla-r-python/</link><pubDate>Thu, 14 Jun 2018 11:29:30 +0000</pubDate><guid>https://blog.prokulski.science/2018/06/14/serwer-vps-dla-r-python/</guid><description>&lt;p&gt;Budujemy własny serwer do programowania w R i Pythonie, razem z serwerem WWW, PHP oraz bazami danych MySQL i PostgreSQL.&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;a href="#opis-srodowiska"&gt;Opis środowiska&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="#zakupy"&gt;Zakupy&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="#konfigurujemy-vpsa"&gt;Konfigurujemy VPSa&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="#r-rstudio-i-shiny"&gt;R, RStudio i Shiny&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="#python-i-jupyter"&gt;Python i Jupyter&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="#subdomeny-konfiguracja"&gt;Subdomeny - konfiguracja&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="#dodatki"&gt;Dodatki&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="#koniec"&gt;Koniec&lt;/a&gt;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Tym razem więcej administrowana serwerami, a mniej programowania i analizowania danych. Zbudujemy własny serwer do programowania w R i Pythonie, razem z serwerem WWW (aby móc prezentować wynik swoich prac).&lt;/p&gt;&#10;&lt;h3 id="opis-środowiska"&gt;Opis środowiska&lt;/h3&gt;&#10;&lt;p&gt;W niniejszym wpisie przygotujemy serwer zbudowany na linuxie w dystrybucji &lt;strong&gt;Ubuntu&lt;/strong&gt; z działającym na nim (i dostępnym przez przeglądarkę z dowolnego miejsca z internetem) &lt;strong&gt;RStudio&lt;/strong&gt;. Serwer pozwoli nam też na budowanie i publikowanie aplikacji napisanych w &lt;strong&gt;Shiny&lt;/strong&gt;. Przy okazji zainstalujemy &lt;strong&gt;Python&lt;/strong&gt;a razem z &lt;strong&gt;Jupyter Notebook&lt;/strong&gt; (oraz &lt;strong&gt;JupyterLab&lt;/strong&gt;) do wygodnej pracy. Całości dopełni baza danych &lt;strong&gt;PostgreSQL&lt;/strong&gt;. Aby móc publikować swoje dzieła w formie bloga zainstalujemy &lt;strong&gt;PHP&lt;/strong&gt; oraz bazy &lt;strong&gt;MySQL&lt;/strong&gt; - być może zechcesz zainstalować WordPressa, a on tego wymaga.&#10;&lt;strong&gt;Do czego taka maszyna może się przydać?&lt;/strong&gt; W zależności od wydajności:&lt;/p&gt;</description></item><item><title>Webscrapping w R</title><link>https://blog.prokulski.science/2018/06/05/webscrapping-w-r/</link><pubDate>Tue, 05 Jun 2018 16:26:22 +0000</pubDate><guid>https://blog.prokulski.science/2018/06/05/webscrapping-w-r/</guid><description>&lt;p&gt;W dzisiejszym wpisie nieco bardziej techniczne sprawy, ale bardzo cenne dla osób, które przy pomocy R chcą pobierać dane ze stron WWW.&#10;Przedstawię trzy narzędzia, które w tym pomogą. Dwa pomogą na pewno, trzecie to bardziej ciekawostka do robienia screen shotów.&lt;/p&gt;&#10;&lt;h3 id="jak-dobrać-się-do-tabelki-na-stronie"&gt;Jak dobrać się do tabelki na stronie?&lt;/h3&gt;&#10;&lt;p&gt;Często jakieś dane, które nas interesują są opublikowane na stronach WWW. Można je przepisać ręcznie, można je wciągnąć do Excela (jest odpowiedni, w miarę intuicyjny importer tabelek dostępny pod guzikiem &lt;em&gt;Z sieci Web&lt;/em&gt; w menu Dane). Ale nas interesuje oczywiście w R (i Python, ale to nie w tym odcinku).&#10;W dzisiejszych zajęciach przydadzą nam się biblioteki:&lt;/p&gt;</description></item><item><title>R-base, R-dplyr, R-data.table i Python</title><link>https://blog.prokulski.science/2018/05/23/r-i-python/</link><pubDate>Wed, 23 May 2018 15:44:07 +0000</pubDate><guid>https://blog.prokulski.science/2018/05/23/r-i-python/</guid><description>&lt;p&gt;Podstawy manipulacji danymi w tabelkach. W R (trzy wersje) oraz w Pythonie. Bo to pierwszy post z cyklu &lt;em&gt;idziemy w stronę Pythona&lt;/em&gt;.&#10;W dzisiejszym wpisie zajmiemy się podstawowymi operacjami na tabelach (data frame) z danymi. &lt;strong&gt;Dlaczego to jest ważne?&lt;/strong&gt; Są to najczęściej wykonywane operacje w trakcie analizy danych, bo przecież:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;dane trzeba wczytać &lt;em&gt;do komputera&lt;/em&gt;&lt;/li&gt;&#10;&lt;li&gt;czasem zmodyfikować, na przykład policzyć wartość na podstawie dwóch lub więcej kolumn&lt;/li&gt;&#10;&lt;li&gt;wybrać określone wiersze lub określone kolumny&lt;/li&gt;&#10;&lt;li&gt;połączyć jedną tabelę z inną&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;Z tak przygotowanych danych można później na przykład narysować wykres czy też wrzucić je do modelu. I to jest wystarczające, na co dowodem jest pewnie z 70% moich wpisów z ostatnich 12 miesięcy (albo i więcej). Kolejne 20% wpisów to sposób pozyskania danych. 10% było pewnie o modelach wszelakich.&#10;Osobiście uważam, że w R nauczyłem się na tyle dużo, aby przejść na kolejny poziom. W pracy są to aplikacje w Shiny czy też panele w wykorzystaniem &lt;em&gt;flexdashboard&lt;/em&gt; (znowu: w obu przypadkach 70% pracy to manipulacja danymi w tabelkach), ale ciągnie mnie do Pythona. Gdybym zaczynał przygodę z machine learning czy data science to wybrałbym Pythona. Jednocześnie mam nadzieję, że dla osób znających jeden z języków niniejszy wpis będzie ciekawym wprowadzeniem w drugi język.&#10;Jeśli chodzi o R to zobaczymy jak wykonać podstawowe operacje wykorzystując standardowe możliwości R (R-base), wykorzystując pakiety &lt;em&gt;dplyr&lt;/em&gt; (wchodzący w skład ekosystemu &lt;em&gt;tidyverse&lt;/em&gt;) oraz &lt;em&gt;data.table&lt;/em&gt;. W przykładach dla Pythona będzie to &lt;em&gt;pandas&lt;/em&gt;.&#10;Dlaczego data.table? &lt;a href="https://github.com/Rdatatable/data.table/wiki/Benchmarks-%3A-Grouping"&gt;Porównanie prędkości&lt;/a&gt; pokazuje, że dla bardzo dużych tabel data.table jest najszybszy.&#10;Zaczniemy od wczytania odpowiednich bibliotek. W R oczywiście:&lt;/p&gt;</description></item><item><title>Wracam</title><link>https://blog.prokulski.science/2017/02/23/wracam/</link><pubDate>Thu, 23 Feb 2017 21:04:26 +0000</pubDate><guid>https://blog.prokulski.science/2017/02/23/wracam/</guid><description>&lt;p&gt;Wróciliśmy z Chin. 6 lat temu, relację można przeczytać na blogu &lt;a href="http://madeinchina.blox.pl/html"&gt;Made in China&lt;/a&gt;.&#10;Przez te sześć lat zdążył urodzić się Szymon, potem Hubert.&#10;Kilka razy zmieniłem pracę.&#10;W między czasie blog leżał odłogiem - nie było tematów, nie było czasu i weny. Mogłem co prawda pisać blogaska o wszystkim i o niczym, ale po co?&#10;Teraz mam wrażenie, że znalazłem coś, czym warto się podzielić. Zainteresowałem się analizą danych, predykcją i tym podobnymi zagadnieniami związanymi z szeroko pojętym &lt;em&gt;data mining&lt;/em&gt; i &lt;em&gt;data science&lt;/em&gt;. Próbowałem sił w PowerBI, Tableau, aby na koniec dojść do R, przy którym zostałem (jak na razie - Python pewnie następny). Ostatnio zawodowo grzebię też w VBA w Accessie i Excelu.&#10;I to jest ta nisza - dane, ich przetwarzanie i wizualizacja. Takiego polskojęzycznego bloga nie znalazłem, sporo fajnych jest po angielsku (ale co to za problem czytać po angielsku?). Może kogoś zainteresuje, może komuś się przyda do nauki, chociaż nie zamierzam prowadzić tutaj jakiegoś kursu, a publikowane kody źródłowe będą raczej dla zaznajomionych z R.&#10;A jeśli nie przyda się nikomu - &amp;ldquo;będzie do portfolio&amp;rdquo;, &amp;ldquo;wpiszę sobie do CV&amp;rdquo;.&lt;/p&gt;</description></item></channel></rss>