<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AWS on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/aws/</link><description>Recent content in AWS on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 24 Nov 2025 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/aws/index.xml" rel="self" type="application/rss+xml"/><item><title>Jak wygląda "przerzucanie liczb z worka do worka" w ubezpieczeniach i przemyśle?</title><link>https://blog.prokulski.science/2025/11/24/jak-wyglada-przerzucanie-liczb-z-worka-do-worka-w-ubezpieczeniach-i-przemysle/</link><pubDate>Mon, 24 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/24/jak-wyglada-przerzucanie-liczb-z-worka-do-worka-w-ubezpieczeniach-i-przemysle/</guid><description>&lt;p&gt;W dzisiejszym wydaniu znajdziesz solidną dawkę praktycznej wiedzy – od optymalizacji agentów AI w GitHub Copilot i dyskusji o tym, czy serwer MCP rzeczywiście jest Ci potrzebny, przez zaawansowane techniki pracy z DuckDB i porównanie narzędzi do przetwarzania 650 GB danych, aż po konkretne konfiguracje Nginx, Terraform i Kubernetes.&lt;/p&gt;&#10;&lt;p&gt;Często tutaj trafiają teksty związane/zachwalające DuckDB (dzisiaj też będą). Alibaba tymczasem opublikowała trzyczęściowy cykl, w którym dogłębnie analizuje wewnętrzne mechanizmy DuckDB. Na blogu znajduje się analiza kodu DuckDB pod kątem formatu plików, formatu przechowywania tabel oraz warstwy wykonawczej. &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-1-file-format-overview_602511"&gt;Część pierwsza&lt;/a&gt;, &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-2-table-storage-format_602657"&gt;druga&lt;/a&gt; i &lt;a href="https://www.alibabacloud.com/blog/duckdb-internals---part-3-execution-layer-overview_602660"&gt;trzecia&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Kafka jest szybka, ale użyję Postgres</title><link>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</link><pubDate>Mon, 03 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/03/kafka-jest-szybka-ale-uzyje-postgres/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się rozwiązaniom praktycznym z kilku kluczowych obszarów analizy i przetwarzania danych. Zaczynamy od fuzzy string matching i technik dopasowywania niedoskonałych tekstów, przechodzimy przez architekturę pipeline&amp;rsquo;ów ETL opartych na open source, aż po szczegóły integracji Kafka, Flink i Spark w systemach streamingowych.&lt;/p&gt;&#10;&lt;p&gt;W sekcji Python znajdziesz porównanie nowości w wersjach 3.13 i 3.14, kompleksowy przewodnik (a nawet dwa, aby niejako dopełnić wiedzę) po Pydantic oraz praktyczne wzorce projektowe dla FastAPI. Nie zabraknie też tematów związanych z optymalizacją PostgreSQL w aplikacjach czasu rzeczywistego, zarządzaniem kosztami w chmurze AWS oraz głęboko partycjonowanymi danymi w Apache Spark.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-02-10</title><link>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</link><pubDate>Mon, 10 Feb 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/02/10/newsletter-dane-i-analizy-2025-02-10/</guid><description>&lt;p&gt;Zanim przejdę do sedna, czyli bieżącego numeru, mam dla Ciebie informację. Otóż za moment będzie dostępny kompleksowy e-book typu &lt;strong&gt;&amp;ldquo;od juniora do mida&amp;rdquo;&lt;/strong&gt;. Książka to projekt, który kompleksowo przeprowadza przez budowę aplikacji - od komunikacji z API, przez bazę danych, aż po konteneryzację. Bez pierdół teoretycznych, za to z mocnym naciskiem na praktykę. Szczegóły już niedługo w oddzielnym mailu, więc trzymajcie się blisko skrzynki odbiorczej!&lt;/p&gt;&#10;&lt;p&gt;A co Cię czeka w tym numerze?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-21</title><link>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</link><pubDate>Mon, 21 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</guid><description>&lt;p&gt;OpenAI ze swoim modelem w wersji o1 wróciło na szczyt listy przebojów w kategorii LLM. Garść firm zajmujących się GenAI zaczyna generować poważne przychody. Co jeszcze dzieje się na rynku AI w 2024 roku? Jaki jest &amp;ldquo;Stan AI w 2024&amp;rdquo;? O tym dowiecie się z raportu, do którego link poniżej, w sekcji AI/ML.&lt;/p&gt;&#10;&lt;p&gt;Sporo w tym wydaniu o bazach danych (co najmniej dwa razy pojawia się Postgres i Redis, ale są też inne rozwiązania: wektorowa &lt;a href="https://milvus.io/"&gt;Milvus&lt;/a&gt;, &lt;a href="https://www.influxdata.com/"&gt;InfluxDB&lt;/a&gt; do szeregów czasowych, grafowa &lt;a href="https://neo4j.com/"&gt;Neo4j&lt;/a&gt;, dobrze znany stałym czytelnikom &lt;a href="https://duckdb.org/"&gt;DuckDB&lt;/a&gt;oraz &lt;a href="https://tile38.com/"&gt;Tile38&lt;/a&gt; do zadań geo).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-04-08</title><link>https://blog.prokulski.science/2024/04/08/newsletter-dane-i-analizy-2024-04-08/</link><pubDate>Mon, 08 Apr 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/04/08/newsletter-dane-i-analizy-2024-04-08/</guid><description>&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2024/03/one-class-svm-for-anomaly-detection/"&gt;&lt;strong&gt;SVM One-Class Classifier For Anomaly Detection&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Poznaj mechanizm One-Class SVM pod kątem wykrywania anomalii. Jakie są niuanse, hiperparametry? Do tego praktyczna implementacja identyfikacji rzadkich zdarzeń.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2024/03/decision-trees-split-methods-hyperparameter-tuning/"&gt;&lt;strong&gt;Decision Trees: Split Methods &amp;amp; Hyperparameter Tuning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;O przycinaniu drzew decyzyjnych - rozbudowane podstawy algorytmów ML&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.analyticsvidhya.com/blog/2024/03/comprehensive-guide-on-linear-discriminant-analysis/"&gt;&lt;strong&gt;Comprehensive Guide on Linear Discriminant Analysis&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozbudowane podstawy algorytmów ML, ciąg dalszy - o redukcji wymiarów&lt;/p&gt;&#10;&lt;h3 id="airflow"&gt;#airflow&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/apache-airflow/utilizing-dockeroperator-in-airflow-to-run-containerized-applications-in-data-engineer-projects-f596df26ea83"&gt;&lt;strong&gt;Utilizing DockerOperator in Airflow&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak użyć AirFlow do zarządzania procesami składającymi się ze zdockeryzowanych elementów?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-23</title><link>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</link><pubDate>Mon, 23 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</guid><description>&lt;p&gt;Lubię DuckDB i lubię AirFlow. Kafka jest naturalnym sposobem na przesyłanie danych między systemami czy też mikroserwisami. Stąd też dzisiaj kilka tekstów zahaczających o te wszystkie technologie.&lt;/p&gt;&#10;&lt;p&gt;Dodatkowo trochę z obszaru zarządzania - zarówno opis typowego projektu data science jak i metryka opisująca stabilność kolejki prac.&lt;/p&gt;&#10;&lt;p&gt;No i trochę o mapkach, bo mapki są fajne.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-softmax-regression-for-multi-class-label-with-python-782a34283894"&gt;&lt;strong&gt;Fully Explained Softmax Regression for Multi-Class Label with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Klasyfikacja do wielu klas - o co tutaj chodzi? Przewodnik dla początkujących&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-08-14</title><link>https://blog.prokulski.science/2023/08/08/newsletter-dane-i-analizy-2023-08-14/</link><pubDate>Tue, 08 Aug 2023 00:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/08/08/newsletter-dane-i-analizy-2023-08-14/</guid><description>&lt;p&gt;Na początek &lt;a href="https://youtu.be/NwiI4y8PC9g"&gt;tutorial&lt;/a&gt; (YT, 30 minut, po polsku), tym razem z LLMami w roli głównej - o tym jak zbudować chatbota odpowiadającego na pytania z własnej bazy wiedzy. Bardzo fajny materiał, takich trochę brakuje - chłopaki opowiadają o tych najbardziej kluczowych kawałkach kodu a nie o podstawach. Rozumiesz o czym jest mowa, nie ma straty czasu na opowiadanie co do jest model albo funkcja w Pythonie ;-)&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj też &lt;a href="https://levelup.gitconnected.com/mlops-mastering-machine-learning-deployment-an-intro-to-docker-kubernetes-helm-and-modern-web-b14dd140a9bf"&gt;pelny proces MLOps&lt;/a&gt; - wprowadzenie zawierające wszystkie elementy. Super tekst na początek dla każdego DevOpsa który chce się zająć tematami ML oraz każdego data scientisty, który chce umieć nowocześnie wdrażać swoje modele.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-07-10</title><link>https://blog.prokulski.science/2023/07/10/newsletter-dane-i-analizy-2023-07-10/</link><pubDate>Mon, 10 Jul 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/07/10/newsletter-dane-i-analizy-2023-07-10/</guid><description>&lt;p&gt;Myślisz, że analitycy danych już nie będą potrzebni? Dlaczego? Bo pojawił się Code Interpreter, a jeśli nie wiesz o co chodzi to przeczytaj koniecznie o nim (i o tym jak go używać!) &lt;a href="https://www.oneusefulthing.org/p/what-ai-can-do-with-a-toolbox-getting"&gt;tutaj (&amp;ldquo;What AI can do with a toolbox&amp;hellip; Getting started with Code Interpreter&amp;rdquo;)&lt;/a&gt; oraz &lt;a href="https://www.oneusefulthing.org/p/it-is-starting-to-get-strange"&gt;tutaj (&amp;ldquo;It is starting to get strange&amp;rdquo;)&lt;/a&gt;. Code Interpreter jest dostępny w planie &amp;ldquo;ChatGPT Plus&amp;rdquo;.&lt;/p&gt;&#10;&lt;p&gt;I ten temat, te dwa teksty to chyba najciekawszy materiał w tym tygodniu. Gdyby było mało - poniżej kilka kolejnych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-30</title><link>https://blog.prokulski.science/2023/01/30/newsletter-dane-i-analizy-2023-01-30/</link><pubDate>Mon, 30 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/30/newsletter-dane-i-analizy-2023-01-30/</guid><description>&lt;p&gt;Dzisiaj na początek trochę o orkiestracji za pomocą Apache Airflow. Zobaczymy co potrafi to narzędzie w zakresie sterowania pobieraniem danych i jak sprawuje się na produkcji.&lt;/p&gt;&#10;&lt;p&gt;A jak już mamy pobrane dane to możemy z nimi coś zrobić korzystając z jednej z bibliotek pythonowych. Albo policzyć jakieś modele i z ich pomocą przeanalizować na przykład klientów i ich drogę przez koszyk zakupowy.&lt;/p&gt;&#10;&lt;p&gt;W sumie - u laików - synonimem słowa &amp;ldquo;model&amp;rdquo; jest &amp;ldquo;sztuczna inteligencja&amp;rdquo;. A jak sztuczna inteligencja to może od razu ChatGPT (z którego już dzieciaki korzystają żeby pisać prace domowe)?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-27</title><link>https://blog.prokulski.science/2022/12/27/newsletter-dane-i-analizy-2022-12-27/</link><pubDate>Tue, 27 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/27/newsletter-dane-i-analizy-2022-12-27/</guid><description>&lt;p&gt;Święta, święta i po świętach. Nawet newsletter opóźniony specjalnie o jeden dzień, żebyście mogli w pełni od komputerów odpocząć :)&lt;/p&gt;&#10;&lt;p&gt;W ostatnim w 2022 roku numerze trochę mniej tekstów, ale to nie znaczy że są one słabszej jakości. Spora część dzisiejszego tortu to technologie big data, ale jest też coś o Pythonie i kilka ciekawostek ogólnych.&lt;/p&gt;&#10;&lt;p&gt;Najbardziej chyba polecam zestawienie w zmianie liczby ludności w i wokół polskich miast - książkowe wręcz przykłady suburbanizacji. Dobre jest też wyjaśnienie algorytmów boostingowych.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-11-07</title><link>https://blog.prokulski.science/2022/11/07/newsletter-dane-i-analizy-2022-11-07/</link><pubDate>Mon, 07 Nov 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/11/07/newsletter-dane-i-analizy-2022-11-07/</guid><description>&lt;p&gt;Dzisiaj poniedziałek, ale w środę po południu przyjdzie do Ciebie &lt;strong&gt;mail z ankietą&lt;/strong&gt;. To 6 prostych pytań, które pomogą w rozwoju newslettera. Dawno nie było ankiety, widzę statystyki tego co czytacie, ale statystyki to jedno, a odczucie prawdziwego czytelniak to drugie :) Ankieta sprowadza się do klikania, zajmuje 2-3 minuty, zachęcam do wypełnienia.&lt;/p&gt;&#10;&lt;p&gt;A dzisiaj jeszcze standardowo - dużo treści na przeróżne tematy :). Dzisiaj na prawdę &lt;strong&gt;dużo&lt;/strong&gt; (drugie tyle czeka w garażu, mam przynieść?).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-06</title><link>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</link><pubDate>Mon, 06 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</guid><description>&lt;p&gt;W tym tygodniu sporo rozwiązań big data&amp;rsquo;owych i ciekawostek ogólnie związanych z przetwarzaniem danych.&lt;/p&gt;&#10;&lt;p&gt;Ale jeśli interesuje Cię coś bardziej &amp;ldquo;biznesowego&amp;rdquo;, w szczególności jak &lt;em&gt;projektuje się produkty&lt;/em&gt; to gorąco polecam rozmowę z Marcinem Zarembą o projektowaniu autobookingu w Dobrym Mechaniku oraz dodatkowo &lt;a href="https://marcinzaremba.pl/2022/05/12/jak-powstawal-autobooking/?utm_source=newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;tekst o tymże&lt;/a&gt; u Marcina na blogu. Świetny case study, serio serio.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-mask-rcnn-net-for-object-detection-in-60-lines-of-code-9b6bbff292c3"&gt;&lt;strong&gt;Train Mask R-CNN Net for Object Detection in 60 Lines of Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie obiektów na zdjęciach - jak to działa?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-09</title><link>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</link><pubDate>Mon, 09 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-08</title><link>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</link><pubDate>Sun, 08 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-31</title><link>https://blog.prokulski.science/2021/07/31/newsletter-dane-i-analizy-2021-07-31/</link><pubDate>Sat, 31 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/31/newsletter-dane-i-analizy-2021-07-31/</guid><description>&lt;p&gt;&lt;a href="https://medium.com/geekculture/how-to-model-time-between-events-using-the-exponential-gamma-and-poisson-distributions-4b058a357a55"&gt;&lt;strong&gt;How to Model Time Between Events Using the Exponential, Gamma, and Poisson Distributions&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;How to model time-to-event and ‘time between events’ on real data using the Exponential Family to optimize returns of time driven investments. Screenshots from within the article. Usually, when we have time as a variable on a dataset, we can model other variables reflected in time itself, whether we apply Time Series Analysis or just use time to cut our data and apply continual ML or S tate Space (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-03</title><link>https://blog.prokulski.science/2021/05/03/newsletter-dane-i-analizy-2021-05-03/</link><pubDate>Mon, 03 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/03/newsletter-dane-i-analizy-2021-05-03/</guid><description>&lt;p&gt;&lt;a href="https://www.enterprisedb.com/blog/comparison-joins-mongodb-vs-postgresql"&gt;&lt;strong&gt;Comparison of JOINS: MongoDB vs. PostgreSQL | EDB&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This is the second in a continuing series comparing MongoDB capabilities with those of Postgres. The first post covered “Schema Later Considered Harmful.”&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-machine-learning-to-predict-customers-next-purchase-day-7895ad49b4db"&gt;&lt;strong&gt;Using Machine Learning to Predict Customers Next Purchase Day&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Machine Learning model to predict whether customers will make their next purchase after a certain period. Image by Mediamodifier and can be accessed  here . Introduction If there is one major lesson that those in the retail business have learnt from the SARS-CoV-2 pandemic, it is the demand to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>MNIST dataset – sieci neuronowe, część 2 (Keras)</title><link>https://blog.prokulski.science/2018/02/13/mnist-dataset-sieci-neuronowe-czesc-2-keras-w-r/</link><pubDate>Tue, 13 Feb 2018 10:34:35 +0000</pubDate><guid>https://blog.prokulski.science/2018/02/13/mnist-dataset-sieci-neuronowe-czesc-2-keras-w-r/</guid><description>&lt;p&gt;Tym razem przygotujemy środowisko do pracy z Keras i rozpoznamy kilka liczb (ponownie jak poprzednio).&lt;/p&gt;&#10;&lt;h3 id="instalacja-keras"&gt;Instalacja Keras&lt;/h3&gt;&#10;&lt;p&gt;Zaczniemy od instalacji. Potrzebujemy zainstalowanego Pythona na maszynie. W unixach (w tym odcinku korzystam z serwera EC2 w AWS) nie jest to problem, pod Windowsem można zainstalować go na przykład instalując &lt;a href="https://www.anaconda.com/"&gt;Anacondę&lt;/a&gt;.&#10;Kolejny krok to przygotowanie R do pracy z Keras. Najpierw instalujemy bibliotekę &lt;code&gt;keras&lt;/code&gt;:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;install.packages&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;keras&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;a następnie sam silnik:&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-r" data-lang="r"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;library&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;keras&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#6639ba"&gt;install_keras&lt;/span&gt;&lt;span style="color:#1f2328"&gt;()&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Ta ostatnia funkcja ma trochę parametrów - między innymi odpowiedzialnych z zainstalowanie TensorFlow skompilowanego pod korzystanie z GPU (wykorzystanie kart graficznych do obliczeń - znacznie przyspiesza to cały proces, ale potrzebny jest stosowny sprzęt). Odpowiedni ich opis znajdziecie &lt;a href="https://keras.rstudio.com/reference/install_keras.html"&gt;w dokumentacji&lt;/a&gt;. Szczegółową dokumentację Keras znajdziecie na stronie &lt;a href="https://keras.io/"&gt;Keras.io&lt;/a&gt;.&#10;Proces instalacji nieco trwa za pierwszym razem, później jest już z górki. Przy instalacji na Windowsie może się coś pogryźć w Anacondzie (mi powstało drugie środowisko i trochę z tym trzeba powalczyć). Na maszynie EC2 (szczególnie t2.micro) może być okazać, że zabraknie pamięci (tak się stało dla sieci opisywanych poniżej). Rozwiązaniem jest zwiększenie wielkości tzw. &lt;em&gt;swapu&lt;/em&gt; czyli wirtualnej pamięci, która tak na prawdę jest miejscem na dysku. Znalazłem &lt;a href="https://stackoverflow.com/questions/17173972/how-do-you-add-swap-to-an-ec2-instance"&gt;odpowiednie obejście&lt;/a&gt; na niezastąpionym Stackoverflow. Stosujemy więc zwiększenie swapu, po resecie maszyny wszystko wraca do normy (chyba, że potrzebujemy pozostać przy powiększonym miejscu - odpowiednia zmiana opisana jest też na SO).&lt;/p&gt;</description></item></channel></rss>