<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Regresja on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/regresja/</link><description>Recent content in Regresja on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 20 Oct 2025 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/regresja/index.xml" rel="self" type="application/rss+xml"/><item><title>Konkretne projekty z analizy danych (jak zawsze :)</title><link>https://blog.prokulski.science/2025/10/20/konkretne-projekty-z-analizy-danych-jak-zawsze/</link><pubDate>Mon, 20 Oct 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/10/20/konkretne-projekty-z-analizy-danych-jak-zawsze/</guid><description>&lt;p&gt;W dzisiejszym wydaniu skupiamy się na praktycznych rozwiązaniach dla każdego etapu pracy z danymi - od modelowania i inżynierii cech przez optymalizację baz danych, aż po wdrażanie w produkcji.&lt;/p&gt;&#10;&lt;p&gt;Czeka Cię porównanie modeli predykcyjnych (typowe zadanie dla juniorów - wytłumaczone krok po kroku) i nowe możliwości DuckDB, które zastępują całe pipeline&amp;rsquo;y w Pandas. Znajdziesz też wyzwania związane z architekturą: jak budować skalowalne systemy danych od podstaw oraz gdzie naprawdę powinny znaleźć się kontrakty danych. Dla miłośników LLMów jest przewodnik po LangChain oraz LangGraph, praktyczną instrukcję budowy lokalnego systemu RAG oraz analizę gotowości &lt;em&gt;foundation models&lt;/em&gt; do pracy z danymi tabelarycznymi.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-09</title><link>https://blog.prokulski.science/2025/06/09/newsletter-dane-i-analizy-2025-06-09/</link><pubDate>Mon, 09 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/09/newsletter-dane-i-analizy-2025-06-09/</guid><description>&lt;p&gt;Dzisiaj momentami jest grubo - na przykład matematyczna elegancja B-spline&amp;rsquo;ów. Ale jest też trochę praktyki w DuckDB. Jeśli myślisz, że świat danych to tylko nudne CSVki i niekończące się ETLe, ten numer (mam nadzieję) przekona Cię, że to naprawdę fascynująca dziedzina pełna niespodzianek.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie polecam zwrócić uwagę na historię firmya Tencent Music, która oszczędziła 80% kosztów przenosząc się z Elasticsearch na Apache Doris - to jeden z tych przypadków, gdy zmiana architektury naprawdę się opłaca. Z kolei dla miłośników optymalizacji opowieść o tym, jak Python API można przyspieszyć 10x bez przepisywania na Go czy Rust - czasem wystarczy po prostu dobrze pomyśleć!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-06-02</title><link>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</link><pubDate>Mon, 02 Jun 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/06/02/newsletter-dane-i-analizy-2025-06-02/</guid><description>&lt;p&gt;Ten tydzień przyniósł interesującą mieszankę praktycznych rozwiązań i technologicznych rewolucji. Od monitorowania nocnych maratonów chomików (to ta rewolucja, wiadomo) po architekturę Apache Spark - branża pokazuje, że innowacja kryje się w każdym zakątku.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie ciekawy jest trend odchodzenia od tradycyjnych rozwiązań na rzecz nowoczesnych alternatyw. Na przykład zamiast odpalać joby w cronie można wykorzystać Change Data Capture (CDC), a API-first podejście staje się standardem dla 74% zespołów. Apache Iceberg wygra wojnę formatów tabel, a FastAPI udowadnia, że Python może być równie wydajny co elegancki.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-23</title><link>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</link><pubDate>Mon, 23 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/23/newsletter-dane-i-analizy-2023-10-23/</guid><description>&lt;p&gt;Lubię DuckDB i lubię AirFlow. Kafka jest naturalnym sposobem na przesyłanie danych między systemami czy też mikroserwisami. Stąd też dzisiaj kilka tekstów zahaczających o te wszystkie technologie.&lt;/p&gt;&#10;&lt;p&gt;Dodatkowo trochę z obszaru zarządzania - zarówno opis typowego projektu data science jak i metryka opisująca stabilność kolejki prac.&lt;/p&gt;&#10;&lt;p&gt;No i trochę o mapkach, bo mapki są fajne.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-softmax-regression-for-multi-class-label-with-python-782a34283894"&gt;&lt;strong&gt;Fully Explained Softmax Regression for Multi-Class Label with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Klasyfikacja do wielu klas - o co tutaj chodzi? Przewodnik dla początkujących&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-29</title><link>https://blog.prokulski.science/2023/05/29/newsletter-dane-i-analizy-2023-05-29/</link><pubDate>Mon, 29 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/29/newsletter-dane-i-analizy-2023-05-29/</guid><description>&lt;p&gt;Dość przekrojowo dzisiaj.&lt;/p&gt;&#10;&lt;p&gt;Najciekasze według mnie tekstu to ten o sensownym nadawaniu gwiazdek produktom (ile razy filtrowaliście produkty w sklepie internetowym przed kupnem po najlepszej ocenie i okazywało się, że z &amp;ldquo;piątką&amp;rdquo; jest tylko jeden?), ten o SoftMax (nie przeraź się równaniami na początku, chociaż może podstawy matematyczne są akutat dla Ciebie cenne?).&lt;/p&gt;&#10;&lt;p&gt;Bardzo dajny jest też dział Python - od rzeczy prostych typu wiele wykresów na jednym obrazku do modelu (no&amp;hellip;) informującego o tym że akcje należy kupić albo sprzedać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-13</title><link>https://blog.prokulski.science/2023/02/13/newsletter-dane-i-analizy-2023-02-13/</link><pubDate>Mon, 13 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/13/newsletter-dane-i-analizy-2023-02-13/</guid><description>&lt;p&gt;Tak się zdarzyło, że w dzisiejszym newsletterze wiodącą rolę mają tematy związane z wdrożeniami i utrzymaniem rozwiązań przetwarzających dane. Mamy więc tekst o kubefow, budowaniu struktur bazodanowych albo integracji kilku technologii (i jak zrobić to w domu). Dla inżynierów zajmujących się takimi zagadnieniami konsola CLI nie jest pewnie obca, więc i dla nich coś - mam nadzieję - interesującego się znajdzie.&lt;/p&gt;&#10;&lt;p&gt;Bardzo ciekawy jest tekst o podejściu do autoryzacji z punktu widzenia UX. Ostatnio miałem okazję szukać i rezerwować lokum na weekend w serwisie Airbnb. Nie pamiętałem hasła, a po kilku próbach serwis po prostu przysłał mi maila z linkiem dzięki któremu od razu byłem zalogowany. Czy to bezpieczne czy nie - nie określajmy. Ale jakże wygodne!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-30</title><link>https://blog.prokulski.science/2023/01/30/newsletter-dane-i-analizy-2023-01-30/</link><pubDate>Mon, 30 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/30/newsletter-dane-i-analizy-2023-01-30/</guid><description>&lt;p&gt;Dzisiaj na początek trochę o orkiestracji za pomocą Apache Airflow. Zobaczymy co potrafi to narzędzie w zakresie sterowania pobieraniem danych i jak sprawuje się na produkcji.&lt;/p&gt;&#10;&lt;p&gt;A jak już mamy pobrane dane to możemy z nimi coś zrobić korzystając z jednej z bibliotek pythonowych. Albo policzyć jakieś modele i z ich pomocą przeanalizować na przykład klientów i ich drogę przez koszyk zakupowy.&lt;/p&gt;&#10;&lt;p&gt;W sumie - u laików - synonimem słowa &amp;ldquo;model&amp;rdquo; jest &amp;ldquo;sztuczna inteligencja&amp;rdquo;. A jak sztuczna inteligencja to może od razu ChatGPT (z którego już dzieciaki korzystają żeby pisać prace domowe)?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-28</title><link>https://blog.prokulski.science/2022/02/28/newsletter-dane-i-analizy-2022-02-28/</link><pubDate>Mon, 28 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/28/newsletter-dane-i-analizy-2022-02-28/</guid><description>&lt;p&gt;Po raz drugi Dane i Analizy są patronem medialnym &lt;strong&gt;CuValley Hack&lt;/strong&gt;. To też druga edycja tego hackathonu, który organizowany jest przez #KGHM w ramach programu #DolinaMiedziowa.&lt;/p&gt;&#10;&lt;p&gt;Impreza startuje &lt;strong&gt;11 marca&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cuvalley.com"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/cuvalley_900x500.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Hackathon zrzesza otwarte umysły i pomysłowych specjalistów, którzy chcą tworzyć innowacyjne projekty dla polskiej miedzi. Uczestnicy skupią się na analizie danych oraz wykorzystaniu #AI, #MachineLearning czy #BigData w układach automatyki przemysłowej. Co Was czeka?&lt;br&gt;&#10;3 zadania, w których do wygrania wysokie nagrody pieniężne 40 godzin kodowania i networking na kanale Slack tysiące dostępnych danych webinary, Keynote Speakerzy, porządna dawka wiedzy i inspiracji!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-28</title><link>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</link><pubDate>Mon, 28 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</guid><description>&lt;p&gt;&lt;a href="https://erdavis.com/2021/06/26/average-colors-of-the-world/"&gt;&lt;strong&gt;Average colors of the world&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;I wrote that I wanted to expand creatively beyond maps in 2021, but here we are, halfway in, and half my posts are maps. In my defense, I made these last year and just haven’t gotten around to posting them yet! They’ve been sitting in a folder since December, mocking me. It’s time to get […]&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/4-tricks-to-use-python-f-strings-more-efficiently-4f389e890514?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;4 Tricks to Use Python F-strings More Efficiently&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Have full control over what you print out. String interpolation is a way to embed variables into strings. It makes it easy to manipulate and enrich strings. Thus, the print statements are much more powerful with string interpolation. Formatted string literals, also known as f-strings, are a highly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-21</title><link>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</link><pubDate>Mon, 21 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</guid><description>&lt;p&gt;&lt;a href="https://jellyfish.tech/implementation-of-common-design-patterns-in-python/"&gt;&lt;strong&gt;Implementation of Top Design Patterns in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;*according to developer &amp;amp; software architect with 9+ years of experience&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/a-hands-on-demo-of-analyzing-big-data-with-spark-68cb6600a295?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A hands-on demo of analyzing big data with Spark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Scan a novel, calculate pi, and run regression on 50 million rows Conclusions This post was a deep dive on using Spark to process big data. We started with an overview of distributed computing before counting the frequency of each letter in Dostoyevsky’s War and Peace , estimating π with randomly (&amp;hellip;)&lt;/p&gt;</description></item></channel></rss>