<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Klasyfikacja on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/klasyfikacja/</link><description>Recent content in Klasyfikacja on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 17 Nov 2025 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/klasyfikacja/index.xml" rel="self" type="application/rss+xml"/><item><title>Agenci AI, data engineering i fine-tuning LLM</title><link>https://blog.prokulski.science/2025/11/17/agenci-ai-data-engineering-i-fine-tuning-llm/</link><pubDate>Mon, 17 Nov 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/11/17/agenci-ai-data-engineering-i-fine-tuning-llm/</guid><description>&lt;p&gt;W dzisiejszym wydaniu koncentrujemy się na praktycznych aspektach pracy z danymi i sztuczną inteligencją (co nie jest niczym nowym dla stałych czytelników newslettera; a nowych - serdecznie witam!).&lt;br&gt;&#10;Znajdziesz tu kompleksowe tutoriale budowy agentów AI z LangChain, przewodniki po fine-tuningu modeli językowych metodą QLoRA oraz zaawansowane techniki pracy z PostgreSQL i jego rozszerzeniami.&lt;/p&gt;&#10;&lt;p&gt;Szczególną uwagę poświęcamy inżynierii danych: od strategii inkrementalnego ładowania i projektowania idempotentnych pipeline&amp;rsquo;ów, przez real-time CDC z Debezium i Kafką, aż po nowoczesne podejście lakehouse z DuckDB.&lt;br&gt;&#10;Nie zabrakło również głębokiej analizy matematyki stojącej za zero-shot learning, przeglądu metryk klasyfikacyjnych oraz praktycznych rozwiązań dla systemów rozproszonych, jak predykcyjne autoskalowanie Apache Flink.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-25</title><link>https://blog.prokulski.science/2024/11/25/newsletter-dane-i-analizy-2024-11-25/</link><pubDate>Mon, 25 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/25/newsletter-dane-i-analizy-2024-11-25/</guid><description>&lt;p&gt;Nieco o LLMach dzisiaj - o przygotowywaniu danych (z PDFów) oraz o poszukiwaniu modelu, który można uruchomić lokalnie. Ponieważ LLMy od dwóch lat są znaczącym tematem - mają swoją sekcję i właśnie tam możecie zajrzeć.&lt;/p&gt;&#10;&lt;p&gt;A jeśli wolisz sobie skonfigurować VSCode do pracy z Pythonem to &lt;a href="https://www.youtube.com/watch?v=PwGKhvqJCQM"&gt;Arjan pomoże&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.kdnuggets.com/implement-named-entity-recognition-with-hugging-face-transformers"&gt;&lt;strong&gt;How to Implement Named Entity Recognition with Hugging Face Transformers&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie nazwanych jednostek (NER) to podstawowe zadanie przetwarzania języka naturalnego (NLP), obejmujące identyfikację i klasyfikację nazwanych jednostek w tekście do wstępnie zdefiniowanych kategorii. Kategoriami tymi mogą być nazwiska osób, organizacje, lokalizacje, daty i inne. Zobaczmy, jak można przeprowadzić NER, wykorzystując Transformers od Hugging Face&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-08-26</title><link>https://blog.prokulski.science/2024/08/26/newsletter-dane-i-analizy-2024-08-26/</link><pubDate>Mon, 26 Aug 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/08/26/newsletter-dane-i-analizy-2024-08-26/</guid><description>&lt;p&gt;Poniżej znajdziecie tekst opisujący Ghostbuster - narzędzie do wykrywania czy tekst został napisany przez AI. Dawno temu &lt;a href="../../2017/06/30/kto-napisal-te-ksiazke/"&gt;na blogu napisałem&lt;/a&gt; (kod jeszcze w R) coś w dużej mierze podobnego, ale tam celem było przyporządkowanie autora (jednego z dwóch) do tekstu. W banalny sposób, oparty jedynie na statystyce. Przeczytaj artykuł o Ghostbuster i zobacz jak zmieniło się to na przestrzeni lat (mój tekst ma 7 lat!)&amp;hellip; W podobnym czasie na Kaggle był konkurs &lt;a href="https://www.kaggle.com/competitions/spooky-author-identification"&gt;Spooky Author Identification&lt;/a&gt; - o wiele krótsze teksty, a w najnowszych &lt;a href="https://www.kaggle.com/competitions/spooky-author-identification/code"&gt;rozwiązaniach&lt;/a&gt; pojawiają się transformery.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-07-08</title><link>https://blog.prokulski.science/2024/07/08/newsletter-dane-i-analizy-2024-07-08/</link><pubDate>Mon, 08 Jul 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/07/08/newsletter-dane-i-analizy-2024-07-08/</guid><description>&lt;p&gt;Zbieranie i magazynowanie danych - to typowe projekty, którymi zajmują się inżynierowie danych. Ale obszar data engineeringu jest na tyle obszerny, że co tydzień właściwie coś tutaj możecie znaleźć. Dzisiaj dwa takie projekty-tutoriale: zbieranie informacji z YouTube oraz ogólnie z jakiegoś strumienia danych. W obu przypadkach używane są różne technologie.&lt;/p&gt;&#10;&lt;p&gt;A jak już mamy te dane, to kto powinien się zająć ich obróbką na &amp;ldquo;ostatniej mili&amp;rdquo; - baza czy kod? O tym też dzisiaj przeczytacie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-10</title><link>https://blog.prokulski.science/2024/06/10/newsletter-dane-i-analizy-2024-06-10/</link><pubDate>Mon, 10 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/10/newsletter-dane-i-analizy-2024-06-10/</guid><description>&lt;p&gt;Dzisiaj dwa ciekawe teksty o technikach OSINTowych - czyli jak z publicznie dostępnych informacji dotrzeć do czegoś więcej. Na przykład do informacji &lt;a href="https://frontstory.pl/penthouse-daniel-obajtek-budapeszt-orlen/"&gt;gdzie ktoś faktycznie jest&lt;/a&gt; (chociaż mówi inaczej) co jest nieco zabawą podobną do serwisu &lt;a href="https://www.geoguessr.com/pl"&gt;GeoGuesser&lt;/a&gt; (interesująca zabawa, zacznij od map ze znanej Ci okolicy) - na przykładzie &lt;a href="https://zaufanatrzeciastrona.pl/post/na-tropie-szmydta-czyli-jak-znalezc-bialoruskiego-szpiega/"&gt;szpiegów&lt;/a&gt;. Może jeszcze na dokładkę coś &lt;a href="https://devszczepaniak.pl/osint-pozyskiwanie-informacji-z-wykorzystaniem-map/"&gt;o szukaniu informacji z wykorzystaniem map&lt;/a&gt;?&lt;br&gt;&#10;Tyle o szukaniu. A o ukrywaniu? No na przykład &lt;a href="https://bishopfox.com/blog/unredacter-tool-never-pixelation"&gt;pikselowanie tekstu&lt;/a&gt; na obrazkach umieszczanych w sieci nie ma większego sensu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-05-20</title><link>https://blog.prokulski.science/2024/05/20/newsletter-dane-i-analizy-2024-05-20/</link><pubDate>Mon, 20 May 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/05/20/newsletter-dane-i-analizy-2024-05-20/</guid><description>&lt;p&gt;Dzisiaj w sekcji poświęconej językowi R mamy tekst, w którym w atrakcyjny, animowany sposób pokazano kilka podstawowych operacji na ramkach danych (albo jak kto woli - tabelkach, np. w bazie danych). Jeśli nie wiesz jak działają operacje grupowania, agregacji czy łączenia danych - po tych przykładach nie powinno być z tym problemu.&lt;/p&gt;&#10;&lt;p&gt;Jeśli już przy bazach danych jesteśmy - powraca DuckDB, bo to jest cudo. Tym razem m.in. porównanie ze Sparkiem.&lt;br&gt;&#10;Od Sparka niedaleko zaś do ogólnie pojętego big data - w tej sekcji kompletny przewodnik jak zbudować cały zestaw do strumieniowego przetwarzania danych: czyli pełne środowisko zawierające Kafkę, Schema Registry, Kafka Connect, ksql i co tam jeszcze wokoło potrzebne.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-11</title><link>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</link><pubDate>Mon, 11 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</guid><description>&lt;p&gt;Miniony tydzień to uruchomienie nowej wersji asysstenta AI od Google, czyli Gemini (w miejsce Barda). Sam model mówi o sobie, że &lt;em&gt;&amp;ldquo;jestem zarówno Bardem, jak i Gemini. Bard to nazwa użytkownika, którą wykorzystuję do interakcji z użytkownikami, podczas gdy Gemini to nazwa platformy AI, na której jestem oparty&amp;rdquo;&lt;/em&gt;.&lt;br&gt;&#10;&lt;a href="https://deepmind.google/technologies/gemini/#introduction"&gt;Przedstawienie projektu&lt;/a&gt; (przez twórców) mówi o lepszych wynikach od ChataGPT v4 w prawie każdym mierniku., ale niby ma to dostęp do najnowszej wiedzy, ale jednak &lt;a href="https://g.co/bard/share/c0633f7cd6ac"&gt;taki sobie&lt;/a&gt;. Z literaturą nieco starszą radzi sobie&amp;hellip; &lt;a href="https://g.co/bard/share/21dc6e2f9212"&gt;sami zobaczcie&lt;/a&gt;. Słowacki i &amp;ldquo;Wesele&amp;rdquo;? to mogłoby być ciekawe, ale wolę wersję Wyspiańskiego (a filmową od Wajdy stawiam tuż za wajdowską &amp;ldquo;Ziemią obiecaną&amp;rdquo;). Czyli też zmyśla.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-11</title><link>https://blog.prokulski.science/2023/09/11/newsletter-dane-i-analizy-2023-09-11/</link><pubDate>Mon, 11 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/11/newsletter-dane-i-analizy-2023-09-11/</guid><description>&lt;p&gt;Dzisiaj sporo materiałów wideo. Od prostych przewodników po kilkanaście minut (z czego &amp;ldquo;mięso&amp;rdquo; zajmuje do 5-10, a i to najwyżej) do dużego kursu na półtorej godziny. Trochę też o budowaniu czy może raczej ulepszaniu swojego środowiska pracy. Czy to w Linuxie czy to w VSCode. Ciekawostka, szok i niedowierzanie: oba te &amp;ldquo;zakresy tematyczne&amp;rdquo; (poprawa wygody pracy i wideo) mają części wspólne!&lt;/p&gt;&#10;&lt;p&gt;Dla tych którzy wierzą w &lt;a href="https://pl.wikipedia.org/wiki/Smugi_chemiczne"&gt;chemtrails&lt;/a&gt; też coś mamy ;-) a z całego tekstu, który znajdziecie niżej najlepszy i tak zawsze jest gotowy &lt;a href="https://www.kaggle.com/code/mnokno/getting-started-eda-model-train-submit"&gt;notebook z kodem&lt;/a&gt; (znowu Torch a nie TensorFlow - coś jest na rzeczy, prawda?)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-12</title><link>https://blog.prokulski.science/2023/06/12/newsletter-dane-i-analizy-2023-06-12/</link><pubDate>Mon, 12 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/12/newsletter-dane-i-analizy-2023-06-12/</guid><description>&lt;p&gt;Piękna, słoneczna (przynajmniej ma Mazurach i w Warszawie) pogoda w &amp;ldquo;długi weekend&amp;rdquo; pozwoliła (mam nadzięję) na trochę wytchnienia od komputerów, programowania, budowania modeli i tworzenia sztucznych inteligencji. Po odpoczynku można do tego wrócić :)&lt;/p&gt;&#10;&lt;p&gt;A właśnie - budowanie większości modeli ML/AI sprowadza się do kilku podstawowych i powtarzalnych etapów:&lt;br&gt;&#10;gromadzenie danych przegląd danych i ich wzajemnych zależności czyszczenie i uzupełnianie braków dobór hiperparametrów do modelu trenowanie modelu ocena jego jakości użycie modelu na nowych danych&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-15</title><link>https://blog.prokulski.science/2023/05/15/newsletter-dane-i-analizy-2023-05-15/</link><pubDate>Mon, 15 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/15/newsletter-dane-i-analizy-2023-05-15/</guid><description>&lt;p&gt;Wielokrotnie w newsletterze znalazły się teksty mówiące o wykorzystaniu Snowflake, BigQuery czy Databricks. Dzisiaj przyszedł jednak czas na szybkie wprowadzenie do tych narzędzi - jak zacząć z nich korzystać? Jak stworzyć konto, jak załadować pierwsze dane?&lt;/p&gt;&#10;&lt;p&gt;A wiecie, że narzędzia Microsoftu - na przykład Excel (poprzez VBA) czy też PowerBI potrafią współpracować z zewnętrznymi skryptami napisanymi w Pythonie albo R? Jeśli nie, to poniżej znajdziecie przykłady takiej współpracy. Swoją drogą - pewnie już ze dwa lata mija od plotek o wprowadzeniu Pythona do Excela&amp;hellip; ale coś nie widać zmiany.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-05-08</title><link>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</link><pubDate>Mon, 08 May 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/05/08/newsletter-dane-i-analizy-2023-05-08/</guid><description>&lt;p&gt;Majówka, majówka i po majówce. Wypoczęci? Ja zwiedziłem z rodziną Trójmiasto, jestem zadowolony i o to właściwie w wypoczynku chodzi. Tylko dlaczego tak wieje nad morzem?&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym odcinku zaś szczególnie polecam książkę Françoisa Fleureta &lt;a href="https://fleuret.org/francois/"&gt;&lt;strong&gt;The Little Book of Deep Learning&lt;/strong&gt;&lt;/a&gt; - sporo teorii o tym jak działa głębokie uczenie, różne typy warstw i w ogóle na czym ta cała sztuczna inteligencja polega. Książka wygląda na przyciętą formatem do ekranu telefonu - przyznam, że to interesujący pomysł (ale już go znamy z chociażby [reklama] &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;Kart Data Science&lt;/strong&gt;&lt;/a&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-04-17</title><link>https://blog.prokulski.science/2023/04/10/newsletter-dane-i-analizy-2023-04-17/</link><pubDate>Mon, 10 Apr 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/04/10/newsletter-dane-i-analizy-2023-04-17/</guid><description>&lt;p&gt;&lt;a href="https://www.facebook.com/michal.jaskolski/posts/10159695720393003"&gt;&lt;strong&gt;Mój stary to fanatyk sztucznej inteligencji.&lt;/strong&gt;&lt;/a&gt;. Kto zna to zna, Michał przygotował (z użyciem AI) przeróbkę znanej copy-pasty Malcolma XD.&lt;br&gt;&#10;Ponieważ ChatGPT tak mocno rządzi w mediach ostatnio, dzisiaj specjalna sekcja na ten temat.&lt;/p&gt;&#10;&lt;p&gt;W tej dedykowanej sekcji przedstawiam więc kilka inspirujących tekstów, które pokazują drogę od tego w czym i jak ChatGPT może pomóc, do konkretnych rozwiązań zastępujących na przykład StackOverflow, aby na koniec pokazać jak wykorzystać API przygotowane przez OpenAI z poziomu kodu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-03-20</title><link>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</link><pubDate>Mon, 20 Mar 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/03/20/newsletter-dane-i-analizy-2023-03-20/</guid><description>&lt;p&gt;Wiecie kto generuje najwięcej ruchu w internecie? Kiedyś to było porno i torrenty (albo inne sposoby wymiany plików peer-to-peer). Teraz układ wygląda jak na poniższym obrazku, przynajmniej według danych &lt;a href="https://www.statista.com/chart/15692/distribution-of-global-downstream-traffic/"&gt;opublikowanych&lt;/a&gt; przez serwis Statista.&lt;/p&gt;&#10;&lt;p&gt;&lt;img src="https://prokulski.science/temp/static/nlt/global_internet_traffic.jpeg" alt=""&gt;&lt;/p&gt;&#10;&lt;p&gt;Dzisiaj bardzo dużo treści - oraz eksperyment - polskie tytuły (ale przeważnie angielskie teksty). Wśród tych tekstów sporo o Apache Spark i konkretnych wykorzystaniach albo rozwiązaniach konkretnych problemów.&lt;br&gt;&#10;Znajdziecie też kilka fajnych tekstów o różnego typu problemach rozwiązywanych przez analizę czy modele danych (rekomendacje w Netflixie, OHE i Pandas), gorąco polecam tekst o Apache Arrow.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-06</title><link>https://blog.prokulski.science/2023/02/06/newsletter-dane-i-analizy-2023-02-06/</link><pubDate>Mon, 06 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/06/newsletter-dane-i-analizy-2023-02-06/</guid><description>&lt;p&gt;Dzisiaj nieco zagadnień teoretycznych. Dobór odpowiedniego rozkładu do istniejących danych, metody tropienia ile tak na prawdę mamy &amp;ldquo;klastrów&amp;rdquo; (grup) w danych.&lt;/p&gt;&#10;&lt;p&gt;Sporo też o GPT-3, a raczej jego wykorzystaniu w różny sposób (od pisania książek do pisania&amp;hellip; rozszerzeń do Chrome). Niespodziewanie dzisiaj rozrósł się dział dedykowany Apache Kafka.&lt;/p&gt;&#10;&lt;p&gt;Na koniec coś o wizualizacji, na przykład szpilki pokazujące gdzie mieszkają ludzie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://machinelearningmastery.com/building-a-multiclass-classification-model-in-pytorch/"&gt;&lt;strong&gt;Building a Multiclass Classification Model in PyTorch&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PyTorch zdobywa rynek AI spychając w cień TensorFlow. Jeśli więc zamierzasz się przesiadać - ten tutorial o prostej klasyfikacji może się przydać&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-09</title><link>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</link><pubDate>Mon, 09 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</guid><description>&lt;p&gt;W pierwszym pełnym tygodniu nowego roku wracamy ze standardowym zestawem materiałów.&lt;/p&gt;&#10;&lt;p&gt;Jest więc coś o machine learningu (dobry jest tekst o YOLOv5, przede wszystkim pokazujący że nie tylko TensorFlow obowiązuje w domenie deep learning), sporo ciekawostek ocierających się o NLP i analizę tekstu. Jest gotowy przepis na pobieranie danych z Kafki i zapisywanie w Mongo.&lt;/p&gt;&#10;&lt;p&gt;Na koniec zapraszam na &lt;a href="https://cuvalley.com/?utm_source=dia_newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;&lt;strong&gt;CuValley Hack&lt;/strong&gt;&lt;/a&gt;! To trzecia edycja hackathonu organizowanego przez KGHM w ramach programu &lt;em&gt;Dolina Miedziowa&lt;/em&gt;. To przyznam szczerze spełnienie mojej idei hackathonu: dane wprost z przemysłu i konkretne problemy (zobacz na stronie jakie są zadania) do rozwiązania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-10</title><link>https://blog.prokulski.science/2022/10/10/newsletter-dane-i-analizy-2022-10-10/</link><pubDate>Mon, 10 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/10/newsletter-dane-i-analizy-2022-10-10/</guid><description>&lt;p&gt;Dzisiaj prawdziwa bomba na początek - szczegółowy esej na temat wykorzystania uczenia maszynowego na rynku akcji. Tekst obejmuje projekt systemu, który konsekwentnie pokonywał S&amp;amp;P 500, dopóki nie został zamknięty w lipcu 2022 roku. Jest tu wiele, w tym dyskusja na temat dynamiki rynku, podejścia do modelowania, stosu technologicznego, inżynierii funkcji, pipeline ML i nie tylko. Czyta się długo, ale warto! &lt;a href="https://principiamundi.com/posts/didact-anatomy/"&gt;&lt;strong&gt;Didact AI: The anatomy of an ML-powered stock picking engine&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Poza tym sporo dzisiaj materiałów o przetwarzaniu tekstu (na róźnym poziomie zaawansowania), kilka &lt;em&gt;przydasiów&lt;/em&gt; do Apache Kafka, nauka SQLAlchemy (czyli &lt;em&gt;jak w Pythonie gadać z bazami danych&lt;/em&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-22</title><link>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</link><pubDate>Mon, 22 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/22/newsletter-dane-i-analizy-2022-08-22/</guid><description>&lt;p&gt;Czy mniejsza liczba artykułów (nie wiem czy to zauważalne&amp;hellip;) to dla Was lepiej czy gorzej? Przeczytacie w związku z tym więcej (wszystkie?) czy tak samo jak zwykle 2-3, a reszta to nuda?&lt;/p&gt;&#10;&lt;p&gt;Dzisiejszy numer to nieco eksperyment ale - przyznajmy to szczerze - wynik sezonu wakacyjnego. Oj ciężko się zebrać do roboty, ciężko&amp;hellip;&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://mlu-explain.github.io/"&gt;&lt;strong&gt;MLU-Explain&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak działają lasy losowe? Co to jest krzywa ROC i AUC? Jeśli nie wiesz to ten serwis w przystępny, graficzny sposób pomoże to zrozumieć&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-18</title><link>https://blog.prokulski.science/2022/07/18/newsletter-dane-i-analizy-2022-07-18/</link><pubDate>Mon, 18 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/18/newsletter-dane-i-analizy-2022-07-18/</guid><description>&lt;p&gt;W tym tygodniu sporo materiałów związanych z przygotowywaniem modelu danych w bazie - to istotne zagadnienie, warto się chociaż trochę w temacie orientować jeśli projektujemy coś co ma dane przechować (i potem je przekazać dalej albo przekształcić).&lt;/p&gt;&#10;&lt;p&gt;Tak też wyszło, że zebrało się kilka zagadnień związanych z przetwarzaniem tekstu w Pythonie oraz przetwarzaniem (np. poprzez OCR) całych dokumentów.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ml-prediction-on-streaming-data-using-kafka-streams-1e4ebd21008"&gt;&lt;strong&gt;ML prediction on streaming data using Kafka Streams&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Najsmaczniejsze kąski w przetwarzaniu danych w czasie rzeczywistym są właśnie takie - jest strumień danych, na nim działają jakieś modele machine learningowe i o czymś decydują. Tutaj dowiesz się jak to zbudować w kilku krokach&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-25</title><link>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</link><pubDate>Mon, 25 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</guid><description>&lt;p&gt;Dzisiaj zapraszam na duży pakiet związany z Apache Spark - od instalacji, poprzez stosunkowo mało zaawansowane tutoriale, a na debugowaniu i optymalizacji zapytań skończywszy.&lt;/p&gt;&#10;&lt;p&gt;Standardowo jest też trochę Pythona (na przykład świetny kurs spaCy - ale to fani &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;a Dane i Analizy&lt;/a&gt; już znają czy też coś o wzorcach projektowych albo aplikacjach wielowątkowych), a w części &amp;ldquo;analiza danych&amp;rdquo; dość przekrojowe zagadnienia (np. &lt;em&gt;computer vision&lt;/em&gt; bez sieci neuronowych - dość sprytne podejście do tematu zajętych miejsc parkingowych).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-04</title><link>https://blog.prokulski.science/2022/04/04/newsletter-dane-i-analizy-2022-04-04/</link><pubDate>Mon, 04 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/04/newsletter-dane-i-analizy-2022-04-04/</guid><description>&lt;p&gt;Dzisiaj skupiamy się na Kafce i innych kolejkach (MQTT, Redis). Trochę też o długu technologicznym (i nie tylko) oraz wytłumaczenie o co chodzi z tymi &lt;em&gt;@property&lt;/em&gt; czy &lt;em&gt;@staticmethod&lt;/em&gt; w Pythonie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/machine-learning-pipeline-with-ploomber-pycaret-and-mlflow-db6e76ee8a10"&gt;&lt;strong&gt;Machine Learning Pipeline with Ploomber, PyCaret and MLFlow&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Cały &amp;ldquo;rurociąg&amp;rdquo; związany z uczeniem maszynowym, od początku do końca, od czyszczenia danychy do uczenia modeli&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/machine-learning-rules-of-thumb-b50232b4b2f8"&gt;&lt;strong&gt;Machine Learning Rules of Thumb&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Po co wymyślać koło od początku skoro jest kilka dobrych i sprawdzonych sposobów na pierwsze kroki w przygotowywaniu modelu ML?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-07</title><link>https://blog.prokulski.science/2022/03/07/newsletter-dane-i-analizy-2022-03-07/</link><pubDate>Mon, 07 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/07/newsletter-dane-i-analizy-2022-03-07/</guid><description>&lt;p&gt;Dzisiaj świetne teksty o feature selection czy projektowaniu i rozwijaniu API. O API to nawet komiks mamy :)&lt;/p&gt;&#10;&lt;p&gt;Przypominam też, że za chwilę (11 marca) startuje &lt;strong&gt;CuValley Hack&lt;/strong&gt; - hackathon, który organizowany jest przez #KGHM w ramach programu #DolinaMiedziowa.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cuvalley.com"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/cuvalley_900x500.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Uczestnicy skupią się na analizie danych oraz wykorzystaniu AI/ML w układach automatyki przemysłowej. Co Was czeka?&lt;br&gt;&#10;3 zadania i 120 000 PLN do wygrania! 40h kodowania tysiące dostępnych danych webinary, Keynote Speakerzy i duża dawka wiedzy&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-28</title><link>https://blog.prokulski.science/2022/02/28/newsletter-dane-i-analizy-2022-02-28/</link><pubDate>Mon, 28 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/28/newsletter-dane-i-analizy-2022-02-28/</guid><description>&lt;p&gt;Po raz drugi Dane i Analizy są patronem medialnym &lt;strong&gt;CuValley Hack&lt;/strong&gt;. To też druga edycja tego hackathonu, który organizowany jest przez #KGHM w ramach programu #DolinaMiedziowa.&lt;/p&gt;&#10;&lt;p&gt;Impreza startuje &lt;strong&gt;11 marca&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cuvalley.com"&gt;&lt;img src="https://prokulski.science/temp/static/nlt/cuvalley_900x500.jpg" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;Hackathon zrzesza otwarte umysły i pomysłowych specjalistów, którzy chcą tworzyć innowacyjne projekty dla polskiej miedzi. Uczestnicy skupią się na analizie danych oraz wykorzystaniu #AI, #MachineLearning czy #BigData w układach automatyki przemysłowej. Co Was czeka?&lt;br&gt;&#10;3 zadania, w których do wygrania wysokie nagrody pieniężne 40 godzin kodowania i networking na kanale Slack tysiące dostępnych danych webinary, Keynote Speakerzy, porządna dawka wiedzy i inspiracji!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-21</title><link>https://blog.prokulski.science/2022/02/21/newsletter-dane-i-analizy-2022-02-21/</link><pubDate>Mon, 21 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/21/newsletter-dane-i-analizy-2022-02-21/</guid><description>&lt;p&gt;Dzisiaj sporo rzeczy związanych z Wordle - bo to jest świetny poligon doświadczalny na analizę danych i kombinatorykę, ale też ciekawe są wyniki tego jak ludzie grają w tę grę (poniżej link do artykułu na ten temat).&lt;/p&gt;&#10;&lt;p&gt;Świetny jest też tekst Maćka &lt;a href="https://wiadrodanych.pl/bazy-danych/elasticsearch/jak-wykryc-phishing/"&gt;Jak wykryć phishing&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Dla początkujących adeptów Pythona kilka solidnych podstaw - warto prześledzić wszystko z dzisiejszej sekcji &lt;strong&gt;#python_junior&lt;/strong&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/bentoml-create-an-ml-powered-prediction-service-in-minutes-23d135d6ca76"&gt;&lt;strong&gt;Create an ML Powered Prediction Service in Minutes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Prosty i szybki sposób na umieszczanie modeli machine learningowych na produkcji&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-10</title><link>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</link><pubDate>Mon, 10 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</guid><description>&lt;p&gt;Koniec przerw świątecznych, koniec długich weekendów, czas wracać do pracy.&lt;/p&gt;&#10;&lt;p&gt;Dla mnie osobiście rok zaczął się zabawą z Raspberry Pi i próbwaniem co to cudo potrafi. Nigdzie nie ma Raspberry Pi 4, więc zadowoliłem się na start Pi Zero. Mały, ale wariat - używam do PiHole oraz staram się podglądać co robi w nocy kot. Jak? A no tym prostym &lt;a href="https://github.com/prokulski/rasppi_motion_capture/blob/main/main.py"&gt;skryptem&lt;/a&gt; i kamerką podłączoną po USB.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/11-dimensionality-reduction-techniques-you-should-know-in-2021-dcb9500d388b"&gt;&lt;strong&gt;11 Dimensionality reduction techniques you should know in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;11 metod na redukcję rozmiarów Twoich danych. Ale zmniejszenie wielkości to nie jedyne zastosowanie - przy redukcji wymiarów często odsłaniają się ukryte informacje&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-03</title><link>https://blog.prokulski.science/2022/01/03/newsletter-dane-i-analizy-2022-01-03/</link><pubDate>Mon, 03 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/03/newsletter-dane-i-analizy-2022-01-03/</guid><description>&lt;p&gt;Dzisiaj kilka tematów &amp;ldquo;pokrytych&amp;rdquo; nie tylko jednym tekstem. Mamy więc coś o modelach BERT plus automatycznie tworzenie tekstów przez GPT-3, mamy wizualizacje danych na mapach (w R i Pythonie). Mamy też cykl, który pozwoli na napisanie bota do np. CS:GO.&lt;/p&gt;&#10;&lt;p&gt;Na blogu od dawna nie było nowego tekstu (stąd podlinkoway niżej tekst o GPT-3 ;), ale jakieś rzeczy robię i publikuję. Zwykle jest tak, że energia opada po przygotowaniu działającego kodu. Tak jest z serwowaniem obrazków przez API (przy okazji te obrazki się generują) - sami zobaczcie do &lt;a href="https://github.com/prokulski/image_api_threads"&gt;&lt;strong&gt;repozytorium&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-06</title><link>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</link><pubDate>Mon, 06 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</guid><description>&lt;p&gt;Na Mikołajki przegląd internetu pod kątem danych, ich analiz i sposobów programowania oraz wdrażania zaprogramowanych rozwiązań.&lt;br&gt;&#10;Najciekawszym dla początkujących będzie pewnie zbiór ponad 200 tekstów zgromadzonych w jednym miejscu na różne tematy związane z machine learingiem (to prawdę mówiąc trochę jak &lt;a href="https://thecleverprogrammer.com/machine-learning/"&gt;spis treści jednego bloga&lt;/a&gt;), a bardziej doświadczeni dowiedzą się jak połączyć C++ z Pythonem. Są też ciekawe teksty o R (i Shiny), co się ostatnio dość rzadko zdarzało.&lt;/p&gt;&#10;&lt;p&gt;Skoro jesteśmy przy R - w piątek (10 grudnia) zaś konferencja &lt;strong&gt;WhyR?&lt;/strong&gt; - rezerwujcie sobie czas, bo materiału sporo (co widać po zaplanowanych streamingach na YouTube). Więcej szczegółów na stronie imprezy &lt;a href="https://2021.whyr.pl/"&gt;2021.whyr.pl&lt;/a&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-11-29</title><link>https://blog.prokulski.science/2021/11/29/newsletter-dane-i-analizy-2021-11-29/</link><pubDate>Mon, 29 Nov 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/11/29/newsletter-dane-i-analizy-2021-11-29/</guid><description>&lt;p&gt;Po &lt;em&gt;testach na produkcji&lt;/em&gt; z poprzedniego tygodnia przybyło Was równo pięćdziesiąt! Dzięki za zaufanie, mam nadzieję że niniejsze wydanie &lt;a href="../../category/newsletter/?utm_source=dia_nlt&amp;amp;utm_medium=archive_link"&gt;newslettera Dane i Analizy&lt;/a&gt; (jest archiwum!) Was nie rozczaruje i pozostaniecie wiernymi czytelnikami.&lt;/p&gt;&#10;&lt;p&gt;A dzisiaj sporo materiału, na nowo pokuładanego - liczę, że taki układ ułatwi Wam poruszanie się po newsletterze i docieranie do tych najbardziej interesujących treści. Po migracji na serwis &lt;a href="https://raindrop.io"&gt;Raindrop.io&lt;/a&gt; (polecam, nie mam w tym żadnego interesu) łatwiejsze dla mnie stało się przygotowanie newslettera, w tym - co chyba najważniejsze - ręczne wybieranie materiałów i ich opisywanie.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-18</title><link>https://blog.prokulski.science/2021/10/18/newsletter-dane-i-analizy-2021-10-18/</link><pubDate>Mon, 18 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/18/newsletter-dane-i-analizy-2021-10-18/</guid><description>&lt;p&gt;&lt;a href="https://mihaisplace.blog/2021/10/03/the-state-of-web-scraping-in-2021/"&gt;&lt;strong&gt;The State Of Web Scraping in 2021 – Mihai&amp;rsquo;s Blog&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Author: Mihai Avram | Date: 10/02/2021 The area of web scraping has really expanded in the last few years, and it helps to know some of the main frameworks, protocols, and etiquette so that you can build the next awesome Web Scraping tool to revolutionize our world! Or maybe just your local neighborhood, or workgroup – that’s fine too. In this post, we will cover. What is web scraping? What are (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-10-11</title><link>https://blog.prokulski.science/2021/10/11/newsletter-dane-i-analizy-2021-10-11/</link><pubDate>Mon, 11 Oct 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/10/11/newsletter-dane-i-analizy-2021-10-11/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/top-5-time-series-analytics-71a46fbda379?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Top 5 Time Series Analytics&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Learn about the top use-cases and techniques for time-series data Time is present in most of the data around us. From retail product sales data to financial stock price, to IoT sensor data, all have a notion of time in it. So mastering time-series analytics is going to make you master of the data science world The top 5 analytics which I will demonstrate here are Seasonality Detection to find (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-09</title><link>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</link><pubDate>Mon, 09 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-08</title><link>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</link><pubDate>Sun, 08 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-28</title><link>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</link><pubDate>Mon, 28 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</guid><description>&lt;p&gt;&lt;a href="https://erdavis.com/2021/06/26/average-colors-of-the-world/"&gt;&lt;strong&gt;Average colors of the world&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;I wrote that I wanted to expand creatively beyond maps in 2021, but here we are, halfway in, and half my posts are maps. In my defense, I made these last year and just haven’t gotten around to posting them yet! They’ve been sitting in a folder since December, mocking me. It’s time to get […]&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/4-tricks-to-use-python-f-strings-more-efficiently-4f389e890514?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;4 Tricks to Use Python F-strings More Efficiently&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Have full control over what you print out. String interpolation is a way to embed variables into strings. It makes it easy to manipulate and enrich strings. Thus, the print statements are much more powerful with string interpolation. Formatted string literals, also known as f-strings, are a highly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-21</title><link>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</link><pubDate>Mon, 21 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/21/newsletter-dane-i-analizy-2021-06-21/</guid><description>&lt;p&gt;&lt;a href="https://jellyfish.tech/implementation-of-common-design-patterns-in-python/"&gt;&lt;strong&gt;Implementation of Top Design Patterns in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;*according to developer &amp;amp; software architect with 9+ years of experience&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/a-hands-on-demo-of-analyzing-big-data-with-spark-68cb6600a295?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;A hands-on demo of analyzing big data with Spark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Scan a novel, calculate pi, and run regression on 50 million rows Conclusions This post was a deep dive on using Spark to process big data. We started with an overview of distributed computing before counting the frequency of each letter in Dostoyevsky’s War and Peace , estimating π with randomly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Koła w zbożu - algorytmy klasyfikacji</title><link>https://blog.prokulski.science/2017/03/07/kola-w-zbozu/</link><pubDate>Tue, 07 Mar 2017 11:33:58 +0000</pubDate><guid>https://blog.prokulski.science/2017/03/07/kola-w-zbozu/</guid><description>&lt;p&gt;Jednym z głównych zagadnień w analizie danych jest klasyfikacja elementów do wybranych grup, na podstawie właściwości opisujących elementy. W pakiecie R i jego bibliotekach znajdziemy gotowe rozwiązania, pytanie tylko którego użyć?&#10;Zanim jednak coś poklasyfikujemy - zastanówmy się &lt;strong&gt;do czego to może być potrzebne?&lt;/strong&gt;&#10;Zastosowań jest bardzo dużo:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;zaszeregowanie gatunków roślin na podstawie parametrów typu długość liścia (bardzo popularny zestaw danych &lt;a href="https://en.wikipedia.org/wiki/Iris_flower_data_set"&gt;iris&lt;/a&gt; opisujący pąki irysów trzech odmian)&lt;/li&gt;&#10;&lt;li&gt;nieco ryzykowne - określanie czy &lt;a href="https://www.stoltzmaniac.com/random-forest-classification-of-mushrooms/"&gt;grzyb jest jadalny czy też nie&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;filtrowanie spamu na podstawie nadawcy i zawartości maila&lt;/li&gt;&#10;&lt;li&gt;określanie autora tekstu na podstawie samego tekstu (w uproszczeniu na podstawie częstości występowania słów - pojedynczych jak i zbitek wyrazów)&lt;/li&gt;&#10;&lt;li&gt;wykrywanie nadużyć w bankach lub firmach ubezpieczeniowych - tutaj ilość cech (parametrów określających np. transakcję kartą kredytową) jest ogromna&lt;/li&gt;&#10;&lt;li&gt;podział klientów sklepu na określone grupy na podstawie zawartości koszyków&lt;/li&gt;&#10;&lt;li&gt;i tak dalej, i tak dalej&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;My będziemy testować algorytmy klasyfikujące. Narysujemy sobie pięć “rozedrganych” kółek (precyzyjniej: okręgów) nachodzących na siebie (&lt;em&gt;jak generator losowy pozwoli&lt;/em&gt; :-) i później dla każdego narysowanego punktu określimy do którego kółka należy. Coś, co widać gołym &lt;em&gt;ludzkim&lt;/em&gt; okiem na obrazku nie zawsze jest takie łatwe do &lt;em&gt;zobaczenia&lt;/em&gt; dla maszyny.&#10;Post jest stricte edukacyjny, chyba niewiele ciekawych wniosków z danych tutaj wysnujemy. Chcę pokazać jakie są algorytmy (bez wchodzenia w ich szczegóły - klikaj w linki jeśli chcesz zgłębić wiedzę) i jak w najprostszej wersji użyć ich w R.&#10;Jeśli Cię to trochę zniechęciło, to skroluj dalej, pooglądaj kolorowe okręgi. I to bez wychodzenia na pole (w sensie “w zboże”)!&#10;Zaczynamy od przygotowania kółek. Danych.&lt;/p&gt;</description></item></channel></rss>