<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>NLP on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/nlp/</link><description>Recent content in NLP on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 18 May 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/nlp/index.xml" rel="self" type="application/rss+xml"/><item><title>AI agenci, nudny backend i polskie głosy o architekturze hexagonalnej</title><link>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</link><pubDate>Mon, 18 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/18/ai-agenci-nudny-backend-i-polskie-glosy-o-architekturze-hexagonalnej/</guid><description>&lt;p&gt;W tym wydaniu obserwujemy wyraźny trend profesjonalizacji narzędzi AI oraz powrotu do sprawdzonych, &amp;ldquo;nudnych&amp;rdquo; technologii.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak agenci AI i modele LLM (Claude, ChatGPT) ewoluują w stronę praktycznych narzędzi do budowania skillów i automatycznego naprawiania testów, pokazujemy, dlaczego architekci coraz częściej rezygnują ze złożonych baz grafowych na rzecz sprawdzonych ontologii SQL, i tłumaczymy, dlaczego w backendzie prostota i standaryzacja wygrywają z niepotrzebną innowacyjnością.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu skupiamy się na hybrydowym podejściu do analityki i optymalizacji kosztów.&lt;/p&gt;</description></item><item><title>Agenty w produkcji, DuckDB na sterydach i kłamstwa Kubernetesowi</title><link>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</link><pubDate>Mon, 11 May 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/05/11/agenty-w-produkcji-duckdb-na-sterydach-i-klamstwa-kubernetesowi/</guid><description>&lt;p&gt;W tym wydaniu skupiamy się na profesjonalizacji narzędzi AI w codziennej pracy inżynierskiej.&lt;/p&gt;&#10;&lt;p&gt;Analizujemy, jak Databricks i Shopify wbudowują agentów AI bezpośrednio w swoje platformy, pokazujemy, dlaczego AI przestaje być dodatkiem, a staje się integralną warstwą systemów, i tłumaczymy zmianę podejścia: od prompt engineeringu do context engineeringu i pracy na głębszych warstwach modeli LLM.&lt;/p&gt;&#10;&lt;p&gt;W świecie Data Engineeringu wracają do gry lekkie, lokalne silniki analityczne.&lt;/p&gt;&#10;&lt;p&gt;Przyglądamy się, jak DuckDB i Polars redefiniują wydajność pracy z danymi na pojedynczej maszynie, pokazujemy, kiedy lokalne przetwarzanie wygrywa z klasycznym podejściem cloud-first, a także wracamy do fundamentów: Kafka i Spark wciąż żyją, ale wymagają konkretnych checklist optymalizacyjnych przy skali produkcyjnej.&lt;/p&gt;</description></item><item><title>Semantic layer, czarne skrzynki i 30 lat Postgresa kontra cały Twój stack</title><link>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</link><pubDate>Mon, 20 Apr 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/04/20/semantic-layer-czarne-skrzynki-i-30-lat-postgresa-kontra-caly-twoj-stack/</guid><description>&lt;p&gt;Tym razem data engineering trzyma środek ciężkości całego wydania — i robi to z rozmachem.&lt;/p&gt;&#10;&lt;p&gt;DuckLake osiąga wersję 1.0 jako pełnoprawna platforma lakehouse oparta na Apache Iceberg, dbt publikuje świeży benchmark semantic layer kontra text-to-SQL, a Meta dzieli się case study o tym, jak użyła NLP do mapowania wiedzy w pipeline&amp;rsquo;ach danych.&lt;/p&gt;&#10;&lt;p&gt;Do kompletu:&lt;/p&gt;&#10;&lt;p&gt;architektura medallion z warstwą semantyczną, 20 reguł walidacji, które powinny być standardem w każdym pipeline, i konkretny materiał Airbnb o wysokowydajnym pipeline metryk na OpenTelemetry.&lt;/p&gt;</description></item><item><title>Kryzys pracowniczy w branży + konferencja AI Dev 25</title><link>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</link><pubDate>Mon, 08 Dec 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/12/08/kryzys-pracowniczy-w-branzy-konferencja-ai-dev-25/</guid><description>&lt;p&gt;W dzisiejszym wydaniu przyglądamy się transformacji współczesnych architektur IT – od rosnącej konkurencji dla RESTa i mikroserwisów, przez natywną obsługę wektorów w Postgresie, aż po praktyczne wzorce partycjonowania Parquet. W sekcji AI i ML znajdziecie przewodnik po PyTorch dla chcących zacząć z sieciami neuronowymi i budowaniem własnych modeli AI. Znajdziecie też tekst o metodach interpretacji predykcji XGBoost z wykorzystaniem SHAP.&lt;/p&gt;&#10;&lt;p&gt;Dla programistów Pythona przygotowaliśmy materiały o walidacji outputów LLM z Pydantic, monitoringu FastAPI, zaawansowanych technikach pandas oraz nowym narzędziu &amp;ldquo;ty&amp;rdquo; do automatyzacji przepływów w chmurze. DevOpsi mogą sprawdzić tutorial wdrażania Spring Boot na Kubernetes, rozwiązanie problemu rozbieżności między środowiskami lokalnym a produkcyjnym oraz master class z tcpdump i Wireshark.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-11-25</title><link>https://blog.prokulski.science/2024/11/25/newsletter-dane-i-analizy-2024-11-25/</link><pubDate>Mon, 25 Nov 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/11/25/newsletter-dane-i-analizy-2024-11-25/</guid><description>&lt;p&gt;Nieco o LLMach dzisiaj - o przygotowywaniu danych (z PDFów) oraz o poszukiwaniu modelu, który można uruchomić lokalnie. Ponieważ LLMy od dwóch lat są znaczącym tematem - mają swoją sekcję i właśnie tam możecie zajrzeć.&lt;/p&gt;&#10;&lt;p&gt;A jeśli wolisz sobie skonfigurować VSCode do pracy z Pythonem to &lt;a href="https://www.youtube.com/watch?v=PwGKhvqJCQM"&gt;Arjan pomoże&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.kdnuggets.com/implement-named-entity-recognition-with-hugging-face-transformers"&gt;&lt;strong&gt;How to Implement Named Entity Recognition with Hugging Face Transformers&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie nazwanych jednostek (NER) to podstawowe zadanie przetwarzania języka naturalnego (NLP), obejmujące identyfikację i klasyfikację nazwanych jednostek w tekście do wstępnie zdefiniowanych kategorii. Kategoriami tymi mogą być nazwiska osób, organizacje, lokalizacje, daty i inne. Zobaczmy, jak można przeprowadzić NER, wykorzystując Transformers od Hugging Face&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-24</title><link>https://blog.prokulski.science/2024/06/24/newsletter-dane-i-analizy-2024-06-24/</link><pubDate>Mon, 24 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/24/newsletter-dane-i-analizy-2024-06-24/</guid><description>&lt;p&gt;W piłkę polska reprezentacja już (za moment) na Euro nie pogra, ale o przewidywaniu wyników trwającego turnieju piłkarskiego coś dzisiaj znajdziecie. Nawet nie w kontekście polskiej reprezentacji, a bardziej w kontekście &amp;ldquo;jak to się robi?&amp;rdquo;. Bo taki cel ma ten newsletter - pokazywać jak to się robi. Więc jeśli znasz kogoś, kto jeszcze nie wie to ślij mu tego maila. A jeśli ktoś przysłał Tobie tego maila - to zapisz się prawilnie na &lt;a href="https://www.subscribepage.com/daneanalizy"&gt;odpowiedniej stronie&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-17</title><link>https://blog.prokulski.science/2024/06/17/newsletter-dane-i-analizy-2024-06-17/</link><pubDate>Mon, 17 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/17/newsletter-dane-i-analizy-2024-06-17/</guid><description>&lt;p&gt;W minionym tygodniu miało swoją premierę narzędzie, które w ramach GenAI potrafi ożywić zdjęcia. Mowa o &lt;a href="https://lumalabs.ai/dream-machine"&gt;Luma&lt;/a&gt;. Oczywiście pojawiło się już kilka &lt;a href="https://sztucznainteligencjablog.pl/blog/ozywione-memy-za-pomoca-luma-ai-dream-machine/"&gt;ożywionych memów&lt;/a&gt; albo &lt;a href="https://www.linkedin.com/posts/matthieulorrain_genai-music-lumaai-activity-7207754739105574912-nMfJ"&gt;okładek płyt&lt;/a&gt;. W ciekawą idzie to stronę&amp;hellip; Pamiętajcie jednak, że zanim wrzucicie w tego typu maszynki swoje prywatne zdjęcia żeby przeczytać regulamin (ten z LumaLabs AI na wiele im pozwala).&lt;/p&gt;&#10;&lt;p&gt;W minionym tygodniu rozpoczęło się też Euro 2024 i to pewnie części z Was zajmuje sporo czasu. Szkoda tylko, że FiveThirtyEight.com przestało się zajmować sportem - bardzo fajne modele predykcyjne mieli na temat sportu. Za to (przed startem turnieju) swoje predykcje przygotował &lt;a href="https://eurosport.tvn24.pl/pilka-nozna/euro-2024/2024/analiza-szans-polski-w-euro-2024.-znamy-mistrza-i-rewelacje-euro-2024_sto10194122/story.shtml"&gt;Eurosport&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-06-10</title><link>https://blog.prokulski.science/2024/06/10/newsletter-dane-i-analizy-2024-06-10/</link><pubDate>Mon, 10 Jun 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/06/10/newsletter-dane-i-analizy-2024-06-10/</guid><description>&lt;p&gt;Dzisiaj dwa ciekawe teksty o technikach OSINTowych - czyli jak z publicznie dostępnych informacji dotrzeć do czegoś więcej. Na przykład do informacji &lt;a href="https://frontstory.pl/penthouse-daniel-obajtek-budapeszt-orlen/"&gt;gdzie ktoś faktycznie jest&lt;/a&gt; (chociaż mówi inaczej) co jest nieco zabawą podobną do serwisu &lt;a href="https://www.geoguessr.com/pl"&gt;GeoGuesser&lt;/a&gt; (interesująca zabawa, zacznij od map ze znanej Ci okolicy) - na przykładzie &lt;a href="https://zaufanatrzeciastrona.pl/post/na-tropie-szmydta-czyli-jak-znalezc-bialoruskiego-szpiega/"&gt;szpiegów&lt;/a&gt;. Może jeszcze na dokładkę coś &lt;a href="https://devszczepaniak.pl/osint-pozyskiwanie-informacji-z-wykorzystaniem-map/"&gt;o szukaniu informacji z wykorzystaniem map&lt;/a&gt;?&lt;br&gt;&#10;Tyle o szukaniu. A o ukrywaniu? No na przykład &lt;a href="https://bishopfox.com/blog/unredacter-tool-never-pixelation"&gt;pikselowanie tekstu&lt;/a&gt; na obrazkach umieszczanych w sieci nie ma większego sensu.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-04</title><link>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</link><pubDate>Mon, 04 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/04/newsletter-dane-i-analizy-2023-12-04/</guid><description>&lt;p&gt;W poprzednim tygodniu przeczytać mogliście króciutkie podsumowanie Data Science Summit, a tam stwierdzenie, że dużo się mówi o Streamlit jako sposobie na &lt;em&gt;PoC-owanie&lt;/em&gt; prezentacji danych. Świat obecnie idzie również w stronę streamingu i obsługi tak przesyłanych danych - głównie Flinkiem. I na Flinku skupia się dzisiejszy numer naszego newslettera.&lt;/p&gt;&#10;&lt;p&gt;Ciekawy jest też niespełna półgodzinne nagranie prezentujące możliwości DuckDB w kontekście danych przestrzennych pozyskanych z Open Street Maps. Chwilę bawiłem się DuckDB ale w połączeniu ze sporymi zbiorami geo (zapisanymi w ShapeFile&amp;rsquo;ach) i śmiga to wspaniale. Jedyny minus - to baza plikowa, więc średnio do użycia w przypadku dostępu przez wiele aplikacji na raz. Ale jako element w procesie &lt;em&gt;data engineeringu&lt;/em&gt; może się bardzo przydać.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-30</title><link>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</link><pubDate>Mon, 30 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</guid><description>&lt;p&gt;Dzisiaj trochę o mapkach, trochę o diagramach (takie &lt;em&gt;diagram as a code&lt;/em&gt; tylko dlaczego &lt;a href="https://jira.atlassian.com/browse/BCLOUD-18559"&gt;BitBucket nie potrafi wyświetlić Mermaid&lt;/a&gt; (ticket w Atlassianie jest &amp;ldquo;solved&amp;rdquo;! Ale zobaczcie jak ;-), a GitHub robi to z palcem&amp;hellip; to znaczy bez problemu?), a do tego sporo materiału video. Chyba też więcej niż zwykle treści po polsku (polecamy tekst Tomka Zielińskiego o &lt;em&gt;transportowaniu danych&lt;/em&gt; - może się przydać na spotkania rekrutacyjne, ja lubię zadawać analogiczne pytania).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-18</title><link>https://blog.prokulski.science/2023/09/18/newsletter-dane-i-analizy-2023-09-18/</link><pubDate>Mon, 18 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/18/newsletter-dane-i-analizy-2023-09-18/</guid><description>&lt;p&gt;Dziś polecam gorąco dwa teksty, dość obszerne.&lt;/p&gt;&#10;&lt;p&gt;Pierwszy to świetny i darmowy kurs &lt;strong&gt;spaCy&lt;/strong&gt; - chyba najlepszej obecnie biblioteki służącej do przetwarzania tekstu w Pythonie (z bogatą biblioteką słowników w różnych językach)&lt;/p&gt;&#10;&lt;p&gt;Drugi to cykl (link prowadzi do jego środka) opowiadający o budowaniu aplikacji do zamawiania usług: zaczyna się od FastAPI przyjmującego zamówienia, Kafka jako potok na dane, Apache Pinot jako hurtownia danych i aplikacja-dashboard napisany za pomocą Dash.&lt;/p&gt;&#10;&lt;p&gt;A żeby nie było za łatwo - musisz samodzielnie przeczytać całą poniższą listę, aby te dwa teksty odkryć. Dzięki temu może znajdziesz jeszcze coś ciekawego?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-04-24</title><link>https://blog.prokulski.science/2023/04/24/newsletter-dane-i-analizy-2023-04-24/</link><pubDate>Mon, 24 Apr 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/04/24/newsletter-dane-i-analizy-2023-04-24/</guid><description>&lt;p&gt;W dzisiejszym świecie IT standardem jest (a przynajmniej wydaje się, że powinno być - bo to sensowne) podejście DevOps. W świecie IT związanym z danym nic się nie zmienia w tym względzie&amp;hellip; no&amp;hellip; może dochodzi jeszcze MLOps. Godną zatem uwagi może okazać się pozycja &lt;a href="https://do4ds.com/"&gt;&lt;strong&gt;DevOps for Data Science&lt;/strong&gt;&lt;/a&gt;, która jest książką dostępną online.&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym numerze nieco mniej zawartości, mniej tekstów zachęcających do sprawdzenia w praktyce takich czy innych rozwiązań albo narzędzi - nie obciążajcie głowy przed majówką ;-) Majówka to - jak przystało, zgodnie z tradycją - czas na grilla. Albo mały remont.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-20</title><link>https://blog.prokulski.science/2023/02/20/newsletter-dane-i-analizy-2023-02-20/</link><pubDate>Mon, 20 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/20/newsletter-dane-i-analizy-2023-02-20/</guid><description>&lt;p&gt;Jak wyglądać będzie świat kiedy GPT-3 będzie pisać teksty? Mniej więcej tak jak wygląda Medium.com. Clickbaitowe tytuły, mało merytorycznej treści. Jeśli brać pod uwagę teksty mówiące ogólnie rzecz biorąc o IT to dodatkowo długie wprowadzenia (zawsze mniej więcej o tym samym: czym jest Kafka, czym jest AirFlow, czym jest Docker), potem dwa akapity o banalnym do rozwiązania problemie i to wszystko.&lt;/p&gt;&#10;&lt;p&gt;Może to przeziębienie trwające już za długo, może kryzys wieku średniego ;-) albo za dużo zajęć i rzeczy do zrobienia tu i teraz, ale szczerze mówiąc jestem zmęczony, głównie internetem - wszędzie to samo, wszystko miałkie, wszystko wtórne. Dlatego, żeby tego wszystkiego Wam oszczędzić do dzisiejszego newslettera wstępnie wybrałem około 50 artykułów. Ile przeszło selekcję? Widzicie poniżej. Ile z nich jest godnych uwagi i na prawdę coś ciekawego wnosi? To musicie ocenić sami.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-16</title><link>https://blog.prokulski.science/2023/01/16/newsletter-dane-i-analizy-2023-01-16/</link><pubDate>Mon, 16 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/16/newsletter-dane-i-analizy-2023-01-16/</guid><description>&lt;p&gt;Czy wiecie, że książka &lt;em&gt;&amp;ldquo;365 dni&amp;rdquo;&lt;/em&gt; jest bardziej o Massimo niż o Laurze? W sumie w całej książce użyte jest jakieś 8350 różnych słów, z czego 50% treści wykorzystuje 425 z nich (czyli 5% użytych słów stanowi 50% treści!). Oczywiście chodzi o lematy, z wykluczonymi &lt;em&gt;stopwords&lt;/em&gt;. Polecam &lt;a href="https://youtu.be/NpPfa61P2jk"&gt;wykład na TEDx Koszalin&lt;/a&gt; o NLP dla laików, trochę zabawne, na pewno inspirujące - właśnie z tej inspiracji te wyliczenia.&lt;/p&gt;&#10;&lt;p&gt;A co poza tym dzisiaj? Sporo o MLOps (cały dział!) Trochę o przetwarzaniu danych dla początkujących - Pandas i PySpark.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-09</title><link>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</link><pubDate>Mon, 09 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</guid><description>&lt;p&gt;W pierwszym pełnym tygodniu nowego roku wracamy ze standardowym zestawem materiałów.&lt;/p&gt;&#10;&lt;p&gt;Jest więc coś o machine learningu (dobry jest tekst o YOLOv5, przede wszystkim pokazujący że nie tylko TensorFlow obowiązuje w domenie deep learning), sporo ciekawostek ocierających się o NLP i analizę tekstu. Jest gotowy przepis na pobieranie danych z Kafki i zapisywanie w Mongo.&lt;/p&gt;&#10;&lt;p&gt;Na koniec zapraszam na &lt;a href="https://cuvalley.com/?utm_source=dia_newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;&lt;strong&gt;CuValley Hack&lt;/strong&gt;&lt;/a&gt;! To trzecia edycja hackathonu organizowanego przez KGHM w ramach programu &lt;em&gt;Dolina Miedziowa&lt;/em&gt;. To przyznam szczerze spełnienie mojej idei hackathonu: dane wprost z przemysłu i konkretne problemy (zobacz na stronie jakie są zadania) do rozwiązania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-03</title><link>https://blog.prokulski.science/2022/10/03/newsletter-dane-i-analizy-2022-10-03/</link><pubDate>Mon, 03 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/03/newsletter-dane-i-analizy-2022-10-03/</guid><description>&lt;p&gt;W tym tygodniu nieco mniejsza liczba tekstów, ale chyba bardziej rozbudowanych niż zwykle.&lt;/p&gt;&#10;&lt;p&gt;Szczególnie polecam tekst pierwszy &lt;a href="https://opendatascience.com/2022-data-science-research-round-up-highlighting-ml-dl-nlp-more/"&gt;2022 Data Science Research Round-Up&lt;/a&gt;, ale też przykłady i porównanie różnych algorytmów do &lt;em&gt;topic modelingu&lt;/em&gt; czy też całą praktycznie sekcję poświęconą Pythonowi.&lt;/p&gt;&#10;&lt;p&gt;Być może ktoś z Was przegapił na fanpage&amp;rsquo;u &lt;a href="https://fb.com/daneanalizy"&gt;Dane i analizy&lt;/a&gt;: &lt;a href="https://app.rasgoml.com/sql"&gt;klikalny generator zapytań SQL&lt;/a&gt; - świetna sprawa do nauki ale też zapewne może przyspieszyć pracę.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://opendatascience.com/2022-data-science-research-round-up-highlighting-ml-dl-nlp-more/"&gt;&lt;strong&gt;2022 Data Science Research Round-Up&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przegląd najciekaszych zagadnień związanych z machine learning. deep learnig, NLP z ostatnich miesięcy. Tylko wstęp, każde opisane jest dalej w podlinkowanych materiałach&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-26</title><link>https://blog.prokulski.science/2022/09/26/newsletter-dane-i-analizy-2022-09-26/</link><pubDate>Mon, 26 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/26/newsletter-dane-i-analizy-2022-09-26/</guid><description>&lt;p&gt;Wracamy do rysowania wykresów, pobierania danych ze stron internetowych oraz robienia dashboardów (i raportów w Wordzie). To dzisiejsze główne punkty zainteresowań. Ale dla fanów rozwiązań big data też coś się znajdzie.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_projekty"&gt;#analiza_danych_projekty&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://blog.platypush.tech/article/Automate-your-music-collection"&gt;&lt;strong&gt;Automate your music collection&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Znudziły Ci się playlisty Spofity? Ciągle słuchasz &amp;ldquo;ulubionych&amp;rdquo;? Być może Ci to odpowiada. Ale jeśli lubisz odkrywać nową muzykę to możesz czuć się jak w bańce. Albo wykorzystać historię odtwarzanych utworów oraz API serwisu Last.fm żeby poznać coś nowego&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-09-19</title><link>https://blog.prokulski.science/2022/09/19/newsletter-dane-i-analizy-2022-09-19/</link><pubDate>Mon, 19 Sep 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/09/19/newsletter-dane-i-analizy-2022-09-19/</guid><description>&lt;p&gt;Dzisiaj sporo tekstów dotyka sieci neuronowych. a może lepiej powiedzieć: TensorFlow. Mamy krótkie przedstawienie jak w ogóle sieci działają, kilka tekstów pokazujących jak z TensorFlow pracować i przygotowywać modele. Interesujące jest porównanie modeli regresji liniowej zawartych w pythonowym SciKit-Learn.&lt;/p&gt;&#10;&lt;p&gt;Dla początkujących i średniozaawansowanych mamy dwa obszary: scheduler zadań czyli coś o Apache Airflow oraz (też Apache) Spark o łączeniu danych i wykorzystaniu w NLP&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Mam też dla Was coś specjalnego.&lt;/strong&gt; Każdy lubi rabaty, a ja daję &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;bezterminowo 15% zniżki na Karty Data Science!&lt;/strong&gt;&lt;/a&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-01</title><link>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</link><pubDate>Mon, 01 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/01/newsletter-dane-i-analizy-2022-08-01/</guid><description>&lt;p&gt;Dzisiaj nieco więcej materiałów z krainy &amp;ldquo;ops&amp;rdquo; w świecie &amp;ldquo;devops&amp;rdquo;. Warto znać obie ziemie, żeby nie mieć problemu chociażby z uruchomieniem kilku aplikacji (dockerowymi) pod różnymi ścieżkami na jednej domenie. Dlatego warto zajrzeć do tekstów o Nginx.&lt;/p&gt;&#10;&lt;p&gt;Ale sprawy związane z analizowaniem danych czy też ich przetwarzaniem w celu przewidywania przyszłości tradycyjnie też są na poniższej liście interesujących artykułów z minionego tygodnia.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://miroslawmamczur.pl/czym-jest-i-jak-zbadac-dryft-modelu-model-drift/"&gt;&lt;strong&gt;Czym jest i jak zbadać dryft modelu (model drift)?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Dryft modelu odnosi się do spadku wydajności modelu z powodu zmian danych i relacji między zmiennymi wejściowymi i wyjściowymi&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-27</title><link>https://blog.prokulski.science/2022/06/27/newsletter-dane-i-analizy-2022-06-27/</link><pubDate>Mon, 27 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/27/newsletter-dane-i-analizy-2022-06-27/</guid><description>&lt;p&gt;Gorąco&amp;hellip; &lt;a href="https://www.youtube.com/watch?v=CKTKbiZW38Y"&gt;&lt;em&gt;żar leje się z nieba, taka spiekota w mieście to piekło&lt;/em&gt; (niczym w Hydrozagadce)&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Zatem gorące materiały: wyniki ankiety StackOverflow, którą osobiście traktuję jako wyznacznik tego jakie technologie są obecnie używane na rynku, czego warto się uczyć i co trzeba potrafić aby swobodnie zmieniać pracę. Pakiet materiałów od Krzyśka Sopyły do nauki ML oraz rozwiązanie konkretnych zagadnień takich jak pipeline dla danych ze Stravy.&lt;/p&gt;&#10;&lt;p&gt;Weźmiecie udział &lt;em&gt;w pieszym rajdzie PPTK na odznakę nizinną?&lt;/em&gt; Nawet jeśli nie, pamiętajcie że &lt;em&gt;dobrze jest łączyć przyjemne z pożytecznym!&lt;/em&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-06</title><link>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</link><pubDate>Mon, 06 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/06/newsletter-dane-i-analizy-2022-06-06/</guid><description>&lt;p&gt;W tym tygodniu sporo rozwiązań big data&amp;rsquo;owych i ciekawostek ogólnie związanych z przetwarzaniem danych.&lt;/p&gt;&#10;&lt;p&gt;Ale jeśli interesuje Cię coś bardziej &amp;ldquo;biznesowego&amp;rdquo;, w szczególności jak &lt;em&gt;projektuje się produkty&lt;/em&gt; to gorąco polecam rozmowę z Marcinem Zarembą o projektowaniu autobookingu w Dobrym Mechaniku oraz dodatkowo &lt;a href="https://marcinzaremba.pl/2022/05/12/jak-powstawal-autobooking/?utm_source=newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;tekst o tymże&lt;/a&gt; u Marcina na blogu. Świetny case study, serio serio.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/train-mask-rcnn-net-for-object-detection-in-60-lines-of-code-9b6bbff292c3"&gt;&lt;strong&gt;Train Mask R-CNN Net for Object Detection in 60 Lines of Code&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie obiektów na zdjęciach - jak to działa?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-16</title><link>https://blog.prokulski.science/2022/05/16/newsletter-dane-i-analizy-2022-05-16/</link><pubDate>Mon, 16 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/16/newsletter-dane-i-analizy-2022-05-16/</guid><description>&lt;p&gt;Łączyłem kiedyś accesssowe VBA z R - da się, nawet spoko działa. A było to tak, że Access wypluwał dane do CSV - chyba za pośrednictwem Excela, nie pamiętam - potem R to mieliło i robiło wykres, który wstawiany był jako obrazek do raportu opartego na szablonie zrobionym w&amp;hellip; VBA piszącym do Excela. Jak to cudo odziedziczyłem to przepisałem na Shiny produkujące PDFa z RMarkdowna i potrzebujący sobie sami te raporty robili, a nie czekali aż ja ręcznie te accessowe cuda odpalę (i zablokuję sobie komputer, bo przecież &amp;ldquo;raporty się generują&amp;rdquo;). O tym jak łączyć Excela z R czy Pythonem przeczytacie dzisiaj.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-31</title><link>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</link><pubDate>Mon, 31 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/31/newsletter-dane-i-analizy-2022-01-31/</guid><description>&lt;p&gt;Dzisiaj &lt;em&gt;odcinek&lt;/em&gt; dość pythonowy, ale za to z obszernym tekstem o tworzeniu modeli w R - cały proces opisany po kolei. Polecam!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.pinecone.io/learn/nlp/?utm_medium=link&amp;amp;utm_source=data-elixir&amp;amp;utm_campaign=sponsored"&gt;&lt;strong&gt;Natural Language Processing (NLP) for Semantic Search&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Duża pozycja, która wprowadza w świat NLP&lt;/p&gt;&#10;&lt;h3 id="ciekawostki"&gt;#ciekawostki&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://opendatascience.com/what-does-a-data-driven-government-look-like/"&gt;&lt;strong&gt;What Does a Data-Driven Government Look Like?&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Teoretycznie więcej danych to lepsze decyzje. Czy zarządzanie maistem albo państwem jest możliwe w oparciu o dane? Jak może to wyglądać?&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/ai-geospatial-wildfire-risk-prediction-8c6b1d415eb4"&gt;&lt;strong&gt;AI Geospatial Wildfire Risk Prediction&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przewidywanie zdarzeń związanych z geografią - pogoda, pożary - ciekawe zagadanienie, a często pomijane przy np. poradnikach ML.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-10</title><link>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</link><pubDate>Mon, 10 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</guid><description>&lt;p&gt;Koniec przerw świątecznych, koniec długich weekendów, czas wracać do pracy.&lt;/p&gt;&#10;&lt;p&gt;Dla mnie osobiście rok zaczął się zabawą z Raspberry Pi i próbwaniem co to cudo potrafi. Nigdzie nie ma Raspberry Pi 4, więc zadowoliłem się na start Pi Zero. Mały, ale wariat - używam do PiHole oraz staram się podglądać co robi w nocy kot. Jak? A no tym prostym &lt;a href="https://github.com/prokulski/rasppi_motion_capture/blob/main/main.py"&gt;skryptem&lt;/a&gt; i kamerką podłączoną po USB.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/11-dimensionality-reduction-techniques-you-should-know-in-2021-dcb9500d388b"&gt;&lt;strong&gt;11 Dimensionality reduction techniques you should know in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;11 metod na redukcję rozmiarów Twoich danych. Ale zmniejszenie wielkości to nie jedyne zastosowanie - przy redukcji wymiarów często odsłaniają się ukryte informacje&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-09</title><link>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</link><pubDate>Mon, 09 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/09/newsletter-dane-i-analizy-2021-08-09/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-08-08</title><link>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</link><pubDate>Sun, 08 Aug 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/08/08/newsletter-dane-i-analizy-2021-08-08/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/multi-page-document-classification-using-machine-learning-and-nlp-ba6151405c03?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Multi Page Document Classification using NLP and ML&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;An approach to classify documents with different variations shapes, text and page sizes. Source: &lt;a href="https://unsplash.com/photos/5cFwQ-WMcJU"&gt;https://unsplash.com/photos/5cFwQ-WMcJU&lt;/a&gt; This article describes a novel Multi Page Document Classification solution approach, which leverages advanced machine learning and textual analytics to solve one of the major challenges in the Mortgage industry. Abstract Even in today’s technological era most of (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/introduction-to-concurrency-in-python-a3ad6aa8b2d1?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;Introduction to Concurrency in Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;PYTHON | PROGRAMMING | CONCURRENCY A guide to speeding up Python code Back in 1965, Gordon Moore predicted that the number of transistors on microchips will double every two years[1]. This prediction is referred to as Moore’s Law. Moore’s Law also states that the price of computing hardware will also half every two years. Source: (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-12</title><link>https://blog.prokulski.science/2021/07/12/newsletter-dane-i-analizy-2021-07-12/</link><pubDate>Mon, 12 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/12/newsletter-dane-i-analizy-2021-07-12/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/what-is-mlops-everything-you-must-know-to-get-started-523f2d0b8bd8"&gt;&lt;strong&gt;What is MLOps — Everything You Must Know to Get Started | by Harshit Tyagi&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A complete walkthrough of ML systems development lifecycle and need for MLOps Until recently, all of us were learning about software development lifecycle(SDLC) and how it goes from requirement elicitation → designing → development → testing → deployment → all the way down to maintenance. We (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://neptune.ai/blog/vectorization-techniques-in-nlp-guide"&gt;&lt;strong&gt;Vectorization Techniques in NLP [Guide] - neptune.ai&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Natural Language is how we, humans, exchange ideas and opinions. There are two main mediums for natural language – speech and text.  Listening and reading are effortless for a healthy human, but they’re difficult for a machine learning algorithm. That’s why scientists had to come up with Natural (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-28</title><link>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</link><pubDate>Mon, 28 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/28/newsletter-dane-i-analizy-2021-06-28/</guid><description>&lt;p&gt;&lt;a href="https://erdavis.com/2021/06/26/average-colors-of-the-world/"&gt;&lt;strong&gt;Average colors of the world&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;I wrote that I wanted to expand creatively beyond maps in 2021, but here we are, halfway in, and half my posts are maps. In my defense, I made these last year and just haven’t gotten around to posting them yet! They’ve been sitting in a folder since December, mocking me. It’s time to get […]&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/4-tricks-to-use-python-f-strings-more-efficiently-4f389e890514?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;4 Tricks to Use Python F-strings More Efficiently&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Have full control over what you print out. String interpolation is a way to embed variables into strings. It makes it easy to manipulate and enrich strings. Thus, the print statements are much more powerful with string interpolation. Formatted string literals, also known as f-strings, are a highly (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-10</title><link>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</link><pubDate>Mon, 10 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/10/newsletter-dane-i-analizy-2021-05-10/</guid><description>&lt;p&gt;&lt;a href="https://blog.dataiku.com/how-to-perform-basic-ml-serving-with-python-docker-kubernetes"&gt;&lt;strong&gt;How to Perform Basic ML Serving With Python, Docker, and Kubernetes&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial provides a basic, step-by-step example of real-time serving a machine learning (ML) model as a REST API with Python, Docker, and Kubernetes. We’ll build a basic REST API with Python, test it locally with Docker, and deploy our API with Kubernetes. By the way, if you want to go faster, (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://www.r-bloggers.com/2021/05/dockerizing-shiny-applications/"&gt;&lt;strong&gt;Dockerizing Shiny Applications&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Docker provides isolation to applications. Images are immutable. Running multiple instances of the same image can serve many users at the same time. All these general advantages of containerized applications apply to Shiny apps too. The post Dockerizing Shiny Applications first appeared on (&amp;hellip;)&lt;/p&gt;</description></item><item><title>AI &amp; NLP Day 2020</title><link>https://blog.prokulski.science/2020/08/21/ai-nlp-day-2020/</link><pubDate>Fri, 21 Aug 2020 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2020/08/21/ai-nlp-day-2020/</guid><description>&lt;p&gt;Do 2025 r. Polska będzie potrzebować ok. 200 tys. specjalistów zajmujących się sztuczną inteligencją - wynika z danych ostatniej, siódmej edycji raportu &lt;em&gt;Monitoring trendów w innowacyjności&lt;/em&gt; Polskiej Agencji Rozwoju Przedsiębiorczości.&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="http://nlpday.pl"&gt;&lt;img src="../../downloads/2020/08/NLPDAY_b.png" alt=""&gt;&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;em&gt;Post to informacja prasowa, a niniejszy blog oraz fanpage &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;Dane i Analizy&lt;/a&gt; to patroni medialni konferencji.&lt;/em&gt;&lt;/p&gt;&#10;&lt;p&gt;W obliczu rosnącego zapotrzebowania na ekspertów AI i dynamicznie postępującej cyfryzacji, edukacja nowych i obecnych kadr IT w obszarze Big Data będzie miała znaczący wpływ na rozwój gospodarczy w najbliższych latach.&lt;/p&gt;</description></item></channel></rss>