<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>SpaCy on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/spacy/</link><description>Recent content in SpaCy on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 18 Sep 2023 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/spacy/index.xml" rel="self" type="application/rss+xml"/><item><title>Newsletter Dane i Analizy, 2023-09-18</title><link>https://blog.prokulski.science/2023/09/18/newsletter-dane-i-analizy-2023-09-18/</link><pubDate>Mon, 18 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/18/newsletter-dane-i-analizy-2023-09-18/</guid><description>&lt;p&gt;Dziś polecam gorąco dwa teksty, dość obszerne.&lt;/p&gt;&#10;&lt;p&gt;Pierwszy to świetny i darmowy kurs &lt;strong&gt;spaCy&lt;/strong&gt; - chyba najlepszej obecnie biblioteki służącej do przetwarzania tekstu w Pythonie (z bogatą biblioteką słowników w różnych językach)&lt;/p&gt;&#10;&lt;p&gt;Drugi to cykl (link prowadzi do jego środka) opowiadający o budowaniu aplikacji do zamawiania usług: zaczyna się od FastAPI przyjmującego zamówienia, Kafka jako potok na dane, Apache Pinot jako hurtownia danych i aplikacja-dashboard napisany za pomocą Dash.&lt;/p&gt;&#10;&lt;p&gt;A żeby nie było za łatwo - musisz samodzielnie przeczytać całą poniższą listę, aby te dwa teksty odkryć. Dzięki temu może znajdziesz jeszcze coś ciekawego?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-01-09</title><link>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</link><pubDate>Mon, 09 Jan 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/01/09/newsletter-dane-i-analizy-2023-01-09/</guid><description>&lt;p&gt;W pierwszym pełnym tygodniu nowego roku wracamy ze standardowym zestawem materiałów.&lt;/p&gt;&#10;&lt;p&gt;Jest więc coś o machine learningu (dobry jest tekst o YOLOv5, przede wszystkim pokazujący że nie tylko TensorFlow obowiązuje w domenie deep learning), sporo ciekawostek ocierających się o NLP i analizę tekstu. Jest gotowy przepis na pobieranie danych z Kafki i zapisywanie w Mongo.&lt;/p&gt;&#10;&lt;p&gt;Na koniec zapraszam na &lt;a href="https://cuvalley.com/?utm_source=dia_newsletter&amp;amp;utm_medium=email&amp;amp;utm_campaign=dane_i_analizy"&gt;&lt;strong&gt;CuValley Hack&lt;/strong&gt;&lt;/a&gt;! To trzecia edycja hackathonu organizowanego przez KGHM w ramach programu &lt;em&gt;Dolina Miedziowa&lt;/em&gt;. To przyznam szczerze spełnienie mojej idei hackathonu: dane wprost z przemysłu i konkretne problemy (zobacz na stronie jakie są zadania) do rozwiązania.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-05</title><link>https://blog.prokulski.science/2022/12/05/newsletter-dane-i-analizy-2022-12-05/</link><pubDate>Mon, 05 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/05/newsletter-dane-i-analizy-2022-12-05/</guid><description>&lt;p&gt;Jak wygląda Mundial na Twitterze?&lt;/p&gt;&#10;&lt;p&gt;W kilka dni i właściwie w trzy osoby przygotowaliśmy dashboard pozwalający monitorować co się dzieje podczas meczów na Mundialu. Gdzie to zobaczyć? Na &lt;a href="https://mundial.achaja.org/"&gt;mundial.achaja.org&lt;/a&gt; (login: &lt;em&gt;robercik&lt;/em&gt;, hasło: &lt;em&gt;nicsieniestalo&lt;/em&gt;).&lt;br&gt;&#10;&lt;strong&gt;A jak to wszystko działa?&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;Skrypt w Pythonie zbiera dane z Twittera&lt;/p&gt;&#10;&lt;p&gt;API Twittera pozwala na podpięcie się pod strumień (dane same spływają, w czasie rzeczywistym, chociaż przy natłoku komunikatów zdarza się nawet 5-minutowy lag) którym przychodzą nowe obiekty - tweety taki &lt;em&gt;obiekt&lt;/em&gt; zawiera treść, tagi, informacje o tym w jakim języku napisany został tekst zbieramy więc te wszystkie twitty dla meczu po hashtagu, np. dla meczu Francja-Polska #FRAPOL oraz #POLFRA dodatkowo zbieramy tweety dla hashtagów ogólnych: #WorldCup #WorldCup2022 #FIFAWorldCup #QatarWorldCup2022 #Qatar2022&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-17</title><link>https://blog.prokulski.science/2022/10/17/newsletter-dane-i-analizy-2022-10-17/</link><pubDate>Mon, 17 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/17/newsletter-dane-i-analizy-2022-10-17/</guid><description>&lt;p&gt;Od ostatniego numeru newslettera przybyło Was trochę - dziękuję za zaufanie i pozostawienie swojego adresu mailowego w nadziei na interesujące materiały. Wiem, że oczekujecie czegoś związanego z Pythonem i przetwarzaniem większej ilości danych, a tym bardziej wiem że dobrze dzisiaj trafiliście.&lt;/p&gt;&#10;&lt;p&gt;Mamy zatem trochę materiału pozwalającego przeskoczyć z poziomu &lt;em&gt;junior&lt;/em&gt; do &lt;em&gt;mid&lt;/em&gt; w Pythonie. Dla tych bardziej zaawansowanych trochę o łączeniu się ze Snowflake z poziomu Pythona (nie tylko dla zainteresowanych Snowflake&amp;rsquo;em te teksty są warte chociażby przejrzenia - dużo w nich wartości między wierszami, czy też liniami kodu).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-10-10</title><link>https://blog.prokulski.science/2022/10/10/newsletter-dane-i-analizy-2022-10-10/</link><pubDate>Mon, 10 Oct 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/10/10/newsletter-dane-i-analizy-2022-10-10/</guid><description>&lt;p&gt;Dzisiaj prawdziwa bomba na początek - szczegółowy esej na temat wykorzystania uczenia maszynowego na rynku akcji. Tekst obejmuje projekt systemu, który konsekwentnie pokonywał S&amp;amp;P 500, dopóki nie został zamknięty w lipcu 2022 roku. Jest tu wiele, w tym dyskusja na temat dynamiki rynku, podejścia do modelowania, stosu technologicznego, inżynierii funkcji, pipeline ML i nie tylko. Czyta się długo, ale warto! &lt;a href="https://principiamundi.com/posts/didact-anatomy/"&gt;&lt;strong&gt;Didact AI: The anatomy of an ML-powered stock picking engine&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;Poza tym sporo dzisiaj materiałów o przetwarzaniu tekstu (na róźnym poziomie zaawansowania), kilka &lt;em&gt;przydasiów&lt;/em&gt; do Apache Kafka, nauka SQLAlchemy (czyli &lt;em&gt;jak w Pythonie gadać z bazami danych&lt;/em&gt;).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-06-20</title><link>https://blog.prokulski.science/2022/06/20/newsletter-dane-i-analizy-2022-06-20/</link><pubDate>Mon, 20 Jun 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/06/20/newsletter-dane-i-analizy-2022-06-20/</guid><description>&lt;p&gt;Długi weekend się przedłużył&amp;hellip; ale zgodnie z planem (a nie że &amp;ldquo;melanż poniósł za daleko&amp;rdquo; ;-). Newsletter przygotowany, a (prawie) jednodniowe opóźnienie nie powinno zmienić Waszego stosunku do zawartości. Odrobina tęsknoty (mam nadzieję) nikomu jeszcze nie zaszkodziła.&lt;/p&gt;&#10;&lt;p&gt;Deszcz pada w całym kraju, zapraszam zatem do lektury!&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://medium.com/analytics-vidhya/fundamentals-of-mlops-part-4-tracking-with-mlflow-deployment-with-fastapi-61614115436"&gt;&lt;strong&gt;Model Tracking with MLFlow &amp;amp; Deployment with FastAPI&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Fajny tutorial pokazujący jak śledzić wyniki modelu przez MLFlow oraz serwować ten najlepszy przez FastAPI&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-05-16</title><link>https://blog.prokulski.science/2022/05/16/newsletter-dane-i-analizy-2022-05-16/</link><pubDate>Mon, 16 May 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/05/16/newsletter-dane-i-analizy-2022-05-16/</guid><description>&lt;p&gt;Łączyłem kiedyś accesssowe VBA z R - da się, nawet spoko działa. A było to tak, że Access wypluwał dane do CSV - chyba za pośrednictwem Excela, nie pamiętam - potem R to mieliło i robiło wykres, który wstawiany był jako obrazek do raportu opartego na szablonie zrobionym w&amp;hellip; VBA piszącym do Excela. Jak to cudo odziedziczyłem to przepisałem na Shiny produkujące PDFa z RMarkdowna i potrzebujący sobie sami te raporty robili, a nie czekali aż ja ręcznie te accessowe cuda odpalę (i zablokuję sobie komputer, bo przecież &amp;ldquo;raporty się generują&amp;rdquo;). O tym jak łączyć Excela z R czy Pythonem przeczytacie dzisiaj.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-04-25</title><link>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</link><pubDate>Mon, 25 Apr 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/04/25/newsletter-dane-i-analizy-2022-04-25/</guid><description>&lt;p&gt;Dzisiaj zapraszam na duży pakiet związany z Apache Spark - od instalacji, poprzez stosunkowo mało zaawansowane tutoriale, a na debugowaniu i optymalizacji zapytań skończywszy.&lt;/p&gt;&#10;&lt;p&gt;Standardowo jest też trochę Pythona (na przykład świetny kurs spaCy - ale to fani &lt;a href="https://www.facebook.com/DaneAnalizy/"&gt;fanpage&amp;rsquo;a Dane i Analizy&lt;/a&gt; już znają czy też coś o wzorcach projektowych albo aplikacjach wielowątkowych), a w części &amp;ldquo;analiza danych&amp;rdquo; dość przekrojowe zagadnienia (np. &lt;em&gt;computer vision&lt;/em&gt; bez sieci neuronowych - dość sprytne podejście do tematu zajętych miejsc parkingowych).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-03-14</title><link>https://blog.prokulski.science/2022/03/14/newsletter-dane-i-analizy-2022-03-14/</link><pubDate>Mon, 14 Mar 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/03/14/newsletter-dane-i-analizy-2022-03-14/</guid><description>&lt;p&gt;Mam nadzieję, że wiosna nadchodzi wielkimi krokami, więc dzisiaj trochę lżejszy dobór tematów.&lt;/p&gt;&#10;&lt;p&gt;Koniecznie zobacz nagranie z webinaru u Vladimira o BI i ML!&lt;/p&gt;&#10;&lt;p&gt;Polecam też zainteresować się Mermaid - rozszerzeniem do Markdown pozwalającym rysować diagramy. Da się też eksportować je później do np. PDFów - istnieje odpowiedni &lt;a href="https://github.com/raghur/mermaid-filter"&gt;dodatek do pandoc&lt;/a&gt;. A o Meramind wiem od &lt;a href="https://www.youtube.com/watch?v=JiQmpA474BY"&gt;Arjana i jego filmu&lt;/a&gt;.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://www.youtube.com/watch?v=ANEJADyAyOE"&gt;&lt;strong&gt;Business Intelligence z Machine Learning&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Zapis ciekawego webinaru łączącego oba wspominane w tytule zagadnienia&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-14</title><link>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</link><pubDate>Mon, 14 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</guid><description>&lt;p&gt;Dzisiaj coś trudniejszego niż MNIST oraz ściągawka z algorytmów grupowania elementów (clustering). Do tego ciekawy projekt wizualizacji danych z meczów piłki nożnej.&lt;/p&gt;&#10;&lt;p&gt;A jeśli myślisz o projektowaniu systemów a nie tylko o samej analizie danych to wykład Sławka Sobótki o Domain Driven Design powinien Cię uradować.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-google-cloud-machine-learning-apis-programmatically-in-python-part-1-430f608af6a5"&gt;&lt;strong&gt;Using Google Cloud Machine Learning APIs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak korzystać z interfejsów machine learning API od Google w Pythonie? Część pierwsza cyklu&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-fastai-to-classify-japanese-kanji-characters-47d7edd4d569"&gt;&lt;strong&gt;Using FastAI to classify Japanese kanji characters&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie pisanych ręcznie cyfr - czyli zbiór MNIST - to może być zbyt prosty problem dla adeptów sztuki nauki o danych&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-24</title><link>https://blog.prokulski.science/2022/01/24/newsletter-dane-i-analizy-2022-01-24/</link><pubDate>Mon, 24 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/24/newsletter-dane-i-analizy-2022-01-24/</guid><description>&lt;p&gt;W ostatnim tygodniu na sile przybrała moda na &lt;strong&gt;Wordle&lt;/strong&gt;. Co to? To taka gra podobna do znanego od lat &amp;lsquo;70 XX wieku &lt;a href="https://pl.wikipedia.org/wiki/Mastermind_(gra_planszowa)"&gt;Masterminda&lt;/a&gt;. Trzeba w 6 ruchach odgadnąć sześcioliterowe słowo. Jedyne podpowiedzi to kolor:&lt;br&gt;&#10;zielony = odpowiednia litera stoi w odpowiednim miejscu, żółty = odpowiednia litera stoi na złym miejscu, czarny = &lt;em&gt;to zła litera jest&lt;/em&gt; (parafrazując pewnego aktora z pewnego filmu).&lt;/p&gt;&#10;&lt;p&gt;Gra w wersji oryginalnej (angielskiej) dostępna jest &lt;a href="https://www.powerlanguage.co.uk/wordle/"&gt;tej na stronie&lt;/a&gt;. Oczywiście jest też wersja z &lt;a href="https://literalnie.fun/"&gt;polskimi słowami&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-17</title><link>https://blog.prokulski.science/2022/01/17/newsletter-dane-i-analizy-2022-01-17/</link><pubDate>Mon, 17 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/17/newsletter-dane-i-analizy-2022-01-17/</guid><description>&lt;p&gt;Dzisiaj więcej o &lt;em&gt;data engineering&lt;/em&gt; i nowym buzz wordzie z tej okolicy: &lt;strong&gt;data mesh&lt;/strong&gt; a także seria polecanych kanałów. Trochę też o architekturze systemów - wywiad z architektem i coś o tym czy mikroserwisy są lepsze niż monolityczne byty.&lt;/p&gt;&#10;&lt;p&gt;Interesują Cię takie tematy? Czy jednak żywy kod i konkretne problemy analizy cyferek to lepsze &lt;em&gt;mięso&lt;/em&gt;?&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://levelup.gitconnected.com/auto-detect-anything-with-custom-named-entity-recognition-ner-c89d6562e8e9"&gt;&lt;strong&gt;Auto-Detect Anything With Custom Named Entity Recognition (NER)&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie nazw własnych z wykorzystaniem SpaCy&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-01-10</title><link>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</link><pubDate>Mon, 10 Jan 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/01/10/newsletter-dane-i-analizy-2022-01-10/</guid><description>&lt;p&gt;Koniec przerw świątecznych, koniec długich weekendów, czas wracać do pracy.&lt;/p&gt;&#10;&lt;p&gt;Dla mnie osobiście rok zaczął się zabawą z Raspberry Pi i próbwaniem co to cudo potrafi. Nigdzie nie ma Raspberry Pi 4, więc zadowoliłem się na start Pi Zero. Mały, ale wariat - używam do PiHole oraz staram się podglądać co robi w nocy kot. Jak? A no tym prostym &lt;a href="https://github.com/prokulski/rasppi_motion_capture/blob/main/main.py"&gt;skryptem&lt;/a&gt; i kamerką podłączoną po USB.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/11-dimensionality-reduction-techniques-you-should-know-in-2021-dcb9500d388b"&gt;&lt;strong&gt;11 Dimensionality reduction techniques you should know in 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;11 metod na redukcję rozmiarów Twoich danych. Ale zmniejszenie wielkości to nie jedyne zastosowanie - przy redukcji wymiarów często odsłaniają się ukryte informacje&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-06</title><link>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</link><pubDate>Mon, 06 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</guid><description>&lt;p&gt;Na Mikołajki przegląd internetu pod kątem danych, ich analiz i sposobów programowania oraz wdrażania zaprogramowanych rozwiązań.&lt;br&gt;&#10;Najciekawszym dla początkujących będzie pewnie zbiór ponad 200 tekstów zgromadzonych w jednym miejscu na różne tematy związane z machine learingiem (to prawdę mówiąc trochę jak &lt;a href="https://thecleverprogrammer.com/machine-learning/"&gt;spis treści jednego bloga&lt;/a&gt;), a bardziej doświadczeni dowiedzą się jak połączyć C++ z Pythonem. Są też ciekawe teksty o R (i Shiny), co się ostatnio dość rzadko zdarzało.&lt;/p&gt;&#10;&lt;p&gt;Skoro jesteśmy przy R - w piątek (10 grudnia) zaś konferencja &lt;strong&gt;WhyR?&lt;/strong&gt; - rezerwujcie sobie czas, bo materiału sporo (co widać po zaplanowanych streamingach na YouTube). Więcej szczegółów na stronie imprezy &lt;a href="https://2021.whyr.pl/"&gt;2021.whyr.pl&lt;/a&gt;&lt;/p&gt;</description></item></channel></rss>