<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Clustering on Łukasz Prokulski, Dane i Analizy</title><link>https://blog.prokulski.science/tags/clustering/</link><description>Recent content in Clustering on Łukasz Prokulski, Dane i Analizy</description><generator>Hugo</generator><language>pl-PL</language><lastBuildDate>Mon, 29 Jun 2026 15:00:00 +0000</lastBuildDate><atom:link href="https://blog.prokulski.science/tags/clustering/index.xml" rel="self" type="application/rss+xml"/><item><title>Dashboard i agent muszą się zgadzać. Plus Kueue, Iceberg i kryzys jakości kodu przy 40 stopniach w cienu</title><link>https://blog.prokulski.science/2026/06/29/dashboard-i-agent-musza-sie-zgadzac-plus-kueue-iceberg-i-kryzys-jakosci-kodu-przy-40-stopniach-w-cienu/</link><pubDate>Mon, 29 Jun 2026 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2026/06/29/dashboard-i-agent-musza-sie-zgadzac-plus-kueue-iceberg-i-kryzys-jakosci-kodu-przy-40-stopniach-w-cienu/</guid><description>&lt;p&gt;Witaj w pierwsym wakacyjnym wydaniu newslettera Dane i Analizy — przygotowanym w niedzielę wieczór, gdy Polska powoli stygła (ta, jasne&amp;hellip;) po tym, co meteorolodzy nazwali najgorętszym dniem w historii pomiarów. Nawet 40 stopni w cieniu. Skoro już jesteś przed ekranem zamiast przy wiatraczku, to dobrze trafiłeś — zebrałem dla Ciebie materiały, które warto przeczytać przy klimatyzacji lub choćby przy otwartym oknie.&lt;/p&gt;&#10;&lt;p&gt;W tym numerze sporo miejsca zajmują agenty AI — i to z różnych kątów. Dowiesz się, jak wyposażyć LLM w mózg data inżyniera, dlaczego Twój agent i dashboard mogą sobie wzajemnie zaprzeczać (i jak temu zaradzić architektonicznie), czym jest Agent Experience jako nowy wymiar projektowania API, a do tego jak AI wkracza do katalogów danych. Temat agentów w danych to nie hype — to realny kierunek, który warto rozumieć głębiej niż na poziomie demo.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2025-03-24</title><link>https://blog.prokulski.science/2025/03/24/newsletter-dane-i-analizy-2025-03-24/</link><pubDate>Mon, 24 Mar 2025 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2025/03/24/newsletter-dane-i-analizy-2025-03-24/</guid><description>&lt;p&gt;W dzisiejszym numerze analizujemy ewolucję systemów rekomendacji i wyszukiwania w erze LLM, prezentujemy zaawansowane techniki inżynierii danych, w tym potoki danych oparte na PostgreSQL oraz porównanie formatów data lake. Poruszamy również kwestię minimalizację liczby spotkań, a także przedstawiamy nowe narzędzia usprawniające pracę z Pythonem i bazami wektorowymi.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#ai_ml&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://eugeneyan.com//writing/recsys-llm/"&gt;&lt;strong&gt;Improving Recommendation Systems &amp;amp; Search in the Age of LLMs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Kompleksowa analiza transformacji systemów rekomendacji i wyszukiwania w kontekście dużych modeli językowych. Artykuł omawia zmiany w przemysłowych rozwiązaniach w ostatnim roku, skupiając się na architekturach multimodalnych, generowaniu danych wspomaganym przez LLM oraz technikach uczenia transferowego i destylacji.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2024-10-21</title><link>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</link><pubDate>Mon, 21 Oct 2024 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2024/10/21/newsletter-dane-i-analizy-2024-10-21/</guid><description>&lt;p&gt;OpenAI ze swoim modelem w wersji o1 wróciło na szczyt listy przebojów w kategorii LLM. Garść firm zajmujących się GenAI zaczyna generować poważne przychody. Co jeszcze dzieje się na rynku AI w 2024 roku? Jaki jest &amp;ldquo;Stan AI w 2024&amp;rdquo;? O tym dowiecie się z raportu, do którego link poniżej, w sekcji AI/ML.&lt;/p&gt;&#10;&lt;p&gt;Sporo w tym wydaniu o bazach danych (co najmniej dwa razy pojawia się Postgres i Redis, ale są też inne rozwiązania: wektorowa &lt;a href="https://milvus.io/"&gt;Milvus&lt;/a&gt;, &lt;a href="https://www.influxdata.com/"&gt;InfluxDB&lt;/a&gt; do szeregów czasowych, grafowa &lt;a href="https://neo4j.com/"&gt;Neo4j&lt;/a&gt;, dobrze znany stałym czytelnikom &lt;a href="https://duckdb.org/"&gt;DuckDB&lt;/a&gt;oraz &lt;a href="https://tile38.com/"&gt;Tile38&lt;/a&gt; do zadań geo).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-12-11</title><link>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</link><pubDate>Mon, 11 Dec 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/12/11/newsletter-dane-i-analizy-2023-12-11/</guid><description>&lt;p&gt;Miniony tydzień to uruchomienie nowej wersji asysstenta AI od Google, czyli Gemini (w miejsce Barda). Sam model mówi o sobie, że &lt;em&gt;&amp;ldquo;jestem zarówno Bardem, jak i Gemini. Bard to nazwa użytkownika, którą wykorzystuję do interakcji z użytkownikami, podczas gdy Gemini to nazwa platformy AI, na której jestem oparty&amp;rdquo;&lt;/em&gt;.&lt;br&gt;&#10;&lt;a href="https://deepmind.google/technologies/gemini/#introduction"&gt;Przedstawienie projektu&lt;/a&gt; (przez twórców) mówi o lepszych wynikach od ChataGPT v4 w prawie każdym mierniku., ale niby ma to dostęp do najnowszej wiedzy, ale jednak &lt;a href="https://g.co/bard/share/c0633f7cd6ac"&gt;taki sobie&lt;/a&gt;. Z literaturą nieco starszą radzi sobie&amp;hellip; &lt;a href="https://g.co/bard/share/21dc6e2f9212"&gt;sami zobaczcie&lt;/a&gt;. Słowacki i &amp;ldquo;Wesele&amp;rdquo;? to mogłoby być ciekawe, ale wolę wersję Wyspiańskiego (a filmową od Wajdy stawiam tuż za wajdowską &amp;ldquo;Ziemią obiecaną&amp;rdquo;). Czyli też zmyśla.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-10-30</title><link>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</link><pubDate>Mon, 30 Oct 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/10/30/newsletter-dane-i-analizy-2023-10-30/</guid><description>&lt;p&gt;Dzisiaj trochę o mapkach, trochę o diagramach (takie &lt;em&gt;diagram as a code&lt;/em&gt; tylko dlaczego &lt;a href="https://jira.atlassian.com/browse/BCLOUD-18559"&gt;BitBucket nie potrafi wyświetlić Mermaid&lt;/a&gt; (ticket w Atlassianie jest &amp;ldquo;solved&amp;rdquo;! Ale zobaczcie jak ;-), a GitHub robi to z palcem&amp;hellip; to znaczy bez problemu?), a do tego sporo materiału video. Chyba też więcej niż zwykle treści po polsku (polecamy tekst Tomka Zielińskiego o &lt;em&gt;transportowaniu danych&lt;/em&gt; - może się przydać na spotkania rekrutacyjne, ja lubię zadawać analogiczne pytania).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-09-04</title><link>https://blog.prokulski.science/2023/09/04/newsletter-dane-i-analizy-2023-09-04/</link><pubDate>Mon, 04 Sep 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/09/04/newsletter-dane-i-analizy-2023-09-04/</guid><description>&lt;p&gt;Wiecie co jest największym problemem dla analityka danych w dużej organizacji? Jest ich kilka, ale podzielić można je na kilka obszarów:&lt;br&gt;&#10;znajdowanie danych zrozumienie danych uzyskanie dostępu do danych&lt;/p&gt;&#10;&lt;p&gt;Przeczytacie o tym w &lt;a href="https://towardsdatascience.com/5-common-data-governance-pain-points-for-analysts-data-scientists-8efe8a007ac2"&gt;5 Common Data Governance Pain Points for Analysts &amp;amp; Data Scientists&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;I jeszcze na to dochodzi podejście do organizacji zespołów zajmującymi się danymi. Centralnie? A może każdy osobno? O tym pisze SeattleDataGuy w &lt;a href="https://seattledataguy.substack.com/p/centralized-vs-decentralized-vs-federated"&gt;Centralized vs Decentralized vs Federated Data Teams&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-06-26</title><link>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</link><pubDate>Mon, 26 Jun 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/06/26/newsletter-dane-i-analizy-2023-06-26/</guid><description>&lt;p&gt;Rozpoczynamy pierwszy tydzień wakacji, ale to wcale nie oznacza, że newsletter ma urlop. Wręcz przeciwnie.&lt;/p&gt;&#10;&lt;p&gt;W dzisiejszym wydaniu kilka tekstów opisujących dobre praktyki i całe cykle tutorialowe: CRUD-woe API dla MongoDB czy też asynchroniczne mikroserwisy spięte Rabbitem. To dla tych średniozaawansowanych programistów (i tych, którzy chcą swoją wiedzę przenieść z poziomu juniorskiego na wyższy). Dla tych bardziej juniorów - korepetycje z Window Functions w SQLu i &amp;ldquo;rozpakowywujących&amp;rdquo; gwiazdek w Pythonie (mimo że to nie Gwiazdka, he he, zacny suchar).&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-20</title><link>https://blog.prokulski.science/2023/02/20/newsletter-dane-i-analizy-2023-02-20/</link><pubDate>Mon, 20 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/20/newsletter-dane-i-analizy-2023-02-20/</guid><description>&lt;p&gt;Jak wyglądać będzie świat kiedy GPT-3 będzie pisać teksty? Mniej więcej tak jak wygląda Medium.com. Clickbaitowe tytuły, mało merytorycznej treści. Jeśli brać pod uwagę teksty mówiące ogólnie rzecz biorąc o IT to dodatkowo długie wprowadzenia (zawsze mniej więcej o tym samym: czym jest Kafka, czym jest AirFlow, czym jest Docker), potem dwa akapity o banalnym do rozwiązania problemie i to wszystko.&lt;/p&gt;&#10;&lt;p&gt;Może to przeziębienie trwające już za długo, może kryzys wieku średniego ;-) albo za dużo zajęć i rzeczy do zrobienia tu i teraz, ale szczerze mówiąc jestem zmęczony, głównie internetem - wszędzie to samo, wszystko miałkie, wszystko wtórne. Dlatego, żeby tego wszystkiego Wam oszczędzić do dzisiejszego newslettera wstępnie wybrałem około 50 artykułów. Ile przeszło selekcję? Widzicie poniżej. Ile z nich jest godnych uwagi i na prawdę coś ciekawego wnosi? To musicie ocenić sami.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2023-02-13</title><link>https://blog.prokulski.science/2023/02/13/newsletter-dane-i-analizy-2023-02-13/</link><pubDate>Mon, 13 Feb 2023 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2023/02/13/newsletter-dane-i-analizy-2023-02-13/</guid><description>&lt;p&gt;Tak się zdarzyło, że w dzisiejszym newsletterze wiodącą rolę mają tematy związane z wdrożeniami i utrzymaniem rozwiązań przetwarzających dane. Mamy więc tekst o kubefow, budowaniu struktur bazodanowych albo integracji kilku technologii (i jak zrobić to w domu). Dla inżynierów zajmujących się takimi zagadnieniami konsola CLI nie jest pewnie obca, więc i dla nich coś - mam nadzieję - interesującego się znajdzie.&lt;/p&gt;&#10;&lt;p&gt;Bardzo ciekawy jest tekst o podejściu do autoryzacji z punktu widzenia UX. Ostatnio miałem okazję szukać i rezerwować lokum na weekend w serwisie Airbnb. Nie pamiętałem hasła, a po kilku próbach serwis po prostu przysłał mi maila z linkiem dzięki któremu od razu byłem zalogowany. Czy to bezpieczne czy nie - nie określajmy. Ale jakże wygodne!&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-12-12</title><link>https://blog.prokulski.science/2022/12/12/newsletter-dane-i-analizy-2022-12-12/</link><pubDate>Mon, 12 Dec 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/12/12/newsletter-dane-i-analizy-2022-12-12/</guid><description>&lt;p&gt;Dzisiaj nie będzie o GPT-3 i &lt;a href="https://chat.openai.com/chat"&gt;chacie OpenAI&lt;/a&gt; (jak &lt;a href="https://www.google.com/search?tbm=nws&amp;amp;q=Chat+GPT"&gt;wszędzie&lt;/a&gt;), ale będzie wprowadzenie w temat szeregów czasowych oraz coś o metrykach dla modeli rekomendacyjnych.&lt;/p&gt;&#10;&lt;p&gt;Jest też trochę materiałów dla początkujących i średnio-zaawansowanych w Pythonie, a sekcja &lt;strong&gt;ciekawostek&lt;/strong&gt; pozwoli wybrać książkę dla inżynierów danych albo&amp;hellip; nauczyć się programu do obsługi audio/wideo.&lt;/p&gt;&#10;&lt;p&gt;Pamiętacie o &lt;strong&gt;Kartach Data Science&lt;/strong&gt;? Właśnie pojawiła się aktualizacja o paczkę dotyczącą szeregów czasowych (dobrze komponuje się z dzisiejszym wydaniem, prawda?). To coś dla Ciebie? A może na prezent pod choinkę dla kogoś znajomego? Tak czy inaczej ja daję &lt;a href="https://kartydatascience.pl/?utm_source=newsletter&amp;amp;utm_medium=link&amp;amp;utm_campaign=daneianalizy"&gt;&lt;strong&gt;bezterminowo 15% zniżki&lt;/strong&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-08-08</title><link>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</link><pubDate>Mon, 08 Aug 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/08/08/newsletter-dane-i-analizy-2022-08-08/</guid><description>&lt;p&gt;Wakacje za półmetkiem, więc tematy w dzisiejszym newsletterze tak pół na pół.&lt;/p&gt;&#10;&lt;p&gt;Z jednej strony mamy ciężkie rzeczy: nowe naukowe &lt;em&gt;pejpery&lt;/em&gt; czy omówienie algorytmu grupowania przestrzennego opartego na gęstości. Ale z drugiej - automatyzację w Excelu czy kilka(naście) inspiracji dotyczących prezentowania danych.&lt;/p&gt;&#10;&lt;p&gt;Dla tych zaś co lubią wdrażanie i Kubernetesy - też coś się znajdzie, chociażby cluster na malinach ;-)&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/6-papers-every-modern-data-scientist-must-read-1d0e708becd"&gt;&lt;strong&gt;6 Papers Every Modern Data Scientist Must Read&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Przegląd prasy (publikacji naukowych) dla prawdziwych nerdów AI/ML. Jaki &amp;ldquo;pejper&amp;rdquo; czytasz dzisiaj?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-07-04</title><link>https://blog.prokulski.science/2022/07/04/newsletter-dane-i-analizy-2022-07-04/</link><pubDate>Mon, 04 Jul 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/07/04/newsletter-dane-i-analizy-2022-07-04/</guid><description>&lt;p&gt;Znacie historię plików cookie? Dzisiaj możecie ją poznać z jednego z tekstów w newsletterrze.&lt;/p&gt;&#10;&lt;p&gt;Jeśli interesuje Was coś z zakresu wdrażania oprogramowania, monitoringu i ogólnie pojętej automatyzacji tego typu działań - sekcja DevOps może być dobrym początkiem.&lt;/p&gt;&#10;&lt;p&gt;Polecam też gorąco tekst o efekcie wabika oraz R-owy pakiet gtExtras użyty w jednym ze sposobów prezentacji rankingu zawodników.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="analiza_danych_koncepcje"&gt;#analiza_danych_koncepcje&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/unsupervised-learning-k-means-clustering-27416b95af27"&gt;&lt;strong&gt;Unsupervised Learning: K-Means Clustering&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;K-means to jeden z algorytmów nienadzorowanego uczenia maszynowego o którego pytają na rozmowach kwalifikacyjnych. Jak działa?&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2022-02-14</title><link>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</link><pubDate>Mon, 14 Feb 2022 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2022/02/14/newsletter-dane-i-analizy-2022-02-14/</guid><description>&lt;p&gt;Dzisiaj coś trudniejszego niż MNIST oraz ściągawka z algorytmów grupowania elementów (clustering). Do tego ciekawy projekt wizualizacji danych z meczów piłki nożnej.&lt;/p&gt;&#10;&lt;p&gt;A jeśli myślisz o projektowaniu systemów a nie tylko o samej analizie danych to wykład Sławka Sobótki o Domain Driven Design powinien Cię uradować.&lt;/p&gt;&#10;&lt;hr&gt;&#10;&lt;h3 id="ai_ml"&gt;#AI_ML&lt;/h3&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-google-cloud-machine-learning-apis-programmatically-in-python-part-1-430f608af6a5"&gt;&lt;strong&gt;Using Google Cloud Machine Learning APIs&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Jak korzystać z interfejsów machine learning API od Google w Pythonie? Część pierwsza cyklu&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/using-fastai-to-classify-japanese-kanji-characters-47d7edd4d569"&gt;&lt;strong&gt;Using FastAI to classify Japanese kanji characters&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Rozpoznawanie pisanych ręcznie cyfr - czyli zbiór MNIST - to może być zbyt prosty problem dla adeptów sztuki nauki o danych&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-12-06</title><link>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</link><pubDate>Mon, 06 Dec 2021 15:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/12/06/newsletter-dane-i-analizy-2021-12-06/</guid><description>&lt;p&gt;Na Mikołajki przegląd internetu pod kątem danych, ich analiz i sposobów programowania oraz wdrażania zaprogramowanych rozwiązań.&lt;br&gt;&#10;Najciekawszym dla początkujących będzie pewnie zbiór ponad 200 tekstów zgromadzonych w jednym miejscu na różne tematy związane z machine learingiem (to prawdę mówiąc trochę jak &lt;a href="https://thecleverprogrammer.com/machine-learning/"&gt;spis treści jednego bloga&lt;/a&gt;), a bardziej doświadczeni dowiedzą się jak połączyć C++ z Pythonem. Są też ciekawe teksty o R (i Shiny), co się ostatnio dość rzadko zdarzało.&lt;/p&gt;&#10;&lt;p&gt;Skoro jesteśmy przy R - w piątek (10 grudnia) zaś konferencja &lt;strong&gt;WhyR?&lt;/strong&gt; - rezerwujcie sobie czas, bo materiału sporo (co widać po zaplanowanych streamingach na YouTube). Więcej szczegółów na stronie imprezy &lt;a href="https://2021.whyr.pl/"&gt;2021.whyr.pl&lt;/a&gt;&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-07-05</title><link>https://blog.prokulski.science/2021/07/05/newsletter-dane-i-analizy-2021-07-05/</link><pubDate>Mon, 05 Jul 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/07/05/newsletter-dane-i-analizy-2021-07-05/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/create-a-dashboard-to-track-anything-with-plotly-and-dash-f9a5234d548b"&gt;&lt;strong&gt;How to Create a Dashboard to Track Anything With Plotly And Dash&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Or “How I stopped using third-party apps to track my investments”! It’s really easy to get started with your own template. Spoiler alert: this is not my actual portfolio! Ever since I started investing my hard-earned money, I was obsessed with having some sort of dashboard or tool that would allow (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://towardsdatascience.com/state-of-the-art-of-speech-synthesis-at-the-end-of-may-2021-6ace4fd512f2"&gt;&lt;strong&gt;State Of The Art of Speech Synthesis at the End of May 2021 | by Patrick Meyer | Jun, 2021&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Thoughts and Theory Presentation of the state of the art in speech synthesis research at the end of May 2021 with a focus on deep learning technologies. I present a synthesis of 71 publications and give you the keys to understand the underlying concepts. Voice is the most natural way we have to (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-06-07</title><link>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</link><pubDate>Mon, 07 Jun 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/06/07/newsletter-dane-i-analizy-2021-06-07/</guid><description>&lt;p&gt;&lt;a href="https://towardsdatascience.com/3-examples-that-show-the-unlimited-flexibility-of-pyspark-319ab22d5a?source=rss----7f60cf5620c9---4"&gt;&lt;strong&gt;3 Examples That Show The Unlimited Flexibility of PySpark&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;A combination of Python and SQL but easier than both Spark is an analytics engine used for large-scale data processing. It lets you spread both data and computations over clusters to achieve a substantial performance increase. It is easier than ever to collect, transfer, and store data. Hence, we (&amp;hellip;)&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://cmdlinetips.com/2021/06/row-wise-operations-in-r/"&gt;&lt;strong&gt;Row-wise operations in R: compute row means in tidyverse&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;This tutorial shows how to perform row-wise operations in R using tidyverse. We will use three key functions, rowwise(), c_across() and rowMeans() to perform to perform row-wise operations on a dataframe. rowwise() and c_across() functions are from dplyr. rowwise() function is available in dplyr (&amp;hellip;)&lt;/p&gt;</description></item><item><title>Newsletter Dane i Analizy, 2021-05-31</title><link>https://blog.prokulski.science/2021/05/31/newsletter-dane-i-analizy-2021-05-31/</link><pubDate>Mon, 31 May 2021 09:00:00 +0000</pubDate><guid>https://blog.prokulski.science/2021/05/31/newsletter-dane-i-analizy-2021-05-31/</guid><description>&lt;p&gt;&lt;a href="https://gursimar27.medium.com/containers-the-actual-mechanism-behind-the-technology-and-why-kubernetes-depreciated-docker-74b3f2e51cd6"&gt;&lt;strong&gt;Containers: The actual mechanism behind the technology and why Kubernetes depreciated Docker&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;In this article, we will be covering all the details about containers i.e. how they actually work behind the scene and all the parts it… Continue reading on Medium »&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://pub.towardsai.net/fully-explained-hierarchical-clustering-with-python-ebb256317b50"&gt;&lt;strong&gt;Fully Explained Hierarchical Clustering with Python&lt;/strong&gt;&lt;/a&gt;&lt;br&gt;&#10;Programming Agglomerative clustering in unsupervised machine learning Hierarchical clustering. A photo by Author In this article, we will discuss hierarchical clustering algorithms in unsupervised machine learning. This algorithm is based on the splitting and merging of nested clusters. The linkage (&amp;hellip;)&lt;/p&gt;</description></item></channel></rss>