Start Projekty Health Data Analytics
Power BI Data Security Healthcare Compliance

Health Data Analytics
Ochrona Danych Medycznych

Projekt łączący zaawansowaną analitykę medyczną z rygorystycznymi standardami bezpieczeństwa informacji. Na podstawie badawczych zbiorów danych stworzono wielowymiarowe dashboardy w Power BI, prezentujące czynniki ryzyka zdrowotnego. Głównym filarem projektu jest zastosowanie mechanizmów anonimizacji, kontroli dostępu i zabezpieczeń wymaganych do ochrony silnie wrażliwych danych pacjentów (RODO/HIPAA), co wpisuje się w ścieżkę rozwoju w kierunku Information Security Officera (CISO).

2026 Informacje Wrażliwe (PHI) 250k+ rekordów CSV
100% Anonimizacja Danych
RBAC Role-Based Access
RODO Zgodność prawna
253k+ Badanych rekordów

Anonimizacja w locie

Całkowite usunięcie wartości typu PII (Personally Identifiable Information) w warstwie analitycznej w celu ochrony tożsamości pacjentów.

Zabezpieczenia RLS

Projekt przygotowany do zaimplementowania Row-Level Security w usłudze Power BI w celu logicznego odizolowania danych między różnymi klinikami.

Zgodność (Compliance)

Architektura zgodna z założeniami minimalizacji danych, co jest fundamentem wdrażania procedur RODO/GDPR oraz standardów HIPAA w organizacjach.

Bezpieczna Analityka

Skuteczne łączenie danych demograficznych oraz genetycznych do poszukiwania ryzyk zdrowotnych z poszanowaniem cyfrowej prywatności i etyki danych.

Oczyszczanie (ETL)

Rygorystyczna walidacja i standaryzacja pliku .csv przed transferem, zapobiegająca potencjalnym infekcjom lub wstrzyknięciom szkodliwego kodu (Injection).

Podejście "Privacy by Design"

System zaplanowany od zera w sposób traktujący zachowanie integralności i poufności informacji (CIA Triad) jako absolutny priorytet.

Zarządzanie bezpieczeństwem danych

Analiza zjawisk dotyczących ryzyka sercowo-naczyniowego (bazująca na zbiorze heart_disease_health_indicators_BRFSS2015.csv) została przeprowadzona w taki sposób, aby udowodnić możliwość generowania wysokojakościowych wniosków medycznych bez narażania na kompromitację ani jednego pacjenta. Stworzone dashboardy stanowią praktyczną implementację podejścia Privacy by Design.

W związku z moim długoterminowym celem rozwoju w kierunku stanowiska Information Security Officera (DPO / CISO), projekt ten stanowi pomost między inżynierią analityczną a zarządzaniem ryzykiem ochrony danych. Rozumienie tego, jak dane są przechowywane, transformowane oraz wyświetlane użytkownikowi końcowemu (End-User), jest fundamentem projektowania odpornych na wycieki systemów (DLP).

Standardy i Procedury (Data Protection)

01

Klasyfikacja Danych Zastrzeżonych

Informacje medyczne (tzw. Protected Health Information - PHI) sklasyfikowane zostały jako ściśle poufne. Przed użyciem pliku w modelu zaimplementowano reguły odrzucające wszystkie rekordy mogące prowadzić do odkrycia tożsamości.

02

Kategoryzacja Dostępów

Zasada "najmniejszego przywileju" (Principle of Least Privilege). W teorii architektury, role analityczne otrzymują jedynie widoki zagregowane na poziomie populacyjnym, bez dostępu do ziarnistości na poziomie wiersza bazodanowego.

03

Zachowanie Integralności

Przetwarzanie danych oparte zostało o surowe transformacje ETL zapobiegające powstawaniu błędów (Data Poisoning) na etapie karmienia środowiska modelu (Power BI Engine).

Wnioski Analityczne i Zidentyfikowane Korelacje

Oprócz warstwy bezpieczeństwa, zintegrowane i zagregowane dane pozwoliły na przeprowadzenie głębokiej eksploracji (Data Mining). W roli analityka zidentyfikowałem kluczowe wzorce populacyjne ze zbioru obejmującego ponad ćwierć miliona rekordów:

  • Kaskadowe Czynniki Ryzyka (Clinical Risk): Wykazano silną, dodatnią korelację między wysokim ciśnieniem krwi (HighBP), nieuregulowanym cholesterolem, a zapadalnością na choroby wieńcowe (Heart Disease/Attack). Analiza wykazuje, że jednoczesne występowanie tych dwóch zmiennych drastycznie zwiększa ryzyko zawału względem wpływu pojedynczych czynników w izolacji.
  • Segmentacja Behawioralna (Lifestyle): Model danych został wykorzystany do budowy profili behawioralnych na podstawie wskaźnika BMI, regularności aktywności fizycznej (PhysActivity) oraz historii palenia tytoniu. Tabele krzyżowe ewidentnie potwierdzają, że otyłość powiązana z brakiem ruchu stanowi główny akcelerator dla współwystępowania cukrzycy (Diabetes).
  • Wielochorobowość (Health Burden): Zbadano wpływ wskaźnika GenHlth (samoocena ogólnego zdrowia) na liczbę zgłaszanych problemów fizycznych i mentalnych. Zidentyfikowano segment krytyczny — grupę "wysokiego obciążenia", w której pacjenci borykający się z udarami (Stroke) oraz trudnościami w poruszaniu się (DiffWalk) generują największe obciążenie dla systemu opieki zdrowotnej.
  • Zależności Socjoekonomiczne: Zagregowano dane po wskaźnikach wykształcenia (Education) oraz przychodów (Income). Dashboardy w czytelny sposób uwydatniły dysproporcję: niski pułap zarobków oraz brak planów ubezpieczeniowych (Healthcare Coverage) drastycznie korelują z zaniedbywaniem wizyt profilaktycznych z powodu barier finansowych.