Health Data Analytics
Ochrona Danych Medycznych
Projekt łączący zaawansowaną analitykę medyczną z rygorystycznymi standardami bezpieczeństwa informacji. Na podstawie badawczych zbiorów danych stworzono wielowymiarowe dashboardy w Power BI, prezentujące czynniki ryzyka zdrowotnego. Głównym filarem projektu jest zastosowanie mechanizmów anonimizacji, kontroli dostępu i zabezpieczeń wymaganych do ochrony silnie wrażliwych danych pacjentów (RODO/HIPAA), co wpisuje się w ścieżkę rozwoju w kierunku Information Security Officera (CISO).
Anonimizacja w locie
Całkowite usunięcie wartości typu PII (Personally Identifiable Information) w warstwie analitycznej w celu ochrony tożsamości pacjentów.
Zabezpieczenia RLS
Projekt przygotowany do zaimplementowania Row-Level Security w usłudze Power BI w celu logicznego odizolowania danych między różnymi klinikami.
Zgodność (Compliance)
Architektura zgodna z założeniami minimalizacji danych, co jest fundamentem wdrażania procedur RODO/GDPR oraz standardów HIPAA w organizacjach.
Bezpieczna Analityka
Skuteczne łączenie danych demograficznych oraz genetycznych do poszukiwania ryzyk zdrowotnych z poszanowaniem cyfrowej prywatności i etyki danych.
Oczyszczanie (ETL)
Rygorystyczna walidacja i standaryzacja pliku .csv przed transferem, zapobiegająca potencjalnym infekcjom lub wstrzyknięciom szkodliwego kodu (Injection).
Podejście "Privacy by Design"
System zaplanowany od zera w sposób traktujący zachowanie integralności i poufności informacji (CIA Triad) jako absolutny priorytet.
Zarządzanie bezpieczeństwem danych
Analiza zjawisk dotyczących ryzyka sercowo-naczyniowego (bazująca na zbiorze heart_disease_health_indicators_BRFSS2015.csv) została przeprowadzona w taki sposób, aby udowodnić możliwość generowania wysokojakościowych wniosków medycznych bez narażania na kompromitację ani jednego pacjenta. Stworzone dashboardy stanowią praktyczną implementację podejścia Privacy by Design.
W związku z moim długoterminowym celem rozwoju w kierunku stanowiska Information Security Officera (DPO / CISO), projekt ten stanowi pomost między inżynierią analityczną a zarządzaniem ryzykiem ochrony danych. Rozumienie tego, jak dane są przechowywane, transformowane oraz wyświetlane użytkownikowi końcowemu (End-User), jest fundamentem projektowania odpornych na wycieki systemów (DLP).
Standardy i Procedury (Data Protection)
Klasyfikacja Danych Zastrzeżonych
Informacje medyczne (tzw. Protected Health Information - PHI) sklasyfikowane zostały jako ściśle poufne. Przed użyciem pliku w modelu zaimplementowano reguły odrzucające wszystkie rekordy mogące prowadzić do odkrycia tożsamości.
Kategoryzacja Dostępów
Zasada "najmniejszego przywileju" (Principle of Least Privilege). W teorii architektury, role analityczne otrzymują jedynie widoki zagregowane na poziomie populacyjnym, bez dostępu do ziarnistości na poziomie wiersza bazodanowego.
Zachowanie Integralności
Przetwarzanie danych oparte zostało o surowe transformacje ETL zapobiegające powstawaniu błędów (Data Poisoning) na etapie karmienia środowiska modelu (Power BI Engine).
Wnioski Analityczne i Zidentyfikowane Korelacje
Oprócz warstwy bezpieczeństwa, zintegrowane i zagregowane dane pozwoliły na przeprowadzenie głębokiej eksploracji (Data Mining). W roli analityka zidentyfikowałem kluczowe wzorce populacyjne ze zbioru obejmującego ponad ćwierć miliona rekordów:
- Kaskadowe Czynniki Ryzyka (Clinical Risk): Wykazano silną, dodatnią korelację między wysokim ciśnieniem krwi (HighBP), nieuregulowanym cholesterolem, a zapadalnością na choroby wieńcowe (Heart Disease/Attack). Analiza wykazuje, że jednoczesne występowanie tych dwóch zmiennych drastycznie zwiększa ryzyko zawału względem wpływu pojedynczych czynników w izolacji.
- Segmentacja Behawioralna (Lifestyle): Model danych został wykorzystany do budowy profili behawioralnych na podstawie wskaźnika BMI, regularności aktywności fizycznej (PhysActivity) oraz historii palenia tytoniu. Tabele krzyżowe ewidentnie potwierdzają, że otyłość powiązana z brakiem ruchu stanowi główny akcelerator dla współwystępowania cukrzycy (Diabetes).
- Wielochorobowość (Health Burden): Zbadano wpływ wskaźnika GenHlth (samoocena ogólnego zdrowia) na liczbę zgłaszanych problemów fizycznych i mentalnych. Zidentyfikowano segment krytyczny — grupę "wysokiego obciążenia", w której pacjenci borykający się z udarami (Stroke) oraz trudnościami w poruszaniu się (DiffWalk) generują największe obciążenie dla systemu opieki zdrowotnej.
- Zależności Socjoekonomiczne: Zagregowano dane po wskaźnikach wykształcenia (Education) oraz przychodów (Income). Dashboardy w czytelny sposób uwydatniły dysproporcję: niski pułap zarobków oraz brak planów ubezpieczeniowych (Healthcare Coverage) drastycznie korelują z zaniedbywaniem wizyt profilaktycznych z powodu barier finansowych.