Skrb za zasebnost podatkov narašča, hkrati pa se povečuje potreba po modelih umetne inteligence, ki temeljijo na kakovostnih podatkih iz različnih virov. Ker podatki posamezne organizacije pogosto ne zadoščajo za razvoj naprednih modelov, je potrebno sodelovanje več podatkovnih virov. Neposredno združevanje podatkov pa ni mogoče, saj bi lahko ogrozilo njihovo zasebnost.
Rešitev predstavlja zvezno učenje (angl. federated learning), pri katerem se podatki med sodelujočimi organizacijami ne izmenjujejo, temveč se združujejo le modeli, naučeni pri posameznih udeležencih. Pomemben izziv pri tem ostaja, kako prepoznati udeležence s podobnimi podatkovnimi zbirkami, saj lahko neustrezno združevanje modelov vpliva na kakovost končnega rezultata.
S tem izzivom so se ukvarjali izr. prof. dr. Veljko Pejović in Boris Radovič z UL FRI ter prof. Marco Canini s KAUST v članku Label-free dataset profiling for federated client clustering, objavljenem v reviji Data Mining and Knowledge Discovery. Predstavili so pristop CoLEDS, ki omogoča profiliranje podatkovnih zbirk in prepoznavanje podobnosti med njimi, ne da bi bilo treba razkrivati same podatke.
CoLEDS s pomočjo porazdeljenega učenja ustvari predstavitev podatkovnih zbirk, na podlagi katere lahko prepozna skupine udeležencev s podobnimi podatki. Pristop ne zahteva označenih podatkov in omogoča učinkovitejše zvezno učenje, saj lahko posamezne skupine uporabljajo modele, ki so bolje prilagojeni njihovim podatkovnim značilnostim.

Slika: Prikaz postopka učenja COLEDS. Za vsak vhodni podatkovni nabor se ustvarita dva pogleda (vzorca), ki ju obdela model ψ za izračun vložitev (embeddingov) podatkovnega nabora. Zelena črta označuje razdaljo, ki se med učenjem minimizira, medtem ko rdeče črte označujejo razdalje, ki se maksimizirajo.
Tak pristop ima potencial predvsem na področjih, kjer so podatki občutljivi in razpršeni med različne organizacije. V zdravstvu bi na primer lahko omogočil sodelovanje bolnišnic pri razvoju modelov za prepoznavanje bolezni na podlagi podatkov pacientov, pri tem pa bi zasebnost podatkov ostala zaščitena.
Več si lahko preberete tukaj: