Klaszterek
Info
Az oldal a kiválasztott sorozatokat a viselkedésük hasonlósága szerint csoportokba, klaszterekbe rendezi (clustering), és egy térképen mutatja, melyek hasonlítanak egymásra: mely hatóanyagok fogynak azonos ütemben az évben, melyek nőnek vagy csökkennek együtt. A szakdolgozat ezt a feladatot jövőbeli irányként jelölte meg; itt a böngészőben fut. A sorozatok egyetlen kéréssel érkeznek, a jellemzőkészlet, a klaszterszám, az ablak vagy a kezdőérték átállítása után a számítás helyben ismétlődik, új kérés nélkül. A módszerek megnevezései a dokumentációjukra mutatnak; mindegyik ebben az alkalmazásban van megvalósítva, a tesztek szintetikus adatokon ellenőrzik őket.
- Jellemzők. Két választható leírása van egy sorozatnak. Az alak: a sorozat a közös időablakon a saját átlagával osztva, így a nagy és a kis forgalmú, de azonos lefutású sorozatok egy pontba kerülnek; két sorozat távolsága az alakjaik pontonkénti eltéréseiből adódó euklideszi távolság. A leíróvektor: tizenkét szezonális index (az egyes naptári hónapok átlaga az egész átlagához képest), a log-lineáris trend meredeksége, a trend és a szezon után maradó ingadozás relatív szórása, a nulla hónapok aránya, és az utolsó év növekedése az előzőhöz; mindegyik a sorozatok között standardizálva (átlag 0, szórás 1), hogy egyik se nyomja el a többit. Az ablakot nem teljesen lefedő sorozatok (időközben bevezetett vagy kivont készítmények) kimaradnak, a számuk a feliratban áll.
- k-means (k-közép klaszterezés): k középpontból indul, minden sorozatot a legközelebbihez sorol, a középpontokat a tagjaik átlagára helyezi, és ezt ismétli, amíg a besorolás nem változik. A kezdőpontokat a k-means++ eljárás választja, egymástól távol, hogy a módszer ne ragadjon rossz felosztásban; tíz különböző indulás közül a legkisebb klaszteren belüli négyzetösszegű (inertia) eredmény marad. A kezdőérték (seed) a véletlen indulást rögzíti: ugyanaz a beállítás ugyanazt a képet adja, ezért egy ábra reprodukálható.
- Silhouette coefficient (sziluett-együttható): minden pontra (b − a) / max(a, b), ahol a a saját klasztere többi tagjától mért átlagos távolság, b a legközelebbi másik klaszter tagjaitól mért; 1 közelében a pont mélyen a saját klaszterében ül, 0 körül határon, negatív értéknél inkább a másikhoz tartozna. A táblázat minden k-ra a pontok átlagát mutatja, 2-től 12-ig: a legnagyobb érték a legjobban elváló felosztás, a választásnál azonban az is számít, hogy a csoportok szakmailag értelmezhetők-e.
- Principal component analysis (főkomponens-elemzés, PCA): a sokdimenziós jellemzőtér két olyan irányát keresi meg, amelyben a pontok a legjobban szóródnak, és ezekre vetíti őket: ez a térkép. A tengelyfeliratok megmondják, a teljes szóródás (variancia) hány százaléka látszik; ami hiányzik, azt a kép nem mutatja, a klaszterezés viszont a teljes jellemzőtérben történt, nem a vetületen.
A klaszterek tipikus alakja a tagok alakjának átlaga az ablak hónapjaira; a tagtáblázat a középponttól mért távolsággal mutatja, ki a csoport jellegzetes és ki a szélső tagja. Az éves adatkészleten csak az alak választható: a leíróvektor a szezon tizenkét hónapjára épül.
Az adatforrás a forgalom helyett a NEAK egyedi betegszáma is lehet (lásd a Betegszámok oldalt): a BSZ a hónap betegszáma, az év alakjához; a BSZ_MAT a jelölt hónappal záruló 12 hónapé, a betegkör lassú változásához. Ekkor a sorozatok a betegszám-táblákból jönnek, országosan és csak a havi adatkészleten; az első N sorozatot az időszak utolsó hónapjának betegszáma rangsorolja, mert az egyedi betegszám nem összegezhető; és csak az időszak minden hónapjában közölt (50 fölötti) sorozatok szerepelnek. Az alapértelmezett kezdet 2015. Ettől a hónaptól a táblák kb. harmadával több sort tartalmaznak, de a többlet mind 0 értékű sor (50 alatti betegszám): a 0 fölötti sorok száma és az értékek menete nem változik, a mért betegszámokat tehát a váltás nem érinti. Korábbi kezdet is választható.