sunnuntai 28. helmikuuta 2016

Voiko vaaleja ennustaa?

Ennen vaaleja tutkijoiden, median ja kahvipöytäkeskustelujen yhdeksi lempiaiheeksi tulee vaalituloksen ennustaminen. Media tuuttaa gallupeja ulos kiihtyvällä tahdilla ja niiden tuloksia seurataan tarkasti niin puoluetoimistoissa, yliopistojen työhuoneissakin kuin politiikkanörttien Facebook-ketjuissakin. Valveutuneimmat seuraajat yhdistelevät gallupeihin omaa teoreettista näkemystään ja mututuntumaa luodakseen omia ennusteita vaalien lopputulemasta.

Jenkki Nate Silver nousi monien tietoisuuteen hyvin tarkoilla, monia gallupeja ja bayesilaista
päättelyä yhdistelevillä ennusteillaan. Joskus Suomessakin tehdyt ennusteet osuvat täysin oikeaan. Mutta Fivethirtyeightin kaltaisesti systemaattisesta formaaleihin malleihin perustuvasta ennustamisesta me Suomessa olemme kaukana.

Arvostan suuresti Fivethirtyeightia ja Nate Silveria, mutta itse olen vaalien fiksua ja tarkkaa ennustamistakin kiinnostuneempi siitä, että kuinka hyvin vaaleja voidaan ennustaa "ilman poliittista järkeä". Tarkoitan tällä tilastollisten ennustemallien soveltamista dataan, josta on irrotettu kaikki tieto kannatusmittauksista ja muista vaalien alla poliittiseen mielialaan vaikuttavista tekijöistä. Ehdokastasolla valituksi tulleiden ennustamista käsittelevää juttuani jo mainostinkin. Seuraavaksi on aika pyrkiä samaan puoluetasolla ja "ennustaa" puolueiden kunnittaista kannatusta vuoden 2015 eduskuntavaaleissa hyödyntäen vain kuntien sosioekonomisia indikaattoreita ja vuoden 2011 eduskuntavaalien tulosta.

Mallina hyödynnetään random forest - tekniikkaa. Kyseessä on paranneltu versio tässä blogipostauksessa esitellystä päätöspuumenetelmästä. Satunnaismetsässä tehdään nimensä mukaisesti useita eri päätöspuu-malleja, joita kaikkia varioidaan vähän käytetyn datan ja muuttujien suhteen ja näistä yksittäistä päätöspuu-malleista aggregoidaan käytettävä lopullinen malli. Näin yhden mallin vinoumat ja virheet tasoittuvat ja lopputuloksen mallin pitäisi olla tasapainoisempi ja ennustamiskykyisempi kuin mikään yksittäinen päätöspuu. Haittapuolena on tulkittavuuden vähentyminen; satunnaismetsämallin vaikutussuhteita ei enää voi selvittää, eli syitä tehtyisin ennustuksiin on yksittäistä päätöspuuta vaikeampi päätellä. Malli koulutetaan rakentamaan jokaiselle puolueelle kannatusta alla mainituilla sosioekonomisilla indikaattoreilla vuoden 2011 vaalitulosta selittävä malli, jolla sitten "ennustetaan" vuosien 2015 tulosta.

Datana käytetään Tilastokeskukselta vuosilta 2011 ja 2014 muuttujia keskimääräinen asunnon koko per henkilö, väestön keskimääräinen koulutusaste (VKTM-mittari), mediaanitulo, väestöllinen huoltosuhde, keski-ikä, muuhun uskontokuntaan kuuluvien osuus, työttömyysaste ja pois muuttaneiden osuus väestöstä. Työttömyysasteessa jouduttiin käyttämään 2016 mukaista kuntajakoa ja kaksi havaintoa aineistosta näyttää puuttuvan ihan muuten vaan, joten havaintojen lukumäärä on lopulta 311 molemmissa vaaleissa.

Ja sitten itse tuloksiin.

SDP, ennustetut vs toteutuneet kunnittaiset ääniosuudet
Kunnittaisten ääniosuuksien keskihajonta:7,3
Jäännösten keskihajonta:5,8
R2: 0,38
Ennusteen ja aidon tuloksen keskimääräinen ero: 5,5
Kunnittaisten äänestysosuuksien keskiarvo (toteutunut): 13,1
Kunnittaisten äänestysosuuksien keskiarvo (ennustettu): 16,4
Kristillisdemokraatit , ennustetut vs toteutuneet kunnittaiset ääniosuudet
Kunnittaisten ääniosuuksien keskihajonta:3,7
Jäännösten keskihajonta:2,6
R2: 0,5
Ennusteen ja aidon tuloksen keskimääräinen ero: 2,1
Kunnittaisten äänestysosuuksien keskiarvo (toteutunut): 3.5
Kunnittaisten äänestysosuuksien keskiarvo (ennustettu): 4,3


Keskusta, ennustetut vs toteutuneet kunnittaiset ääniosuudet
Kunnittaisten ääniosuuksien keskihajonta: 18,5
Jäännösten keskihajonta: 11,5
R2: 0,62
Ennusteen ja aidon tuloksen keskimääräinen ero:11,5
Kunnittaisten äänestysosuuksien keskiarvo (toteutunut): 34
Kunnittaisten äänestysosuuksien keskiarvo (ennustettu): 28,1

Kokoomus, ennustetut vs toteutuneet kunnittaiset ääniosuudet
Kunnittaisten ääniosuuksien keskihajonta:7,2
Jäännösten keskihajonta:4,6
R2: 0,58
Ennusteen ja aidon tuloksen keskimääräinen ero: 4,5
Kunnittaisten äänestysosuuksien keskiarvo (toteutunut): 11
Kunnittaisten äänestysosuuksien keskiarvo (ennustettu): 13,5

Perussuomalaiset, ennustetut vs toteutuneet kunnittaiset ääniosuudet
Kunnittaisten ääniosuuksien keskihajonta:7,4
Jäännösten keskihajonta:5,8
R2: 0,39
Ennusteen ja aidon tuloksen keskimääräinen ero: 4,5
Kunnittaisten äänestysosuuksien keskiarvo (toteutunut): 18
Kunnittaisten äänestysosuuksien keskiarvo (ennustettu): 19,9

RKP, ennustetut vs toteutuneet kunnittaiset ääniosuudet
Kunnittaisten ääniosuuksien keskihajonta:14,5
Jäännösten keskihajonta:11,5
R2: 0,36
Ennusteen ja aidon tuloksen keskimääräinen ero: 5,5
Kunnittaisten äänestysosuuksien keskiarvo (toteutunut): 4,4
Kunnittaisten äänestysosuuksien keskiarvo (ennustettu): 4,6

Vasemmistoliitto
Kunnittaisten ääniosuuksien keskihajonta:4,8
Jäännösten keskihajonta:4
R2: 0,31
Ennusteen ja aidon tuloksen keskimääräinen ero: 4,3
Kunnittaisten äänestysosuuksien keskiarvo (toteutunut): 5,7
Kunnittaisten äänestysosuuksien keskiarvo (ennustettu): 8,9
Vihreät, ennustetut vs toteutuneet kunnittaiset ääniosuudet
Kunnittaisten ääniosuuksien keskihajonta:2,9
Jäännösten keskihajonta:1,6 R2: 0,69
Ennusteen ja aidon tuloksen keskimääräinen ero: 1,4
Kunnittaisten äänestysosuuksien keskiarvo (toteutunut): 3,7
Kunnittaisten äänestysosuuksien keskiarvo (ennustettu): 3,4


Ylläolevista kuvioista ja tunnusluvuista nähdään, että puolueen vaalitulosta tietyssä kunnassa todellakin on mahdollista suhteellisen hyvin ennustaa neljä vuotta sitten käytyjen vaalien ja nykyhetken sosioekonomisten indikaattorien tietämisellä. Joidenkin puolueiden kohdalla tämä onnistui paremmin kuin toisten.

Parhaiten ennustaminen onnistui Vihreiden, Keskustan ja Kokoomuksen kohdalla. Heikoiten se onnistui Vasemmistoliiton ja RKP:n kanssa. Näillä kolmella puolueella onkin aika selkeä maantieteellinen profiili. Sekä Kokoomus, että Vihreät ovat suosittuja etelän suurissa kaupunkikeskittymissä, kun taas Keskusta pitää valtaa suuressa osaa pienempiä pitäjiä.

Toisaalta RKP: lläkin on selkeä maantieteellinen profiili. Valitettavasti tähän ei päästy kiinni, koska Tilastokeskus ei taida tarjota avoimena datana ruotsinkielisten osuutta väestöstä kunnittaisella tasolla. Tästä syystä mallin ennustamat ja oikeasti korkean kannatuksen kunnat eivät kohdanneet. RKP:n selkeä eriytyminen muutamaan korkean kannatuksen kuntaan ja muuten olemattomaan kannatukseen ei sekään helpottanut ennustamistyötä. Vasemmistoliiton kohdalla varsinkin harvojen korkean kannatuksen kuntien profilointi tuotti suuria vaikeuksia.

Perussuomalaisten jytkyn havaitsin jo gradua aikoinani tehdessäni ja Perussuomalaisten kannatusta matemaattisesti mallintaessani olleen varsin tasaisesti jakautunut eri kuntiin. Oletettavasti tästä syystä mallinikin tahtoi ehdottaa suurimmalle osalle kunnista kannatusosuudeksi noin 20 %. Ei mennyt ihan nappiin. Kristillisten kohdalla yllättäen malli osasi hakea sen yksittäisen korkean kannatuksen kunnan muusta joukosta erilleen, vaikka ennustikin yli 20 prosenttiyksikköä liian alhaisen tuloksen.

Demarien vaaliennustekin on niin keskinkertaisen hajuton ja mauton, ettei siitä ole mitään erityisempää sanottavaa.

Puutteellisellakin sosioekonomisella datalla voidaan siis saada ainakin kelvollisia vaaliennusteita, vaikka toimisimmekin neljän vuoden viiveellä edellisestä kannatusmittauksesta. Kuvittelisin Suomen historiassa politiikan tutkijoiden esittäneen heikommin paikkansa pitäneitä ennusteita juuri ennen vaalejakin.


lauantai 30. tammikuuta 2016

Naisten osuus parlamentaarikoista - avaimet tasaisempaan kansan edustamiseen?

Reilu puoli vuotta sitten kirjoitin Tilastokeskuksen Tieto ja Trendit - lehteen jutun, jossa käsittelin logistisen regressiomallin avulla niitä kansanedustajaehdokkaiden taustatekijöitä, jotka eniten edesauttoivat läpipääsyä. Sukupuolen merkitys oli tässä kokonaiskuvassa vain yksi osa, mutta se mihin media kärkkäimmin tarttui. Ehkä osasyy oli toimittajille upotettu koukku "maskuliinisesta vallankumouksesta", jonka Hesari söi kokonaisenaan. Omaksikin harmikseni, sillä jutun mielenkiintoisin pointti, eli läpipääsemisen ennustamisvoima, jäi siten taka-alalle.

Naisten osuus kansanedustuslaitoksesta on kuitenkin sikäli mielenkiintoinen ja monissa intohimoja herättävä aihe, että palataan siihen taas tämän blogin voimin. En ehkä allekirjoita demarilaista käsitystä tasa-arvosta, enkä tilastojen valossa näe, että Suomessa naisten eduskuntaan pääsemiselle olisi suuria esteitä (eduskunnan sisäinen seksismi ja positiot, joihin naiset politiikon uralla etenevät ovatkin toinen keskustelun aihe). Muualla maailmassa tilanne ei välttämättä ole aivan yhtä hyvä naisten poliittisen uran kannalta kuin täällä pohjoismaissa, joten otan tässä makronäkökulman ja mallinnan naiskansanedustajien osuutta valtion tasolla yhteiskunnallisilla indikaattoreilla.

Data tulee tällä kertaa täysin YK:n Human Development Recordsin kautta. R:llä on tämänkin API:n käyttöön kätevä wrapper-funktio, jolla datan lataaminen käy hyvin yksinkertaisesti. Datasta poistettiin ne maat, joista ei ollut tietoa naisten kansanedustajien osuudesta (eli maassa ei edes yritetä esittää parlamentaarista demokratiaa). Muut puuttuvat tiedot imputoitiin päätöspuumallin avulla.Vuotena on vuosi 2013, koska R:n funktion kautta ei uudempaan dataan päässyt käsiksi. Selittäviksi muuttujiksi valitsin alaikäisten (15-19-vuotiaiden) syntyvyyden, toisen asteen tutkinnon suorittaneiden osuuden, naisten keskimääräisen odotetun koulutuksen, palma-suhteen, kaupungeissa asuvien osuuden, HDI:n sukupuolisuhteen (Osa Gender Development Indexiä), työssäkäyvien sukupuolisuhteen ja eliniänajan odotteen

Ja sitten data-analyysin tuloksiin.



Muuttujien korrelaatiomatriisi

Korrelaatiomatriisista huomataan, että ainakaan valituilla muuttujilla naisten osuutta kansanedustajapaikoista on aika vaikeaa ennustaa. Sen sijaan muut kehitysindikaattorit korreloivat melko vahvasti keskenään. Yhteiskunnan kehityksen tasosta näillä muuttujilla saadaan kattava kuva, mutta naisten osuutta eduskunnassa on vaikeampaa ennustaa. Korrelaatio ei ole olematon, mutta se on aika heikko.

Tasa-arvoon liittyvät muuttujat, HDI:n sukupuolten välinen suhde sekä työssäkäyvien sukupuolittainen suhde kuitenkin liittyvät, näyttävät parhailta valinnoilta lineaariseen regressiomalliin. Niiden keskinäinen korrelaatio ei yllättäen ole voimakkaimmasta päästä vähentäen multikolliniariteettiongelmia. Valitaan nämä kaksi indikaattoria regressiomallin selittäviksi muuttujiksi.

Coefficients:
               Estimate Std. Error t value Pr(>|t|)  
(Intercept)   -26.94047   18.48461  -1.457   0.1467  
hdiSukupSuhde   0.49998    0.20845   2.399   0.0175 *
tyoSukupSuhde   0.11257    0.07887   1.427   0.1552  
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 19.75 on 185 degrees of freedom
Multiple R-squared:  0.05617, Adjusted R-squared:  0.04596 
F-statistic: 5.504 on 2 and 185 DF,  p-value: 0.004763 



Mallissa havaitaan, että yhden prosenttiyksikön lisäys HDI:n suhteessa lisää naisten osuutta parlamentissa noin puolella prosenttiyksiköllä. Sen sijaan yhden prosenttiyksikön lisäys naisten osuuteen työssäkäyvistä lisää osuutta vain 0,1 prosenttiyksikköä. Mallilla onnistutaan selittämään noin 4,5 prosenttia naiskansanedustajien osuuden vaihtelusta. 
 
Tuskin Kurikassakaan yllätyttiin, että yhteiskunnan sukupuolten välisellä tasa-arvolla on jonkinlaista merkitystä sukupuolten tasapuoliseen edustukseen kansanedustuslaitoksessa. Mutta naisten poliittista aliedustusta pohtivat teoreetikot ja aktivistit tuskin saivat tästä analyysistä työkaluja asiansa edistämiseen; tuskin kukaan haluaa edistää naisten poliittista tasa-arvoa ja jättää huomioimatta muut yhteiskunnallisen elämän osa-alueet.

torstai 7. tammikuuta 2016

Rajat kiinni - ryhmän diskurssi Facebookissa aka garbage in, garbage out


Tilastotieteen yksi perusprinsiipeistä on ns. "garbage in, garbage out" eli jos data on surkeaa niin ei hienoimmatkaan tilastolliset mallit saa tulokseksi kuin käyttökelvotonta suhinaa. Eipä ole aikaisemmin kyseinen sääntö ollut yhtä sopiva kuin nyt. Useammastakin syystä.

Tarkoituksenani oli tutkia "maahanmuuttokriitikoiden" erilaisia sivullaan (tarkastelussa Rajat kiinni-ryhmä) käymiä diskursseja, mutta data teki eri kommenttien luokittelun järkeviin ryhmiin mahdottomaksi eikä assosiaatiosääntöjäkään sieltä saanut ulos. Tarjoan siis teille vain yhden sanapilven, koska mitään muuta kiinnostavaa datasta ei oikein irti saa, vaikka kuinka vääntelee.

Ja olen laiska, enkä jaksa nyt miettiä uutta aihetta kun tännekin blogiin haluan jotain elon merkkejä saada.



En jaksa analysoida pilveä yhtään tarkemmin, mutta väsynyttähän tuo mamujen ja suvakkien huutelu on, todella väsynyttä.

Sanapilvikin ahdistaa tarpeeksi, mutta kun ryhmän tekstejä menee sitten oikeasti lukemaan niin usko ihmiskuntaan tai vähintään suomalaisiin laskee varsin alhaisiin lukemiin. Oli maahanmuutosta ja pakolaisista itse mitä mieltä tahansa, niin kaikkien pitäisi kauhistua tuollaisesta massapsykoosista, todellisuudesta irrallaan olevasta fantasiamaailmasta ja puhtaasta, suodattamattomasta vihasta.

Tämä on juuri se mentaliteetti, mikä on ollut maailman kauheimpien massamurhien takana Maosta Pol Potiin (jee, natsikortti väistetty!). Minä olen oikeassa, muut ovat väärässä ja tämän lisäksi on vielä löydetty se absoluuttinen paha, jota vastaan pitää taistella. Maailman monia eri harmaan sävyjä ei ole minun omien silmieni nähden koskaan tulkittu mustavalkoisemmin.

Tämä blogipostaus oli enemmän avautumista kuin datan pyörittelyä, mutta menkööt. Muistaakseni kuitenkin blogin alussa sallin itselleni mielipiteen ilmauksen vapauden, vaikka mielipiteideni tuominen lävitse ei koskaan ole ollut pointtini.


tiistai 15. joulukuuta 2015

Zeit ist Data - nyt myös englanniksi

Aikaondataa-blogista on tänään aloitettu uusi versio englanniksi. Sen on tarkoitus näkyä myös tämän blogin sisällössä.

Englanninkielisessä blogissa tarkoitukseni on jakaa kirjoittamaani R-koodia ja ottaa astetta teknisempi ote. Tämän seurauksena täällä on tarkoitus jättää entistä enemmän menetelmän kuvaus taka-alalle ja keskittyä itse asiaan, eli tuloksiin.

Uusi blogi löytyy täältä.

maanantai 7. joulukuuta 2015

Suomalainen kuntabyrokratia kartalla

Geokoodaus on yleisnimi analyyseille, joiden avulla osoite-, postinumero- tai muun tunnistetiedon omaaville tietueille luodaan spatiaalisen tiedon sisältävien tietueiden avulla maantieteellinen sijainti.

Täältä bongattu määritelmä on tarpeeksi hyvä johdatus tämän lyhyen blogipostauksen aihealueeseen. Paikkatiedolla on monia mielenkiintoisia sovelluskohteita, mutta minua näin yhteiskuntatieteellisestä taustasta kirjoittavana kiinnostaa eniten sen tarjoamat mahdollisuudet tiedon yksinkertaiseen ja ymmärrettävään visualisointiin. Parhainkaan datakikkailu kun ei hyödytä ketään, ellei siitä osata kommunikoida muille. Paitsi jos sen tekee pelkästään omaan käyttöön, mitä nyt en näin avoimen datan ja datalähtöisemmän päätöksenteon puolestapuhujana tietenkään tee. Siksi datan kaunis visualisointi on yksi muutenkin tulikuuman databisneksen kuumimpia osa-alueita.

Suomalaisen poliittisen slangin uusia muotisanoja taasen on normitalkoot. Kaikki ovat sitä mieltä, että Suomessa säännellään liikaa ja virkamiehet rajoittavat lakien valvomisellaan liikaa tavallisten ihmisten ja yrittäjien elämää. Missään ei vain synny yksimielisyyttä siitä, että mitkä säännöt ovat turhia ja missä normistoa kannattaisi löyhentää. Samaan aihepiiriin kuuluu ikuisuusaihe, Suomen julkisen sektorin koko. Onko se Euroopan tehokkaimpia ja virtaviivaisimpia (kun tarkastellaan pelkkiä valtion virkamiehiä) vai paisuneimpia (kun huomioidaan kuntienkin työntekijät)? Vastaus riippuu jokaisen omasta puolueen jäsenkirjasta.

Tässäkin asiassa on kuitenkin poliittisista mielipiteistä riippumattomia tosiasioita, rankelaisittain sanottuna wie es eigentlich gewesen (imperfekti sopinee, kun virallinen tilasto ei ole koskaan tasan nykyhetken kuva, vaan valmistuu aina pienellä tai suurella viivellä). Yksi tosiasia on, että Suomen kunnistakaan ei voida puhua yhtenä suurena kafkalaisena byrokratiakoneistona, vaan kuntien välillä on suuriakin eroja palkatun henkilöstön määrässä (palkattu henkilöstö koostuu niin opettajista, kuntien virastojen virkamiehistä kuin sairaanhoitajista). Alla kuva näistä eroista vuonna 2013.



Jos alueellisia tulkintoja voidaan tehdä niin Lapissa ja Pohjanmaan rannikkokunnissa on keskimäärin enemmän henkilöstöä, kun taas Etelä-Karjalassa näyttäisi olevan niukempi julkisen sektorin koneisto. Sen lisäksi muutamia yksittäisiä kuntia löytyy sieltä täältä, joissa palkatun henkilöstön määrä erottuu huomattavasti ympäryskuntia korkeampana.

Loppu tulkinnasta jätetään lukijalle tehtäväksi jokaisen omien ideologisten lasien takaa. Niin Kokoomusnuoret kuin Vasemmistonuoret, kuviota saa käyttää.

Aineisto on ladattu Tilastokeskuksen avoimen rajapinnan kautta, kun taas Suomen kartasta on kiittäminen erinomaista datajournalismi-blogia.

sunnuntai 22. marraskuuta 2015

Googlehaut ainoa mittari? - urheilusarjojen suosiosta

Vähän aikaa sitten julkaistiin tutkimus, jonka mukaan jääkiekko on edelleen suosituin urheilulaji Suomessa. Liigajohto uutisoi tästä (ja Nelosen oman analytiikkatiimin tuloksista) sitten lievästi harhaanjohtavasti niin, että sarja kasvattaisi yleisöään. Tosiasiassahan syksyllä on uutisoitu useaan otteeseen laskevista yleisömääristä, kuten myös vuosi sitten. Luulisi lisääntyvien videoiden toistomäärien olevan laiha lohtu, jos jääkiekkohallit tyhjenevät. Varsinkin kun liikkuvan kuvan katsominen siirtyy nykyaikana yhä enenevissä määrin televisiosta tableteille, niin liigajohdon logiikalla varmaan jokin Kummelikin on nyt suositumpi kuin koskaan.

Jalkapallon Veikkausliigassa taas oli havaittavissa kasvua yleisömäärissä ja muukin mediahype sarjan ympärillä vaikutti olevan ennätyshyvää tasoa. Tätä edesauttoi HIFK:in nouseminen ja Stadin derbyt ja tottakai pitkästä aikaa mielenkiintoinen mestaruustaisto, jonka vielä omaksi ja varmasti hyvin monen muunkin ilokseni HJK hävisi.

Sarjojen trendikäyrät siis näyttävät osoittavan eri suuntiin. Näin sunnuntai-illan ratoksi ajattelin katsella asiaa vielä vähän enemmän hyödyntäen google-hakuja. Kuten yleisömäärät, googlehaut kertovat ihmisten aidosta toiminnasta ja täten sitä voidaan mielestäni pitää varsin hyvänä mittarina sille, että kuinka kiinnostavana mitäkin tuotetta pidetään. Jos tämäkin indikaattori on SM-liigan kannalta hieman lerpallaan niin puheet liigan kasvavasta yleisöstä menevät suoraan kategoriaan Irakin tiedotusministeri. 

Alla hieman dekomponoituja aikasarjoja eri urheilusarjojen googlehakujen historiasta (jostain syystä "korisliiga" ja "lentisliiga"- hakusanoilla en saanut R-kirjaston kautta ladattua hakuhistoriaa, joten Veikkausliigan ja SM-liigan ohella esitellään Superperistä ja Salibandyliigaa. Ja joo, SM-liiga on enää vain "Liiga", mutta sitä ei voi oikein huomioida, ja eiköhän kuluttajille se vielä suurelta osin puheessa ole SM-liiga). Dekomponoinnissa aikasarja "rikotaan osiin" eli trendiin, kausivaihteluun ja satunnaisvaihteluun. Tämä helpottaa aikasarjan analysoinnissa. Nyt meitä kiinnostaa lähinnä toiseksi ylin kuva eli aikasarjojen trendi.



Veikkausliigan aikasarja



SM-liigan aikasarja

Superpesiksen aikasarja

 Salibandyliigan aikasarja

Veikkausliigan kohdalla vuonna 2015 noustiin sille tasolle, missä oltiin pitkälti 2008-2011. Laskeva trendi siis katkesi ja mielenkiintoisin kausi aikoihin aiheutti myös selkeän kasvun hakumäärissä. Mistään ennennäkemättömästä buumista ei kuitenkaan voida puhua. Suunta on oikea, toivottavasti jalkapallossa osataan orastava buumi hyödyntää. Suomifutiksen johtajat tuntien on tämä toki täyttä utopiaa.

Sen sijaan SM-liigan hakumäärät ovat 2014 alkaen olleet yleisömäärien tapaan selkeässä pudotuksessa. Pudotus on sen verran jyrkkä ettei sitä selitä pelkkä nimen muutos, vaikka se tapahtuikin samoihin aikoihin google-hakujen laskun myötä. Tuskin Suomen suosituimman urheilulajin päättäjien vielä tarvitsee kriisinappulaa painaa pohjaan, mutta kasvavasta lajista puhuminen ainakin asettuu aika kyseenalaiseen valoon.

Pari hajahuomiota Superpesiksestä ja Salibandyliigasta. Pesiksessä hakumäärät ovat kasvaneet tasaisesti, kuten ilmeisesti myös katsojamäärät. Salibandyssä taas on selittämätön romahdus. Ilmeisesti lajin lakipiste katsojamäärissäkin on saavutettu, mutta ei kai yleisömäärät mitenkään ole romahtaneet?

Kausivaihtelusta voi nostaa pikanttina detaljina sen, että Veikkausliigassa ainoastaan kauden alku tuo selkeän piikin hakumääriin kun taas muissa lajeissa kauden lopussa on myös piikki. Jalkapallossa viimeinen kierros ei vastaa muiden lajien finaaleja, vaikka usein ainakin toinen mestaruustaistosta ja putoamistaistosta ratkeaa juuri silloin. Myös kauden alun piikki on jalkapallossa voimakkaampi kuin muissa lajeissa. Syystäkin, niin tuskastuttavan pitkään sitä joutuu joka talvi odottamaan.

Jääkiekko on yhä edelleen kiistatta Suomen suosituin urheilulaji, sitä ei voi kiistää vaikka eläisi kuinka tiiviissä jalkapallokuplassa. Ero kuitenkin näyttää kaventuvan. Toivoisin vain, että se tapahtuu ennemmin jalkapallon suosion kasvun kuin jääkiekon suosion rapistumisen seurauksena.

lauantai 7. marraskuuta 2015

Vihreä ja vassari ne yhteen soppii - puolueiden Facebook-läheisyydestä

Muutamassa aikaisemmassa Facebookia datalähteenä käyttävässä postauksessani on lähdetty siitä implisiittisestä oletuksesta, että puolueen sivuilla tykkäyksiä ja kommentteja jakelevat henkilöt ovat puolueen kannattajia. Tämähän ei pidä paikkaansa vaan samat poliittisesti valveutuneet henkilöt huseeraavat useammankin puolueen sivuilla. Varsinkin kommentoinnissa oletus puolueen arvomaailman jakamisesta on heikolla pohjalla, sillä henkilöhän voi olla kiistämässä puolueen väitteitä. Viestistä tykkääminen implikoi vahvemmin jaettua arvomaailmaa, mutta ei sekään ääntä oikeissa vaaleissa takaa.

Tämän blogipostauksen aiheena on esitellä menetelmiä, joilla tutkia puolueiden "läheisyyttä" jaettujen tykkääjien ja kommentoijien perusteella. Hyödynnän ns. social network analysis-menetelmää, jolla tutkitaan erilaisia verkostoja. Klassisimmassa versiossa henkilö joko tuntee tai ei tunne toista henkilöä, mutta tässä versiossa otetaan huomioon linkkien voimakkuus. Eli niiden ihmisten määrä, jotka ovat tykänneet sekä puolueen A, että B viestistä vähintään kerran. 

Koska puolueiden koolla on väliä, tarvitaan standardointia. Esimerkiksi jos kaikkiaan 200 Itsenäisyyspuolueen viestistä tykänneestä 100 tykkää lisäksi vähintään yhdestä Perussuomalaisten viestistä, on linkki puolueiden välillä hyvin vahva IPU:n näkökulmasta, vaikka se ei Perussuomalaisten kaikkiaan 10 000 tykkääjän määrässä tunnukaan. Sen sijaan jos 10 000 Keskustan viestistä tykkääjästä 400 tykkää myös Perussuomalaisten viestistä, näyttää tämä linkki huomattavasti voimakkaampana kuin Itsenäisyyspuolueen ja Perussuomalaisten välinen linkki vaikka suhteellisesti edellinen on IPU:n näkökulmasta paljon voimakkaampi.

Standardoinnissa jaan jaettujien tykkääjien määrän suhteessa puolueen tykkääjien/kommentoijien koko määrällä. Edellistä esimerkkiä hyödyntäen IPU:n näkökulmasta suhde Perussuomalaisiin saa arvon 0.5, koska 100 kaikkiaan 200 sadasta IPU:n viestistä tykänneestä on tykännyt myös Persujen viestistä, mutta Perussuomalaisten 10 000 tykkääjän näkökulmasta suhteen voimakkuus saa vain arvon 0.01. Koska jaettujen tykkääjien määrä siis ei ole kummallekin puolueelle yhtä merkityksellinen, on alla olevassa kuvassa suunnatut ja erivahvuiset nuolet, vaikka absoluuttinen määrä onkin vakio.

Mutta nyt on jaariteltu taas tarpeeksi tylsiä teknisiä detaljeja. Ei muuta kuin kuvioita pöytään.



Ylläolevasta kuviosta ensimmäisenä silmään pistää punavihreä kupla, jossa Vasemmistoliiton, Vihreiden ja SDP:n suhteet ovat läheiset, varsinkin kahden ensiksi mainitun. Vanha heitto Vihreistä "kokoomuksen puisto-osastona" on siis todella kaukana todellisuudesta. Pienpuolueet Piraatit ja IPU ovat myös kytköksissä tähän blokkiin, IPU lähinnä Vasemmistoliiton kautta, Piraattien ollessa vahvahkosti Vihreiisiin ja myös selkeästi Vasemmistoliittoon kytköksissä.

Toinen vahvempi ryhmittymä on konservatiiviblokki, jossa Kristilliset käyvät aktiivisesti tykkäilemässä myös Persujen ja Kepu viesteistä. Myös Keskustan ja Perussuomalaisten välillä on selkeä sidos. Eurokriittiset pitävät myös yhtä, IPU:n ja Perussuomalaisten välisen liitoksen ollessa IPU:n näkökulmasta todella vahva. RKP on somekartan koulukiusattu; pieniä teinipojan hapuavia askeleita otetaan Kokoomuksen ja Vihreiden suuntaan. Kokoomukselle läheisimpiä viestejä tekevät keskustalaiset ja ärkoopeelaiset, mutta tykkäyksiä jaellaan jonkin verran myös perussuomalaisille.

Tykkääjien verkosto menee siis selkeästi puolueiden ideologioiden mukaisesti ja somemaailman kumppanuudet on nähtävissä myös puolueiden periaateohjelmista. Tykkääminen on merkki tuesta. Sen sijaan kommentointi on jotain ihan muuta kuten näemme alla olevasta kuvasta:


Perussuomalaiset ovat suomalaisen somekeskustelun hubi ja oikeastaan Piraattipuoluetta ja RKP:tä lukuunottamatta perussuomalaisten sivulla kommentoineet ovat vahvasti olleet mukana muidenkin puolueiden keskustelussa mukana. Kysymys onkin, että ovatko perussuomalaisiin identifioituvat aktiivisia politiikan seuraajia ja keskustelijoita/nettitrolleja/huolestuneita kansalaisia, jotka debatoivat ja asiakeskustelevat ympäri somen puoluekenttää vai käykö jokaisen yksittäisen puolueen kannattajat purkamassa ärsyyntymisensä nimenomaan perussuomalaisten sivuilla?

Perussuomalaisten keskeisen sijainnin lisäksi Kokoomuksen näkökulmasta Keskusta on hyvin läheinen, persujakin tärkeämpi, keskustelukumppani ja punavihreä blokki esiintyy tässäkin omana kokonaisuutenaan. RKP ja Piraattipuolue ovat ne kaksi omaa saarekettaan, joiden sivuilla käyty keskustelu ei hirveästi leviä muiden puolueiden puoluelle.

 Puolueiden ideologioiden kvantitaativinen mittaaminen ja asettaminen erinäisille akseleille tai nelikenttiin on yksi valtio-opin rakastetuimpia harrastuksia. Mielestäni tässä näytetty somekäyttäytymisen tutkiminen tuo yhden uuden näkökulman tähän puolueiden läheisyyteen käytyyn keskusteluun. Sillä eikö ihmisten konkreettinen käyttäytyminen pitäisi olla vähintään yhtä tärkeää kuin periaateohjelmien sanavalinnat tai kansanedustajien äänestyskäyttäytyminen?