Aivomme ovat neuronien verkosto. Keinotekoinen neuroverkko (neural network) on neuronien verkosto? Suuri kielimalli (Large Language Model, LLM) on yksi neuroverkkotyyppi. Toimiiko LLM:ään perustuva ChatGPT tai Claude siis samalla tavalla kuin aivomme? Termit saavat helposti luulemaan, että toinen on toisen suora malli.
Samankaltaisuus ei ole sattumaa: jo vuonna 1943 Warren McCulloch ja Walter Pitts kuvasivat keinotekoisen neuronin matemaattisena mallina, joka sai innoituksensa hermosolusta. Nimi on periytynyt siitä nykyisiin neuroverkkoihin ja kielimalleihin asti.
Vastaus aivojen ja neuroverkkojen samankaltaisuuteen on kuitenkin moniulotteisempi. Käyn tässä läpi sitä, miten aivojen rakenne ja toiminta eroaa ja toisaalta muistuttaa suurten kielimallien toimintaa.
Miten aivot toimivat?
Aivoissa on hermosoluja (neuroneita) 86 miljardia, joiden välillä kulkee sähköisiä impulsseja. Jokaisessa hermosolussa on tyypillisesti yhteyksiä tuhansiin toisiin hermosoluihin. Yhteydet muodostuvat yhdestä viejähaarakkeesta, aksonista, ja erinäisestä määrästä tuojahaarakkeita, dendriittejä. Aksonit ovat hyvin eripituisia (mikrometreistä metriin) ja dendriitit lyhyitä. Koska aksonit ovat fyysisesti eri mittaisia, impulssien kulku kestää eri ajan.
Hermosolun tuhannet yhteydet muodostuvat hermoliitoksilla, synapseilla, joilla solujen viejähaarakkeet kiinnittyvät tyypillisesti toisten neuroneiden dendriitteihin. Synapsissa neuroneiden välillä kulkeva sähköinen impulssi välitetään kemiallisten välittäjäaineiden avulla uudeksi sähköimpulssiksi toiselle hermosolulle. Synaptisia yhteyksiä on myös aksonien ja hermosolujen keskusten välillä, dendriittien välillä ja aksonien välillä. Hermosolu on monimutkainen, elävä koneisto. Synapsin perusmekanismi tunnetaan hyvin, mutta esimerkiksi sitä, miten synapsien toimintaa säädellään ja miten ne muovautuvat oppimisen myötä, ei vielä kunnolla ymmärretä.

Yhdessä hermosolut muodostavat aivojen konnektomin, kytkentäkaavion (connectome), joka on tiheä ja monimutkainen kolmiulotteinen rihmasto. Aivot ovat koko ajan yhteydessä elimistön muihin soluihin hermoston välityksellä. Aivoja pommitetaan jatkuvalla virralla aistien tuottamaa informaatiota. Aivot myös muuttuvat koko ajan, kun opimme. Konnektomi ei siis ole lukittu rakenne.
Miten kielimallit toimivat?
Jos aivoissa on hermosoluja sekä niiden välisiä erilaisia yhteyksiä ja synapseja, niin kielimalleissa on lukuja, painoja (weights). Ne on järjestetty matriiseiksi, joissa on rivejä ja sarakkeita. Synapsi vastaa tavallaan kielimallin painoa. Vastaavuus on karkea, koska hermosolu on fyysinen solu ja synapsit sähkökemiallisia liitoksia.

Malleissa jokainen paino on tarkasti tiedossa. Aivoissa taas kaikkia hermosolujen välisiä painoja (yhteyksien vahvuuksia) ei voi määrittää lukuarvoina kerralla, koska hermosolujen yhteydet ovat niin monimutkaisen mekanismin takana ja aivot ovat myös koko ajan toiminnassa ja muutoksessa.

Yhdessä asiassa sekä aivot että keinotekoiset neuroverkot ovat samanlaisia: ne tallentavat informaatiota hajautetusti. Tietoa ei voi paikallistaa selkeästi yhteen paikkaan. Ei ole olemassa aivojen hermosolua ja yhteyttä, joka tarkoittaisi aina ”Pariisia” tai ”kirahvia”. Eikä yksikään hermosolu sisällä ilkeän naapurisi kasvokuvaa. Aivoissa tieto on hajautuneena hermosolujen keskinäisten yhteyksien verkossa.
Kielimallissa tieto on hajautuneena matriiseissa. LLM:n matriisipino koostuu ruudukoista, joita on kymmenistä satoihin, ja nämä matriisit on järjestetty peräkkäin. Kuten aivoissa, LLM:ssä ”kirahvi” ei ole tallennettuna yksittäisessä luvussa yhdessä matriisissa, vaan sanat muodostuvat tekstipalasten eli tokeneiden aktivaatiovektoreiden laskennassa (tästä myöhemmissä osissa lisää). Token on sana tai sanan osa.
Tokenit lasketaan matriisipinon läpi kerros kerrallaan yhteen suuntaan, ja lopuksi saadaan todennäköisyysjakauma seuraavalle tokenille. Jokainen paino kertoo, kuinka voimakkaasti yksi kerroksen yksikkö vaikuttaa yhteen seuraavan kerroksen yksikköön. Yksikkö laskee yhteen saamansa painotetut syötteet ja ajaa summan epälineaarisen funktion, aktivaatiofunktion, läpi. Tämä muistuttaa karkeasti hermosolun laukeamiskynnystä: hermosolu ei välitä signaalia eteenpäin, jos ärsyke jää liian heikoksi.

Aivojen monimutkaista synaptista yhteyttä vastaa siis kielimallissa yksi lukuarvo. Mutta mittakaava on eri: aivoissa on noin 100 biljoonaa (1014) synapsia, suurimmissa kielimalleissa arviolta satoja miljardeja (1011) tai muutamia biljoonia (1012) painoja. Aivoissa ei siis ole vain enemmän yhteyksiä, vaan jokainen yhteys on myös paljon monimutkaisempi, koska biologinen synapsi on paljon monimutkaisempi koneisto kuin vain yksi lukuarvo.
Mistä tieto tulee?
Mistä painot syntyvät, mistä aivojen tieto tulee? Kun kielimallia koulutetaan tekstiaineistolla, koulutus säätää painoja niin, että tokeneiden väliset suhteet tallentuvat niihin. Käytännössä malli arvaa tekstiaineistosta seuraavan tokenin, arvauksen virhe mitataan, ja jokaista painoa siirretään hieman suuntaan, joka pienentää virhettä. Tätä toistetaan valtavan monta kertaa. Opittuja tokeneiden välisiä suhteita voidaan sitten käyttää ennustamaan seuraava token koko siihen asti syötetyn tekstin (kontekstin) perusteella, ei pelkästään edellisen sanan. Siksi kielimalli on paljon enemmän kuin esim. puhelimissa käytetty automaattinen täydennys: LLM-ohjelmisto ottaa huomioon koko keskustelun ja sen sisällön.
Kun malli on kerran koulutettu tekstiaineiston pohjalta, se on ”valmis”: painot eivät sen jälkeen muutu, eikä malli opi käytön aikana mitään. Keskustelu vaikuttaa vastauksiin vain niin kauan kuin se on mukana syötteessä, mutta malliin siitä ei jää pysyvää jälkeä. Mallin ympärillä oleva muu ohjelmisto voi kyllä muistaa käyttäjän toimintaa ja syöttää aiempia keskusteluja laskentaan uudelleen, mutta itse malli pysyy samana.
Koulutettu malli on siis matriisipino, joka voidaan ladata tiedostona, kuten open weight -mallien tapauksessa kuka vain voi tehdä (tästä myöhemmin lisää). Aivojen biologisen ja elävän luonteen vuoksi emme taas osaa tallentaa hermoverkon tilaa tiedostoon emmekä edes ottaa siitä tilannekuvaa jollain tietyllä hetkellä (aivothan ovat koko ajan muutoksessa).

Aivoissa aistien informaatiopommitus (ja myös fyysinen ympäristön aiheuttama muutos) kuormittaa ja muokkaa hermoverkkoa jatkuvasti. Pohjana on konnektomin perusrakenne, jonka evoluutio on vuosimiljoonien aikana muovannut ihmisen selviytymiseen fyysisessä maailmassa. Kieli, jota syötämme kielimallille, on aivojen tuottama ylemmän tason abstraktio, joka on syntynyt paljon myöhemmin ihmisen kehityksessä. Voisi sanoa, että kielimallin opetus lähtee liikkeelle aivojen lopputuotteesta. Kielimalli osaa ennustaa, mitä aivot saattavat tuottaa tietyn kielen palasen jatkoksi. Ero näkyy myös oppimisen tehokkuudessa: lapsi oppii äidinkielensä kuulemalla ensimmäisten vuosiensa aikana kymmeniä miljoonia sanoja, kun suuria kielimalleja koulutetaan biljoonilla tokeneilla eli satojatuhansia tai jopa miljoona kertaa suuremmalla tekstimäärällä. Lapsi ei myöskään opi pelkästä tekstistä, vaan vuorovaikutuksessa ympäristöön, aistiensa ja kehonsa kautta.
Vertailua
Aivojen ja kielimallien vertailua voi katsoa eri osa-alueittain:
| Biologiset aivot | Suuri kielimalli | |
|---|---|---|
| Kytkentäkaavio | Fyysinen hermosolujen verkosto. Kasvaa ja karsiutuu koko eliniän. Kolmiulotteinen solujen välisten yhteyksien verkko. |
Keinotekoinen pysyvä rakenne. Matriisipino, ei kolmiulotteinen. |
| Syöte | Biologiset ja analogiset signaalit kehon aistien ja solujen kautta. | Teksti pilkotaan tokeneiksi ja muunnetaan lukuvektoreiksi, jotka syötetään mallille. |
| Neuroni | Biologinen hermosolu yhteyksineen toisiin hermosoluihin. | Yksittäinen luku kerroksen aktivaatiovektorissa. |
| Yhteydet | Hermosolu on yhteydessä vain muutamaan tuhanteen toiseen hermosoluun, mutta yhteydet muuttuvat jatkuvasti. | Jokainen kerroksen yksikkö on tyypillisesti kytketty jokaiseen seuraavan kerroksen yksikköön. Kytkennät ovat tiheät mutta kiinteät. |
| Synapsi | Hermoliitos, joka muodostaa yhteyden toiseen soluun sähkökemiallisesti. | Yksi opittu yksiköiden välinen luku, paino. ”Yhteyden vahvuus”. |
| Signaali | Hermosolu joko aktivoituu tai ei riippuen sen saamien lukuisien synaptisten yhteyksien vahvuuksista ja ajoituksista (osa vahvistaa ja osa estää). | Yksikön arvo (aktivaatio) lasketaan sen saamien painotettujen syötteiden summasta, joka ajetaan epälineaarisen funktion läpi. Siinä ei ole aikaulottuvuutta. |
| Signaalin suunta | Signaalit kulkevat moneen suuntaan. Aivoissa on runsaasti takaisinkytkentöjä ja silmukoita, joissa signaali palaa takaisin aiempiin hermosoluihin. | Signaali kulkee yhteen suuntaan, kerros kerrallaan syötteestä tulokseen. Verkossa itsessään ei ole silmukoita (laskennan toiminnasta lisää seuraavissa osissa). |
| Muovautuvuus / oppiminen | Hermoverkon yhteyksien ja voimakkuuksien muovautuminen jatkuvasti kehon/aistien antamien ärsykkeiden mukaan. | Rakenne on suunniteltu ja painot opetetaan ennen käyttöä, eivätkä ne muutu käytön aikana. Luvut matriisissa pysyvät samoina. |
| Energiankulutus | Noin 20 wattia, vaikka aivot ovat koko ajan toiminnassa. | Koulutus vaatii datakeskuksessa kymmeniätuhansia näytönohjaimia viikkojen tai kuukausien ajan. Esimerkiksi GPT-4:n koulutuksen on arvioitu kuluttaneen noin 50–60 GWh, eli saman verran kuin yhden ihmisen aivot kuluttaisivat noin 300 000 vuodessa. Myös jokainen vastaus lasketaan aina koneilla. |
| Perusta | Elävä keho ja sen biologia, fyysisessä maailmassa selviytymisen muovaama pohjarakenne (vuosimiljoonien evoluutio). | Mallin luvut perustuvat tekstiaineistojen tilastolliseen laskentaan. |
Yhteenvetona voisi sanoa, että aivojen ja kielimallien suurin yhtäläisyys on se, että molemmat tallentavat tietoa hajautetusti. Myös oppimisessa on samankaltaisuutta: se on yhteyksien vahvuuksien säätämistä. Aivoissa on biologisia hermosoluja ja fyysisiä yhteyksiä, jotka muuttuvat koko ajan käytössä. LLM:ssä taas on opetusvaiheessa muodostuneita lukuja matriiseissa, eivätkä ne muutu käytössä.
Perusidea on sama, mutta käytännön mekanismit ovat hyvin erilaiset. Asian voi tiivistää niin, että LLM:t ovat saaneet innoituksensa aivoista, mutta eivät toimi kuten aivot.
Kielimallin jokaisen luvun voi ladata koneelle tarkasti ja kokonaan. Aivojen tilasta emme pysty tekemään samaa, sillä emme osaa vielä lukea jokaista synapsia. Silti, vaikka meillä on käsissämme kielimallin koko ”konnektomi” ja jokainen paino on luettavissa, emme pysty täysin selittämään, mitä malli tekee. Mikään matriisin luku ei kerro, mitä se tarkoittaa.
Tämä osoittaa yhden olennaisen asian: verkon toiminnan ymmärtäminen ei ole kiinni datan saatavuudesta. Meillä voi olla pääsy kaikkeen dataan, kuten LLM:ien tapauksessa on, mutta kunnollista ymmärrystä emme silti pysty muodostamaan toiminnasta. Vaikka saisimme tallennettua tilannekuvan aivojen yhteyksistä, emme ehkä siltikään ymmärtäisi, miten yhteydet rakentavat ”mielen”. Ainakin siihen on vielä pitkä matka.
Seuraavaksi osa 2: LLM-ohjelmiston toiminta
Seuraavassa blogin osassa perehdymme siihen, mistä LLM-ohjelmisto koostuu ja miten se toimii.
Lue lisää
Aloittelijalle, suomeksi
- Hannu Toivonen: Mitä tekoäly on? — 100 kysymystä ja vastausta (Teos, 2023). Helpoin suomenkielinen johdatus aiheeseen, jos neuroverkot ja ohjelmistot tuntuvat vierailta. Sadan kysymyksen ja vastauksen muodossa — voi lukea järjestyksessä tai poimia kiinnostavat kohdat.
Ihmismielen puolelta
- Anil Seth: Being You: A New Science of Consciousness (2021). Neurotieteilijän näkemys tietoisuudesta jonakin, jonka aivot rakentavat — olemme “ennustuskoneita”, jotka tuottavat kokemuksensa todellisuudesta ja korjaavat sitä jatkuvasti. Kiehtova vastapari kysymykseen siitä, onko malli mieli.
- Robert M. Sapolsky: Determined: A Science of Life Without Free Will (2023). Laaja argumentti siitä, että valintamme ovat biologian, ympäristön ja historian tulosta. Luettuna rinnan deterministisen, seuraavaa tokenia ennustavan mallin kanssa se herättää epämukavan ja valaisevan kysymyksen siitä, kuinka erilaisia oikeastaan olemme.
- Oma aiempi kirjoitukseni: Ajatteleva kone, luova ihminen? — koneellinen luovuus, tietoisuus ja kysymys siitä, vaatiiko luovuus aina ihmisen.
- Oma aiempi kirjoitukseni: Tietoisuus ja tekoäly.
Tekniikan taustaa
- Warren McCulloch & Walter Pitts: A Logical Calculus of the Ideas Immanent in Nervous Activity (1943). Keinotekoisen neuronin ensimmäinen matemaattinen malli — nimien yhteinen juuri.
- Vaswani ym.: Attention Is All You Need (2017). Transformer-arkkitehtuuri, jolle nykyiset kielimallit perustuvat. Tähän palataan seuraavissa osissa.
- Anthropicin tulkittavuustutkimus: Towards Monosemanticity (2023) ja Scaling Monosemanticity (2024). Taustoittaa suoraan kirjoituksen loppuhuomiota: vaikka meillä on pääsy kaikkiin mallin painoihin, emme silti pysty täysin selittämään, mitä malli tekee.
Syvään päätyyn: kärpäsen aivot
- Dorkenwald ym.: “Neuronal wiring diagram of an adult brain”, Nature (2024). Banaanikärpäsen täydellinen konnektomi — noin 166 000 neuronia ja 125 miljoonaa yhteyttä.
- Shiu ym.: “A leaky integrate-and-fire computational model based on the connectome of the entire adult Drosophila brain”, Nature (2024). Konnektomin pohjalta rakennettu toimiva simulaatio.
- Yleistajuinen tausta: “Researchers simulate an entire fly brain on a laptop. Is a human brain next?”, Berkeley News (2024). Hyvä muistutus erosta: konnektomi kuvaa yhteydet, mutta simulaatio lisää oletuksia — kärpäsen liikkuminen pelissä ei vielä todista biologista tarkkuutta.
