Miten LLM toimii? Osa 1 – Aivot ja kielimallit

Aivomme ovat neuronien verkosto. Keinotekoinen neuroverkko (neural network) on neuronien verkosto? Suuri kielimalli (Large Language Model, LLM) on yksi neuroverkkotyyppi. Toimiiko LLM:ään perustuva ChatGPT tai Claude siis samalla tavalla kuin aivomme? Termit saavat helposti luulemaan, että toinen on toisen suora malli.

Samankaltaisuus ei ole sattumaa: jo vuonna 1943 Warren McCulloch ja Walter Pitts kuvasivat keinotekoisen neuronin matemaattisena mallina, joka sai innoituksensa hermosolusta. Nimi on periytynyt siitä nykyisiin neuroverkkoihin ja kielimalleihin asti.

Vastaus aivojen ja neuroverkkojen samankaltaisuuteen on kuitenkin moniulotteisempi. Käyn tässä läpi sitä, miten aivojen rakenne ja toiminta eroaa ja toisaalta muistuttaa suurten kielimallien toimintaa.

Miten aivot toimivat?

Aivoissa on hermosoluja (neuroneita) 86 miljardia, joiden välillä kulkee sähköisiä impulsseja. Jokaisessa hermosolussa on tyypillisesti yhteyksiä tuhansiin toisiin hermosoluihin. Yhteydet muodostuvat yhdestä viejähaarakkeesta, aksonista, ja erinäisestä määrästä tuojahaarakkeita, dendriittejä. Aksonit ovat hyvin eripituisia (mikrometreistä metriin) ja dendriitit lyhyitä. Koska aksonit ovat fyysisesti eri mittaisia, impulssien kulku kestää eri ajan.

Hermosolun tuhannet yhteydet muodostuvat hermoliitoksilla, synapseilla, joilla solujen viejähaarakkeet kiinnittyvät tyypillisesti toisten neuroneiden dendriitteihin. Synapsissa neuroneiden välillä kulkeva sähköinen impulssi välitetään kemiallisten välittäjäaineiden avulla uudeksi sähköimpulssiksi toiselle hermosolulle. Synaptisia yhteyksiä on myös aksonien ja hermosolujen keskusten välillä, dendriittien välillä ja aksonien välillä. Hermosolu on monimutkainen, elävä koneisto. Synapsin perusmekanismi tunnetaan hyvin, mutta esimerkiksi sitä, miten synapsien toimintaa säädellään ja miten ne muovautuvat oppimisen myötä, ei vielä kunnolla ymmärretä.

Kuva 1. Aivojen konnektomin hahmotelma. Kirjoittajan tekoälyllä luoma kuva.
Kuva 1. Aivojen konnektomin hahmotelma. Kirjoittajan tekoälyllä luoma kuva.

Yhdessä hermosolut muodostavat aivojen konnektomin, kytkentäkaavion (connectome), joka on tiheä ja monimutkainen kolmiulotteinen rihmasto. Aivot ovat koko ajan yhteydessä elimistön muihin soluihin hermoston välityksellä. Aivoja pommitetaan jatkuvalla virralla aistien tuottamaa informaatiota. Aivot myös muuttuvat koko ajan, kun opimme. Konnektomi ei siis ole lukittu rakenne.

Miten kielimallit toimivat?

Jos aivoissa on hermosoluja sekä niiden välisiä erilaisia yhteyksiä ja synapseja, niin kielimalleissa on lukuja, painoja (weights). Ne on järjestetty matriiseiksi, joissa on rivejä ja sarakkeita. Synapsi vastaa tavallaan kielimallin painoa. Vastaavuus on karkea, koska hermosolu on fyysinen solu ja synapsit sähkökemiallisia liitoksia.

Kuva 2. Biologinen vs. koneellinen yhteys. Kirjoittajan tekoälyllä luoma kuva.
Kuva 2. Biologinen vs. koneellinen yhteys. Kirjoittajan tekoälyllä luoma kuva.

Malleissa jokainen paino on tarkasti tiedossa. Aivoissa taas kaikkia hermosolujen välisiä painoja (yhteyksien vahvuuksia) ei voi määrittää lukuarvoina kerralla, koska hermosolujen yhteydet ovat niin monimutkaisen mekanismin takana ja aivot ovat myös koko ajan toiminnassa ja muutoksessa.

Kuva 3. Aivojen yhteydet vs. neuroverkon rakenne. Kirjoittajan tekoälyllä luoma kuva.
Kuva 3. Aivojen yhteydet vs. neuroverkon rakenne. Kirjoittajan tekoälyllä luoma kuva.

Yhdessä asiassa sekä aivot että keinotekoiset neuroverkot ovat samanlaisia: ne tallentavat informaatiota hajautetusti. Tietoa ei voi paikallistaa selkeästi yhteen paikkaan. Ei ole olemassa aivojen hermosolua ja yhteyttä, joka tarkoittaisi aina ”Pariisia” tai ”kirahvia”. Eikä yksikään hermosolu sisällä ilkeän naapurisi kasvokuvaa. Aivoissa tieto on hajautuneena hermosolujen keskinäisten yhteyksien verkossa.

Kielimallissa tieto on hajautuneena matriiseissa. LLM:n matriisipino koostuu ruudukoista, joita on kymmenistä satoihin, ja nämä matriisit on järjestetty peräkkäin. Kuten aivoissa, LLM:ssä ”kirahvi” ei ole tallennettuna yksittäisessä luvussa yhdessä matriisissa, vaan sanat muodostuvat tekstipalasten eli tokeneiden aktivaatiovektoreiden laskennassa (tästä myöhemmissä osissa lisää). Token on sana tai sanan osa.

Tokenit lasketaan matriisipinon läpi kerros kerrallaan yhteen suuntaan, ja lopuksi saadaan todennäköisyysjakauma seuraavalle tokenille. Jokainen paino kertoo, kuinka voimakkaasti yksi kerroksen yksikkö vaikuttaa yhteen seuraavan kerroksen yksikköön. Yksikkö laskee yhteen saamansa painotetut syötteet ja ajaa summan epälineaarisen funktion, aktivaatiofunktion, läpi. Tämä muistuttaa karkeasti hermosolun laukeamiskynnystä: hermosolu ei välitä signaalia eteenpäin, jos ärsyke jää liian heikoksi.

Kuva 4. Neuroverkon matriisi ja painot. Kirjoittajan tekoälyllä luoma kuva.
Kuva 4. Neuroverkon matriisi ja painot. Kirjoittajan tekoälyllä luoma kuva.

Aivojen monimutkaista synaptista yhteyttä vastaa siis kielimallissa yksi lukuarvo. Mutta mittakaava on eri: aivoissa on noin 100 biljoonaa (1014) synapsia, suurimmissa kielimalleissa arviolta satoja miljardeja (1011) tai muutamia biljoonia (1012) painoja. Aivoissa ei siis ole vain enemmän yhteyksiä, vaan jokainen yhteys on myös paljon monimutkaisempi, koska biologinen synapsi on paljon monimutkaisempi koneisto kuin vain yksi lukuarvo.

Mistä tieto tulee?

Mistä painot syntyvät, mistä aivojen tieto tulee? Kun kielimallia koulutetaan tekstiaineistolla, koulutus säätää painoja niin, että tokeneiden väliset suhteet tallentuvat niihin. Käytännössä malli arvaa tekstiaineistosta seuraavan tokenin, arvauksen virhe mitataan, ja jokaista painoa siirretään hieman suuntaan, joka pienentää virhettä. Tätä toistetaan valtavan monta kertaa. Opittuja tokeneiden välisiä suhteita voidaan sitten käyttää ennustamaan seuraava token koko siihen asti syötetyn tekstin (kontekstin) perusteella, ei pelkästään edellisen sanan. Siksi kielimalli on paljon enemmän kuin esim. puhelimissa käytetty automaattinen täydennys: LLM-ohjelmisto ottaa huomioon koko keskustelun ja sen sisällön.

Kun malli on kerran koulutettu tekstiaineiston pohjalta, se on ”valmis”: painot eivät sen jälkeen muutu, eikä malli opi käytön aikana mitään. Keskustelu vaikuttaa vastauksiin vain niin kauan kuin se on mukana syötteessä, mutta malliin siitä ei jää pysyvää jälkeä. Mallin ympärillä oleva muu ohjelmisto voi kyllä muistaa käyttäjän toimintaa ja syöttää aiempia keskusteluja laskentaan uudelleen, mutta itse malli pysyy samana.

Koulutettu malli on siis matriisipino, joka voidaan ladata tiedostona, kuten open weight -mallien tapauksessa kuka vain voi tehdä (tästä myöhemmin lisää). Aivojen biologisen ja elävän luonteen vuoksi emme taas osaa tallentaa hermoverkon tilaa tiedostoon emmekä edes ottaa siitä tilannekuvaa jollain tietyllä hetkellä (aivothan ovat koko ajan muutoksessa).

Kuva 5. Mistä tieto tulee: neuroverkko vs. aivot. Kirjoittajan tekoälyllä luoma kuva.
Kuva 5. Mistä tieto tulee: neuroverkko vs. aivot. Kirjoittajan tekoälyllä luoma kuva.

Aivoissa aistien informaatiopommitus (ja myös fyysinen ympäristön aiheuttama muutos) kuormittaa ja muokkaa hermoverkkoa jatkuvasti. Pohjana on konnektomin perusrakenne, jonka evoluutio on vuosimiljoonien aikana muovannut ihmisen selviytymiseen fyysisessä maailmassa. Kieli, jota syötämme kielimallille, on aivojen tuottama ylemmän tason abstraktio, joka on syntynyt paljon myöhemmin ihmisen kehityksessä. Voisi sanoa, että kielimallin opetus lähtee liikkeelle aivojen lopputuotteesta. Kielimalli osaa ennustaa, mitä aivot saattavat tuottaa tietyn kielen palasen jatkoksi. Ero näkyy myös oppimisen tehokkuudessa: lapsi oppii äidinkielensä kuulemalla ensimmäisten vuosiensa aikana kymmeniä miljoonia sanoja, kun suuria kielimalleja koulutetaan biljoonilla tokeneilla eli satojatuhansia tai jopa miljoona kertaa suuremmalla tekstimäärällä. Lapsi ei myöskään opi pelkästä tekstistä, vaan vuorovaikutuksessa ympäristöön, aistiensa ja kehonsa kautta.

Vertailua

Aivojen ja kielimallien vertailua voi katsoa eri osa-alueittain:

Biologiset aivot Suuri kielimalli
Kytkentäkaavio Fyysinen hermosolujen verkosto. Kasvaa ja karsiutuu koko eliniän.
Kolmiulotteinen solujen välisten yhteyksien verkko.
Keinotekoinen pysyvä rakenne.
Matriisipino, ei kolmiulotteinen.
Syöte Biologiset ja analogiset signaalit kehon aistien ja solujen kautta. Teksti pilkotaan tokeneiksi ja muunnetaan lukuvektoreiksi, jotka syötetään mallille.
Neuroni Biologinen hermosolu yhteyksineen toisiin hermosoluihin. Yksittäinen luku kerroksen aktivaatiovektorissa.
Yhteydet Hermosolu on yhteydessä vain muutamaan tuhanteen toiseen hermosoluun, mutta yhteydet muuttuvat jatkuvasti. Jokainen kerroksen yksikkö on tyypillisesti kytketty jokaiseen seuraavan kerroksen yksikköön. Kytkennät ovat tiheät mutta kiinteät.
Synapsi Hermoliitos, joka muodostaa yhteyden toiseen soluun sähkökemiallisesti. Yksi opittu yksiköiden välinen luku, paino. ”Yhteyden vahvuus”.
Signaali Hermosolu joko aktivoituu tai ei riippuen sen saamien lukuisien synaptisten yhteyksien vahvuuksista ja ajoituksista (osa vahvistaa ja osa estää). Yksikön arvo (aktivaatio) lasketaan sen saamien painotettujen syötteiden summasta, joka ajetaan epälineaarisen funktion läpi. Siinä ei ole aikaulottuvuutta.
Signaalin suunta Signaalit kulkevat moneen suuntaan. Aivoissa on runsaasti takaisinkytkentöjä ja silmukoita, joissa signaali palaa takaisin aiempiin hermosoluihin. Signaali kulkee yhteen suuntaan, kerros kerrallaan syötteestä tulokseen. Verkossa itsessään ei ole silmukoita (laskennan toiminnasta lisää seuraavissa osissa).
Muovautuvuus / oppiminen Hermoverkon yhteyksien ja voimakkuuksien muovautuminen jatkuvasti kehon/aistien antamien ärsykkeiden mukaan. Rakenne on suunniteltu ja painot opetetaan ennen käyttöä, eivätkä ne muutu käytön aikana. Luvut matriisissa pysyvät samoina.
Energiankulutus Noin 20 wattia, vaikka aivot ovat koko ajan toiminnassa. Koulutus vaatii datakeskuksessa kymmeniätuhansia näytönohjaimia viikkojen tai kuukausien ajan. Esimerkiksi GPT-4:n koulutuksen on arvioitu kuluttaneen noin 50–60 GWh, eli saman verran kuin yhden ihmisen aivot kuluttaisivat noin 300 000 vuodessa. Myös jokainen vastaus lasketaan aina koneilla.
Perusta Elävä keho ja sen biologia, fyysisessä maailmassa selviytymisen muovaama pohjarakenne (vuosimiljoonien evoluutio). Mallin luvut perustuvat tekstiaineistojen tilastolliseen laskentaan.

Yhteenvetona voisi sanoa, että aivojen ja kielimallien suurin yhtäläisyys on se, että molemmat tallentavat tietoa hajautetusti. Myös oppimisessa on samankaltaisuutta: se on yhteyksien vahvuuksien säätämistä. Aivoissa on biologisia hermosoluja ja fyysisiä yhteyksiä, jotka muuttuvat koko ajan käytössä. LLM:ssä taas on opetusvaiheessa muodostuneita lukuja matriiseissa, eivätkä ne muutu käytössä.

Perusidea on sama, mutta käytännön mekanismit ovat hyvin erilaiset. Asian voi tiivistää niin, että LLM:t ovat saaneet innoituksensa aivoista, mutta eivät toimi kuten aivot.

Kielimallin jokaisen luvun voi ladata koneelle tarkasti ja kokonaan. Aivojen tilasta emme pysty tekemään samaa, sillä emme osaa vielä lukea jokaista synapsia. Silti, vaikka meillä on käsissämme kielimallin koko ”konnektomi” ja jokainen paino on luettavissa, emme pysty täysin selittämään, mitä malli tekee. Mikään matriisin luku ei kerro, mitä se tarkoittaa.

Tämä osoittaa yhden olennaisen asian: verkon toiminnan ymmärtäminen ei ole kiinni datan saatavuudesta. Meillä voi olla pääsy kaikkeen dataan, kuten LLM:ien tapauksessa on, mutta kunnollista ymmärrystä emme silti pysty muodostamaan toiminnasta. Vaikka saisimme tallennettua tilannekuvan aivojen yhteyksistä, emme ehkä siltikään ymmärtäisi, miten yhteydet rakentavat ”mielen”. Ainakin siihen on vielä pitkä matka.

Seuraavaksi osa 2: LLM-ohjelmiston toiminta

Seuraavassa blogin osassa perehdymme siihen, mistä LLM-ohjelmisto koostuu ja miten se toimii.

Lue lisää

Aloittelijalle, suomeksi

  • Hannu Toivonen: Mitä tekoäly on? — 100 kysymystä ja vastausta (Teos, 2023). Helpoin suomenkielinen johdatus aiheeseen, jos neuroverkot ja ohjelmistot tuntuvat vierailta. Sadan kysymyksen ja vastauksen muodossa — voi lukea järjestyksessä tai poimia kiinnostavat kohdat.

Ihmismielen puolelta

  • Anil Seth: Being You: A New Science of Consciousness (2021). Neurotieteilijän näkemys tietoisuudesta jonakin, jonka aivot rakentavat — olemme “ennustuskoneita”, jotka tuottavat kokemuksensa todellisuudesta ja korjaavat sitä jatkuvasti. Kiehtova vastapari kysymykseen siitä, onko malli mieli.
  • Robert M. Sapolsky: Determined: A Science of Life Without Free Will (2023). Laaja argumentti siitä, että valintamme ovat biologian, ympäristön ja historian tulosta. Luettuna rinnan deterministisen, seuraavaa tokenia ennustavan mallin kanssa se herättää epämukavan ja valaisevan kysymyksen siitä, kuinka erilaisia oikeastaan olemme.
  • Oma aiempi kirjoitukseni: Ajatteleva kone, luova ihminen? — koneellinen luovuus, tietoisuus ja kysymys siitä, vaatiiko luovuus aina ihmisen.
  • Oma aiempi kirjoitukseni: Tietoisuus ja tekoäly.

Tekniikan taustaa

Syvään päätyyn: kärpäsen aivot

Leave a Reply

Your email address will not be published. Required fields are marked *


The reCAPTCHA verification period has expired. Please reload the page.