Siirry pääsisältöön
Back to Insights
Open Source LLM DeepSeek Llama Mistral Kimi Transformer Tekoälyn Suvereniteetti

Avoin Lähdekoodi Voitti: Kuinka Vapaa AI Valloitti Maailman (2017-2026)

By Yoram Halberstam 35 min read
Available in 25 other languages

Transformer: Keksintö, joka Muutti Kaiken

Kesäkuussa 2017 kahdeksan Google-tutkijaa julkaisi kaksitoistasivuisen artikkelin. He eivät vielä tienneet, mutta olivat juuri sytyttäneet sytytyslangan vallankumoukselle, joka muuttaisi ihmiskunnan.

Transformer — niin sitä kutsutaan — korvasi toistuvat hermoverkot huomiomekanismilla, joka mahdollistaa massiivisen rinnakkaisen tietojenkäsittelyn. Toisin kuin aiemmat arkkitehtuurit, jotka käsittelivät sanat yksi kerrallaan, Transformer näkee koko lauseen kerralla. Tuo hienovarainen ero muuttaa kaiken.

Kuusi vuotta myöhemmin, tammikuussa 2026, avoimen lähdekoodin ekosysteemi hallitsee maailmanlaajuista tekoälyä. Se, mikä oli ennen vain akateeminen täydennys omistetuille jäteille, on tullut teollisen innovaation moottoriksi. Kuinka päädyimme tänne?

2017
Transformerin vuosi
2023
Llama-ilmiö
2026
Tekninen tasa-arvo saavutettu

Ensimmäiset Pioneerit (2018-2021)

GPT-2: Kipinä, joka Herätti Yhteisön

Kesäkuu 2018. OpenAI julkaisee GPT-2:n. Malli on pelottava — niin pelottava, että OpenAI epäröi julkaista sitä. Heidän argumenttinsa? Kyky tuottaa johdonmukaista tekstiä voisi palvella disinformaatiota.

Väärä laskelma. Yhteisö ei siedä, että siltä piilotetaan leluja. Kun GPT-2 lopulta julkaistaan MIT-lisenssillä, tutkijat ympäri maailmaa tarttuvat siihen. Kollektiivi muodostuu: EleutherAI. Heidän tehtävänsä? Todeta, että malleja, joissa on miljardeja parametreja, voidaan kouluttaa ilman monikansallisen resursseja.

"Halusimme todistaa, että avoin tiede ei tarvinnut miljardeja dollareita edetäkseen."

— Connor Leahy, EleutherAI:n perustaja

Google Vastaa iskulla BERT:llä ja T5:llä

Sillä välin Google ei istu paikallaan. BERT (lokakuu 2018) mullistaa kaksisuuntaisen kielenymmärryksen. T5 (helmikuu 2020) ehdottaa yhtenäistä kehystä, jossa jokainen tehtävä muuttuu tekstistä tekstiin -transformaatioksi.

Nämä mallit, jotka julkaistaan Apache 2.0 -lisenssillä, muodostavat tuhansien akateemisten tutkimusprojektien perustan. Ne todistavat yhden olennaisen asian: massiivinen esikoulutus, jota seuraa hienosäätö, on kuninkaallinen tie.

Yhteisön Ensimmäiset Menestykset

Maaliskuussa 2021 EleutherAI julkaisee GPT-Neo:n 2,7 miljardilla parametrilla. Se on tekninen menestys: malli kilpailee tuon ajan GPT-3:n kanssa, täysin koulutettu laskentalahjoituksilla ja vapaaehtoistyöllä.

Viesti on selvä: avoin lähdekoodi voi kilpailla jättiläisten kanssa.

2022: Avoin Tiede Paineen Alla

BigScience ja BLOOM: Ennenkokematon Lähestymistapa

Vuosi 2022 merkitsee käännekohtaa. OpenAI sulkee mallinsa maksettujen API:ien taakse. Yhteisö reagoi eri tavalla.

BigScience, Hugging Facen koordinoima, kokoaa yhteen 1 000 tutkijaa 60 maasta. Heidän tavoitteensa? Luoda suurin monikielinen avoimen lähdekoodin malli, joka on koskaan rakennettu. Tulos: BLOOM, 176 miljardia parametria, 46 kieltä, 13 ohjelmointikieltä.

Se, mikä tekee BLOOM:sta historiallisen, ei ole sen koko. Se on täydellinen läpinäkyvyys: julkiset koulutusdata, avoin lähdekoodi, täydellinen koulutusloki. Ensimmäistä kertaa voimme todella ymmärtää, kuinka LLM syntyi.

Meta Iskee Kovaa OPT:llä

Lähes samanaikaisesti Meta AI käynnistää OPT:n (Open Pre-trained Transformer). Sama koko kuin GPT-3:lla, mutta yhdellä ratkaisevalla erolla: täydellinen koulutusprosessin dokumentointi.

Tutkijat voivat vihdoin tutkia mallia tässä mittakaavassa ilman käänteistä suunnittelua.

Galactica: Ennuste

Marraskuu 2022. Meta yrittää erikoistaa tekoälyä Galacticalla, joka on omistettu tieteelliselle kirjallisuudelle. Malli vedetään pois 48 tunnin kuluessa sen harhojen kritiikin jälkeen.

Epäonnistuminen? Ei täysin. Galactica luo pohjan erikoistuneiden korpusien koulutukselle. Trendi, joka räjähtäisi kolme vuotta myöhemmin.

2023: Vuosi, jolloin Kaikki Muuttui

24. Helmikuuta 2023: Llama-ilmiö

Sinä päivänä Meta julkaisee Llama:n. Malli ei ole tarkoitettu suurelle yleisölle — vain tutkimukseen. Mutta sen painot vuotavat verkossa päivissä.

Vallankumouksen kipinä.

Llama todistaa, että vaatimattomampi malli (7–65 miljardia parametria), joka on koulutettu useammilla tokeneilla, voi päihittää jättiläiset. Yhteisö tarttuu siihen välittömästi.

Malli Päivämäärä Keskeinen Innovaatio Lisenssi
Alpaca Maaliskuu 2023 Matalakustannushienosäätö self-instructin kautta Ei-kaupallinen
Vicuna Huhtikuu 2023 90 % ChatGPT:n laatu 500 dollarin koulutuskustannuksella Ei-kaupallinen
Falcon 40B Kesäkuu 2023 Ensimmäinen avoimen lähdekoodin malli, joka hallitsee vertailuarvot Apache 2.0
Mistral 7B Lokakuu 2023 Äärimmäinen tehokkuus Sliding Window Attentionin avulla Apache 2.0
Mixtral 8x7B Joulukuu 2023 Mixture of Experts (MoE) demokratisoitu Apache 2.0

QLoRA: Paikallinen Demokratisointi

Huhtikuu 2023. Tekniikka muuttaa kaiken: QLoRA (Quantized Low-Rank Adaptation).

Tulos? Hienosäädä 65 miljardin parametrin malli yhdellä ainoalla kuluttaja-GPU:lla. Pienet yritykset voivat nyt luoda oman tekoälynsä ilman massiivista infrastruktuuria.

Esteet kaatuvat yksi kerrallaan.

2024-2025: Tekninen Tasa-arvo

DeepSeek: Kiina Astuu Näyttämölle

Kesä 2024 merkitsee merkittävän uuden toimijan saapumista: DeepSeek, High-Flyer Quantille kuuluva kiinalainen laboratorio.

Heidän mestarinsa? Erittäin tehokas MoE-arkkitehtuuri ja MLA (Multi-head Latent Attention) -mekanismi, joka vähentää KV-välimuistin muistitarpeita 93 %.

Tulos tammikuussa 2025: DeepSeek-V3 saavuttaa GPT-4:n murto-osalla kustannuksista. Kansainvälinen yhteisö huomaa, että avoin lähdekoodi ei enää ole seuraaja — se on johtaja.

OpenAI Antaa Periksi Paineelle

Elokuu 2025. OpenAI, vuosien sulkeutumisen jälkeen, julkaisee GPT-OSS:n. Ensimmäinen malli avoimilla painoilla sitten GPT-2:n. Optimoitu agenttisille työnkuluille ja pitkälle kontekstille.

Miksi tämä käännös? Avoimen lähdekoodin kilpailupaine oli tullut liian vahvaksi. Kun ilmaiset mallit vastaavat sinun, sulkeminen ei enää riitä.

Meta Vastaa Llama 4:llä

Metan välitön vastaus: Llama 4. Luonnostaan multimodaalinen, kykenevä käsittelemään 10 miljoonaa konteksti-tokenia.

Kuvittele: analysoi koko koodikanta yhdessä kyselyssä. Se on nyt mahdollista — ja ilmaista.

Tammikuu 2026: Avoin Lähdekoodi Hallitsee

Parhaiden Mallien Sijoitus

Tässä olemme tänään:

Sijoitus Malli Kehittäjä Laatupisteet Erikoisala
1 Kimi K2.5 (Reasoning) Moonshot AI 46,77 Matematiikka, monimutkainen päättely
2 GLM-4.7 (Thinking) Zhipu AI 41,70 Koodaus, Visio-Kieli
3 DeepSeek V3.2 DeepSeek 41,20 Tehokkuus, alhainen päätelmien kustannus
4 GPT-OSS-120B OpenAI 40,50 Työkalujen käyttö, agenttinen
5 Llama 4 (70B) Meta 39,80 Monimuotoisuus, ekosysteemi
6 Qwen3-235B Alibaba 39,20 Monikielisyys, RAG

Tuomio on julma: 5 kuudesta parhaasta mallista on avointa lähdekoodia. Vain GPT-OSS, ironisesti, kantaa entisen omistetun johtajan nimeä.

Peliä Muuttaneet Innovaatiot

MLA ja DeepSeek Sparse Attention: Miljoonien konteksti-tokenien käsittely vaati kiellettyä KV-välimuistia. MLA pakkaa tämän välimuistin aggressiivisesti. DSA vähentää laskennan monimutkaisuutta käsittelemällä vain relevantteja osia sekvenssistä.

BitNet 1.58b: Vuoden 2025 radikaalein innovaatio. Sen sijaan, että painot koodattaisiin 16 bitillä, BitNet käyttää kolmiarvoisia arvoja {-1, 0, 1} — noin 1,58 bittiä parametria kohti.

Seuraus:

  • 70–80 % energiankulutuksen vähennys
  • 2,3x–6,1x nopeutus standardi-CPU:illa
  • 100 miljardin parametrin malli, joka toimii standardilla pöytätietokoneella

Tekoälyn suvereniteetti ei ole enää unelma. Se on tekninen todellisuus.

Paikallinen Päättelystä Tulee Standardi

RTX 5090: Tehoälytyöasemien Sydän

Vuoden 2025 alussa NVIDIA julkaisee RTX 5090:n. 32 GB GDDR7-muistia, 1,79 TB/s kaistanleveys (+77 % edelliseen sukupolveen verrattuna).

Tulokset kuluttajakortilla:

  • Llama 4 8B (4-bit): 180 tokenia/sekunti
  • DeepSeek-R1 14B (4-bit): 89 tokenia/sekunti
  • Qwen 2.5 32B (4-bit): 45 tokenia/sekunti

70B+-mallit toimivat nyt paikallisissa multi-GPU-konfiguraatioissa teollisella suorituskyvyllä.

vLLM vs Ollama

Kaksi ekosysteemiä hallitsee:

  • vLLM: Tuotannon standardi. PagedAttention-moottori, optimoitu KV-välimuistin hallinta, useita samanaikaisia käyttäjiä.
  • Ollama: Kehittäjien suosikki. Äärimmäinen yksinkertaisuus, nolla konfiguraatio, natiivi macOS/Linux/Windows-tuki.

Agenttinen Aikakausi: Chatista Toimintaan

Devstral 2: Tekoäly Koodin Palveluksessa

Joulukuu 2025. Mistral AI käynnistää Devstral 2:n, 123 miljardia parametria, jotka on optimoitu ohjelmistokehitykseen.

SWE-bench Verified -tulos: 72,2 %. Samalla tasolla kuin Claude Sonnet 4, mutta seitsemän kertaa kalliimpaa.

Hinta: 0,40 dollaria miljoonaa tokenia kohden. Tekoälyavusteinen kehitys tulee taloudellisesti kannattavaksi pienille ja keskisuurille yrityksille sekä itsenäisille ammatilaisille.

Vibe CLI: Tekoäly, joka Ohjelmoii Itse

Samassa kuussa Mistral käynnistää Vibe CLI:n. Tämä työkalu orkestroi autonomisesti monimutkaisia muutoksia koko koodikantoihin.

Vuoden 2026 agenttiset mallit voivat:

  • Navigoida monimutkaisissa tiedostojärjestelmissä
  • Tunnistaa riippuvuuksia frameworkien välillä
  • Havaita testivirheet ja korjata itse itsensä
  • Tuottaa luotettavasti strukturoitua JSON-tulostetta ohjelmistointegraatiota varten

Siirrymme “chat-tekoälystä” “toiminta-tekoälyyn”.

Sääntely: Mitä Avoimesta Jää?

OSAID 1.0: Virallinen Määritelmä

Lokakuu 2024. Open Source Initiative julkaisee viimein virallisen määritelmän Open Source AI:lle.

Avoimen lähdekoodin kelpuuttamiseksi järjestelmän on taattava neljä vapautta: käyttää, tutkia, muokata ja jakaa. Kolme olennaista komponenttia:

  1. Koodi: Täydellinen esikoulutus-, suodatus- ja päättelykoodi
  2. Parametrit: Painot, optimoijan asetukset, arkkitehtuurin konfiguraatiot
  3. Data: Yksityiskohtainen dokumentaatio alkuperästä, valinnasta ja käsittelystä

Tulos? Useimmat nykyiset “avoimen lähdekoodin” mallit eivät ole yhteensopivia. Llama 4, Mistral, jopa GPT-OSS puuttuvat täydellisestä datan läpinäkyvyydestä.

Vain Pythia (EleutherAI) ja OLMo (AI2) saavat merkinnän “todella avoin lähdekoodi”.

EU AI Act Rakenneta Markkinat

Helmikuusta 2025 lähtien EU AI Act on voimassa. Avoimen lähdekoodin mallit hyötyvät merkittävistä vapautuksista — edellyttäen, että niitä ei luokitella “järjestelmälliseksi riskiksi”.

Malleille, jotka ylittävät 10^25 FLOPs, sovelletaan dokumentointi- ja tietoturvavelvoitteita riippumatta lisenssistä.

2026-2030: Mitä Edessä

Muotoutuvat Trendit

Post-Transformer: Uusia arkkitehtuureja syntyy vähentämään huomion neliöllistä monimutkaisuutta. BitNet on vasta alku.

Edge AI: Mallit kuten Ministral 3B toimivat älypuhelimissa massiivisella kontekstilla. Kodin automaatio ja henkilökohtainen robotiikka räjähtävät.

Älykkyyden Suvereniteetti: Yritykset eivät halua enää “vuokrata” älykkyyttä API:iden kautta. Ne haluavat omistaa omat digitaaliset aivonsa, koulutettuina teollisiin salaisuuksiinsa.

Moniagenttiyhteistyö: Tulevaisuus on eri toimittajien mallien välisessä viestinnässä. Ongelmien ratkaisu yhteistyön kautta rather than monoliittinen raaka voima.

Uusi SEO-paradigma

Hakukoneiden massiivinen LLM-integraatio on muuttanut verkkonäkyvyyttä. Puhumme nyt GEO:sta (Generative Engine Optimization).

Vuonna 2026 noin 25 % perinteisestä orgaanisesta liikenteestä siepataan tekoälyn tuottamilla suorilla vastauksilla. Käyttäjät eivät enää napsauta — he lukevat synteesiä.

Brändin menestystä ei enää mitata Google-sijoituksella. Se mitataan Gemini 3:n tai GPT-5:n generatiivisten vastausten sitaattien tiheydellä ja vakaudella.

Ja Nyt?

Vuoden 2026 avoimen lähdekoodin ekosysteemi on todistanut jotain olennaista: läpinäkyvyys ja yhteistyö eivät ole eettisiä ihanteita, vaan ylivoimaisia kilpailuetuja.

Rikkomalla älykkyyden monopolit avoin lähdekoodi on muuttanut tekoälyn eksklusiivisesta palvelusta globaaliksi julkiseksi infrastruktuuriksi — yhtä perustavanlaatuiseksi kuin sähkö tai internet.

Tekninen tasa-arvo on saavutettu. Seuraava raja? Järjestelmien täydellinen autonomia ihmiskunnan palveluksessa.

Massiivisia generalistisia malleja täydennetään, joskus korvataan, erikoistuneiden, taloudellisempien, tarkempien, suvereenien mallien konstellaatioilla.

Avoin lähdekoodi voitti. Loput ovat vain historiaa.

Sisällysluettelo