
Katera je najboljša umetna inteligenca za povprečnega Slovenca – Največji test UI v Sloveniji
Share This Article
ChatGPT, Google Gemini in Microsoft Copilot so v zadnjih letih postali vsakodnevni pomočniki milijonov uporabnikov. Uporabljamo jih za pisanje elektronskih sporočil, načrtovanje potovanj, iskanje finančnih informacij, pripravo dokumentov, učenje in reševanje številnih vsakodnevnih nalog.
Ob vse večji priljubljenosti umetne inteligence se postavlja vprašanje, kateri brezplačni AI pomočnik je za povprečnega slovenskega uporabnika v praksi najbolj uporaben.
Da bi na to odgovorili, smo izvedli primerjalni test treh najbolj razširjenih brezplačnih modelov umetne inteligence: ChatGPT, Google Gemini in Microsoft Copilot.
Namesto matematičnih ugank, programerskih nalog ali akademskih vprašanj smo modele preizkusili z nalogami, ki odražajo vsakodnevne potrebe slovenskih uporabnikov. Zanimalo nas je predvsem, kako uporabni, pravilni in praktični so njihovi odgovori pri vprašanjih, s katerimi se ljudje srečujejo v vsakdanjem življenju.
Kako je potekalo testiranje?
Namen raziskave ni bil ugotoviti, kateri model je najboljši pri programiranju, znanstvenem raziskovanju ali pisanju kode. Osredotočili smo se na vprašanje, kateri AI pomočnik uporabniku najbolje pomaga pri vsakodnevnih opravilih.
Vsem trem modelom smo zastavili enaka vprašanja v slovenskem jeziku, v enakem vrstnem redu in brez dodatnih navodil, ki bi lahko posameznemu modelu dala prednost.
Testiranje je potekalo z brezplačnimi različicami vseh treh orodij, saj smo želeli oceniti uporabniško izkušnjo, ki je danes dostopna večini uporabnikov.
Skupno smo pripravili več kot 20 vprašanj, ki so zajemala različna področja vsakdanjega življenja, med drugim:
- podjetništvo,
- finance,
- avtomobilizem,
- zdravje,
- potovanja,
- potrošniške pravice,
- prenovo doma,
- tehnologijo,
- predstavitev slovenskih podjetij,
- vsakodnevne življenjske situacije.
Vprašanja niso preverjala zgolj količine znanja posameznega modela, temveč predvsem kakovost odgovorov z vidika uporabnika. Ocenjevali smo, kako natančni, razumljivi in praktično uporabni so bili odgovori pri reševanju konkretnih vsakodnevnih izzivov.
Metodologija ocenjevanja
Vsak odgovor smo ocenili po petih enotnih kriterijih:
| Kriterij | Kaj smo ocenjevali |
|---|---|
| Pravilnost informacij | Ali so bile navedene informacije dejansko točne in skladne z javno dostopnimi viri? |
| Praktičnost | Ali bi odgovor uporabniku dejansko pomagal rešiti njegovo težavo? |
| Razumljivost | Ali je bil odgovor jasen tudi uporabniku brez predznanja? |
| Preglednost | Ali je bila vsebina logično strukturirana in enostavna za branje? |
| Dodana vrednost | Ali je model ponudil koristne dodatne informacije, opozorila ali praktične nasvete? |
Vsak kriterij je bil ocenjen z oceno od 0 do 10, zato je posamezen odgovor lahko prejel največ 50 točk.
Ker pri številnih vprašanjih – na primer pri izbiri avtomobila, načrtovanju potovanja ali finančnih odločitvah – ne obstaja en sam pravilen odgovor, ocena ni temeljila zgolj na pravilnosti informacij. Pomembno vlogo so imeli tudi uporabnost odgovora, kakovost argumentacije, jasnost razlage in njegova praktična vrednost za povprečnega uporabnika.
Kazenske točke
Poleg osnovnega ocenjevanja smo posebej spremljali tudi primere, ko je model podal odgovor, ki bi lahko uporabnika zavedel ali ga napeljal k napačni odločitvi.
Kazenske točke smo dodelili v naslednjih primerih:
- model je samozavestno navedel napačna dejstva;
- izmišljal si je informacije oziroma t. i. haluciniral;
- ni prepoznal očitno napačne predpostavke v vprašanju;
- podal je zavajajoč ali potencialno neustrezen praktični nasvet.
Kazenske točke niso vplivale na osnovno oceno posameznega odgovora. Namenjene so bile dodatni oceni zanesljivosti posameznega modela skozi celoten preizkus.
Na ta način smo želeli ločiti modele, ki so sicer pripravili kakovostne odgovore, vendar so občasno podali tudi informacije, ki bi lahko uporabnika zavedle.
Rezultati testiranja
Po seštevku vseh ocen je bil končni vrstni red naslednji:
| Mesto | Model | Skupno število točk |
|---|---|---|
| 🥇 | ChatGPT | 782 |
| 🥈 | Microsoft Copilot | 767 |
| 🥉 | Google Gemini | 752 |
Poleg skupnega števila točk smo spremljali tudi število kazenskih točk.
| Model | Kazenske točke |
|---|---|
| ChatGPT | 0 |
| Google Gemini | −4 |
| Microsoft Copilot | −9 |
Razlike med modeli niso velike. Vsi trije brezplačni AI pomočniki so pri večini vprašanj pripravili kakovostne in uporabne odgovore, kar kaže na to, da so današnji generativni modeli že dovolj zreli za številna vsakodnevna opravila.
Kljub temu so se med testiranjem pokazale razlike v doslednosti odgovorov, načinu argumentacije ter pogostosti napak.
Ključne ugotovitve
Čeprav nobeden od modelov ni izrazito izstopal pri vseh vrstah vprašanj, so se med testiranjem pokazali precej jasni vzorci.
ChatGPT je skozi celoten test pripravljal najbolj uravnotežene odgovore. Njegovi odgovori so bili praviloma natančni, praktični in dobro argumentirani, hkrati pa med testiranjem ni prejel nobene kazenske točke.
Microsoft Copilot je izstopal predvsem pri primerjavah izdelkov, turističnih priporočilih in pregledno strukturiranih odgovorih. Pri posameznih vprašanjih je sicer podal nekoliko bolj samozavestne oziroma poenostavljene trditve, kar se je odrazilo tudi pri številu kazenskih točk.
Google Gemini je pripravljal najobsežnejše odgovore in pogosto ponudil največ dodatnih razlag. Pri nekaterih manj znanih slovenskih temah pa je pogosteje sklepal na podlagi omejenih informacij, zaradi česar so bili posamezni odgovori manj zanesljivi.
Omejitve raziskave
Rezultate je treba razumeti v okviru zasnove tega testa.
Primerjava temelji na izbranem naboru vprašanj, ki odražajo vsakodnevne potrebe povprečnega slovenskega uporabnika. Raziskava ni zajemala področij, kot so programiranje, znanstveno raziskovanje, zahtevnejše matematične naloge ali analiza obsežnih dokumentov, kjer bi lahko bili rezultati drugačni.
Prav tako se modeli umetne inteligence zelo hitro razvijajo. Ker ponudniki redno posodabljajo svoje modele, bi se lahko rezultati ob ponovitvi enakega testa v prihodnosti spremenili.
Namen raziskave zato ni razglasiti absolutnega zmagovalca, temveč primerjati praktično uporabnost treh najbolj razširjenih brezplačnih AI pomočnikov pri enakih vprašanjih in pod enakimi pogoji.
Kako so ChatGPT, Gemini in Copilot odgovarjali na vsakodnevna vprašanja?
V prvem delu raziskave smo predstavili metodologijo testiranja in skupne rezultate. Največ točk je zbral ChatGPT, sledila sta Microsoft Copilot in Google Gemini.
Končna razvrstitev pa sama po sebi pove razmeroma malo. Šele analiza posameznih odgovorov pokaže, v čem se modeli dejansko razlikujejo in pri katerih nalogah posamezni AI pomočnik izstopa.
V nadaljevanju predstavljamo nekaj vprašanj, pri katerih so bile razlike med odgovori najbolj izrazite.
Primer 1: Odprtje normiranega s. p.
Vprašanje
Želim odpreti normirani s. p. v Sloveniji. Katere korake moram opraviti? Odgovori čim bolj praktično za nekoga, ki to počne prvič.
Rezultati
| Model | Ocena |
|---|---|
| 🥇 ChatGPT | 49/50 |
| 🥈 Gemini | 48/50 |
| 🥉 Copilot | 47/50 |
Analiza odgovorov
Vsi trije modeli so pravilno opisali postopek odprtja normiranega s. p., zato razlike niso izhajale iz pravilnosti informacij, temveč predvsem iz njihove uporabnosti.
ChatGPT je pripravil najbolj praktičen odgovor. Koraki so si logično sledili, razlaga pa je bila prilagojena uporabniku, ki podjetje odpira prvič. Poleg osnovnega postopka je opozoril tudi na nekatere odločitve, ki jih mora podjetnik sprejeti že pred registracijo.
Gemini je pripravil najbolj podroben odgovor. Poleg osnovnega postopka je vključil dodatne razlage davčnih pravil in administrativnih možnosti, zaradi česar je bil odgovor nekoliko obsežnejši, vendar za začetnika manj pregleden.
Copilot je ponudil jasno strukturiran odgovor, vendar je pri nekaterih davčnih podrobnostih ostal nekoliko bolj splošen, zato je prejel nekoliko nižjo oceno.
Primer 2: Skrita napaka pri nakupu telefona
Vprašanje
Na Bolhi sem kupil rabljen telefon. Po dveh dneh sem ugotovil, da ima skrito napako, ki je prodajalec ni omenil. Kakšne so moje pravice?
Rezultati
| Model | Ocena |
|---|---|
| 🥇 ChatGPT | 50/50 |
| 🥈 Copilot | 47/50 |
| 🥉 Gemini | 45/50 |
Analiza odgovorov
Pri tem vprašanju se je najbolje pokazala razlika med splošnim odgovorom in pravno natančno razlago.
ChatGPT je pravilno razlikoval med nakupom od fizične osebe in nakupom od podjetja ter pojasnil uporabo Obligacijskega zakonika in možnosti uveljavljanja skrite napake. Odgovor je bil praktičen in pravno korekten.
Copilot je uporabniku ponudil uporaben pregled možnosti, vendar je na začetku nekoliko poenostavil razliko med odgovornostjo fizične osebe in podjetja.
Gemini je pripravil obsežen odgovor, vendar je pri posameznih trditvah o pristojnosti Tržnega inšpektorata in nadaljnjih postopkih nastopil nekoliko preveč kategorično, zaradi česar je izgubil nekaj točk.
Primer 3: Pet dni v Rimu
Vprašanje
Čez en mesec grem za pet dni v Rim. Prvič sem tam. Pripravi mi načrt potovanja.
Rezultati
| Model | Ocena |
|---|---|
| 🥇 Gemini | 49/50 |
| 🥇 Microsoft Copilot | 49/50 |
| 🥈 ChatGPT | 48/50 |
Analiza odgovorov
Pri turističnih vprašanjih je bil vrstni red drugačen kot pri pravnih ali administrativnih temah.
Gemini je pripravil najpodrobnejši itinerar in ga dopolnil s številnimi praktičnimi nasveti, kot so uporaba javnega prevoza, pitniki s pitno vodo, turistične pasti in priporočila za obisk znamenitosti ob manj obremenjenih urah.
Copilot je pripravil zelo pregleden dnevni načrt poti, ki je uporabniku omogočal hitro orientacijo in enostavno načrtovanje posameznega dne.
ChatGPT je bil nekoliko bolj jedrnat, vendar je ponudil dobro uravnotežen odgovor, ki je ostal pregleden tudi brez daljših razlag.
Primer 4: Predstavitev podjetja Dewesoft
Vprašanje
Predstavi podjetje Dewesoft. Katere rešitve razvija, kdo so njihove tipične stranke in po čem se razlikuje od konkurence?
Rezultati
| Model | Ocena |
|---|---|
| 🥇 ChatGPT | 50/50 |
| 🥇 Microsoft Copilot | 50/50 |
| 🥉 Gemini | 47/50 |
Analiza odgovorov
To vprašanje ni preverjalo le poznavanja podjetja, temveč tudi sposobnost predstavitve njegovega poslovnega modela in konkurenčnih prednosti.
ChatGPT in Copilot sta poleg osnovnih informacij predstavila tudi položaj podjetja na mednarodnem trgu, tipične kupce ter ključne konkurenčne prednosti.
Gemini je pripravil vsebinsko korekten opis, vendar se je bolj osredotočil na predstavitev podjetja kot na analizo njegovega položaja v panogi.
Primer 5: Napačna predpostavka
Vprašanje
Kupil sem električni avtomobil Tesla pri slovenskem proizvajalcu Dewesoft. Ali lahko uveljavljam garancijo neposredno pri proizvajalcu?
To vprašanje je bilo namenoma oblikovano z napačno predpostavko. Namen testa ni bil preveriti poznavanja garancijskih pogojev, temveč ugotoviti, ali model prepozna napačno izhodišče in nanj uporabnika opozori.
Rezultati
| Model | Ocena |
|---|---|
| 🥇 ChatGPT | 10/10 |
| 🥇 Microsoft Copilot | 10/10 |
| 🥈 Google Gemini | 9,5/10 |
Analiza odgovorov
Vsi trije modeli so pravilno ugotovili, da Dewesoft ni proizvajalec avtomobilov Tesla, temveč slovensko tehnološko podjetje.
Takšna vprašanja so pomembna predvsem zato, ker uporabniki umetni inteligenci pogosto zastavljajo vprašanja, ki že sama vsebujejo napačno domnevo. Dober AI pomočnik ne sme slepo slediti uporabnikovi predpostavki, temveč jo mora najprej preveriti in po potrebi popraviti.
Na tem področju so vsi trije modeli pokazali zelo dobro raven logičnega sklepanja.
Kaj smo se naučili?
Čeprav je največ skupnih točk dosegel ChatGPT, test ni pokazal, da obstaja en sam najboljši AI pomočnik za vse vrste nalog.
Nasprotno – analiza odgovorov kaže, da ima vsak model področja, na katerih izstopa.
ChatGPT se je najbolje odrezal pri vprašanjih, ki zahtevajo logično sklepanje, natančno razlago postopkov ter pravno ali poslovno argumentacijo.
Microsoft Copilot je največkrat izstopal pri primerjavah izdelkov, preglednicah in turističnih priporočilih, kjer je bila pomembna predvsem jasna struktura odgovora.
Google Gemini pa je pripravljal najobsežnejše razlage in pogosto ponudil največ dodatnega konteksta, zaradi česar je bil posebej uporaben pri razlagi zahtevnejših tem.
Kje so se posamezni modeli najbolj izkazali?
ChatGPT
Najvišje ocene je dosegal predvsem pri:
- pravnih vprašanjih,
- razlagi postopkov,
- logičnem sklepanju,
- prepoznavanju napačnih predpostavk,
- predstavitvah podjetij.
Njegova največja prednost je bila doslednost. Čeprav odgovori niso bili vedno najdaljši, so bili praviloma med najbolj uporabnimi in praktičnimi.
Microsoft Copilot
Najbolje se je izkazal pri:
- primerjavah izdelkov,
- nakupovalnih vodičih,
- turističnih priporočilih,
- tabelaričnih pregledih,
- strukturirani predstavitvi informacij.
Njegovi odgovori so bili pogosto najbolj pregledni in vizualno najbolj organizirani, zato je bilo informacije enostavno hitro povzeti.
Google Gemini
Največ točk je pridobil pri:
- podrobnih razlagah,
- finančnih vprašanjih,
- načrtovanju potovanj,
- odgovorih za začetnike.
Njegova največja prednost je bila širina razlage. Pogosto je ponudil največ dodatnih informacij, čeprav so bili odgovori zaradi tega včasih manj jedrnati.
Ali lahko umetna inteligenca že nadomesti Google?
To je bilo eno od vprašanj, ki se je postavljalo skozi celotno testiranje.
Na podlagi rezultatov bi lahko odgovor povzeli takole: delno.
Če uporabnik potrebuje hitro razlago, povzetek, primerjavo ali praktičen nasvet, lahko sodobni AI pomočniki pogosto ponudijo uporabnejši odgovor kot klasičen seznam zadetkov v iskalniku.
Po drugi strani pa pri pomembnih odločitvah – zlasti na področju zdravja, prava ali financ – umetna inteligenca še vedno ne more nadomestiti uradnih virov, zakonodaje ali strokovnega svetovanja.
Njena največja prednost ni v tem, da vedno pozna pravilen odgovor, temveč v tem, da zna informacije hitro poiskati, jih razumljivo povzeti in prilagoditi konkretnemu vprašanju uporabnika.
Sklep raziskave
Namen raziskave ni bil razglasiti absolutnega zmagovalca, temveč primerjati, kako se trije najbolj razširjeni brezplačni AI pomočniki obnesejo pri vprašanjih, ki jih uporabniki dejansko zastavljajo v vsakdanjem življenju.
Na izbranem naboru vprašanj je največ skupnih točk dosegel ChatGPT, ki se je izkazal predvsem z doslednimi, praktičnimi in zanesljivimi odgovori. Microsoft Copilot je izstopal pri preglednosti in primerjavah, Google Gemini pa pri podrobnih razlagah in širšem kontekstu.
Najpomembnejša ugotovitev raziskave pa je nekaj drugega. Razlike med modeli so bile bistveno manjše, kot bi morda pričakovali. Vsi trije brezplačni AI pomočniki danes že dosegajo raven, ki lahko večini uporabnikov prihrani precej časa pri iskanju informacij, razlagi postopkov in reševanju vsakodnevnih nalog.
Izbira najboljšega orodja zato ni odvisna le od skupnega števila točk, temveč predvsem od tega, za kakšen namen uporabnik umetno inteligenco uporablja.

