Model qwen3.5:4b-q4_K_M iz drugog dijela serijala već odgovara na pitanja bez interneta, i to na običnom laptopu sa 16 GB memorije. Dobar je opći pomoćnik, ali ne treba mu povjeriti i pretraživanje vlastitih datoteka ili programiranje. Umjesto jednog modela opterećenog svim zadacima, bolje je imati tri mala modela, svaki za svoj posao.
Kontrola nad lokalnim AI sustavom počinje jasnim odlukama: koji model i program za njegovo pokretanje odabrati, pod kojom licencijom te gdje će podaci ostati. Ako još ne znaš koliko tvoj laptop ima RAM-a ili VRAM-a, prvo pročitaj koliko memorije laptop treba za lokalni AI. Ako još nemaš instaliranu Ollamu, vodič za postavljanje prvog lokalnog AI sustava pokazuje kako početi. Ovdje polazimo od toga da si oba koraka već prošao. Slijedi izbor modela i provjera koliko su dobri.
Za koristan lokalni AI komplet potrebna su tri modela s različitim zadacima, a ne jedan koji pokušava obaviti sve.
Opći pomoćnik za svakodnevni razgovor, pisanje nacrta i brza pitanja: qwen3.5:4b-q4_K_M. Preuzimanje zauzima 3,4 GB, a oznaka modela ista je kao u drugom dijelu serijala.
Mali specijalist za uži zadatak, primjerice strukturirani odgovor ili zaključivanje prema zadanim ograničenjima: granite4.2:3b. Preuzimanje zauzima 2,2 GB, model je objavljen u kolovozu 2026. i nosi licenciju Apache 2.0. U šestom odjeljku naći ćeš i specijaliste za programiranje, matematiku, rad sa slikama i prevođenje, pa ovaj model možeš zamijeniti onim koji odgovara tvojem zadatku.
Model za vektorizaciju teksta za pretraživanje vlastitih dokumenata: embeddinggemma:300m. Preuzimanje zauzima 622 MB. Taj model ne vodi razgovor: pretvara tekst u vektore koje aplikacija za dohvat može pretraživati. Postupak je detaljno opisan u osmom odjeljku.
Tri preuzimanja zajedno zauzimaju približno 6,2 GB na disku, ali to nije i njihova ukupna potrošnja radne memorije. Ako sva tri modela ostanu istodobno učitana, mogu premašiti slobodnu memoriju laptopa. Učitavaj po jedan model za pojedini zadatak, isprobaj ga u stvarnom radu i ukloni svaki koji ti ne koristi.
Učinak kvantizacije najlakše je vidjeti usporedbom unutar iste obitelji modela. U Ollaminu katalogu qwen3.5:9b-q4_K_M zauzima 6,6 GB, qwen3.5:9b-q8_0 11 GB, a qwen3.5:9b-bf16 19 GB. Iste težine modela, ali tri razine preciznosti i tri veličine preuzimanja.
To su veličine preuzimanja iz kataloga, ne zajamčeno zauzeće memorije nakon učitavanja. Niža preciznost znači manju datoteku, a često i manju potrošnju memorije pri radu. Utjecaj na kvalitetu odgovora ovisi o modelu, načinu kvantizacije i zadatku. Nemoj unaprijed pretpostaviti ni da kvaliteta ostaje ista ni da manja datoteka dolazi bez kompromisa.
Učitane težine nisu jedino što zauzima memoriju. Prostor trebaju i kontekstni prozor sa svojom predmemorijom ključ-vrijednost te sve ostalo što radi na laptopu. Ušteda ostvarena kvantizacijom sama po sebi ne jamči da će veći model stati u memoriju. Samo je razumnije pokušati s njim nego prvo učitati datoteku pune preciznosti.
Dvije oznake u katalogu lako je pogrešno protumačiti. U oba slučaja možeš preuzeti model koji nisi namjeravao.
Prva zamka. Na Googleovoj kartici modela Gemma 4 E2B stoji da ima 2,3 milijarde „efektivnih“ jezičnih parametara. To zvuči kao mala datoteka, no preuzimanje u Ollami zauzima 7,2 GB, gotovo koliko i Q4 inačica gemma4:12b od 7,6 GB. Kad procjenjuješ što stane na tvoj laptop, gledaj veličinu preuzimanja, a ne oznaku broja parametara.
Druga zamka. Nepotpuna oznaka može ti neprimjetno donijeti pogrešan model. Ako preuzmeš samo granite4.2, dobit ćeš model 8B od 5,3 GB, a ne model 3B od 2,2 GB iz drugog odjeljka. Ako preuzmeš samo qwen3-embedding, dobit ćeš model 8B od 4,7 GB, a ne model 0.6B od 639 MB koji se koristi u osmom odjeljku.
Rješenje je u oba slučaja isto: pri preuzimanju navedi punu, točnu oznaku modela, ne samo naziv obitelji. Prije testiranja provjeri i veličinu datoteke koja se preuzima.
Ako u katalogu piše da model prima 128K ili 256K tokena, to je njegov načelni maksimum. Ne znači da si laptop sa 16 GB memorije može priuštiti toliki kontekst.
Ollama prema zadanim postavkama koristi kontekst od 4 096 tokena. Možeš ga povećati, ali dulji kontekst i veći broj istodobnih zahtjeva povećavaju potrošnju memorije. Postavka num_ctx: 4096 iz drugog dijela serijala odgovara upravo toj opreznoj zadanoj vrijednosti. Broj nije odabran napamet.
Novi model počni isprobavati s 4K do 8K tokena i jednom aktivnom sesijom. Prati pritom zauzeće memorije sustava. Kontekst povećaj tek kad vidiš da zauzeće ostaje stabilno, a ne samo zato što katalog navodi da je veći kontekst tehnički moguć.
Nema jednog najboljeg specijalista za sve zadatke. Nekoliko malih modela vrijedi isprobati na zadatku koji imaš pred sobom.
Programiranje: qwen2.5-coder:3b (1,9 GB) ili veći qwen2.5-coder:7b (4,7 GB). Oba imaju licenciju Apache 2.0.
Matematika ili logika uz zadana ograničenja: phi4-mini:3.8b (2,5 GB), Microsoftov model.
Pitanja o slikama i snimkama zaslona: gemma4:e2b (7,2 GB) ili gemma4:12b Q4 (7,6 GB). Oba imaju licenciju Apache 2.0 i navedenu podršku za tekstualni i slikovni unos.
Višejezično pisanje ili prevođenje: aya-expanse:8b (5,1 GB), razvijen za 23 jezika.
Jedno ograničenje licence ne valja skrivati u fusnoti: Aya Expanse 8B ima licenciju CC-BY-NC-4.0 s dodatnim uvjetima i namijenjen je nekomercijalnoj upotrebi. Nemoj ga zato smatrati zadanim izborom bez ograničenja upotrebe uz gore navedene modele s licencijom Apache. Ako nijedna od ove četiri skupine specijalista ne odgovara tvom zadatku, granite4.2:3b iz drugog odjeljka ostaje opći izbor za zaključivanje.
Svaki model isprobaj na vlastitom zadatku prije nego što se odlučiš. Specijalist mora pokazati koliko ti koristi u poslu koji mu zadaš, a ne samo zauzeti prvo mjesto na tuđoj ljestvici.
Pet kratkih provjera reći će ti o modelu više od bilo koje stranice kataloga. Ponovi iste provjere za svakog kandidata, na vlastitim materijalima.
1. Sažetak potkrijepljen tekstom. Daj modelu bilješku od 250 riječi i zatraži tri stvari koje treba učiniti. Za svaku neka navede rečenicu iz bilješke na kojoj se temelji. Označi sve što tvrdi bez uporišta u tekstu.
2. Strukturirano izvlačenje podataka. Osmisli pet dogovorenih termina s imenima i datumima. Zatraži JSON s točno određenim poljima, a zatim svih pet unosa usporedi sa svojim popisom.
3. Popravak koda. Daj modelu kratku funkciju koja ne prolazi test i taj test. Zabilježi prolazi li test nakon popravka. Za svaki model koji uspoređuješ koristi isti repozitorij i isti kontekst.
4. Jezični par. Neka osoba koja tečno govori oba jezika provjeri jesu li u prijevodu odlomka nalik stvarnom tekstu sačuvana imena, brojevi i nijanse. Kvalitetu višejezičnog rada nemoj procjenjivati samo na temelju upita na engleskom.
5. Pitanje o slici, samo za modele koji obrađuju slike. Pokaži modelu grafikon ili snimku zaslona s provjerljivim odgovorom. Potvrdi da je dobio samu sliku, a ne samo naziv datoteke.
Za svaki pokušaj zabilježi točnost u odnosu na poznati odgovor, praćenje uputa, sve što je model izmislio, vrijeme do prvog vidljivog dijela odgovora, ukupno trajanje, broj tokena te je li radio na CPU-u ili GPU-u. Korisnost i brzinu ocijeni zasebno: model koji zaključuje prije odgovora može potrošiti vrijeme na tokene koje nikad ne vidiš.
Model za vektorizaciju iz drugog odjeljka ima samo jedan zadatak: pretvara tekst u vektore koje aplikacija za dohvat može pretraživati. Sam ne odgovara na pitanja.
Postupak ide ovim redom: datoteke se podijele na manje cjeline, a model za vektorizaciju svaku od njih pretvori u vektor. Lokalno spremište pohrani vektore. Zatim se i tvoj upit pretvori u vektor kako bi se pronašle najsličnije cjeline. Tek tada model za razgovor na temelju pronađenih dijelova sastavi odgovor i navede ih kao izvore.
Model za razgovor nije treniran na tvojim dokumentima. Vidi samo ono što mu sustav za dohvat proslijedi kad postaviš pitanje.
Za malu demonstraciju ne treba mnogo pripreme: indeksiraj pet bilješki koje već imaš. Postavi pitanje na koje odgovor postoji u jednoj od njih, a zatim drugo na koje nema odgovora ni u jednoj bilješci. Ako sustav radi kako treba, za prvo će pitanje pronaći i citirati pravi odlomak, a za drugo priznati da nema dokaza umjesto da izmisli odgovor. Kvalitetu dohvata i konačnog odgovora mjeri zasebno.
Prije preuzimanja provjeri punu oznaku modela za vektorizaciju: embeddinggemma:300m ili qwen3-embedding:0.6b. Razlog je isti kao kod nepotpunih oznaka iz četvrtog odjeljka.
Model s oznakom poput „26B A4B“ pri generiranju svakog tokena aktivira samo dio svojih parametara. Ipak, svih 26 milijardi težina mora negdje biti pohranjeno ili se tijekom rada odnekud učitavati. Manje aktivnih parametara ne znači ni manju datoteku ni manje zauzeće memorije.
U ovom kompletu nema novih rezultata mjerenja performansi. Ako brojka dolazi iz drugog izvora, primjerice iz nečijeg izvještaja o približno 18,5 tokena u sekundi na neuobičajenoj konfiguraciji s modelom 26B arhitekture mješavine stručnjaka, starijim procesorom i grafičkom karticom sa 6 GB memorije, čitaj je upravo tako: kao rezultat jednog korisnika na njegovoj opremi, ne kao brzinu koju treba očekivati od svakog modela s tom oznakom.
Ovaj smo komplet testirali na dva stvarna laptopa koja su trenutačno dostupna, ista kao u drugom dijelu serijala: osnovnom modelu s čipom Apple Silicon i radnoj stanici s Windowsom i vlastitom grafičkom memorijom. Oba su obnovljena: profesionalno su testirana, očišćena i pripremljena za ponovnu upotrebu. Na platformi refurbed uz svaki dolazi 12 mjeseci jamstva, a svaki bez poteškoća pokreće modele iz ovog kompleta.
MacBook Air (2026) od 13 inča s čipom M5 standardno dolazi sa 16 GB objedinjene memorije, a može se konfigurirati s do 32 GB. Dell Precision 7730 ima 32 GB sistemske memorije i zasebnih 6 GB namjenske NVIDIA grafičke memorije. To su dva odvojena memorijska kapaciteta, ne jedan zajednički iznos.
Ovi laptopi nisu ovdje kao prodajni argument, nego kao konkretno mjerilo za vodič. Svoj možeš usporediti sa stvarnim uređajima, a ne samo s marketinškim popisom specifikacija.
Licencija vrijedi za točan model, ne za cijelu obitelj. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B i Gemma 4 E2B nose licenciju Apache 2.0. Aya Expanse 8B nosi CC-BY-NC-4.0 s dodatnim uvjetima za nekomercijalnu upotrebu, kao što smo istaknuli u šestom odjeljku. Mogućnost preuzimanja težina modela, autorskopravno dopuštenje za njihovu upotrebu i „vlasništvo“ nad samim modelom tri su različite stvari. Zato provjeri aktualnu karticu točnog modela koji preuzimaš, ne samo naziv obitelji.
Mali komplet modela ne ostaje malen sam od sebe. Naredbom ollama rm uklanjaš preuzeti model koji ti se nije pokazao korisnim, primjerice ollama rm aya-expanse:8b kad znaš da ga nećeš koristiti. ollama ls pokazuje što je na disku, a ollama ps što je trenutačno učitano. Katalozi se mijenjaju, pa povremeno preispitaj svoj uži izbor umjesto da se bez provjere oslanjaš na odluku od prije nekoliko mjeseci.
I mali modeli mogu izmisliti odlomak, previdjeti nijansu u drugom jeziku ili napisati kod koji izgleda ispravno, ali ne prolazi test. Svaku preporuku iz vodiča provjeri vlastitim pokusom; kad je riječ o nečemu važnom, to nije zamjena za stručnu provjeru.
Mogu li istodobno pokrenuti sva tri modela iz kompleta? Na laptopu sa 16 GB memorije vjerojatno ne bez poteškoća. Učitaj model koji ti treba za trenutačni zadatak pa ga zamijeni drugim, umjesto da opći pomoćnik, specijalist i model za vektorizaciju svi ostanu u memoriji.
Treba li mi GPU za model za vektorizaciju? Ne. embeddinggemma:300m dovoljno je malen da ga isprobaš samo na CPU-u, ali izmjeri koliko traje. Nemoj pretpostaviti da će raditi trenutačno.
Hoće li veći model uvijek dati bolji odgovor? Ne. Hoće li se bolje pokazati model 4B ili 9B ovisi o zadatku. Zato u sedmom odjeljku donosimo metodu s pet zadataka, a ne samo broj s ljestvice uspješnosti.
Je li model preuzet u formatu Q4 dovoljno dobar? Ovisi o zadatku. Ako imaš dovoljno memorije za pokretanje obiju inačica, usporedi oznake Q4 i Q8 istog modela na tri vlastita testa, kao u trećem odjeljku.
Mogu li koristiti Aya Expanse za komercijalni projekt? Ne prema zadanim uvjetima. Licencija CC-BY-NC-4.0 obuhvaća nekomercijalnu upotrebu, uz dodatne uvjete. Prije drukčijeg zaključka provjeri aktualnu karticu modela.
Treba li modelu za vektorizaciju internet nakon preuzimanja? Ne. Kao i ostali modeli u ovom kompletu, radi bez interneta čim su njegove težine spremljene na disk.
Na laptop koji si uz prvi dio serijala procijenio, a uz drugi pripremio za lokalni AI, instaliraj pomoćnika 4B i jednog specijalista za zadatak koji imaš. Pokreni vlastitu inačicu provjere iz sedmog odjeljka s tri pitanja. Zadrži model koji ti pomaže, a drugi ukloni naredbom ollama rm. O kupnji dodatne memorije razmišljaj tek ako stvarni zadatak, a ne popis specifikacija, pokaže da te ograničava upravo memorija.
Time završava ovaj serijal u tri dijela. Ako se pokazalo da tvojem laptopu ipak prvo treba više memorije, kategorija prijenosnih računala razumno je mjesto za početak.
Prijavi se na naš newsletter po prvi put i uštedi 15 €!
Nikad više ne propusti ponudu.
Informacije o korištenju osobnih podataka možeš pronaći u našim Pravilima privatnosti.
Potvrdi prijavu
Klikni na poveznicu u našoj e-poruci s potvrdom kako bi dobio/la svoj kupon. Vrijedi za kupnje iznad 200 €.