Datoteka za preuzimanje od 3,4 GB pod nazivom qwen3.5:4b-q4_K_M (LLM, veliki jezični model) već večeras može odgovoriti na pitanje na sasvim običnom laptopu sa 16 GB memorije, bez cloud računa. Preuzmi je kroz Ollamu, postavi jedno pitanje uz 4K kontekst i već lokalno pokrećeš pravi AI model, na hardveru koji već imaš. Model čita tekst i slike, a ovdje je riječ o inferenciji, ne treniranju: nitko model ne uči ničemu novom, on samo odgovara.
Nejasna naljepnica "AI PC" na kutiji laptopa nije specifikacija. Specifikacije su RAM, memorija koju GPU može koristiti, pohrana i stvarna softverska podrška. 16 GB memorije stvarna je ulazna točka za male AI modele, ali to nije ni premalo da ga odmah otpišeš ni jamstvo za sve što piše u specifikacijama. Više memorije znači više konteksta i više prostora za rad u više aplikacija. Sa 16 GB možeš krenuti.
Veličina preuzete datoteke modela i količina RAM-a koju model zauzima tijekom rada nisu isti broj, a njihovo miješanje najčešća je pogreška pri kupnji laptopa za AI. Tih 3,4 GB koje preuzimaš za qwen3.5:4b-q4_K_M datoteka su na disku. Za učitavanje treba stvarna memorija. Memoriju troši i kontekstni prozor, odnosno razgovor koji model zadržava dok odgovara, takozvani KV cache. Memoriju troši i sam engine, kao i sve ostalo što tvoj operativni sustav i druge aplikacije već koriste.
Ollama zadano učitava kontekst od 4.096 tokena, a ti ga možeš povećati. Ako istodobno pokrećeš više zahtjeva, potrebna memorija za kontekst raste otprilike razmjerno broju paralelnih zahtjeva. Na specifikacijama modela može pisati kontekstni prozor od 128K ili 256K tokena: gledaj na to kao na gornju granicu modela, a ne kao na obećanje da tvoj laptop sa 16 GB može sve to koristiti odjednom.
Apple Silicon čipovi koriste objedinjenu memoriju: CPU i GPU dijele istih 16, 24 ili 32 GB, pa ne postoji zasebna grafička memorija koje može ponestati. Tipičan Windows ili Linux laptop s namjenskim NVIDIA GPU-om radi drukčije. Sistemski RAM i vlastiti VRAM grafičke kartice dva su odvojena spremnika, pa 16 GB sistemskog RAM-a i GPU od 8 GB nisu jedan zajednički spremnik od 24 GB kojim model može slobodno raspolagati.
Kad cijeli model ne stane na GPU, dio se izvršava na CPU-u, odnosno djelomično se prebacuje s GPU-a, pa model koji se tehnički može učitati može raditi osjetno sporije. Pokreneš li , točno ćeš vidjeti tu podjelu između CPU-a i GPU-a za sve što je trenutačno učitano.
Kapacitet je tek pola priče. Jednako je važno i koliko se brzo ta memorija prenosi: Apple za MacBook Air M5 navodi propusnost memorije od 153 GB/s, a upravo je propusnost, ne samo veličina, važan razlog zašto objedinjena memorija radi uvjerljivo brzo, a ne samo dovoljno brzo da zadovolji minimum.
Kvantizacija je razlog zašto to preuzimanje zauzima 3,4 GB: težine modela spremaju se s nižom numeričkom preciznošću pa datoteka postaje manja, a raspon se jasno vidi na Qwen3.5 modelu od 9B. Isti model zauzima 6,6 GB kao Q4_K_M, 11 GB kao Q8_0 i 19 GB pri punoj BF16 preciznosti. Isti model, isti broj parametara, tri vrlo različite veličine preuzimanja, a i dalje govorimo o veličini datoteke, ne o RAM-u potrebnom tijekom rada.
Niža preciznost obično donekle smanjuje kvalitetu, ali koliko točno ovisi o zadatku, ne o fiksnom postotku. Prije nego što odabereš Qwen kao prvi model, vrijedi znati još jednu praktičnu stvar: neki korisnici navode da njegov korak "razmišljanja" stvara primjetnu odgodu prije nego što se pojavi odgovor, u usporedbi s modelima koji odgovaraju izravnije. Zato je bolje isprobati oba pristupa na vlastitim zadacima nego unaprijed pretpostaviti da je jedan jednostavno bolji.
Ako već imaš MacBook sa 16 GB, kreni s modelom od 2-4B pri Q4 preciznosti i 4K kontekstu prije nego što uopće razmisliš o kupnji nečeg drugog. Možda će se učitati i model od 9B Q4, ili nešto poput Gemma 4 12B QAT. Hoće li to uspjeti ovisi o tome koliko je drugih aplikacija otvoreno, koliko konteksta koristiš i koliko je stroj već zagrijan, zato to uzmi kao nešto što vrijedi isprobati, a ne kao jamstvo.
Kupuješ li baš za ovu svrhu? MacBook Air 13-inch with M5 chip standardno dolazi sa 16 GB objedinjene memorije, a može se konfigurirati do 32 GB. I prije nego što te veći zaslon navede na nadogradnju, 15-inčni M5 Air kreće s potpuno istim opcijama od 16, 24 i 32 GB memorije te istom propusnošću od 153 GB/s kao 13-inčni model. Veličinu zaslona biraj zbog udobnosti, a ne zato što misliš da ćeš tako dobiti više prostora za AI. Nećeš.
Windows ili Linux laptop sa 16 GB bez namjenskog GPU-a i dalje može pokrenuti mali model. Ollama radi nativno na Windowsu, zato prvo preuzmi model od 2-4B u Q4 varijanti i isprobaj ga na CPU-u ili integriranoj grafici prije nego što išta potrošiš. Očekuj više razlika u dojmu rada nego na Apple Siliconu: ne postoji jedan fiksni broj tokena u sekundi koji vrijedi za svaki stroj jer nitko nije izmjerio svaku moguću konfiguraciju.
Lenovo ThinkPad T14 G2 i HP EliteBook x360 1040 G7 oba imaju 16 GB RAM-a i integriranu grafiku, upravo taj razred. Jednu stvar ipak prvo provjeri, posebno kod starijeg obnovljenog uređaja poput ova dva: LM Studio na Windowsu x64 traži AVX2 podršku, a taj skup instrukcija nemaju svi stariji procesori. Zato prije nego što pretpostaviš da će svaki laptop iz ove klase pokrenuti alat koji si odabrao, potvrdi podržava li ga tvoj konkretni procesor.
NVIDIA-ini GPU-i za laptope dijele nazive s desktop karticama, ali taj naziv govori manje nego što se čini. RTX 5060 Laptop GPU ima 8 GB GDDR7 memorije i objavljeni raspon potrošnje od 45 do 100 W. RTX 5070 Ti Laptop GPU ima 12 GB GDDR7 memorije i 60 do 115 W. Rezultat za desktop RTX 5070 Ti koji nađeš na internetu nije isto što i rezultat za laptop RTX 5070 Ti, bez obzira na to što naziv sugerira.
U istom nazivu skriva se još jedna zamka. Dva laptopa mogu imati "RTX 5070 Ti Laptop GPU" i svejedno se različito ponašati pod dugotrajnim opterećenjem: tanko i lagano kućište te deblje i teže kućište drukčije rješavaju toplinu, pa isti naziv GPU-a ne jamči istu stvarnu brzinu nakon što ventilatori neko vrijeme rade. Uvijek provjeri točnu količinu VRAM-a i konkretno podešenje napajanja laptopa, a ne samo ime obitelji GPU-a.
Ako kupuješ baš za redovito lokalno pokretanje AI-ja, Appleov razred od 24 do 32 GB objedinjene memorije osjetno je ugodniji za rad: ostavlja stvaran prostor za veći model, duži kontekst ili jednostavno za to da druge aplikacije ostanu otvorene dok radiš. Odaberi 32 GB ako očekuješ da ćeš to često koristiti i ako ti budžet to dopušta.
MacBook Pro 13-inch with M2 chip konkretan je obnovljeni primjer koji je već iznad početnog razreda od 16 GB: njegov 8-jezgreni CPU i 10-jezgreni GPU dolaze s do 24 GB objedinjene memorije. To je starija generacija čipa od M5 Aira, pa je gornja granica od 24 GB ono što ovdje treba očekivati, a ne zasebne opcije od 24 i 32 GB kakve nudi M5 Air.
Za novi Windows ili Linux laptop koji kupuješ baš zbog lokalnog AI-ja traži 32 GB sistemskog RAM-a i namjenski NVIDIA GPU za laptope s najmanje 8 GB vlastitog VRAM-a, odnosno 12 GB ako ti je prihvatljiv nešto teži ili skuplji laptop. 8 GB razuman je cilj za modele od 4-7B pri Q4 preciznosti i umjerenom kontekstu, ali nemoj računati na to kao na automatski višak prostora: čak i preuzimanje od 6,6 GB za model od 9B Q4 može tražiti više od samih 8 GB za ugodan rad, a 12 GB jednostavno otvara lakše testiranje u toj veličini.
Dell Precision 7730 konkretan je obnovljeni primjer te osnovne ideje, iako nema potpuno iste nove čipove kao gore navedeni modeli: 32 GB sistemske memorije dolazi uz namjensku NVIDIA Quadro P3200 s vlastitih 6 GB VRAM-a. To je drukčija generacija i drukčija klasa GPU-a od današnjih NVIDIA RTX 5060 i 5070 Ti Laptop GPU-ova, ali princip odvojenih spremnika ostaje isti.
AMD-ov procesor Ryzen AI Max+ 395 podržava do 128 GB LPDDR5x sistemske memorije, ovisno o tome kako je konkretan laptop konfiguriran. To je drukčija memorijska arhitektura koju vrijedi poznavati, ali ima i važnu kvaku: Ollamin popis podržanih ROCm konfiguracija za Linux navodi taj čip, dok ga popis za Windows ROCm trenutačno ne navodi.
To nije razlog da taj čip odmah otpišeš, nego razlog da prije preporuke provjeriš točno ugrađenu memoriju, operativni sustav, GPU backend, driver i ponašanje Ollame na konkretnom laptopu. Laptop s AMD-om i velikom količinom memorije promatraj kao zanimljivu alternativnu arhitekturu koju vrijedi pažljivo istražiti, a ne kao zadanu prvu kupnju za nekoga tko tek počinje s lokalnim pokretanjem AI-ja.
Ollama je najjednostavniji način da model progovori na tvojem računalu: preuzmeš model, pokreneš ga i dobiješ lokalni server koji odgovara na zahtjeve, bez cloud računa za već preuzeti model. Na tom se alatu temelji svaki primjer ovdje.
LM Studio nudi grafičku alternativu sa svojim preglednikom modela i prozorom za chat. I sam objavljuje minimalne zahtjeve: najmanje 16 GB RAM-a na Macu ili Windowsu, AVX2 podrška obavezna na Windowsu x64 te preporučenih 4 GB namjenskog VRAM-a na Windowsu. Pravilno postavljanje bilo kojeg od ta dva alata zasebna je tema.
I još jedno upozorenje prije nego što povjeruješ bilo kojem pojedinačnom broju brzine koji pročitaš na internetu: službeni alat llama-bench odvaja brzinu obrade prompta od brzine generiranja i prikazuje varijacije kroz ponovljena mjerenja, a ne samo jednu brojku. Objava na forumu s jednim brojem tokena u sekundi rijetko kaže koju je od te dvije stvari mjerila ili koliko je puta test ponovljen.
Ako kupuješ ili nadograđuješ laptop baš za lokalni AI, provjeri konkretne detalje, a ne marketing.
Točan model GPU-a i količina VRAM-a. Ne samo naziv obitelji GPU-a, nego točnu varijantu laptopa i njezinu količinu memorije, jer se iza istog naziva mogu skrivati različite količine VRAM-a.
Zalemljeni ili nadogradivi RAM. Kod nekih laptopa memoriju možeš dodati kasnije, a kod mnogih tankih i laganih modernih modela ne možeš. Znaj što kupuješ.
Slobodan SSD prostor. Preuzimanja modela kreću se od manje od jednog gigabajta do znatno više od deset, a rastuća kolekcija brzo zauzme prostor uz tvoje druge datoteke.
Ponašanje pri dugotrajnom opterećenju. Jedno pitanje jednom modelu i više uzastopnih zahtjeva na laptopu nisu isti testovi; buka ventilatora i spuštanje performansi nakon više promptova reći će ti više od jedne kratke demonstracije.
Podrška za OS i drivere. Prije nego što nešto uzmeš zdravo za gotovo, potvrdi da tvoja točna kombinacija GPU backenda i operativnog sustava ima podršku za Ollamu ili LM Studio.
Broj TOPS za NPU na kutiji nije jamstvo propusnosti. To je marketinška brojka, a ne testirani rezultat enginea koji ćeš pokretati. Nejasna oznaka "AI PC" ne može zamijeniti nijednu od gornjih provjera.
Treba li mi namjenski GPU za lokalni AI?
Ne. Mali model može raditi na CPU-u ili integriranoj grafici na mnogim laptopima sa 16 GB, samo uz više razlika u brzini nego na laptopu s namjenskim GPU-om. Kreni s modelom od 2-4B prije nego što zaključiš da ti uopće treba namjenska grafika.
Hoće li 8 GB RAM-a biti dovoljno?
Ne baš ugodno za modele koji se ovdje obrađuju. 16 GB realna je početna točka kad uračunaš da model, njegov kontekstni prozor, engine i operativni sustav dijele istu memoriju.
Je li lokalno pokretanje modela isto što i njegovo treniranje?
Ne. Sve gore opisano je inferencija: postavljanje pitanja već istreniranom modelu. Treniranje znači izgradnju modela od početka i traži puno više hardvera nego bilo koji laptop ovdje.
Jamči li više RAM-a brže odgovore?
Ne. Više memorije daje više prostora za veće modele, duži kontekst i više otvorenih aplikacija, ali stvarna brzina ovisi o propusnosti memorije, GPU backendu i konkretnom modelu, a ne samo o količini memorije.
Jesu li moji podaci privatni kad model radi lokalno?
Da, u smislu da tvoji promptovi ostaju na tvojem računalu umjesto da odlaze cloud pružatelju usluge. Ollama se zadano veže uz tvoj laptop i ne šalje zahtjeve nikamo drugdje osim ako namjerno ne podesiš pristup cloudu.
Već imaš laptop sa 16 GB? Večeras instaliraj Ollamu i pokreni jedan mali model prije nego što potrošiš i cent na nešto novo. Kupuješ li baš za ovo? Uzmi gornji popis za provjeru i pet obnovljenih laptopa koje smo upravo prošli kao početnu usporedbu, a ne marketinške specifikacije.
Svaki laptop na refurbed prolazi testiranje i ocjenjivanje prije objave, pa RAM i konfiguracija koje kupiš odgovaraju onome što dobiješ. Sljedeći vodič u ovom serijalu pokazuje kako povezati prvu aplikaciju s modelom koji si upravo isprobao.
Prijavi se na naš newsletter po prvi put i uštedi 15 €!
Nikad više ne propusti ponudu.
Informacije o korištenju osobnih podataka možeš pronaći u našim Pravilima privatnosti.
Potvrdi prijavu
Klikni na poveznicu u našoj e-poruci s potvrdom kako bi dobio/la svoj kupon. Vrijedi za kupnje iznad 200 €.