Pokreni AI lokalno na laptopu: tvoj prvi osobni AI poslužitelj

Laptop odgovara na pitanje dok je potpuno odspojen od interneta. Zatim na potpuno isto pitanje, bez ikakvih promjena, odgovara i drugoj aplikaciji na istom računalu. Upravo taj drugi korak pretvara laptop koji već koristiš u mali osobni AI poslužitelj kojem se mogu obratiti i druge aplikacije i skripte.

Ovdje model preuzimaš i pokrećeš, a ne treniraš. Ako još nisi provjerio ima li tvoj laptop dovoljno RAM-a ili VRAM-a, najprije pročitaj koliko RAM-a laptop treba za lokalni AI. Ako već znaš da može pokrenuti model, nastavi.

Četiri sloja lokalnog AI sustava

Svaki lokalni AI sustav ima četiri odvojena sloja. Kad znaš čemu koji služi, korake u nastavku lakše je pratiti.

Težine modela nalaze se u datoteci koju preuzimaš, primjerice u kvantiziranoj inačici malog modela od 3,4 GB. To je veličina datoteke na disku, a ne podatak o tome koliko će RAM-a model trebati tijekom rada.

Program za izvođenje modela učitava te težine i odgovara na zahtjeve. U ovom vodiču to je Ollama, s vlastitim lokalnim HTTP API-jem. Taj sloj omogućuje da se modelom na tvom laptopu služe i druge aplikacije.

Klijent šalje upit: to može biti chat ugrađen u Ollamu, kratka skripta ili zasebna aplikacija. Od klijenta ovisi ostaje li upit na laptopu ili se šalje drugdje.

Neobavezni indeks dokumenata omogućuje modelu za razgovor da pretražuje tvoje datoteke. Za to su potrebni zaseban model za izradu vektorskih prikaza i poseban prostor za pohranu. Indeks se ne izrađuje automatski i ovdje ga ne obrađujemo.

Kad aplikacija ili skripta pošalje zahtjev na 127.0.0.1:11434, prima ga Ollama i učitava model koji si preuzeo. Brisanje preuzetog modela ne briše povijest razgovora koju je spremio klijent: model i povijest pohranjeni su odvojeno.

Prije instalacije: je li tvoj laptop sličan nekom od ovih modela?

Prije nego što išta instaliraš, odvoji dvije minute: zapiši količinu RAM-a, operacijski sustav i procesor te slobodan prostor na SSD-u. Ako laptop ima namjensku grafičku memoriju (VRAM), zapiši i koliko je ima. Za detaljnije objašnjenje memorijskih zahtjeva pročitaj koliko RAM-a laptop treba za lokalni AI.

Oba laptopa u nastavku trenutačno su dostupna na refurbed. Oba su obnovljena: stručnjaci su ih testirali, očistili i uredili za ponovnu uporabu, a uz svaki dolazi jamstvo od 12 mjeseci. Jedan je Appleov osnovni model s čipom Apple Silicon, drugi laptop sa sustavom Windows i vlastitom namjenskom grafičkom memorijom. Oba su dovoljna da prođeš svaki korak u nastavku.

Instaliraj Ollamu na macOS-u, Windowsima ili Linuxu

Na macOS-u ili Windowsima instaliraj službenu Ollaminu aplikaciju, a za Linux slijedi službene upute za instalaciju. Nakon instalacije otvori Ollamu. Na Linuxu pokreni ollama serve ako poslužitelj već ne radi.

Sadašnja verzija Ollamine aplikacije nudi lokalno pokretanje modela i mogućnosti u oblaku. Odaberi oznaku modela koji se preuzima na laptop: za lokalno izvođenje modela prijava uopće nije potrebna.

Za ovaj vodič preuzmi upravo ovu inačicu: qwen3.5:4b-q4_K_M, veličine 3,4 GB. Točna je oznaka važna jer općenita oznaka „latest“ može bez upozorenja upućivati na model mnogo veći od onoga koji si isprobao. Tih 3,4 GB odnosi se na datoteku koju preuzimaš na disk, a ne na količinu RAM-a potrebnu modelu tijekom rada.

Preuzmi prvi model i započni razgovor

Sljedeće dvije naredbe dovoljne su za prvi razgovor s modelom:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

Prvom preuzimaš model, a drugom otvaraš interaktivni razgovor s njim. Umjesto običnog pozdrava daj mu malen, stvaran zadatak, primjerice: „Pretvori ove tri bilješke sa sastanka u popis zadataka. Ne izmišljaj datume.“

Kad završiš, iz razgovora izađi naredbom /bye.

Pozovi API: AI na tvom laptopu radi lokalno

Kad razgovaraš s modelom u terminalu, klijent šalje zahtjeve programu koji ga izvodi. Sada taj program pozovi izravno, kao što bi to učinila druga aplikacija.

Na macOS-u ili Linuxu:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"U jednoj rečenici objasni što znači lokalno izvođenje AI modela."}],"stream":false,"options":{"num_ctx":4096}}'

Na Windowsima u PowerShellu:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"U jednoj rečenici objasni što znači lokalno izvođenje AI modela."}],"stream":false,"options":{"num_ctx":4096}}'

U odgovoru pronađi message.content. Kad je stream postavljen na false, odgovor stiže u jednom dijelu, a ne kao niz dijelova. Uz num_ctx: 4096 ovaj prvi test koristi skromnu veličinu konteksta u usporedbi sa znatno većom maksimalnom vrijednošću koju model oglašava.

Što saznaješ iz odgovora

Uz tekst u polju message.content, Ollama vraća i polja korisna za procjenu trajanja obrade: load_duration, prompt_eval_count, prompt_eval_duration, eval_count i eval_duration.

Iz njih možeš odvojeno vidjeti dvije stvari koje podatak o „tokenima u sekundi“ spaja u jednu: koliko traje učitavanje modela u memoriju, a koliko generiranje odgovora. Prvi upit nakon pokretanja Ollame obično je najsporiji jer tada treba učitati model; sljedeći upit nema taj trošak.

Točne vrijednosti u potpunosti ovise o tvom računalu, pa ovdje ne navodimo tipične brojke. Umjesto da se osloniš na jednu tvrdnju o brzini, usporedi ta polja pri dvama upitima na istom laptopu.

Što je učitano: ps, ls i oslobađanje memorije

Za osnovno upravljanje modelima dovoljne su tri naredbe.

ollama ps pokazuje koji su modeli trenutačno učitani i na čemu se izvode: u stupcu s procesorom vidjet ćeš 100% GPU, 100% CPU ili podjelu između njih.

ollama ls ispisuje sve modele koje si preuzeo.

ollama rm qwen3.5:4b-q4_K_M uklanja preuzeti model koji ti više ne treba.

Ollama prema zadanim postavkama nakon pet minuta neaktivnosti uklanja model iz memorije. Ako ollama ps ne prikazuje nijedan učitani model, najprije pošalji još jedan upit; to samo po sebi ne znači da nešto ne radi.

Poveži drugu aplikaciju preko lokalnog API-ja kompatibilnog s OpenAI-jem

Umjesto s uslugom u oblaku, poveži drugu aplikaciju s modelom na svom laptopu. Tako laptop postaje AI poslužitelj i za nju, a ne samo za ugrađeni chat.

Većina aplikacija koje podržavaju vlastitu adresu API-ja kompatibilnog s OpenAI-jem traži tri podatka: osnovni URL, naziv modela i API ključ. Unesi http://localhost:11434/v1/ kao osnovni URL, a qwen3.5:4b-q4_K_M kao naziv modela.

Polje za API ključ lako zbuni: neke aplikacije ne dopuštaju da ostane prazno. Ollamina dokumentacija zato koristi zamjensku vrijednost api_key='ollama' i objašnjava da polje mora biti popunjeno, ali lokalni poslužitelj zanemaruje unesenu vrijednost. Taj niz ništa ne autentificira. Služi samo za popunjavanje polja, nije lozinka.

Kompatibilnost obuhvaća samo dio mogućnosti pojedinog API-ja. Prije nego što se osloniš na neku značajku, primjerice slanje slika ili pozivanje alata, isprobaj upravo nju u aplikaciji koju koristiš. Nemoj pretpostaviti da će sve raditi jednako.

Provjeri rad bez interneta: ponovi isti upit

Dosadašnji su se upiti, barem u teoriji, mogli slati na internet a da to ne primijetiš. Evo kako to možeš isključiti.

Kad preuzimanje modela završi, isključi Wi-Fi na laptopu ili izvuci mrežni kabel. Zatim u chatu ili preko API-ja ponovi isti upit kao prije. Ako bez ikakve internetske veze dobiješ suvisao odgovor, to dokazuje da model radi lokalno.

Odgovor koji stiže samo dok si na internetu nije dokaz. Nije dokaz ni odgovor s https://ollama.com umjesto s localhost, kao ni odgovor modela u oblaku umjesto preuzetog modela. Zahtjevi lokalnom modelu u Ollami ostaju na tvom računalu; njezini zasebni modeli u oblaku obrađuju se na udaljenom poslužitelju.

Lokalni AI i privatnost: što te štiti, a što ne

Privatnost se ne podrazumijeva. Zato vrijedi znati koje te postavke štite, a koje ne.

Ollama prema zadanim postavkama osluškuje samo na 127.0.0.1:11434: zahtjeve prihvaća s tvog laptopa, ne s drugih uređaja. Ostavi tu postavku. Ne postavljaj OLLAMA_HOST=0.0.0.0 niti preusmjeravaj port 11434 na javni internet: zamjenski API ključ iz prethodnog odjeljka ne provjerava tko se spaja. Izložiš li port internetu, pristup će biti otvoren, a ne zaštićen.

Ako želiš potpuno isključiti Ollamine funkcije u oblaku, možeš, ali to nije nužno: preuzeti lokalni model već se izvodi na laptopu. U datoteku ~/.ollama/server.json dodaj {"disable_ollama_cloud": true} ili postavi OLLAMA_NO_CLOUD=1. U oba slučaja ponovno pokreni Ollamu da bi promjena stupila na snagu.

Pristup s drugog uređaja ili iz druge sobe zasebna je, naprednija tema: potrebni su privatna mreža i proxy s autentifikacijom. Ovaj vodič to ne obrađuje, a izravno izlaganje porta nije rješenje.

Ako zapne: gdje najprije pogledati

Kod najčešćih poteškoća počni ovim provjerama.

Veza je odbijena. Provjeri je li pokrenuta Ollamina aplikacija ili ollama serve, pa pokušaj ponovno.

Prvi odgovor stiže sporo, kasniji brže. Razlika je u vremenu učitavanja modela, ne u brzini generiranja odgovora. Usporedi ranije spomenuta polja u odgovoru.

Sve je mnogo sporije od očekivanog. Pokreni ollama ps: možda se model izvodi samo na CPU-u ili se posao dijeli između CPU-a i GPU-a. Provjeri podršku za svoj GPU i njegove upravljačke programe na operacijskom sustavu koji koristiš.

Nedostatak memorije ili rušenje programa. Prije novog pokušaja odaberi oznaku manjeg modela, smanji num_ctx i zatvori druge aplikacije koje troše mnogo memorije.

Disk se puni. Naredba ollama ls pokazuje što si preuzeo; pomoću ollama rm ukloni modele koje ne koristiš.

Ako ti ovaj način rada ne odgovara, primjerice zato što želiš grafički preglednik modela ili precizniju kontrolu nad CPU-om i GPU-om, vrijedi pogledati LM Studio i llama.cpp. U tom slučaju ima smisla zamijeniti program za izvođenje modela, a ne održavati dvije instalacije usporedno.

Česta pitanja o lokalnom pokretanju AI-ja na laptopu

Treba li mi internet nakon postavljanja? Ne. Kad se model preuzme, s njim možeš razgovarati i slati zahtjeve njegovu API-ju potpuno bez internetske veze.

Štiti li zamjenski API ključ moj lokalni API? Ne. Ollamin lokalni poslužitelj prihvaća bilo koju nepraznu vrijednost, ali je ne provjerava. Ključ koji neke aplikacije traže zato ne pruža sigurnosnu zaštitu.

Ostaje li moj upit na laptopu? Da, ako odabereš oznaku preuzetog lokalnog modela. Ollama nudi i zasebne modele u oblaku; njihovi se upiti obrađuju na udaljenom poslužitelju. Razlika je u odabranoj oznaci modela, a ne u nekoj skrivenoj zadanoj postavci.

Treba li mi zasebna grafička kartica? Ne. Laptop koji se oslanja samo na CPU može pokrenuti manji model, obično sporije. ollama ps pokazuje kako je obrađen pojedini upit.

Što ako želim veći ili drukčiji model? U već korištenim naredbama ollama pull i ollama run zamijeni oznaku modela, ali najprije provjeri RAM i VRAM. Pojedinosti potraži u vodiču koliko RAM-a laptop treba za lokalni AI.

Hoće li model odsad pamtiti moje dokumente? Ne. Model za razgovor sam od sebe ne pamti trajno sadržaj mape. Za pretraživanje vlastitih datoteka potreban je zaseban indeks dokumenata, neobavezan dodatak koji ovdje ne obrađujemo.

Sad isprobaj svoj osobni AI poslužitelj

Odaberi jedan stvaran zadatak i isprobaj ga putem oba klijenta: ugrađenog chata i druge aplikacije koju si upravo povezao. Možeš, primjerice, sažeti osobnu bilješku, razvrstati niz datoteka u označene skupine ili zatražiti jednostavno objašnjenje kratkog isječka koda.

Što god odabereš, zabilježi točnu oznaku modela, verziju programa koji ga izvodi, postavku konteksta, URL i sam zadatak. Tako ćeš kasnije moći ponoviti rezultat, a moći će i netko drugi tko pokuša isto.

Ako se pokaže da tvoj laptop nema dovoljno RAM-a ili VRAM-a, vrijedi razmisliti o računalu s većom memorijskom rezervom. Sljedeći tekst u serijalu bit će o malom skupu modela: jednom za razgovor, jednom za kod i jednom za pretraživanje.

Obnovljeni laptop prikladan za lokalno pokretanje AI-ja, dostupan na refurbed

Prijavi se na naš newsletter po prvi put i uštedi 15 €!

Nikad više ne propusti ponudu.

Informacije o korištenju osobnih podataka možeš pronaći u našim Pravilima privatnosti.