- Word2Vec transformiše riječi u visokodimenzionalne vektore na osnovu distribucione hipoteze, gdje se značenje izvodi iz konteksta.
- Model koristi dvije glavne arhitekture: CBOW za predviđanje ciljne riječi iz konteksta i Skip-Gram za predviđanje konteksta iz ciljne riječi.
- Semantički odnosi se obuhvataju kao linearni pomaci u vektorskom prostoru, omogućavajući lingvističke analogije putem matematičkih operacija.
Jeste li se ikada zapitali kako mašina zapravo "razumije" šta mislimo kada govorimo? Nije kao da možemo samo dati računaru rječnik i očekivati da razumije nijanse. Dugo vremena, mašine su riječi doživljavale samo kao izolovane simbole , što je značilo da se "pas" jednako razlikovao od "mačke" kao i od "mikrovalne pećnice". Sve se to promijenilo dolaskom Word2Vec-a, revolucionarnog programa u obradi prirodnog jezika koji omogućava računarima da mapiraju riječi u matematički prostor gdje je značenje definirano blizinom.
U svojoj srži, Word2Vec se zasniva na distribucijskoj hipotezi , što je otmjeni način da se kaže da se riječ može razumjeti po društvu s kojim se druži. Ako se dvije riječi često pojavljuju s istim susjedima, vjerovatno dijele slično značenje. Analizirajući ogromne količine teksta, Word2Vec pretvara riječi u visokodimenzionalne vektore , stvarajući semantičku mapu gdje lingvistički odnosi postaju jednostavna geometrija.
Stara škola: Pristupi zasnovani na brojanju

Prije nego što je Word2Vec preuzeo primat, oslanjali smo se na metode zasnovane na brojanju. Najosnovnija verzija uključivala je matrice zajedničkog pojavljivanja , gdje ste jednostavno brojali koliko se puta riječ A pojavila blizu riječi B. Iako jednostavne, ove matrice su postale monstruozno velike i ispunjene nulama, što ih je činilo noćnom morom za izračunavanje. Da bi to riješili, istraživači su koristili tehnike poput Pozitivne tačkaste međusobne informacije (PPMI) za bolje mjerenje asocijacije ili Latentne semantičke analize (LSA) , koja koristi dekompoziciju singularnih vrijednosti (SVD) za smanjenje podataka i otkrivanje skrivenih "tema" unutar dokumenata.
Kako Word2Vec zapravo funkcioniše

Word2Vec je preokrenuo scenario tretirajući problem kao zadatak predviđanja , a ne kao zadatak brojanja. Umjesto samog brojanja riječi, koristi plitku, dvoslojnu neuronsku mrežu za učenje ugrađivanja. Model pomiče prozor preko ogromnog korpusa teksta, fokusirajući se na centralnu riječ i njen okolni kontekst. Iterativnim podešavanjem vektora kako bi se maksimizirala vjerovatnoća predviđanja ispravnih susjeda, model prirodno približava semantički slične riječi u vektorskom prostoru.
Dva načina treninga: CBOW vs. Skip-Gram

- Kontinuirana vreća riječi (CBOW): Zamislite ovo kao vježbu "popunjavanja praznina". Model analizira riječi iz okolnog konteksta i pokušava predvidite nedostajuću centralnu riječGeneralno je brže za učenje i odlično funkcioniše za česte riječi.
- Preskoči gram: Ovo je inverzni pristup. Model uzima jednu centralnu riječ i pokušava predvidjeti okolni kontekstIako traje duže, Skip-Gram je mnogo bolji u rukovanju. rijetke riječi i hvatanje rijetkih semantičkih odnosa.
Učiniti obuku efikasnom: Negativno uzorkovanje

Izračunavanje vjerovatnoće za svaku pojedinačnu riječ u ogromnom vokabularu svaki put kada pomjerate prozor bilo bi nevjerovatno sporo . Da bi se to izbjeglo, Word2Vec koristi negativno uzorkovanje . Umjesto ažuriranja svake riječi u rječniku, model ažurira samo ciljnu riječ i malu šačicu nasumično odabranih "negativnih" primjera . Ovo drastično smanjuje računarsko opterećenje bez žrtvovanja kvaliteta naučenih ugrađivanja, često uzorkujući riječi na osnovu njihove frekvencijske distribucije kako bi se osiguralo da model ne postane lijen.
Magija semantičkog prostora
Nakon što se obuka završi, rezultat je semantički prostor u kojem zapravo možete izvoditi matematičke operacije s riječima. Jedno od najzanimljivijih otkrića je da su ovi odnosi često linearni . Na primjer, ako uzmete vektor za "Kralja", oduzmete "Muškarca" i dodate "Ženu", rezultirajuća tačka u prostoru je nevjerovatno blizu vektoru za "Kraljicu". Ovo pokazuje da je model uhvatio apstraktni koncept roda i kraljevske porodice putem jednostavne vektorske aritmetike.
Više od osnovnih riječi: Proširenja i varijante
Uspjeh Word2Vec-a pokrenuo je cijelu porodicu ekstenzija. Doc2Vec je proširio ideju kako bi predstavio cijele paragrafe ili dokumente kao pojedinačne vektore, omogućavajući naprednu klasifikaciju dokumenata. Zatim se pojavio Top2Vec , koji kombinuje ugrađivanje dokumenata sa algoritmima klasterovanja poput HDBSCAN- a kako bi automatski otkrio teme bez potrebe za označenim podacima. Čak su i biološke nauke dobile dio akcije sa BioVec-om , primjenjujući ove principe na sekvence DNK i proteina kako bi razumjele biohemijske obrasce.
Evaluacija rezultata
Kako znamo da li je model zaista „pametan“? Postoje dva glavna načina. Intrinzična evaluacija ispituje interna svojstva, koristeći referentne vrijednosti kako bi se utvrdilo da li se rezultati sličnosti modela poklapaju s ljudskom procjenom ili da li model može riješiti testove analogije . Ekstrinzična evaluacija je praktičnija; ona uključuje uključivanje ugrađivanja u zadatak iz stvarnog svijeta, poput analize sentimenta ili klasifikacije teksta, kako bi se vidjelo da li se ukupne performanse poboljšavaju. Dok noviji modeli poput BERT-a ili ELMo-a pružaju kontekstualna ugrađivanja (što znači da se vektor riječi mijenja na osnovu rečenice), Word2Vec ostaje temelj za statičke reprezentacije riječi.
Transformirajući haos ljudskog jezika u strukturirani geometrijski pejzaž , ove tehnike omogućavaju mašinama da se kreću kroz značenje putem kosinusne sličnosti i vektorskih pomaka. Od efikasnosti negativnog uzorkovanja do svestranosti Skip-Grama i CBOW-a, sposobnost mapiranja lingvističkih konteksta u matematičke koordinate fundamentalno je promijenila način na koji gradimo sve, od pretraživača do alata za prevođenje.
