- Binabago ng Word2Vec ang mga salita tungo sa mga high-dimensional vector batay sa distributional hypothesis, kung saan ang kahulugan ay hinango mula sa konteksto.
- Gumagamit ang modelo ng dalawang pangunahing arkitektura: CBOW para sa paghula ng isang target na salita mula sa konteksto at Skip-Gram para sa paghula ng konteksto mula sa isang target na salita.
- Ang mga ugnayang semantiko ay nakukuha bilang mga linear offset sa espasyong vector, na nagbibigay-daan sa mga lingguwistikong analogiya sa pamamagitan ng mga operasyong matematikal.
Naisip mo na ba kung paano nga ba talaga "naiintindihan" ng isang makina ang ibig nating sabihin kapag tayo ay nagsasalita? Hindi naman natin basta-basta maibibigay sa computer ang isang diksyunaryo at asahan na mauunawaan nito ang mga detalye. Sa loob ng mahabang panahon, nakita ng mga makina ang mga salita bilang mga nakahiwalay na simbolo lamang , ibig sabihin ang isang "aso" ay kasing-iba ng isang "pusa" tulad ng sa isang "microwave." Nagbago ang lahat ng iyon sa pagdating ng Word2Vec, isang game-changer sa natural language processing na nagbibigay-daan sa mga computer na i-map ang mga salita sa isang mathematical space kung saan ang kahulugan ay binibigyang kahulugan ng kalapitan.
Sa kaibuturan nito, ang Word2Vec ay batay sa distributional hypothesis , na isang magarbong paraan ng pagsasabi na mauunawaan mo ang isang salita sa pamamagitan ng kumpanyang pinapanatili nito. Kung ang dalawang salita ay madalas na nakadikit sa parehong kalapit na salita, malamang na pareho ang kahulugan ng mga ito. Sa pamamagitan ng pagsusuri ng napakaraming teksto, ginagawang high-dimensional vectors ng Word2Vec ang mga salita , na lumilikha ng isang semantic map kung saan ang mga ugnayang lingguwistika ay nagiging simpleng geometry.
Ang Lumang Paaralan: Mga Pamamaraang Batay sa Pagbibilang

Bago pa man umiral ang Word2Vec, umasa muna kami sa mga pamamaraang nakabatay sa bilang. Ang pinakasimpleng bersyon ay kinabibilangan ng mga co-occurrence matrices , kung saan bibilangin mo lang kung ilang beses lumitaw ang salitang A malapit sa salitang B. Bagama't simple, ang mga matrice na ito ay naging napakalaki at puno ng mga zero, kaya mahirap itong kalkulahin. Upang ayusin ito, gumamit ang mga mananaliksik ng mga pamamaraan tulad ng Positive Pointwise Mutual Information (PPMI) upang mas mahusay na masukat ang kaugnayan o Latent Semantic Analysis (LSA) , na gumagamit ng Singular Value Decomposition (SVD) upang paliitin ang data at matuklasan ang mga nakatagong "paksa" sa loob ng mga dokumento.
Paano Talagang Gumagana ang Word2Vec

Binago ng Word2Vec ang script sa pamamagitan ng pagtrato sa problema bilang isang gawain sa paghula sa halip na isang gawain sa pagbibilang. Sa halip na pagbibilang lamang ng mga salita, gumagamit ito ng isang mababaw, dalawang-patong na neural network upang matutunan ang mga pag-embed. Naglalagay ang modelo ng isang window sa isang malaking corpus ng teksto, na nakatuon sa isang sentral na salita at sa nakapalibot na konteksto nito. Sa pamamagitan ng paulit-ulit na pagsasaayos ng mga vector upang ma-maximize ang posibilidad ng paghula sa mga tamang kalapit na salita, natural na pinaglalapit ng modelo ang mga salitang magkatulad ang semantika sa espasyo ng vector.
Dalawang Paraan para Magsanay: CBOW vs. Skip-Gram

- Patuloy na Bag-ng-Mga-Salita (CBOW): Isipin ito bilang isang pagsasanay na "punan ang patlang". Tinitingnan ng modelo ang mga nakapalibot na salita sa konteksto at sinusubukang hulaan ang nawawalang gitnang salitaKaraniwan itong mas mabilis sanayin at mahusay para sa mga salitang madalas bigkasin.
- Skip-Gram: Ito ang kabaligtarang pamamaraan. Ang modelo ay kumukuha ng isang sentral na salita at sinusubukang hulaan ang nakapalibot na kontekstoBagama't mas matagal ang kailangan, mas mahusay ang Skip-Gram sa paghawak mga salitang hindi madalas gamitin at pagkuha ng mga bihirang semantikong ugnayang.
Paggawa ng Epektibong Pagsasanay: Negatibong Pagkuha ng Sample

Ang pagkalkula ng probabilidad para sa bawat salita sa isang napakalaking bokabularyo sa bawat galawin mo ang window ay magiging napakabagal . Upang maiwasan ito, gumagamit ang Word2Vec ng Negative Sampling . Sa halip na i-update ang bawat salita sa diksyunaryo, ina-update lamang ng modelo ang target na salita at isang maliit na bilang ng mga random na napiling "negatibong" halimbawa . Malaki ang nababawasan nito sa computational load nang hindi isinasakripisyo ang kalidad ng mga natutunang embedding, kadalasang nagsasagawa ng mga sampling na salita batay sa kanilang frequency distribution upang matiyak na hindi magiging tamad ang modelo.
Ang Mahika ng Espasyong Semantiko
Kapag natapos na ang pagsasanay, ang resulta ay isang semantic space kung saan maaari mo talagang isagawa ang matematika sa mga salita. Isa sa mga pinaka-cool na tuklas ay ang mga ugnayang ito ay kadalasang linear . Halimbawa, kung kukunin mo ang vector para sa "Hari," ibawas ang "Lalaki," at idadagdag ang "Babae," ang resultang punto sa espasyo ay napakalapit sa vector para sa "Reyna." Ipinapakita nito na nakuha ng modelo ang abstract na konsepto ng kasarian at royalty sa pamamagitan ng simpleng vector arithmetic.
Higit Pa sa mga Pangunahing Salita: Mga Pagpapalawig at Baryante
Ang tagumpay ng Word2Vec ay nagdulot ng isang buong pamilya ng mga extension. Pinalawak ng Doc2Vec ang ideya na kumatawan sa buong mga talata o dokumento bilang mga single vector, na nagpapahintulot para sa advanced na pag-uuri ng dokumento. Pagkatapos ay dumating ang Top2Vec , na pinagsasama ang mga pag-embed ng dokumento sa mga clustering algorithm tulad ng HDBSCAN upang awtomatikong matuklasan ang mga paksa nang hindi nangangailangan ng mga naka-label na data. Maging ang mga biological science ay nagkaroon ng bahagi ng aksyon sa BioVec , na inilalapat ang mga prinsipyong ito sa mga sequence ng DNA at protina upang maunawaan ang mga biochemical pattern.
Pagsusuri ng mga Resulta
Paano natin malalaman kung ang modelo ay talagang "matalino"? Mayroong dalawang pangunahing paraan. Tinitingnan ng intrinsic evaluation ang mga panloob na katangian, gamit ang mga benchmark upang makita kung ang mga marka ng pagkakatulad ng modelo ay naaayon sa paghatol ng tao o kung kaya nitong lutasin ang mga pagsubok sa pagkakatulad . Mas praktikal ang extrinsic evaluation ; kinabibilangan ito ng pagsasama ng mga embedding sa isang totoong gawain, tulad ng pagsusuri ng damdamin o pag-uuri ng teksto, upang makita kung bumubuti ang pangkalahatang pagganap. Habang ang mga mas bagong modelo tulad ng BERT o ELMo ay nagbibigay ng mga contextual embedding (ibig sabihin ay nagbabago ang vector ng isang salita batay sa pangungusap), ang Word2Vec ay nananatiling pundasyon para sa mga static na representasyon ng salita.
Sa pamamagitan ng pagbabago ng kaguluhan ng wika ng tao tungo sa isang nakabalangkas na heometrikong tanawin , ang mga pamamaraang ito ay nagbibigay-daan sa mga makina na mag-navigate sa kahulugan sa pamamagitan ng cosine similarity at vector offsets. Mula sa kahusayan ng negative sampling hanggang sa versatility ng Skip-Gram at CBOW, ang kakayahang i-map ang mga kontekstong lingguwistika sa mga mathematical coordinate ay lubos na nagpabago sa kung paano natin binubuo ang lahat mula sa mga search engine hanggang sa mga tool sa pagsasalin.
