07.08.2026 "Modern Science and Research" xalqaro ilmiy jurnali 1 seriyasi. Volume 5 Issue 8
Abstract. Bul maqalada qaraqalpaq tiliniń zamanagóy leksikasın óz ishine alǵan elektron korpustı jaratıw texnologiyaları hám onıń lingvistikalıq múmkinshilikleri talqılanadı. Izertlewdiń baslı maqseti — qaraqalpaq tili resursların sanlastırıw, tildiń statistikalıq hám morfologiyalıq parametrlerin analizlew ushın universal platforma jaratıw bolıp tabıladı. Maqalada internet resursları, ásirese Wikipedia hám elektron ǴXQ tekstleri tiykarında jıynalǵan 2,5 millionnan artıq sóz qollanılıwǵa iye bolǵan korpustıń arxitekturası kórsetilgen. Shıǵıstaǵı tatar milliy korpusı (“Tugan tel”) sıyaqlı iri joybarlar tájiriybesine súyene otırıp, qaraqalpaq tili korpusında úsh basqıshlı izlew sisteması: morfologiyalıq, kontekstli (KWIC) hám statistikalıq (N-gramm) modulleri islep shıǵılmaqta. Sonday-aq, maqalada korpus quramındaǵı tekstlerdi avtomatlastırılǵan morfologiyalıq teglew maseleleri hám tildiń agglyutinativlik qásiyetin esapqa alǵan halda izlew algoritmlerin optimallastırıw usılları keltirilgen. Izertlew nátiyjeleri qaraqalpaq tilin oqıtıw, leksikografiya hám mashina awdarması sistemaların rawajlandırıwda zárúr derek bolıp xizmet etedi.
Keywords: korpus, maǵlıwmatlar bazası, n-gramm, izlew sisteması, teglew, korpus quramı.