Organization Profile

၁။ အဖွဲ့အစည်း၏ ဝိသေသလက္ခဏာနှင့် နိဒါန်း

ဤကဏ္ဍသည် DatarrX (ဒေတာ-အက်စ်) ၏ ဖြစ်တည်မှု၊ အခြေခံခံယူချက်နှင့် အဖွဲ့အစည်း၏ အမည်နာမနောက်ကွယ်ရှိ လေးနက်သော အဓိပ္ပာယ်ဖွင့်ဆိုချက်များကို အများပြည်သူနှင့် သက်ဆိုင်သူများ ရှင်းလင်းစွာ သိရှိနားလည်စေရန် ရည်ရွယ်၍ ပြုစုထားခြင်း ဖြစ်ပါသည်။

၁.၁ အဖွဲ့အစည်း၏ အမည်နှင့် အဓိပ္ပာယ်ဖွင့်ဆိုချက်

ဤအဖွဲ့အစည်း၏ တရားဝင်အမည်အား အင်္ဂလိပ်ဘာသာဖြင့် “DatarrX” ဟုလည်းကောင်း၊ မြန်မာဘာသာဖြင့် “ဒေတာ-အက်စ်” ဟုလည်းကောင်း သတ်မှတ်ခေါ်ဆိုပါသည်။ DatarrX ဟူသော အမည်နာမသည် ရိုးရှင်းသော အခေါ်အဝေါ်တစ်ခုထက် ကျော်လွန်၍ အဖွဲ့အစည်း၏ လုပ်ငန်းစဉ်နှင့် ရည်မှန်းချက်ကို သိပ္ပံနည်းကျ ပေါင်းစပ်ဖွင့်ဆိုထားခြင်း ဖြစ်ပါသည်။
ကျွန်ုပ်တို့၏ အမည်နာမကို “Defining the Unknown through Rigorous Data Research” (စနစ်ကျနသော ဒေတာသုတေသနနည်းလမ်းများဖြင့် အဖြေမရှိသေးသည့် စိန်ခေါ်မှုများကို ဖြေရှင်းခြင်း) ဟူသော မူဝါဒအပေါ် အခြေခံ၍ အောက်ပါအတိုင်း အစိတ်အပိုင်း (၄) ခုဖြင့် အနက်အဓိပ္ပာယ် ဖွင့်ဆိုပြဋ္ဌာန်းထားပါသည် -

  • Data (The Data) — အခြေခံအုတ်မြစ်
    ဉာဏ်ရည်တု (AI) ခေတ်သစ်တွင် ဒေတာသည် အချက်အလက်သက်သက်မဟုတ်ဘဲ နည်းပညာတစ်ခုလုံး လည်ပတ်ရန်အတွက် မရှိမဖြစ်လိုအပ်သော “ဒစ်ဂျစ်တယ်လောင်စာ” နှင့် “အခြေခံအုတ်မြစ်” ဖြစ်သည်ဟု ကျွန်ုပ်တို့ အခိုင်အမာ ယုံကြည်ပါသည်။
  • r (Research) — သုတေသန
    ကျွန်ုပ်တို့သည် အချက်အလက်များကို စုဆောင်းရုံသာမကဘဲ ဘာသာစကားဆိုင်ရာ အနက်အဓိပ္ပာယ်နှင့် နည်းပညာဆိုင်ရာ လိုအပ်ချက်များကို သိပ္ပံနည်းကျ စနစ်တကျ သုတေသနပြု (Research) လုပ်ဆောင်ပါသည်။
  • r (Rigor) — တိကျခိုင်မာမှု
    ဒေတာများ ပြုစုပျိုးထောင်ရာတွင် အရည်အသွေးနှင့် စံနှုန်းများအပေါ် မည်သည့်လျော့ပေါ့မှုမျှမရှိဘဲ တိကျခိုင်မာသော (Rigorous) စစ်ဆေးမှုစနစ်များဖြင့် ဆောင်ရွက်ပါသည်။
  • X (The Variable) — ကိန်းရှင်
    သင်္ချာနှင့် နည်းပညာသဘောတရားအရ “X” သည် ရှာဖွေရန်လိုအပ်နေသော အဖြေ သို့မဟုတ် ကိန်းရှင် (Variable) ကို ကိုယ်စားပြုပါသည်။ မြန်မာစာနှင့် တိုင်းရင်းသားဘာသာစကားများအတွက် AI လောကတွင် လိုအပ်နေသော “ကွက်လပ်” များကို ဒေတာဖြင့် ဖြည့်ဆည်းပေးမည့် အဖြေမှာ DatarrX ပင် ဖြစ်ပါသည်။

ထို့ကြောင့် DatarrX သည် ခိုင်မာသော ဒေတာသုတေသနနည်းလမ်းများဖြင့် မြန်မာဘာသာစကား၏ နည်းပညာဆိုင်ရာ အကန့်အသတ်များကို ဖြေရှင်းပေးပြီး၊ အနာဂတ် ဉာဏ်ရည်တု (AI) နည်းပညာကဏ္ဍတွင် အဆင်သင့်အသုံးပြုနိုင်မည့် အခြေခံအုတ်မြစ်ကို တည်ဆောက်ပေးမည့် အဖွဲ့အစည်းဖြစ်ပါသည်။

၁.၂ အဖွဲ့အစည်း၏ အမှတ်တံဆိပ်လိုဂိုနှင့် အနက်အဓိပ္ပာယ်

DatarrX (ဒေတာ-အက်စ်) ၏ အမှတ်တံဆိပ်လိုဂို သည် အဖွဲ့အစည်း၏ အနှစ်သာရ၊ နည်းပညာဆိုင်ရာ ခံယူချက်နှင့် မြန်မာဘာသာစကားအပေါ် ထားရှိသော စေတနာတို့ကို အမြင်အာရုံဖြင့် လေးနက်စွာ ဖော်ပြထားခြင်း ဖြစ်ပါသည်။ ဤအမှတ်တံဆိပ်တွင် ပါဝင်သော ပုံသဏ္ဌာန်နှင့် အရောင်အသွေး တစ်ခုချင်းစီ၌ အောက်ပါအတိုင်း ထူးခြားသော အဓိပ္ပာယ်ဖွင့်ဆိုချက်များ ရှိပါသည် -

ပုံသဏ္ဌာန်ဆိုင်ရာ အဓိပ္ပာယ်ဖွင့်ဆိုချက် (Symbolism)
အမှတ်တံဆိပ်လိုဂို၏ ဗဟိုချက်တွင် ဖော်ပြထားသော “D” အက္ခရာသည် ကျွန်ုပ်တို့၏ အခြေခံအုတ်မြစ်ဖြစ်သော Data (ဒေတာ) ကို ကိုယ်စားပြုပါသည်။ ထိုအက္ခရာနှင့် ဆက်စပ်နေသော ပစ်ဇယ် (Pixel) ပုံသဏ္ဌာန် အကွက်ငယ်များသည် ဒစ်ဂျစ်တယ်နည်းပညာနှင့် ဉာဏ်ရည်တု (AI) ၏ သဘောသဘာဝကို ဖော်ဆောင်နေခြင်း ဖြစ်ပါသည်။ အမှတ်တံဆိပ်၏ အပြင်ဘက် ပုံသဏ္ဌာန်သည် ချိတ်ဆက်မှုပုံစံ (Node/Structure) တစ်ခုအဖြစ် တည်ရှိနေပြီး၊ ၎င်းသည် မြန်မာစာကို AI လောကအတွင်း ခိုင်မာစွာ အမြစ်တွယ်စေရန် တည်ဆောက်ထားသော “ဒစ်ဂျစ်တယ်အခြေခံအုတ်မြစ်” နှင့် DatarrX အမည်ပါ “X” (The Variable) ကို ပေါင်းစပ်ပုံဖော်ထားခြင်း ဖြစ်ပါသည်။
အရောင်အသွေးဆိုင်ရာ သတ်မှတ်ချက် (Color Palette)
ကျွန်ုပ်တို့၏ အမှတ်တံဆိပ်တွင် အဓိကအရောင် (၂) မျိုးနှင့် အထောက်အကူပြုအရောင်များကို စနစ်တကျ အသုံးပြုထားပါသည် -

  • အနီရင့်ရောင် (Dark Red - #60151c)
    ဤအရောင်သည် ခိုင်မာသော အမြစ်တွယ်မှု (Rooting)၊ လေးနက်သော သမိုင်းအစဉ်အလာနှင့် အဖွဲ့အစည်း၏ ရည်မှန်းချက်အပေါ် ထားရှိသော ပြင်းပြသည့် စိတ်အားထက်သန်မှု (Passion) ကို ကိုယ်စားပြုပါသည်။
  • လိမ္မော်နုရောင် (Light Orange - #f3e2c8)
    ဤအရောင်သည် တီထွင်ဆန်းသစ်မှု (Innovation)၊ လင်းလက်သော အနာဂတ်နှင့် အများပြည်သူ လက်လှမ်းမီနိုင်သော ပွင့်လင်းမြင်သာမှု (Clarity & Accessibility) ကို ဖော်ဆောင်ပါသည်။
  • အဖြူရောင်နှင့် အမည်းရောင် (White & Black)
    ဤအရောင်များကို အခြေခံအရောင်များအဖြစ် အသုံးပြုခြင်းဖြင့် အမှတ်တံဆိပ်၏ တိကျပြတ်သားမှုနှင့် မည်သည့်နေရာတွင်မဆို လိုက်လျောညီထွေရှိမှုကို ဖော်ပြပါသည်။


နိဂုံးချုပ်အားဖြင့် DatarrX ၏ အမှတ်တံဆိပ်သည် နည်းပညာနှင့် ယဉ်ကျေးမှု ဘာသာစကားတို့ကို ဟန်ချက်ညီညီ ပေါင်းစပ်ထားခြင်းဖြစ်ပြီး၊ ကျွန်ုပ်တို့၏ လုပ်ငန်းစဉ်များအားလုံးတွင် ဤအမှတ်တံဆိပ်ပါ စံနှုန်းများနှင့်အညီ ခိုင်မာစွာ ရပ်တည်သွားမည် ဖြစ်ပါသည်။

၁.၃ တည်ထောင်ခြင်းဆိုင်ရာ ကြေညာချက်

ကမ္ဘာလုံးဆိုင်ရာ နည်းပညာအပြောင်းအလဲတွင် ဉာဏ်ရည်တု (Artificial Intelligence) နည်းပညာသည် လူသားတို့၏ နေ့စဉ်ဘဝ၊ ပညာရေး၊ ကျန်းမာရေးနှင့် စီးပွားရေးကဏ္ဍများကို အရှိန်အဟုန်ဖြင့် ပြောင်းလဲမောင်းနှင်လျက်ရှိပါသည်။ သို့ရာတွင် ထိုနည်းပညာဖွံ့ဖြိုးမှု၏ အသီးအပွင့်များကို ခံစားရာ၌ ဘာသာစကားဆိုင်ရာ အကန့်အသတ်များသည် ကြီးမားသော အဟန့်အတားတစ်ခု ဖြစ်လာခဲ့သည်။ မြန်မာဘာသာစကားနှင့် မြန်မာနိုင်ငံအတွင်းရှိ တိုင်းရင်းသားဘာသာစကားများသည် ဒစ်ဂျစ်တယ်လောကတွင် ရင်းမြစ်နည်းပါးသော ဘာသာစကားများ (Low-Resource Languages) အဖြစ် တည်ရှိနေခြင်းကြောင့် ခေတ်မီနည်းပညာများကို မိခင်ဘာသာစကားဖြင့် အပြည့်အဝ အသုံးချနိုင်မှု အားနည်းနေသည်ကို ကျွန်ုပ်တို့ သတိပြုမိခဲ့ကြသည်။

ဤနည်းပညာကွာဟချက်ကို ဖြည့်ဆည်းရန်နှင့် မြန်မာ့လူမှုအဖွဲ့အစည်းအတွင်းရှိ လူတိုင်းအတွက် တန်းတူညီမျှသော ဒစ်ဂျစ်တယ်အခွင့်အလမ်းများ ဖန်တီးပေးရန် ရည်ရွယ်၍ DatarrX (ဒေတာ-အက်စ်) ကို ၂၀၂၅ ခုနှစ်၊ ဒီဇင်ဘာလ ၁၂ ရက်နေ့တွင် အကျိုးအမြတ်မယူသော ပွင့်လင်းရင်းမြစ်ဖောင်ဒေးရှင်း (Non-profit Open-source Foundation) တစ်ခုအဖြစ် စတင်တည်ထောင်ခဲ့ပါသည်။ ကျွန်ုပ်တို့၏ အခြေခံခံယူချက်မှာ “AI နည်းပညာသည် လူနည်းစု၏ လက်ဝါးကြီးအုပ်မှုမဟုတ်ဘဲ လူတိုင်းလက်လှမ်းမီနိုင်သော အများပြည်သူဆိုင်ရာ အကျိုးစီးပွား (Public Good) ဖြစ်ရမည်” ဟူသော အချက်ပင် ဖြစ်သည်။ ဘာသာစကားဆိုင်ရာ အရင်းအမြစ်များ ချို့တဲ့မှုကြောင့် မည်သည့်လူမျိုးစု၊ မည်သည့်ဒေသခံမျှ နည်းပညာခေတ်၏ နောက်ကွယ်တွင် ကျန်ရစ်ခဲ့ခြင်း မရှိစေရဟူသော သန္နိဋ္ဌာန်ဖြင့် ဤဖောင်ဒေးရှင်းကို အုတ်မြစ်ချခဲ့ခြင်း ဖြစ်ပါသည်။

DatarrX တည်ထောင်ခြင်းသည် ရိုးရှင်းသော အချက်အလက်စုဆောင်းမှုထက် ပိုမိုလေးနက်ပါသည်။ ၎င်းသည် မြန်မာစာနှင့် တိုင်းရင်းသားဘာသာစကားများကို AI လောကအတွင်း ခိုင်မာစွာ အမြစ်တွယ်စေရန်နှင့် နောင်လာနောက်သားများအတွက် ဒစ်ဂျစ်တယ်အမွေအနှစ်တစ်ရပ် ချန်ထားရစ်ရန် ကြိုးပမ်းသည့် သမိုင်းဝင်ခြေလှမ်းတစ်ခု ဖြစ်သည်။ ကျွန်ုပ်တို့သည် အရည်အသွေးမြင့်မားသော ဒေတာအစု (Datasets) များကို စနစ်တကျ ပြုစုပျိုးထောင်ခြင်းဖြင့် ပြည်တွင်းရှိ နည်းပညာရှင်များ၊ သုတေသီများနှင့် ကျောင်းသားလူငယ်များအတွက် လိုအပ်သော အခြေခံအရင်းအမြစ်များကို အခမဲ့ ပံ့ပိုးပေးသွားမည် ဖြစ်သည်။

နိဂုံးချုပ်အားဖြင့် DatarrX သည် နည်းပညာဆိုင်ရာ အတားအဆီးများကို ဖယ်ရှားပြီး ဘာသာစကားကြောင့် နောက်ကျကျန်ရစ်မှု မရှိစေဘဲ၊ မြန်မာနိုင်ငံ၏ ဒစ်ဂျစ်တယ်အနာဂတ်ကို ကမ္ဘာနှင့်ရင်ပေါင်တန်းနိုင်သည့် အဆင့်သို့ မြှင့်တင်ပေးမည့် ခိုင်မာသော အဖွဲ့အစည်းအဖြစ် ရပ်တည်သွားမည်ဖြစ်ကြောင်း ဤတည်ထောင်ခြင်းဆိုင်ရာ ကြေညာချက်ဖြင့် အသိပေးအပ်ပါသည်။

၁.၄ တည်ထောင်သူ၏ အမှာစကား

“ကျွန်တော်တို့ DatarrX ကို စတင်တည်ထောင်ရခြင်း ရည်ရွယ်ချက်ကတော့ ရှင်းပါတယ်။ ယနေ့ခေတ် ဉာဏ်ရည်တု (AI) နည်းပညာတွေကို မြန်မာနိုင်ငံသားတိုင်း မိမိတို့ရဲ့ မိခင်ဘာသာစကားနဲ့ တန်းတူညီမျှ အသုံးပြုနိုင်စေဖို့ ဖြစ်ပါတယ်။
လက်ရှိမှာ နည်းပညာတွေ ဘယ်လောက်ပဲ တိုးတက်နေပါစေ၊ မြန်မာစာနဲ့ တိုင်းရင်းသား ဘာသာစကားတွေအတွက် အရည်အသွေးမီ ဒေတာအရင်းအမြစ်တွေ မရှိသေးတဲ့အတွက် လူတိုင်း နည်းပညာကို ထိရောက်စွာ အသုံးမချနိုင်ကြသေးပါဘူး။ ဒီကွက်လပ်ကို ဖြည့်ဆည်းဖို့ ဒေတာတွေကို စနစ်တကျ ပြုစုပြီး အများပြည်သူအတွက် ပွင့်လင်းရင်းမြစ် (Open-source) အဖြစ် အခမဲ့ မျှဝေပေးသွားမှာ ဖြစ်ပါတယ်။
ဒါဟာ အချိန်နဲ့ လုပ်အား အများကြီး စိုက်ထုတ်ရမယ့် ရေရှည်လုပ်ငန်းစဉ်တစ်ခု ဖြစ်ပါတယ်။ ကျွန်တော်တို့ အနေနဲ့ သတ်မှတ်ထားတဲ့ စံနှုန်းတွေအတိုင်း တိကျခိုင်မာစွာ ဆောင်ရွက်သွားမှာဖြစ်ပြီး၊ ဒီလုပ်ငန်းစဉ် အောင်မြင်ဖို့အတွက် နည်းပညာရှင်များ၊ သုတေသီများနှင့် ဝါသနာရှင် လူငယ်များအားလုံး လက်တွေ့ကျကျ ဝိုင်းဝန်းပူးပေါင်း ပါဝင်ပေးကြဖို့ ဖိတ်ခေါ်အပ်ပါတယ်။”

ခန့်ဆင့်ဟိဏ်း (Khant Sint Heinn)
တည်ထောင်သူ၊ DatarrX (ဒေတာ-အက်စ်)

၁.၅ ပြဿနာရပ်ဆိုင်ရာ ဖော်ပြချက်

မျက်မှောက်ခေတ် ကမ္ဘာလုံးဆိုင်ရာ နည်းပညာရေစီးကြောင်းတွင် ဉာဏ်ရည်တု (Artificial Intelligence) သည် လူသားတို့၏ လူမှုစီးပွားဘဝ တစ်ရပ်လုံးကို အရှိန်အဟုန်ဖြင့် ပြောင်းလဲမောင်းနှင်နေသော်လည်း၊ ထိုပြောင်းလဲမှု၏ နောက်ကွယ်တွင် “ဒစ်ဂျစ်တယ်ကွာဟချက်” (Digital Divide) ဟူသော ကြီးမားသည့် စိန်ခေါ်မှုတစ်ရပ် အထင်အရှား ရှိနေပါသည်။ အထူးသဖြင့် မြန်မာဘာသာစကားနှင့် မြန်မာနိုင်ငံအတွင်းရှိ တိုင်းရင်းသားဘာသာစကားများသည် ဒစ်ဂျစ်တယ်ကမ္ဘာတွင် “ရင်းမြစ်နည်းပါးသော ဘာသာစကားများ” (Low-Resource Languages) အဖြစ် သတ်မှတ်ခံထားရပါသည်။ ဤအခြေအနေသည် နည်းပညာခေတ်သစ်တွင် ကျွန်ုပ်တို့၏ ဘာသာစကားနှင့် ယဉ်ကျေးမှုများအတွက် ကြီးမားသော ခြိမ်းခြောက်မှုတစ်ခု ဖြစ်လာနေပါသည်။

မြန်မာဘာသာစကားသည် အသုံးပြုသူ သန်းပေါင်းများစွာ ရှိသော်လည်း AI နည်းပညာကို လေ့ကျင့်သင်ကြားပေးရန် လိုအပ်သော စက်ဖတ်နိုင်သည့် အရည်အသွေးမြင့် ဒေတာများ (Machine-readable High-quality Data) မှာ အလွန်တရာ ရှားပါးလျက်ရှိပါသည်။ အတိတ်ကာလက ဘာသာစကားဆိုင်ရာ စံနှုန်းများ မညီညွတ်ခဲ့ခြင်း၊ ဒစ်ဂျစ်တယ်စနစ်ဖြင့် မှတ်တမ်းတင်ထားသော အချက်အလက်များ နည်းပါးခြင်းနှင့် ရှိပြီးသား အချက်အလက်များသည်လည်း ပွင့်လင်းရင်းမြစ် (Open-source) အဖြစ် မရှိခြင်းတို့ကြောင့် မြန်မာစာသည် AI လောကတွင် မျက်ကွယ်ပြုခံထားရသည့် အခြေအနေသို့ ရောက်ရှိနေပါသည်။ ဤရင်းမြစ်ရှားပါးမှုကြောင့် ကမ္ဘာကျော် AI Model များတွင် မြန်မာစာကို အသုံးပြုရာ၌ ဘာသာပြန်ဆိုမှု မှားယွင်းခြင်း၊ အဓိပ္ပာယ်ကောက်လွဲခြင်းနှင့် ယဉ်ကျေးမှုဆိုင်ရာ နားလည်မှု လွဲမှားခြင်းများစွာ ကြုံတွေ့နေရပါသည်။

အကယ်၍ ဤပြဿနာကို အချိန်မီ ဖြေရှင်းနိုင်ခြင်း မရှိပါက၊ အနာဂတ် AI ခေတ်တွင် မြန်မာနိုင်ငံသားများသည် မိခင်ဘာသာစကားဖြင့် ခေတ်မီနည်းပညာများကို အသုံးမပြုနိုင်ဘဲ ဘေးဖယ်ခံရမည့် (Digital Marginalization) အန္တရာယ်နှင့် ရင်ဆိုင်ရမည် ဖြစ်ပါသည်။ ဉာဏ်ရည်တု နည်းပညာများက မြန်မာစကားကို နားမလည်ခြင်း သို့မဟုတ် မှားယွင်းစွာ နားလည်ခြင်းသည် ပညာရေး၊ ကျန်းမာရေးနှင့် သတင်းအချက်အလက် စီးဆင်းမှုကဏ္ဍများတွင် ကြီးမားသော ဆုံးရှုံးမှုများကို ဖြစ်ပေါ်စေနိုင်ပါသည်။ ထို့အပြင် တိုင်းရင်းသားဘာသာစကားများမှာ ပိုမို၍ ရင်းမြစ်ရှားပါးနေသည့်အတွက် ဒစ်ဂျစ်တယ်ကမ္ဘာမှ ပျောက်ကွယ်သွားနိုင်သည့် အခြေအနေသို့ပင် ဦးတည်နေပါသည်။
ထို့ကြောင့် DatarrX (ဒေတာ-အက်စ်) အနေဖြင့် ဤပြဿနာရပ်များကို အခြေခံမှစ၍ ဖြေရှင်းရန် လိုအပ်သည်ဟု ရှုမြင်ပါသည်။ ကျွန်ုပ်တို့သည် ဘာသာစကားဆိုင်ရာ အတားအဆီးများကို ဖြိုဖျက်ပြီး၊ မြန်မာနှင့် တိုင်းရင်းသားဘာသာစကားများအတွက် ခိုင်မာသော ဒစ်ဂျစ်တယ်အခြေခံအုတ်မြစ် (Digital Foundation) ကို တည်ဆောက်ပေးရန် ရည်ရွယ်ပါသည်။ အရည်အသွေးမြင့် ဒေတာများကို စနစ်တကျ ပြုစုပျိုးထောင်ခြင်းဖြင့်သာလျှင် ကျွန်ုပ်တို့၏ ဘာသာစကားသည် AI ခေတ်တွင် အခြားသော ကမ္ဘာ့ဘာသာစကားများနှင့် ရင်ပေါင်တန်းနိုင်မည်ဖြစ်ပြီး၊ လူတိုင်း လက်လှမ်းမီနိုင်သော၊ ယုံကြည်စိတ်ချရသော နည်းပညာဂေဟစနစ်တစ်ခု ပေါ်ထွန်းလာမည် ဖြစ်ပါသည်။

၂။ မဟာဗျူဟာမြောက် ရည်မှန်းချက်များ

ဤကဏ္ဍသည် DatarrX (ဒေတာ-အက်စ်) ၏ ရှေ့လုပ်ငန်းစဉ်များကို လမ်းညွှန်ပေးမည့် မဟာဗျူဟာမြောက် မူဘောင်များကို ဖော်ပြခြင်းဖြစ်ပါသည်။ ကျွန်ုပ်တို့၏ လုပ်ဆောင်ချက်တိုင်းသည် ခိုင်မာသော ရည်မှန်းချက်များအပေါ် အခြေခံထားပြီး၊ မြန်မာ့နည်းပညာလောကအတွက် ရေရှည်တည်တံ့သော အကျိုးကျေးဇူးများ ရရှိစေရန် ဤမူဘောင်များအတိုင်း တိကျစွာ လျှောက်လှမ်းသွားမည် ဖြစ်ပါသည်။

၂.၁ မျှော်မှန်းချက်

ကျွန်ုပ်တို့၏ မျှော်မှန်းချက်မှာ မြန်မာဘာသာစကားနှင့် တိုင်းရင်းသားဘာသာစကားများကို ဒေတာအရင်းအမြစ် ရှားပါးသည့် အခြေအနေမှ လုံးဝရုန်းထွက်စေပြီး၊ ကမ္ဘာ့အဆင့်မီ ဉာဏ်ရည်တု (AI) နည်းပညာနယ်ပယ်တွင် ယုံကြည်စိတ်ချစွာ အသုံးပြုနိုင်သည့် ခိုင်မာသော ဒစ်ဂျစ်တယ်အခြေခံအုတ်မြစ်အဖြစ် အသွင်ကူးပြောင်းပေးရန် ဖြစ်ပါသည်။ ကျွန်ုပ်တို့သည် နည်းပညာနှင့် ဘာသာစကားကြားရှိ အတားအဆီးများကို ဖယ်ရှားကာ၊ မြန်မာနိုင်ငံသားတိုင်း မိမိတို့၏ မိခင်ဘာသာစကားဖြင့် ခေတ်မီနည်းပညာ၏ အသီးအပွင့်များကို တန်းတူညီမျှ ခံစားရရှိနိုင်မည့် အနာဂတ်ကို ရှေးရှုတည်ဆောက်နေခြင်း ဖြစ်ပါသည်။

ကျွန်ုပ်တို့ မျှော်မှန်းထားသည့် အနာဂတ်တွင် မြန်မာစာသည် AI လောက၌ ဘေးဖယ်ခံထားရသော ဘာသာစကားတစ်ခု မဟုတ်တော့ဘဲ၊ ကမ္ဘာ့အဆင့်မီ နည်းပညာဂေဟစနစ်အတွင်း အခြားသော ဘာသာစကားကြီးများနှင့် ရင်ပေါင်တန်းကာ တက်ကြွစွာ ပါဝင်နေမည် ဖြစ်ပါသည်။ ထိုအနာဂတ်တွင် မည်သည့်ဒေသခံ၊ မည်သည့်လူမျိုးစုမျှ နည်းပညာကွာဟချက်ကြောင့် နောက်ကျကျန်ရစ်ခဲ့ခြင်း မရှိစေဘဲ၊ လူတိုင်းသည် မိမိတို့၏ ဘာသာစကား၊ ယဉ်ကျေးမှုနှင့် ဝိသေသက္ခဏာများကို ဒစ်ဂျစ်တယ်ကမ္ဘာတွင် ဂုဏ်သိက္ခာရှိစွာ ထိန်းသိမ်းမြှင့်တင်နိုင်မည် ဖြစ်ပါသည်။

နိဂုံးချုပ်အားဖြင့် DatarrX ၏ မျှော်မှန်းချက်သည် ရိုးရှင်းသော ဒေတာစုဆောင်းမှုထက် ပိုမိုနက်ရှိုင်းပါသည်။ ၎င်းသည် မြန်မာနိုင်ငံ၏ ဒစ်ဂျစ်တယ်အချုပ်အခြာအာဏာကို ခိုင်မာစေရန်နှင့် နောင်လာနောက်သားများအတွက် အသိပညာနှင့် နည်းပညာဆိုင်ရာ အမွေအနှစ်တစ်ရပ်ကို ချန်ထားရစ်ရန် ရည်ရွယ်သည့် ရေရှည်တည်တံ့သော လူမှုနည်းပညာဆိုင်ရာ တော်လှန်ရေးတစ်ခုပင် ဖြစ်ပါသည်။

၂.၂ လုပ်ငန်းတာဝန်

ကျွန်ုပ်တို့၏ မျှော်မှန်းချက်များကို လက်တွေ့အကောင်အထည်ဖော်ရန်အတွက် DatarrX (ဒေတာ-အက်စ်) သည် အောက်ပါအဓိက လုပ်ငန်းတာဝန်များကို မဟာဗျူဟာမြောက် ချမှတ်ဆောင်ရွက်သွားမည် ဖြစ်ပါသည် -
ပထမဦးစွာ၊ မြန်မာဘာသာစကားနှင့် တိုင်းရင်းသားဘာသာစကားများအတွက် အရည်အသွေးမြင့်မားပြီး ယုံကြည်စိတ်ချရသော ပွင့်လင်းရင်းမြစ် ဒေတာအစု (Open-source Datasets) များကို စနစ်တကျ ပြုစုပျိုးထောင်ရန် ဖြစ်ပါသည်။ ကျွန်ုပ်တို့သည် အသံ (Audio)၊ စာသား (Text) နှင့် ပုံရိပ်ဖော်စနစ် (OCR) ဆိုင်ရာ အချက်အလက်များကို သိပ္ပံနည်းကျ စုဆောင်းစိစစ်ပြီး၊ AI နည်းပညာ တီထွင်ဖန်တီးသူများ၊ သုတေသီများနှင့် ကျောင်းသားလူငယ်များအတွက် အခြေခံအရင်းအမြစ်များကို အခမဲ့ ဖြည့်ဆည်းပေးသွားမည် ဖြစ်ပါသည်။

ဒုတိယအနေဖြင့်၊ မြန်မာနိုင်ငံ၏ AI နည်းပညာဂေဟစနစ် (AI Ecosystem) ကို အားကောင်းလာစေရန် ပံ့ပိုးကူညီသွားမည် ဖြစ်ပါသည်။ နည်းပညာဆိုင်ရာ အတားအဆီးများကို ဖယ်ရှားပေးခြင်းဖြင့် ပြည်တွင်းရှိ Developer များအနေဖြင့် ကမ္ဘာနှင့်ရင်ပေါင်တန်းနိုင်သော AI Application များနှင့် Language Models များကို မိခင်ဘာသာစကားဖြင့် ပိုမိုလွယ်ကူစွာ ဖန်တီးလာနိုင်စေရန် တွန်းအားပေးဆောင်ရွက်သွားမည် ဖြစ်ပါသည်။

နောက်ဆုံးအနေဖြင့်၊ ဘာသာစကားဆိုင်ရာ တန်းတူညီမျှမှုကို ဖော်ဆောင်ရန် ဖြစ်ပါသည်။ မြန်မာစာသာမက ရင်းမြစ်ရှားပါးနေသည့် တိုင်းရင်းသားဘာသာစကားများကိုပါ ဒစ်ဂျစ်တယ်ကမ္ဘာတွင် ရှင်သန်ခိုင်မာလာစေရန် ဦးစားပေးဆောင်ရွက်ခြင်းဖြင့်၊ နည်းပညာ၏ အကျိုးကျေးဇူးများကို လူမျိုးမရွေး၊ ဒေသမရွေး တန်းတူညီမျှ လက်လှမ်းမီခံစားနိုင်စေရန် ကျွန်ုပ်တို့၏ လုပ်ငန်းတာဝန်အဖြစ် သတ်မှတ်ထားပါသည်။

၂.၃ အခြေခံတန်ဖိုးများ

DatarrX (ဒေတာ-အက်စ်) ၏ လုပ်ငန်းစဉ်တိုင်းနှင့် ဆုံးဖြတ်ချက်တိုင်းကို အောက်ပါ အခြေခံတန်ဖိုးများအပေါ်တွင် ခိုင်မာစွာ အုတ်မြစ်ချထားပါသည် -

  • ပွင့်လင်းမြင်သာမှု (Openness & Transparency)
    ကျွန်ုပ်တို့ ပြုစုဖန်တီးသမျှသော ဒေတာများနှင့် လုပ်ငန်းစဉ်များကို အများပြည်သူ လွတ်လပ်စွာ အသုံးပြုနိုင်ရန်နှင့် စစ်ဆေးနိုင်ရန် ပွင့်လင်းရင်းမြစ် (Open-source) အဖြစ် အမြဲတစေ ချပြသွားမည် ဖြစ်ပါသည်။ အသိပညာကို လူနည်းစုက ထိန်းချုပ်ထားခြင်းထက် အများပြည်သူသို့ မျှဝေခြင်းကသာ တိုးတက်မှုကို ဖြစ်စေသည်ဟု ကျွန်ုပ်တို့ ယုံကြည်ပါသည်။
  • တိကျမှန်ကန်မှု (Accuracy & Scientific Rigor)
    ဒေတာတစ်ခုချင်းစီ၏ အရည်အသွေးအပေါ် မည်သည့်လျော့ပေါ့မှုမျှ ပြုလုပ်မည်မဟုတ်ပါ။ ဘာသာစကားပညာရှင်များနှင့် နည်းပညာရှင်များ ပူးပေါင်း၍ သိပ္ပံနည်းကျ စနစ်တကျ စိစစ်အတည်ပြုခြင်းဖြင့် အမှားအယွင်းကင်းပြီး ယုံကြည်စိတ်ချရသော အချက်အလက်များကိုသာ ထုတ်ပြန်သွားမည် ဖြစ်ပါသည်။
  • စုပေါင်းစွမ်းအားဖြင့် ပူးပေါင်းဆောင်ရွက်မှု (Collaboration)
    မြန်မာစာ AI လောက တိုးတက်ရေးသည် လူတစ်ဦးတစ်ယောက် သို့မဟုတ် အဖွဲ့အစည်းတစ်ခုတည်း၏ အားထုတ်မှုဖြင့် မလုံလောက်ဘဲ၊ လူထုတစ်ရပ်လုံး၏ စုပေါင်းစွမ်းအားဖြင့်သာ အောင်မြင်နိုင်မည် ဖြစ်ပါသည်။ ထို့ကြောင့် ကျွန်ုပ်တို့သည် ကဏ္ဍပေါင်းစုံမှ ပညာရှင်များ၊ စေတနာ့ဝန်ထမ်းများနှင့် ပူးပေါင်းဆောင်ရွက်မှုကို အလေးထားပါသည်။
  • အားလုံးပါဝင်နိုင်မှု (Inclusivity)
    ကျွန်ုပ်တို့၏ လုပ်ဆောင်ချက်များသည် မည်သည့်ခွဲခြားမှုမျှမရှိဘဲ တိုင်းရင်းသားဘာသာစကားအားလုံးနှင့် လူမှုအစုအဖွဲ့အားလုံးကို ကိုယ်စားပြုရမည် ဖြစ်ပါသည်။ နည်းပညာသည် လူတိုင်းအတွက် ဖြစ်စေရမည်ဟူသော မူဝါဒကို ကျွန်ုပ်တို့ အမြဲကိုင်စွဲထားပါသည်။

၂.၄ ရေရှည်ရည်မှန်းချက် (၅ နှစ်ကာလအတွင်း)

  • မြန်မာနှင့် တိုင်းရင်းသား ဘာသာစကား Text Dataset အခု ၅၀ ထက်မနည်း ဖန်တီးရန်
    လာမည့် ၅ နှစ်အတွင်း မြန်မာဘာသာစကားနှင့် ရင်းမြစ်ရှားပါးသော တိုင်းရင်းသားဘာသာစကားများအတွက် စာသားအခြေခံ (Text-based) ဒေတာအစုအဝေး သီးသန့် အနည်းဆုံး ၅၀ ကျော်ကို စနစ်တကျ ပြုစုထုတ်ဝေသွားမည် ဖြစ်သည်။
  • မတူညီသော လုပ်ငန်းသုံး Text Dataset အမျိုးအစားစုံလင်စွာ ဖန်တီးရန်
    ထုတ်ဝေမည့် Dataset ၅၀ ကို AI နည်းပညာနယ်ပယ်တွင် မတူညီသော စာသားဆိုင်ရာ လုပ်ငန်းများ၌ ခွဲခြားအသုံးပြုနိုင်ရန် စာသားအကျဉ်းချုပ် (Summarization)၊ အမေးအဖြေ (Q&A)၊ ဘာသာပြန် (Translation) စသည့် ကွဲပြားသော Text အမျိုးအစားများ ဖြစ်အောင် ဖန်တီးသွားမည် ဖြစ်သည်။
  • ဘာသာစကားအလိုက် Dataset များကို ခွဲခြားတည်ဆောက်ရန်
    စုစုပေါင်း Dataset ၅၀ အတွင်း မြန်မာဘာသာစကား သီးသန့်အပြင် ရင်းမြစ်ရှားပါးသော တိုင်းရင်းသား ဘာသာစကားတစ်ခုချင်းစီအတွက်ပါ အသုံးပြုနိုင်မည့် သီးခြားစာသားဒေတာအစုအဝေး (Targeted Text Datasets) များ ဖြစ်အောင် အချိုးကျ ခွဲခြားပြုစုသွားမည် ဖြစ်သည်။

၃။ စီမံခန့်ခွဲမှုနှင့် ဖွဲ့စည်းပုံ

DatarrX (ဒေတာ-အက်စ်) သည် ဗဟိုချက်တစ်ခုမှ ထိန်းကျောင်းသော စနစ်ထက် လူထုအခြေပြု ပူးပေါင်းဆောင်ရွက်မှုကို အားပေးသည့် ပွင့်လင်းမြင်သာသော စီမံခန့်ခွဲမှုစနစ်ကို ကျင့်သုံးပါသည်။ ကျွန်ုပ်တို့၏ အဖွဲ့အစည်းကို အောက်ပါအတိုင်း အဆင့်ဆင့် ခိုင်မာစွာ ဖွဲ့စည်းထားပါသည် -

၃.၁ တည်ထောင်သူနှင့် ဦးဆောင်မှုကဏ္ဍ

တည်ထောင်သူ (Founder) သည် အဖွဲ့အစည်း၏ မူဝါဒရေးရာ လမ်းညွှန်သူနှင့် အထွေထွေညှိနှိုင်းရေးမှူးအဖြစ် တာဝန်ယူပါသည်။ တည်ထောင်သူ၏ အဓိကတာဝန်မှာ အဖွဲ့အစည်း၏ မျှော်မှန်းချက် (Vision) နှင့် လမ်းလွဲမသွားစေရန် ထိန်းကျောင်းခြင်း၊ ပင်မစီမံခန့်ခွဲမှုအဖွဲ့ အတွင်း လုပ်ငန်းကဏ္ဍများ ခွဲဝေရာတွင် လမ်းညွှန်ခြင်းနှင့် နောက်ဆုံးအဆင့် ဒေတာထုတ်ပြန်မှု (Final Release) များအတွက် အတည်ပြုချက်ပေးခြင်းတို့ ဖြစ်ပါသည်။ တည်ထောင်သူသည် အဖွဲ့ဝင်များအကြား အတွေ့အကြုံဖလှယ်နိုင်မည့် ပတ်ဝန်းကျင်တစ်ခုဖြစ်အောင် ဖန်တီးပေးရမည့် တာဝန်ရှိပါသည်။

၃.၂ ပင်မစီမံခန့်ခွဲမှုအဖွဲ့

ဤအဖွဲ့သည် အဖွဲ့အစည်း၏ ရေရှည်လုပ်ငန်းစဉ်များကို တာဝန်ယူမည့် အမြဲတမ်းအဖွဲ့ဝင်များဖြင့် ဖွဲ့စည်းထားပါသည်။ ၎င်းတို့သည် ဒေတာများကို ကိုယ်တိုင်ဖန်တီးသူများထက် “စီမံကိန်းများကို အကောင်အထည်ဖော်သူများနှင့် ဒေတာများကို စနစ်တကျ ထိန်းသိမ်းသူများ (Facilitators & Curators)” အဖြစ် တာဝန်ယူပါသည်။ လုပ်ငန်းများ ပိုမိုထိရောက်စေရန်အတွက် ပင်မစီမံခန့်ခွဲမှုအဖွဲ့အတွင်း အောက်ပါအတိုင်း လုပ်ငန်းအဖွဲ့ (၃) ခု ခွဲခြားထားပါသည် -

  • စီမံကိန်းနှင့် လူထုဆက်ဆံရေးအဖွဲ့ (Project & Community Group)
    လူထုအခြေပြု စီမံကိန်းများကို စတင်ဖန်တီးခြင်း၊ စေတနာ့ဝန်ထမ်းများနှင့် ဆက်သွယ်ညှိနှိုင်းခြင်းနှင့် အဖွဲ့အစည်း၏ ပုံရိပ်ကို မြှင့်တင်ခြင်းတို့ကို တာဝန်ယူပါသည်။
  • ဒေတာအရည်အသွေးနှင့် ဘာသာစကားစစ်ဆေးရေးအဖွဲ့ (Data Quality & Linguistics Group)
    လူထုထံမှ ရရှိလာသော ဒေတာများကို သတ်မှတ်စံနှုန်းနှင့်အညီ စစ်ဆေးအတည်ပြုခြင်း (Quality Assurance) ကို တာဝန်ယူပါသည်။ ဤအဖွဲ့အတွင်းရှိ အဖွဲ့ဝင်များသည် မိမိတို့ အားလပ်သည့်အချိန်အလိုက် ဒေတာများကို အလှည့်ကျ စိစစ်တည်းဖြတ်သွားမည် ဖြစ်ပါသည်။
  • နည်းပညာနှင့် အခြေခံအဆောက်အအုံအဖွဲ့ (Technical & Infrastructure Group)
    ဒေတာများ သိမ်းဆည်းမည့် Platform များနှင့် နည်းပညာပိုင်းဆိုင်ရာ အခြေခံအဆောက်အအုံများကို ထိန်းသိမ်းခြင်း၊ ဒေတာများကို စက်ဖတ်နိုင်သော Format များအဖြစ် ပြောင်းလဲခြင်းတို့ကို တာဝန်ယူပါသည်။

၃.၃ လူထုအခြေပြု ပံ့ပိုးကူညီသူများ (Community Volunteers)

DatarrX ၏ အင်အားအကောင်းဆုံး အစိတ်အပိုင်းမှာ စေတနာ့ဝန်ထမ်း လူထုပင် ဖြစ်ပါသည်။ ကျွန်ုပ်တို့ ချမှတ်လိုက်သော စီမံကိန်းတစ်ခုချင်းစီ (Project-based) အလိုက် ဘာသာစကား ဝါသနာရှင်များ၊ နည်းပညာရှင်များနှင့် စိတ်အားထက်သန်သူ မည်သူမဆို အကန့်အသတ်မရှိ ပါဝင်နိုင်ပါသည်။ ၎င်းတို့သည် ပင်မစီမံခန့်ခွဲမှုအဖွဲ့နှင့် အတူတကွ ပူးပေါင်း၍ ဘာသာပြန်ဆိုခြင်း၊ ဒေတာများ ဖြည့်သွင်းခြင်းနှင့် စစ်ဆေးခြင်းလုပ်ငန်းများကို လုပ်ဆောင်ကြမည် ဖြစ်ပါသည်။ ၎င်းတို့၏ စုပေါင်းစွမ်းအားဖြင့် ထွက်ပေါ်လာသော ဒေတာမှတ်တမ်းများတွင် ပါဝင်သူအားလုံး၏ ကြိုးပမ်းမှုကို ထိုက်တန်စွာ အသိအမှတ်ပြု မှတ်တမ်းတင်သွားမည် ဖြစ်ပါသည်။

၃.၄ ပြင်ပမှ တစ်ကိုယ်တော်နှင့် အစုအဖွဲ့ ပံ့ပိုးသူများ (Independent & Group Contributors)

အဖွဲ့အစည်း၏ ပြင်ပမှ တစ်ကိုယ်တော်ဖြစ်စေ၊ အစုအဖွဲ့ဖြင့်ဖြစ်စေ မိမိတို့ကိုယ်တိုင် သီးခြားဖန်တီးထားသော ဒေတာအစု (Datasets) များကို DatarrX ၏ အမည်အောက်တွင် တရားဝင် လာရောက်ထုတ်ဝေ (Release) လိုသူများကိုလည်း ကျွန်ုပ်တို့က အထူးကြိုဆိုလျက်ရှိပါသည်။ ထိုသို့ ထုတ်ဝေရာတွင် ဖန်တီးသူ၏ ကိုယ်ပိုင်အမှတ်လက္ခဏာ (Personal Branding) ကို အပြည့်အဝ ဖော်ပြခွင့်ပြုထားပြီး၊ ပေးပို့လာသော ဒေတာများသည် DatarrX ၏ အရည်အသွေးစံနှုန်းများနှင့် လိုင်စင်မူဝါဒများကို လိုက်နာရမည် ဖြစ်ပါသည်။

၃.၅ လုပ်ငန်းလည်ပတ်မှုပုံစံ (Operational Workflow)

DatarrX ၏ လုပ်ငန်းစဉ်သည် အောက်ပါအတိုင်း စက်ဝန်းတစ်ခုအဖြစ် လည်ပတ်ပါသည် -
၁။ စီမံကိန်းစတင်ခြင်း (Initiation)
ပင်မစီမံခန့်ခွဲမှုအဖွဲ့မှ ဒေတာစုဆောင်းမှု စီမံကိန်းတစ်ခုကို စတင် host လုပ်ပါသည်။
၂။ လူထုပူးပေါင်းဆောင်ရွက်ခြင်း (Contribution)
လူထုအခြေပြု စေတနာ့ဝန်ထမ်းများက ဒေတာများကို ဝိုင်းဝန်းဖြည့်ဆည်းပေးပါသည်။
၃။ စစ်ဆေးအတည်ပြုခြင်း (Verification)
ဒေတာအရည်အသွေးစစ်ဆေးရေးအဖွဲ့မှ အချက်အလက်များကို စနစ်တကျ စိစစ်ပါသည်။
၄။ တရားဝင်ထုတ်ပြန်ခြင်း (Release)
နည်းပညာအဖွဲ့မှ ဒေတာများကို DatarrX ၏ Platform များပေါ်တွင် တရားဝင် ထုတ်ပြန်ဖြန့်ဝေပါသည်။

၄။ နည်းပညာနှင့် ဒေတာပြုစုမှု လုပ်ငန်းစဉ်

ကျွန်ုပ်တို့အဖွဲ့အစည်းသည် AI နည်းပညာတွင် အသုံးပြုမည့် ဒေတာများကို အရည်အသွေးမီပြီး စံနှုန်းကိုက်ညီစေရန်အတွက် အောက်ပါ လုပ်ငန်းစဉ် အဆင့် (၄) ဆင့်အတိုင်း နည်းပညာပိုင်းဆိုင်ရာ စနစ်တကျ ပြုစုပျိုးထောင်သွားမည် ဖြစ်ပါသည် -

၄.၁ ဒေတာစုဆောင်းခြင်း (Data Collection)

  • စာသားဒေတာ (Text Data)
    မြန်မာစာနှင့် တိုင်းရင်းသား ဘာသာစကားဆိုင်ရာ ဝါကျများ၊ ဆောင်းပါးများနှင့် ဘာသာပြန် စာကြောင်းများကို ပွင့်လင်းရင်းမြစ် (Open-source) နေရာများမှလည်းကောင်း၊ စေတနာ့ဝန်ထမ်းများ၏ ဖြည့်သွင်းမှုမှလည်းကောင်း စနစ်တကျ စုဆောင်းပါသည်။
  • အသံဒေတာ (Audio Data)
    AI မှ စကားပြောစနစ်များကို လေ့ကျင့်နိုင်ရန်အတွက် အသံထွက်ဖတ်ထားသော အသံဖိုင်များနှင့် ၎င်းနှင့်သက်ဆိုင်သည့် စာသားမှတ်တမ်း (Transcription) များကို စုဆောင်းပါသည်။

၄.၂ ဒေတာသန့်စင်ခြင်းနှင့် ပုံစံချခြင်း (Data Cleaning & Formatting)

  • စုဆောင်းရရှိလာသော အချက်အလက်များထဲမှ အမှားအယွင်းများ၊ မလိုအပ်သော သင်္ကေတများနှင့် စာလုံးပေါင်းအမှားများကို နည်းပညာသုံး၍ ဖယ်ရှားသန့်စင်ပါသည်။
  • ထို့နောက် AI Model များတွင် တိုက်ရိုက်ထည့်သွင်း လေ့ကျင့်နိုင်ရန်အတွက် စက်ဖတ်နိုင်သော စံနှုန်းမီ နည်းပညာပုံစံများ (ဥပမာ - JSON, CSV, Parquet Format များ) သို့ ပြောင်းလဲပြင်ဆင်ပါသည်။

၄.၃ အရည်အသွေး စစ်ဆေးခြင်း (Quality Assurance & Annotation)

  • ဒေတာများ မှန်ကန်မှုရှိစေရန်အတွက် ဘာသာစကားဆိုင်ရာ ကျွမ်းကျင်သူများနှင့် နည်းပညာအဖွဲ့ဝင်များက နှစ်ဆင့် ဖြတ်သန်း စစ်ဆေးပါသည်။
  • ဘာသာပြန်ဆိုမှုများ မှန်ကန်ခြင်း ရှိ/မရှိနှင့် အသံဖိုင်များနှင့် စာသားများ ကိုက်ညီခြင်း ရှိ/မရှိကို တိကျစွာ စိစစ်အတည်ပြုပါသည်။

၄.၄ ဒေတာအုပ်စုဖွဲ့ခြင်းနှင့် သိမ်းဆည်းခြင်း (Dataset Management & Storage)

  • စစ်ဆေးပြီးသား ဒေတာများကို လုပ်ငန်းအမျိုးအစားအလိုက် (ဥပမာ - Text Dataset, Speech Dataset စသဖြင့်) စနစ်တကျ သီးခြားစီ ခွဲခြားသတ်မှတ်ပါသည်။
  • ၎င်းဒေတာများကို ပျောက်ပျက်သွားခြင်း မရှိစေရန်နှင့် အသုံးပြုသူများ အလွယ်တကူ ရယူနိုင်ရန်အတွက် စိတ်ချရသော Cloud Server များနှင့် GitHub, Hugging Face ကဲ့သို့သော နည်းပညာ Platform များပေါ်တွင် စနစ်တကျ သိမ်းဆည်း ထုတ်ဝေပါသည်။

၅။ မူပိုင်ခွင့်နှင့် လိုင်စင်ဆိုင်ရာ မူဝါဒများ

DatarrX (ဒေတာ-အက်စ်) သည် အသိပညာနှင့် နည်းပညာအရင်းအမြစ်များကို လူနည်းစုက ထိန်းချုပ်ထားခြင်းထက် အများပြည်သူသို့ ပွင့်လင်းမြင်သာစွာ မျှဝေခြင်းကသာ တိုးတက်မှုကို ဖြစ်စေသည်ဟု ယုံကြည်ပါသည်။ ထို့ကြောင့် ကျွန်ုပ်တို့၏ ဒေတာများနှင့် နည်းပညာများကို ဥပဒေကြောင်းအရ အကာအကွယ်ပေးရန်နှင့် လွတ်လပ်စွာ အသုံးပြုနိုင်ခွင့်ရရှိစေရန် အောက်ပါလိုင်စင်မူဝါဒများကို ပြဋ္ဌာန်းထားပါသည်။

၅.၁ ပွင့်လင်းရင်းမြစ် ကတိကဝတ် (Open-source Commitment)

ကျွန်ုပ်တို့သည် မြန်မာဘာသာစကားနှင့် တိုင်းရင်းသားဘာသာစကားဆိုင်ရာ ဒေတာများကို အခမဲ့နှင့် ပွင့်လင်းရင်းမြစ် (Open-source) အဖြစ် ထားရှိရန် ခိုင်မာစွာ ကတိပြုပါသည်။ ဤသို့ ဆောင်ရွက်ရခြင်းမှာ နည်းပညာဆိုင်ရာ အတားအဆီးများကို ဖယ်ရှားရန်၊ ဒစ်ဂျစ်တယ်ကွာဟချက်ကို ကျဉ်းမြောင်းစေရန်နှင့် မြန်မာ့နည်းပညာဂေဟစနစ်အတွင်းရှိ သုတေသီများ၊ တီထွင်သူများနှင့် ကျောင်းသားလူငယ်များအတွက် အရင်းအမြစ်အခက်အခဲ မရှိစေရန် ဖြစ်ပါသည်။ ကျွန်ုပ်တို့ ဖန်တီးသမျှသော အချက်အလက်များသည် အများပြည်သူဆိုင်ရာ အကျိုးစီးပွား (Public Good) ဖြစ်ပြီး၊ နောင်လာနောက်သားများအတွက် ဒစ်ဂျစ်တယ်အမွေအနှစ်တစ်ရပ်အဖြစ် ရေရှည်တည်တံ့စေရန် ရည်ရွယ်ပါသည်။

၅.၂ အသုံးပြုမည့် လိုင်စင်အမျိုးအစားများ

DatarrX မှ ထုတ်ဝေသော အရင်းအမြစ်များကို ၎င်းတို့၏ အမျိုးအစားအလိုက် ကမ္ဘာလုံးဆိုင်ရာ စံနှုန်းမီ လိုင်စင်များဖြင့် အောက်ပါအတိုင်း သတ်မှတ်ထားပါသည် -

  • ဒေတာအစုများအတွက် (For Datasets)
    ကျွန်ုပ်တို့၏ ဒေတာအစုများကို Creative Commons Attribution 4.0 International (CC BY 4.0) လိုင်စင်အောက်တွင် ထုတ်ဝေပါသည်။ ဤလိုင်စင်သည် အသုံးပြုသူများအား ဒေတာများကို လွတ်လပ်စွာ ကူးယူခြင်း၊ ပြန်လည်ဖြန့်ဝေခြင်း၊ ပြုပြင်မွမ်းမံခြင်းနှင့် စီးပွားရေးလုပ်ငန်းများတွင် အသုံးပြုခြင်းတို့ကို ခွင့်ပြုထားပါသည်။ သို့ရာတွင် အသုံးပြုသူများသည် မူရင်းရင်းမြစ်ဖြစ်သော DatarrX နှင့် ပါဝင်ကူညီသူများကို သတ်မှတ်ချက်အတိုင်း ထိုက်တန်စွာ ရည်ညွှန်းကိုးကားရန် (Attribution) တာဝန်ရှိပါသည်။ ဤစနစ်သည် ဒေတာများကို အများပြည်သူ လွတ်လပ်စွာ သုံးစွဲနိုင်စေသကဲ့သို့၊ ဖန်တီးသူများ၏ ကြိုးပမ်းမှုကိုလည်း အသိအမှတ်ပြုရာ ရောက်ပါသည်။
  • နည်းပညာကုဒ်များအတွက် (For Source Code)
    ဒေတာစုဆောင်းခြင်း၊ စီမံခန့်ခွဲခြင်းနှင့် သက်ဆိုင်သော ကျွန်ုပ်တို့၏ နည်းပညာဆိုင်ရာ ရင်းမြစ်ကုဒ်များကို Apache License 2.0 အောက်တွင် ထားရှိပါသည်။ ဤလိုင်စင်သည် အသုံးပြုသူများအား ဆော့ဖ်ဝဲကို လွတ်လပ်စွာ အသုံးပြုခွင့်၊ ပြင်ဆင်ခွင့်နှင့် ပြန်လည်ဖြန့်ဝေခွင့်တို့ကို ပေးအပ်ထားသည့်အပြင်၊ မူပိုင်ခွင့်ဆိုင်ရာ အကာအကွယ်များနှင့် အာမခံချက်များကိုပါ စနစ်တကျ ထည့်သွင်းပြဋ္ဌာန်းထားသဖြင့် အသုံးပြုသူများနှင့် တီထွင်သူများအတွက် ဘေးကင်းစိတ်ချရသော ပတ်ဝန်းကျင်တစ်ခုကို ဖန်တီးပေးပါသည်။

၅.၃ အသုံးပြုသူများအတွက် စည်းကမ်းချက်များ

DatarrX (ဒေတာ-အက်စ်) မှ ထုတ်ဝေသော ဒေတာအရင်းအမြစ်များသည် အများပြည်သူပိုင် အသိပညာများ ဖြစ်သော်လည်း၊ ၎င်းတို့ကို အသုံးပြုရာတွင် နည်းပညာဆိုင်ရာ ကျင့်ဝတ်များနှင့် အဖွဲ့အစည်း၏ မူဝါဒများကို လေးစားလိုက်နာရန် လိုအပ်ပါသည်။ အသုံးပြုသူများအနေဖြင့် ကျွန်ုပ်တို့၏ ဒေတာများကို ရယူအသုံးပြုခြင်းဖြင့် အောက်ပါ စည်းကမ်းချက်များနှင့် ကျင့်ဝတ်များကို သဘောတူညီပြီး ဖြစ်သည်ဟု မှတ်ယူပါသည် -
၁။ ရည်ညွှန်းကိုးကားမှုဆိုင်ရာ တာဝန်ရှိမှု
အသုံးပြုသူများသည် DatarrX မှ ရရှိသော ဒေတာများကို အသုံးပြု၍ သုတေသနစာတမ်းများ ရေးသားခြင်း၊ ဆော့ဖ်ဝဲနှင့် AI Model များ တည်ဆောက်ခြင်း သို့မဟုတ် အခြားသော ထုတ်ကုန်များ ဖန်တီးခြင်းတို့ ဆောင်ရွက်ရာတွင် မူရင်းရင်းမြစ်ဖြစ်သော DatarrX နှင့် သက်ဆိုင်ရာ ပူးပေါင်းပါဝင်သူများ (Contributors) ၏ အမည်ကို လိုင်စင်သတ်မှတ်ချက်နှင့်အညီ မပျက်မကွက် ထည့်သွင်းဖော်ပြရမည် ဖြစ်ပါသည်။ ဤသည်မှာ ဒေတာများ၏ ခိုင်မာမှုကို သက်သေပြရန်နှင့် ပူးပေါင်းပါဝင်သူများ၏ ကြိုးပမ်းအားထုတ်မှုကို အသိအမှတ်ပြုရန်အတွက် အခြေခံကျသော ကျင့်ဝတ်ဆိုင်ရာ တာဝန်ယူမှု ဖြစ်ပါသည်။
၂။ လူသားမျိုးနွယ်အပေါ် အကျိုးပြုသော အသုံးပြုမှု
ကျွန်ုပ်တို့၏ ဒေတာများကို လူသားမျိုးနွယ်အား အကျိုးပြုသော၊ အပြုသဘောဆောင်သော လုပ်ငန်းစဉ်များတွင်သာ အသုံးပြုရမည် ဖြစ်ပါသည်။ အထူးသဖြင့် အောက်ပါ လုပ်ဆောင်ချက်များတွင် အသုံးမပြုရန် ပြင်းထန်စွာ တားမြစ်ထားပါသည် -

  • လူမျိုးရေး၊ ဘာသာရေးနှင့် ကျား/မ ကွဲပြားမှုအပေါ် အခြေခံသော အမုန်းစကားများ (Hate Speech) ဖန်တီးခြင်း။
  • မည်သည့် လူမှုအစုအဖွဲ့ကိုမဆို ခွဲခြားဆက်ဆံခြင်း သို့မဟုတ် ပုတ်ခတ်စော်ကားခြင်းဆိုင်ရာ AI စနစ်များ တည်ဆောက်ခြင်း။
  • တရားမဝင်သော လုပ်ငန်းများ၊ လိမ်လည်လှည့်ဖြားမှုများနှင့် လူပုဂ္ဂိုလ်တစ်ဦးတစ်ယောက်၏ လုံခြုံရေးကို ထိခိုက်စေနိုင်သော ကိစ္စရပ်များတွင် အသုံးပြုခြင်း။

၃။ အဖွဲ့အစည်း၏ ပုံရိပ်နှင့် မှန်ကန်စွာ ဖော်ပြမှု
အသုံးပြုသူများသည် DatarrX ၏ ဒေတာများကို အသုံးပြုထားခြင်းကြောင့် မိမိတို့၏ ထုတ်ကုန် သို့မဟုတ် လုပ်ဆောင်ချက်များကို DatarrX မှ တရားဝင် ထောက်ခံချက်ပေးထားသည် ဟူသော သဘောမျိုး သက်ရောက်စေရန် မှားယွင်းစွာ ဖော်ပြခြင်း မပြုရပါ။ ဒေတာများကို ရည်ရွယ်ချက်ရှိရှိ မှားယွင်းစွာ ပြုပြင်ပြောင်းလဲ၍ အဖွဲ့အစည်း၏ ဂုဏ်သိက္ခာကို ညှိုးနွမ်းစေခြင်း သို့မဟုတ် အများပြည်သူကို ထင်ယောင်ထင်မှား ဖြစ်စေခြင်းမျိုးကိုလည်း ရှောင်ကြဉ်ရမည် ဖြစ်ပါသည်။
၄။ တာဝန်ယူမှု ကန့်သတ်ချက်
DatarrX မှ ပံ့ပိုးပေးသော ဒေတာများကို “လက်ရှိအခြေအနေအတိုင်း” (As-is Basis) ပံ့ပိုးပေးခြင်း ဖြစ်ပါသည်။ ကျွန်ုပ်တို့သည် ဒေတာများ၏ တိကျမှုနှင့် ပြည့်စုံမှုအတွက် အစွမ်းကုန် ကြိုးပမ်းဆောင်ရွက်သော်လည်း၊ ဤဒေတာများကို အသုံးပြုခြင်းကြောင့် ဖြစ်ပေါ်လာနိုင်သော တိုက်ရိုက်ဖြစ်စေ၊ သွယ်ဝိုက်၍ဖြစ်စေ မည်သည့် ဆုံးရှုံးမှု သို့မဟုတ် ထိခိုက်မှုများအတွက်မျှ DatarrX တွင် တာဝန်ရှိမည် မဟုတ်ပါ။ အသုံးပြုသူများသည် မိမိတို့၏ ကိုယ်ပိုင်ဆုံးဖြတ်ချက်နှင့် တာဝန်ယူမှုဖြင့်သာ အသုံးပြုရမည် ဖြစ်ပါသည်။
၅။ ပွင့်လင်းမြင်သာမှုနှင့် ပြန်လည်မျှဝေမှု
အသုံးပြုသူများအနေဖြင့် DatarrX ၏ ဒေတာများကို အသုံးပြု၍ ပိုမိုကောင်းမွန်သော ရလဒ်များ သို့မဟုတ် ပြုပြင်မွမ်းမံထားသော ဒေတာအသစ်များ ရရှိလာပါက၊ ထိုအသိပညာများကို အများပြည်သူထံသို့ ပွင့်လင်းရင်းမြစ် (Open-source) အဖြစ် ပြန်လည်မျှဝေပေးရန် တိုက်တွန်းအပ်ပါသည်။ ဤသည်မှာ မြန်မာ့နည်းပညာလောကအတွင်း ကျန်းမာသန်စွမ်းသော ပူးပေါင်းဆောင်ရွက်မှု ယဉ်ကျေးမှုတစ်ရပ်ကို တည်ဆောက်ခြင်း ဖြစ်ပါသည်။
ဤစည်းကမ်းချက်များနှင့် ကျင့်ဝတ်များကို လိုက်နာခြင်းဖြင့် သင်သည် မြန်မာဘာသာစကားဆိုင်ရာ AI နည်းပညာကို ဘေးကင်းစိတ်ချရပြီး တာဝန်ယူမှုရှိသော လမ်းကြောင်းပေါ်တွင် ဖွံ့ဖြိုးတိုးတက်လာစေရန် ကူညီပေးရာ ရောက်ပါသည်။

၆။ ဖြန့်ဝေမှုနှင့် လက်လှမ်းမီမှု မဟာဗျူဟာ

DatarrX (ဒေတာ-အက်စ်) ၏ အဓိက ရည်မှန်းချက်တစ်ခုမှာ ပြုစုပျိုးထောင်ထားသော ဒေတာအရင်းအမြစ်များကို ပြည်တွင်းရှိ နည်းပညာရှင်များသာမက ကမ္ဘာတစ်ဝန်းရှိ AI သုတေသီများပါ လွယ်ကူလျင်မြန်စွာ လက်လှမ်းမီ ရယူနိုင်စေရန် ဖြစ်ပါသည်။ ကျွန်ုပ်တို့သည် ဒေတာများကို စနစ်တကျ ထုတ်ပြန်ဖြန့်ဝေရာတွင် ခိုင်မာသော နည်းပညာပလက်ဖောင်း (Platforms) များကို အသုံးပြု၍ အောက်ပါ မဟာဗျူဟာများအတိုင်း ဆောင်ရွက်သွားမည် ဖြစ်ပါသည်။

၆.၁ စနစ်တကျ ထုတ်ပြန်ခြင်းနှင့် တစ်ပြေးညီဖြစ်စေခြင်း

ကျွန်ုပ်တို့သည် ဒေတာအစု (Datasets) တစ်ခုချင်းစီကို ထုတ်ပြန်ရာတွင် အသုံးပြုသူများ မည်သည့်နေရာမှမဆို အရည်အသွေးတူညီသော အချက်အလက်များကို ရရှိစေရန်အတွက် “တစ်ပြေးညီ ထုတ်ပြန်ခြင်းစနစ်” ကို ကျင့်သုံးပါသည်။ စီမံကိန်းတစ်ခုချင်းစီ၏ ရလဒ်များကို သတ်မှတ်ထားသော ကမ္ဘာလုံးဆိုင်ရာ Platform များပေါ်သို့ တစ်ပြိုင်နက်တည်း (Simultaneous Release) တင်ပြသွားမည် ဖြစ်ပါသည်။ ဤသို့ ဆောင်ရွက်ခြင်းဖြင့် ဒေတာများ၏ ခိုင်မာမှုကို ထိန်းသိမ်းနိုင်ရုံသာမက၊ အသုံးပြုသူများအနေဖြင့် မိမိတို့နှင့် အဆင်ပြေရာ နည်းပညာဂေဟစနစ်အတွင်းမှနေ၍ DatarrX ၏ အရင်းအမြစ်များကို စိတ်ချယုံကြည်စွာ ရယူအသုံးပြုနိုင်မည် ဖြစ်ပါသည်။

၆.၂ အသုံးပြုမည့် နည်းပညာပလက်ဖောင်းများ

ဒေတာများကို ကမ္ဘာသိအောင် ချပြနိုင်ရန်နှင့် နည်းပညာနယ်ပယ်အသီးသီးသို့ ရောက်ရှိစေရန်အတွက် အောက်ပါ Platform များကို အဓိကထား အသုံးပြုသွားမည် ဖြစ်ပါသည် -

  • Hugging Face
    ကမ္ဘာလုံးဆိုင်ရာ AI နှင့် Machine Learning အသိုက်အဝန်းအတွက် အဓိကကျသော ဤစင်မြင့်ပေါ်တွင် DatarrX ၏ ဒေတာများကို တင်ပြခြင်းဖြင့် နိုင်ငံတကာ သုတေသီများက မြန်မာဘာသာစကားဆိုင်ရာ AI Model များ တည်ဆောက်ရာတွင် တိုက်ရိုက် အသုံးပြုနိုင်စေရန် ရည်ရွယ်ပါသည်။
  • Kaggle
    ဒေတာသိပ္ပံ (Data Science) ပညာရှင်များ စုဝေးရာ ဤနေရာတွင် ဒေတာများကို ဖြန့်ဝေခြင်းဖြင့် မြန်မာစာဆိုင်ရာ ဒေတာခွဲခြမ်းစိတ်ဖြာမှုနှင့် စိန်ခေါ်မှုအသစ်များကို ဖော်ထုတ်နိုင်ရန် ဆောင်ရွက်သွားမည် ဖြစ်ပါသည်။
  • GitHub
    ဒေတာများနှင့်အတူ ပါဝင်သော ရင်းမြစ်ကုဒ်များ၊ အသုံးပြုပုံ လမ်းညွှန်များနှင့် အသေးစား ဒေတာအစုများကို Developer များ အလွယ်တကူ ရယူနိုင်ရန်နှင့် ပူးပေါင်းပါဝင်နိုင်ရန်အတွက် အသုံးပြုသွားမည် ဖြစ်ပါသည်။
  • DatarrX Official Website
    အထက်ပါ Platform များအားလုံးသို့ ချိတ်ဆက်ပေးမည့် ဗဟိုချက်အဖြစ် ဆောင်ရွက်မည်ဖြစ်ပြီး၊ အဖွဲ့အစည်း၏ လုပ်ငန်းစဉ်များ၊ စီမံကိန်းအခြေအနေများနှင့် ဒေတာများကို တစ်နေရာတည်းတွင် စုစည်းဖော်ပြပေးသွားမည် ဖြစ်ပါသည်။

၆.၃ ဘာသာစကားနှစ်မျိုးဖြင့် မှတ်တမ်းတင်ခြင်း

ဒေတာများကို အသုံးပြုရာတွင် နားလည်မှု လွဲမှားခြင်းမရှိစေရန်နှင့် အသုံးပြုရ လွယ်ကူစေရန်အတွက် ဒေတာမှတ်တမ်း (Documentation) ပြုစုခြင်းကို အထူးအလေးထား ဆောင်ရွက်ပါသည်။

  • README နှင့် Metadata
    ဒေတာအစုတစ်ခုချင်းစီတွင် ၎င်း၏ နောက်ခံသမိုင်း၊ စုဆောင်းပုံနည်းလမ်း၊ ဒေတာအမျိုးအစားနှင့် အသုံးပြုပုံ လမ်းညွှန်ချက်များ ပါဝင်သော README.md ဖိုင်နှင့် Metadata များကို စနစ်တကျ ထည့်သွင်းသွားမည် ဖြစ်ပါသည်။
  • ဘာသာစကားနှစ်မျိုးစနစ်
    ကျွန်ုပ်တို့၏ မှတ်တမ်းများအားလုံးကို မြန်မာဘာသာနှင့် အင်္ဂလိပ်ဘာသာ (Bilingual) နှစ်မျိုးလုံးဖြင့် ဖော်ပြသွားမည် ဖြစ်ပါသည်။ ဤသို့ ဆောင်ရွက်ခြင်းဖြင့် ပြည်တွင်းရှိ အသုံးပြုသူများအတွက် နားလည်ရလွယ်ကူစေသကဲ့သို့၊ နိုင်ငံတကာမှ သုတေသီများအတွက်လည်း ဘာသာစကား အခက်အခဲမရှိဘဲ မြန်မာစာဆိုင်ရာ ဒေတာများကို လေ့လာအသုံးပြုနိုင်စေရန် အာမခံချက် ပေးထားခြင်း ဖြစ်ပါသည်။

၇။ ပူးပေါင်းဆောင်ရွက်မှုနှင့် ရေရှည်တည်တံ့မှု

DatarrX (ဒေတာ-အက်စ်) ၏ အောင်မြင်မှုနှင့် ရေရှည်တည်တံ့ခိုင်မြဲမှုသည် တစ်ဦးတစ်ယောက်၏ ကြိုးပမ်းမှုထက် ကဏ္ဍပေါင်းစုံမှ စုပေါင်းအင်အားအပေါ်တွင်သာ မူတည်ပါသည်။ ကျွန်ုပ်တို့သည် မြန်မာဘာသာစကားဆိုင်ရာ AI နည်းပညာဂေဟစနစ်ကို ပုံဖော်ရာတွင် ပိုမိုကျယ်ပြန့်သော ပူးပေါင်းဆောင်ရွက်မှုများ ပေါ်ပေါက်လာစေရန်နှင့် အဖွဲ့အစည်း၏ ရည်မှန်းချက်များ ရေရှည်တည်တံ့စေရန် အောက်ပါမူဝါဒများကို ချမှတ်ထားပါသည်။

၇.၁ လူထုအခြေပြု ပါဝင်မှု

ကျွန်ုပ်တို့သည် အသိပညာနှင့် နည်းပညာကို လူနည်းစုကသာ ပိုင်ဆိုင်ထားခြင်းထက် လူထုအတွင်းသို့ ပျံ့နှံ့ရောက်ရှိစေရန် ဦးတည်ဆောင်ရွက်ပါသည်။ ထို့ကြောင့် DatarrX ၏ လုပ်ငန်းစဉ်များတွင် ပါဝင်ရန်အတွက် မည်သည့်ကန့်သတ်ချက်မျှ ထားရှိခြင်းမရှိဘဲ နည်းပညာရှင်များ၊ ဘာသာစကားပညာရှင်များ၊ ကျောင်းသားလူငယ်များနှင့် စိတ်အားထက်သန်သူ မည်သူမဆို မိမိတို့ တတ်စွမ်းသည့် ကဏ္ဍမှနေ၍ စေတနာ့ဝန်ထမ်းအဖြစ် ပါဝင်နိုင်ပါသည်။ ကျွန်ုပ်တို့သည် စေတနာ့ဝန်ထမ်းများအတွက် လက်တွေ့နယ်ပယ်တွင် သင်ယူနိုင်မည့် အခွင့်အလမ်းများကို ဖန်တီးပေးရုံသာမက၊ ၎င်းတို့၏ ပံ့ပိုးမှုများကိုလည်း ကမ္ဘာလုံးဆိုင်ရာ ဒေတာမှတ်တမ်းများတွင် ထိုက်တန်စွာ ဂုဏ်ပြုမှတ်တမ်းတင်သွားမည် ဖြစ်ပါသည်။ လူထု၏ တက်ကြွသော ပါဝင်မှုသည်သာလျှင် DatarrX ကို ရှေ့သို့ မောင်းနှင်ပေးမည့် အဓိက အင်အားစု ဖြစ်ပါသည်။

၇.၂ မိတ်ဖက်အဖွဲ့အစည်းများနှင့် ပူးပေါင်းဆောင်ရွက်မှု

DatarrX သည် ဘုံရည်မှန်းချက် တူညီသော မည်သည့်အဖွဲ့အစည်းနှင့်မဆို မဟာဗျူဟာမြောက် ပူးပေါင်းဆောင်ရွက်ရန် အမြဲတစေ အသင့်ရှိနေပါသည်။ ကျွန်ုပ်တို့သည် တက္ကသိုလ်များ၊ သုတေသနအဖွဲ့အစည်းများ၊ နည်းပညာကုမ္ပဏီများနှင့် အစိုးရမဟုတ်သော အဖွဲ့အစည်းများ (NGOs) အားလုံးကို ပူးပေါင်းဆောင်ရွက်ရန် ဖိတ်ခေါ်အပ်ပါသည်။ ဤသို့ ပူးပေါင်းဆောင်ရွက်ခြင်းဖြင့် အရင်းအမြစ်များကို အတူတကွ အသုံးချနိုင်ခြင်း၊ နည်းပညာဆိုင်ရာ အတွေ့အကြုံများ ဖလှယ်နိုင်ခြင်းနှင့် မြန်မာဘာသာစကားဆိုင်ရာ AI နည်းပညာကို ပိုမိုကျယ်ပြန့်သော နယ်ပယ်များသို့ ရောက်ရှိအောင် ဆောင်ရွက်နိုင်မည် ဖြစ်ပါသည်။ ကျွန်ုပ်တို့သည် ပွင့်လင်းမြင်သာမှုနှင့် အပြန်အလှန် လေးစားမှုကို အခြေခံသော မိတ်ဖက်ဆက်ဆံရေး ယဉ်ကျေးမှုတစ်ရပ်ကို တည်ဆောက်သွားမည် ဖြစ်ပါသည်။

၇.၃ ရေရှည်တည်တံ့မှုနှင့် ရင်းမြစ်စီမံခန့်ခွဲမှု

အကျိုးအမြတ်မယူသော အဖွဲ့အစည်းတစ်ခုအနေဖြင့် DatarrX ၏ ရေရှည်တည်တံ့မှုသည် ရရှိလာသော ရင်းမြစ်များကို အထိရောက်ဆုံးနှင့် အကျိုးရှိဆုံး စီမံခန့်ခွဲနိုင်မှုအပေါ်တွင် တည်ရှိပါသည်။ ကျွန်ုပ်တို့သည် စေတနာ့ဝန်ထမ်းများ၏ စုပေါင်းစွမ်းအား (Human Capital) ကို အဓိက ရင်းမြစ်အဖြစ် အသုံးပြုပြီး၊ နည်းပညာဆိုင်ရာ အခြေခံအဆောက်အအုံများကိုလည်း ကုန်ကျစရိတ် သက်သာစေမည့် ပွင့်လင်းရင်းမြစ် စနစ်များဖြင့်သာ တည်ဆောက်ထားပါသည်။ အဖွဲ့အစည်းသို့ ရောက်ရှိလာသော မည်သည့် ရင်းမြစ် သို့မဟုတ် ပံ့ပိုးမှုများကိုမဆို မြန်မာဘာသာစကားဆိုင်ရာ ဒေတာများ ပြုစုပျိုးထောင်ခြင်းနှင့် နည်းပညာဖွံ့ဖြိုးတိုးတက်ရေး လုပ်ငန်းစဉ်များတွင်သာ ရာနှုန်းပြည့် ပြန်လည်အသုံးပြုသွားမည် ဖြစ်ပါသည်။ ဤကဲ့သို့ အများပြည်သူ အကျိုးစီးပွားကို ရှေးရှုသော လုပ်ငန်းစဉ်များကြောင့် DatarrX သည် နည်းပညာခေတ်၏ လိုအပ်ချက်နှင့်အညီ ရေရှည်ခိုင်မာစွာ ရပ်တည်သွားနိုင်မည် ဖြစ်ပါသည်။

၈။ ဆက်သွယ်ရန်နှင့် နောက်ဆက်တွဲ

DatarrX (ဒေတာ-အက်စ်) သည် နည်းပညာခေတ်၏ ဝိသေသနှင့်အညီ ဒစ်ဂျစ်တယ်စနစ်ဖြင့် လည်ပတ်သော အဖွဲ့အစည်း (Online-based Organization) ဖြစ်ပါသည်။ ကျွန်ုပ်တို့နှင့် ဆက်သွယ်လိုသူများ၊ ပူးပေါင်းဆောင်ရွက်လိုသူများနှင့် အချက်အလက်များ မေးမြန်းလိုသူများအတွက် အောက်ပါ ဒစ်ဂျစ်တယ်ချန်နယ်များကို တရားဝင် ဖွင့်လှစ်ထားရှိပါသည်။

၈.၁ ဆက်သွယ်ရန် လိပ်စာနှင့် ဒစ်ဂျစ်တယ်ရုံးချုပ်

ကျွန်ုပ်တို့သည် ပုံသေရုံးခန်းအခြေစိုက်စနစ်ထက် ပိုမိုသွက်လက်သော ဒစ်ဂျစ်တယ်လုပ်ငန်းခွင်စနစ်ကို ကျင့်သုံးပါသည်။ ထို့ကြောင့် အဖွဲ့အစည်းနှင့်ပတ်သက်သော တရားဝင် အပေးအယူများ၊ စုံစမ်းမေးမြန်းမှုများနှင့် အကြံပြုချက်များအားလုံးကို အောက်ပါ အီးမေးလ်လိပ်စာမှတစ်ဆင့် တိုက်ရိုက် ဆက်သွယ်နိုင်ပါသည်။ ကျွန်ုပ်တို့၏ ပင်မစီမံခန့်ခွဲမှုအဖွဲ့သည် ဒစ်ဂျစ်တယ်ပလက်ဖောင်းများပေါ်တွင် အမြဲမပြတ် ရှိနေမည်ဖြစ်ပြီး၊ ပေးပို့လာသော သတင်းစကားများကို အမြန်ဆုံး တုံ့ပြန်ဆောင်ရွက်ပေးသွားမည် ဖြစ်ပါသည်။

  • Official Email: datarrx@gmail.com
  • Operating Hours: ၂၄ နာရီ (ဒစ်ဂျစ်တယ်စနစ်ဖြင့် အမြဲမပြတ် လက်ခံလျက်ရှိပါသည်)

၈.၂ ဒစ်ဂျစ်တယ် ချန်နယ်များ

DatarrX ၏ လှုပ်ရှားမှုများ၊ စီမံကိန်းအသစ်များနှင့် ဒေတာထုတ်ပြန်မှုများကို အောက်ပါ ချန်နယ်များမှတစ်ဆင့် အချိန်နှင့်တစ်ပြေးညီ လေ့လာစောင့်ကြည့်နိုင်ပါသည် -

  • Official Website
    datarrx.org - အဖွဲ့အစည်း၏ ပင်မသတင်းအချက်အလက်နှင့် ဒေတာချိတ်ဆက်မှုများ။
  • Social Media
    LinkedIn & Telegram - လူထုနှင့် ထိတွေ့ဆက်ဆံမှုနှင့် သတင်းထုတ်ပြန်မှုများ။
  • Developer & Data Forums
    Discord & Telegram - နည်းပညာရှင်များနှင့် စေတနာ့ဝန်ထမ်းများ အပြန်အလှန် ဆွေးနွေးရာနေရာများ။
  • Technical Platforms
    GitHub, Hugging Face နှင့် Kaggle ရှိ DatarrX Official Profiles များ။

၈.၃ ဝေါဟာရရှင်းလင်းချက်

  • Low-resource Language (ရင်းမြစ်နည်းပါးသော ဘာသာစကား): ဒစ်ဂျစ်တယ်ကမ္ဘာတွင် AI လေ့ကျင့်သင်ကြားရန် လိုအပ်သော စက်ဖတ်နိုင်သည့် ဒေတာ (Machine-readable data) အလုံအလောက် မရှိသည့် ဘာသာစကားများကို ဆိုလိုသည်။
  • Dataset (ဒေတာအစု): စနစ်တကျ စုစည်းထားသော အချက်အလက်အစုအဝေး (ဥပမာ - ဘာသာပြန်စာကြောင်းများ၊ အသံဖိုင်များ)။
  • Open-source (ပွင့်လင်းရင်းမြစ်): မည်သူမဆို လွတ်လပ်စွာ ကြည့်ရှုနိုင်၊ ပြင်ဆင်နိုင်နှင့် ပြန်လည်ဖြန့်ဝေနိုင်သော နည်းပညာ သို့မဟုတ် အချက်အလက်။
  • Crowdsourcing (လူထုအခြေပြု စုဆောင်းခြင်း): လုပ်ငန်းတစ်ခုကို လူတစ်ဦးတစ်ယောက်တည်းက မဟုတ်ဘဲ အများပြည်သူ သို့မဟုတ် စေတနာ့ဝန်ထမ်းများ၏ စုပေါင်းစွမ်းအားဖြင့် အကောင်အထည်ဖော်ခြင်း။
  • Metadata (ဒေတာဆိုင်ရာ အချက်အလက်): ဒေတာတစ်ခု၏ အကြောင်းအရာကို ဖော်ပြသော အချက်အလက် (ဥပမာ - ဒေတာကို မည်သူက၊ မည်သည့်အချိန်တွင်၊ မည်သို့ စုဆောင်းခဲ့သည်ဟူသော မှတ်တမ်း)။
  • Attribution (ရည်ညွှန်းကိုးကားမှု): မူရင်းဖန်တီးသူ သို့မဟုတ် အဖွဲ့အစည်း၏ အမည်ကို တရားဝင် ထည့်သွင်းဖော်ပြခြင်း။
  • Natural Language Processing - NLP (သဘာဝဘာသာစကား လုပ်ဆောင်ခြင်း): ကွန်ပျူတာများက လူသားတို့၏ ဘာသာစကားကို နားလည်ရန်၊ အနက်ဖွင့်ရန်နှင့် တုံ့ပြန်ရန် လုပ်ဆောင်သော AI နည်းပညာရပ်။

ထုတ်ဝေသည့်ရက်စွဲ - ၂၀၂၆ ခုနှစ်၊ ဇူလိုင်လ