අන්තර්ගතයට යන්න
මෙය ඉංග්‍රීසි මුල් ලේඛනයේ පරිවර්තනයකි. දෙකෙහි වෙනසක් ඇත්නම් ඉංග්‍රීසි පිටපත නිවැරදි යැයි සලකන්න.

06: සිංහල රෝමානුකරණය ​

මෙම ලේඛනය සිංහල ලතින් අකුරින් ලියන ආකාරය විමසා බලයි. එහි කොටස් දෙකක් ඇත: (a) විධිමත් රෝමානුකරණ ක්‍රම (ISO 15919 සහ එහි 7-bit ASCII ආකෘතිය, ශ්‍රී ලංකා ජාතික ක්‍රමය, UN 1972 වගුව, ALA-LC සහ KNAB), සහ (b) මිනිසුන් සැබවින්ම ලියන අවිධිමත් රෝමානුකරණය ("Singlish"). අවිධිමත් රෝමානුකරණය Dakshina පෙළ සංග්‍රහයේ (corpus) සිංහල කොටසින් මැන ඇති අතර, Singlish නැවත සිංහලට හැරවීම (back-transliteration) පිළිබඳ ප්‍රකාශිත පර්යේෂණ ඇසුරෙන් විස්තර කර ඇත. ලේඛනය අවසන් වන්නේ අකුරෙන් අකුර සැසඳීමකින්, සම්මුති මාලාවකින් (RS-xxx) සහ සිංහල ශබ්දානුසාරී රෝමානුකරණයක් සඳහා නිර්දේශවලිනි.

සම්පාදනය කළේ 2026 ඔක්තෝබර් මාසයේදීය.

සංකේත විස්තරය ​

ලකුණඅර්ථය
✅ප්‍රාථමික මූලාශ්‍රයකින් ගත් දේ (සම්මතය, නිල වාර්තාවක් හෝ ප්‍රකාශිත සිතියම්ගත කිරීමේ වගුවක්)
🧪පෙළ සංග්‍රහයකින් මැන ගත් දේ (Dakshina සිංහල දත්ත, §2a)
❓තහවුරු වී නැත. මූලාශ්‍රය ඒ ගැන කිසිවක් නොකියයි, නැතහොත් අගය නිගමනයකි. එය සිතියම්ගත කිරීමක් (mapping) ලෙස නොසලකන්න
-මෙහි භාවිත කළ මූලාශ්‍රවල මෙම අකුර සඳහා අගයක් සටහන් වී නැත

එක් එක් RS සම්මුතියේ විශ්වාසය: ඉහළ (H) යනු ප්‍රාථමික මූලාශ්‍ර කිහිපයක් එකඟ වන බවයි. මධ්‍යම (M) යනු එක් ප්‍රාථමික මූලාශ්‍රයක් හෝ නිගමනයක් පමණක් ඇති බවයි. අඩු (L) යනු අනුමානයක් බවයි.

අකුරු හැඳුනුම් මෙම ගබඩාවේ (repository) අනෙක් ලේඛනවල ක්‍රමයම අනුගමනය කරයි. ව්‍යඤ්ජන: ka kha ga gha nga(ඞ) nnga(ඟ) ca cha ja jha nya(ඤ) jnya(ඥ) nyja(ඦ) tta ttha dda ddha nna nndda(ඬ) ta tha da dha na nda(ඳ) pa pha ba bha ma mba(ඹ) ya ra la va sha(ශ) ssa(ෂ) sa ha lla(ළ) fa; ස්වර: a aa ae aee i ii u uu ru ruu ilu iluu e ee ai o oo au; ලකුණු: hal anusvara visarga yansaya rakaransaya repaya.


සාරාංශය ​

  • අවිධිමත් ලිවීමේදී th = ත සහ t = ට වේ. ත ලියන අවස්ථාවලින් 93%ක th යෙදේ. ට ලියන අවස්ථාවලින් 99%ක t යෙදේ. ISO 15919 ඊට ප්‍රතිවිරුද්ධව t = ත සහ ṭ = ට ලෙස යොදයි (RS-001).
  • අවිධිමත් ලිවීමේදී d මූලිකවම ද අකුරයි. මිනිසුන් ද අකුරට (99%) සහ ඩ අකුරට (100%) යන දෙකටම d ලියති. ධ සඳහා ඔවුහු dh (69%) වෙන් කර තබා ගනිති. මෙය ISO සමඟද එකඟ වේ (RS-002, RS-003).
  • අවිධිමත් ee/oo යනු ī/ū මිස ē/ō නොවේ. ී ලියන අවස්ථාවලින් 38%ක ee යෙදේ. ේ සඳහා එය කිසිසේත් වාගේ නොයෙදේ. ISO හි 7-bit ආකෘතිය ee/oo යොදන්නේ ē/ō සඳහාය (RS-006, RS-007).
  • ස්වර දිග සලකුණු කරන්නේ කලාතුරකිනි. ා ලියන අවස්ථාවලින් 97%ක a යෙදේ. ී ලියන අවස්ථාවලින් 58%ක i යෙදේ (RS-009).
  • විධිමත් ක්‍රම නාසික අකුරු ගැන එකඟ නොවේ. ISO, ශ්‍රී ලංකා ජාතික ක්‍රමය සහ ALA-LC යන ක්‍රම තුන ං සහ ඞ එකිනෙකට වෙනස් ලෙස රෝමානුකරණය කරයි (RS-029).

⚠️ වැරදීමට ඉඩ ඇති තැන් ​

#ගැටලුවසම්මුතිය
1අවිධිමත් ලිවීමේ kohomada යනු කොහොමද යන්නයි: මෙහි d යනු ද මිස ඩ නොවේ. d ඩ ලෙස කියවුවහොත් වැරදි වචනයක් ලැබේRS-002
2අවිධිමත් ලිවීමේ ee යනු ඊ/ී වේ (kireemata, pawathee). ISO 7-bit හි මෙන් ඒ නොවේRS-006
3අවිධිමත් ලිවීමේ oo යනු ඌ/ූ වේ (soodanam). ISO 7-bit හි මෙන් ඕ නොවේRS-007
4සලකුණු රහිත nd, mb, ng අපැහැදිලිය (ambiguous): න්ද හෝ ඳ, ම්බ හෝ ඹ, න්ග හෝ ඟ හෝ ංග. අවිධිමත් ලිවීමේදී සඤ්ඤක අකුරු සඳහා මේවා යොදයි (ඳ ලියන අවස්ථාවලින් 91%ක nd යෙදේ)RS-012
5ං සඳහා අවිධිමත්ව යොදන n (91%) න් සඳහා යොදන n වලින් වෙන් කර හඳුනාගත නොහැකRS-014
6ISO හි c යනු ච වේ. නමුත් අවිධිමත් ලිවීමේදී ච සඳහා ch යොදයි (95%)RS-005
7කතාබහ (chat) ශෛලියේ Singlish ස්වර අතහරියි (nthi, mta, kynna). එබැවින් එක් ලිවීමකින් වචන කිහිපයක් අදහස් විය හැකRS-010
8ඏ ඐ ෟ ෳ සඳහා අගයන් ඇත්තේ විධිමත් ක්‍රමවල පමණි. ඒවා ගැන අවිධිමත් දත්ත නැතRS-018

1. විධිමත් රෝමානුකරණ ක්‍රම ✅ ​

1a. ISO 15919 (2001) සහ එහි 7-bit ASCII ආකෘතිය ​

මූලාශ්‍රය: Wikipedia හි ISO 15919 වගුව, පිටුවේ මූල කේතයෙන් කියවා ඇත. https://en.wikipedia.org/wiki/ISO_15919. 7-bit ASCII ආකෘතිය වරහන් තුළ දැක්වේ.

  • ස්වර: අ a · ආ ā (aa) · ඇ æ (ae) · ඈ ǣ (aee) · ඉ i · ඊ ī (ii) · උ u · ඌ ū (uu) · ඍ r̥ (,r) · ඎ r̥̄ (,rr) · ඏ l̥ (,l) · ඐ l̥̄ (,ll) · එ e · ඒ ē (ee) · ඓ ai · ඔ o · ඕ ō (oo) · ඖ au
  • ව්‍යඤ්ජන: ක k · ඛ kh · ග g · ඝ gh · ඞ ṅ (;n) · ඟ n̆g (^ng) · ච c · ඡ ch · ජ j · ඣ jh · ඤ ñ (~n) · ඦ n̆j (^nj) · ට ṭ (.t) · ඨ ṭh · ඩ ḍ · ඪ ḍh · ණ ṇ · ඬ n̆ḍ (^n.d) · ත t · ථ th · ද d · ධ dh · න n · ඳ n̆d (^nd) · ප p · ඵ ph · බ b · භ bh · ම m · ඹ m̆b (^mb) · ය y · ර r · ල l · ළ ḷ (.l) · ව v · ශ ś (sh) · ෂ ṣ (.s) · ස s · හ h · ෆ f
  • ලකුණු: ං ṁ (;m) · ඃ ḥ (.h) · ් සඳහා සංකේතයක් නැත
  • ඥ වෙනම දක්වා නැත. සාමාන්‍යයෙන් එය jñ සංයුක්තය ලෙස රෝමානුකරණය කරයි ❓.

1b. ශ්‍රී ලංකා ජාතික ක්‍රමය (මිනින්දෝරු දෙපාර්තමේන්තුව; 2018 සැප්තැම්බර් 4 කැබිනට් මණ්ඩලය අනුමත කළ අතර පසුව සංශෝධනය කළේය) ​

මූලාශ්‍රය: UNGEGN Working Group on Romanization Systems වාර්තාව, v5.0, 2021 ඔක්තෝබර්. https://arhiiv.eki.ee/wgrs/rom2_si.htm. සිංහල සඳහා තවමත් UN අනුමත ක්‍රමයක් නොමැති බව වාර්තාවේ සඳහන් වේ.

  • ISO මත පදනම් වුවත්, මෙම අගයන් වෙනස්ය:
    • ඞ = ṁa සහ ං = ṅ (ISO හි මේවා මාරු වී ඇත)
    • ඓ = ĩ (2018 දී එය ai විය)
    • ඣ = qa (පෙර එය jha විය)
    • ඨ = ṯa (පෙර එය ṭha විය)
    • ෂ = sha, ශ = ś
    • ඥ = gna
    • ඹ = ḅa (පෙර එය m̆ba විය)
    • ඦ = n̆ǰa
  • ලැයිස්තුගත අනෙක් අගයන්: ඟ n̆ga · ඬ n̆ḍa · ඳ n̆da · ඇ æ · ඈ ǣ · ඏ ḷ · ඐ ḹ · ඍ ṛ · ඎ ṝ
  • බැඳි ලකුණු (ligatures): ර්‍ යනු r-, ්‍ර යනු -r, ්‍ය යනු -y. මිනින්දෝරු දෙපාර්තමේන්තුවේ මාර්ගගත පරිවර්තකය https://www.survey.gov.lk/RomanizationConverter/ හි ඇත.

1c. UN 1972 "Sharma" වගුව (කිසිදා අනුමත නොවූ) ​

මූලාශ්‍රය: interscript සිතියම un-sin-Sinh-Latn-1972. එය 1972 UN සමුළු ලේඛන උපුටා දක්වයි. https://github.com/interscript/maps

  • කෙටි ස්වරවලට breve ලකුණක් ඇත: ඇ æ̆ · ඈ æ · එ ĕ · ඒ e · ඔ ŏ · ඕ o
  • ච ch · ඡ chh · ශ sh · ෂ ṣh · ං ṁ · ඞ ṅ

1d. ALA-LC (Library of Congress) Sinhalese ​

මූලාශ්‍රය: interscript සිතියම් alalc-sin-Sinh-Latn-1997 සහ -2011. LoC PDF ගොනුව පරිශීලනය කර නැත. එබැවින් මෙහි විශ්වාසය මධ්‍යමය.

ක්ෂේත්‍රයALA-LC 1997
ස්වරඇ ă · ඈ â · ඏ ḷ · ඐ ḹ · ෟ ḷ · ෳ ḹ · දිගු ස්වර සඳහා ē / ō
ව්‍යඤ්ජනච ca · ඡ cha · ශ ś · ෂ ṣ
අනුස්වාරයං ṃ
සඤ්ඤකඟ ṅga · ඦ ñja · ඬ ṇḍa · ඳ nda · ඹ ṃba

නීති:

  • ALA-LC අනුස්වාරය ලියන්නේ ඊළඟ ව්‍යඤ්ජනයේ වර්ගයට අයත් නාසිකය ලෙසයි: ṅ, ñ, ṇ, n හෝ m.
  • සඤ්ඤක අකුරකට පසු මහාප්‍රාණ අකුරක් ආවොත්, එය අල්පප්‍රාණ + මහාප්‍රාණ ලෙස ලියයි.

2011 පරීක්ෂණ පෙළ ඇ / ඈ සඳහා ă / â යොදයි.

1e. KNAB (එස්තෝනියානු ස්ථාන නාම දත්ත සමුදාය), 1989 ​

මූලාශ්‍රය: https://arhiiv.eki.ee/knab/lat/kblsi1.pdf

  • ස්වර: ඇ è · ඈ ê · එ ĕ · ඒ e
  • ව්‍යඤ්ජන: ච cha · ශ sha · ෂ ṣha
  • ං ṁ (ń)
  • එය සඤ්ඤක අකුරු මැද තිතකින් සලකුණු කරයි (·mba).
  • දේශීය භාවිතයේදී è / ê, e ලෙසත් v, w ලෙසත් ලියන බව එහි සඳහන් වේ.

2. අවිධිමත් Singlish: මිනිසුන් සිංහල ලතින් අකුරින් සැබවින්ම ලියන ආකාරය ​

2a. මැන ගත් දත්ත: Dakshina පෙළ සංග්‍රහය, සිංහල කොටස 🧪 ​

පෙළ සංග්‍රහය: සිංහල මව් බස ලෙස කතා කරන අය රෝමානුකරණය කළ Wikipedia වාක්‍ය 10,000ක් (Roark et al., LREC 2020), සහ භාවිතයේ හමු වූ ප්‍රභේද (variants) ඇතුළත් ශබ්දකෝෂයක් (lexicon). භාවිත කළේ නිල Dakshina v1.0 නිකුතුවේ සිංහල ගොනු ය. ඒවා hash අගයකින් ස්ථිර කර ඇත.

ක්‍රමය: tools/corpus_counts.py (tools/dakshina_counts.py සමඟ) එක් එක් සිංහල වචනය අකුරු සහ ලකුණුවලට බෙදා, එක් එක් අකුරට ඇති පුළුල් ලිවීම් කට්ටලයක් මත ගතික ක්‍රමලේඛනයෙන් (dynamic programming) එහි රෝමානුකරණය සමඟ පෙළගස්වයි. ලිවීම්වල සම්භාවිතා පෙළගැස්වීම්වලින් වට හතරක් නැවත ඇස්තමේන්තු කරන බැවින්, ගණන් අතින් ලියූ වගුවක පිළිවෙළ මත රඳා නොපවතී. ප්‍රතිශත යනු එක් එක් අකුරේ පෙළගැසුණු යෙදීම්වලින් කොටසයි (reports/corpus-counts.md හි CC-17 සහ CC-18).

  • "වාක්‍ය" = වාක්‍යවල ඇති වචන (tokens): 139,154න් 127,072ක් පෙළගැසුණි (ඉලක්කම් හෝ සිංහල අකුරක් නැති ටෝකන ඉවත් කළේය).
  • "ශබ්දකෝෂ ප්‍රභේද" = ශබ්දකෝෂයේ ප්‍රභේද, ලකුණු කළ අය ගණනින් බර කළ: 93,505න් 88,994ක් පෙළගැසුණි.
අකුරවාක්‍යශබ්දකෝෂ ප්‍රභේද
කk 99%, c 1%k 99%
ඛ / ඝkh 71%, k 29% / gh 70%, g 30%kh 94%, k 6% / gh 93%, g 7%
ඟng 52%, g 48%ng 85%, g 15%
ච / ඡch 95%, c 5% / ch 98%, chh 1%ch 59%, c 41% / ch 99%
ජj 100%j 100%
ඤ / ඥn 70%, gn 30% / gn 98%, kn 1%n 82%, gn 16%, kn 1% / gn 94%, ny 4%, gy 2%
ට / ඨt 99% / t 92%, th 8%t 99% / th 81%, t 19%
ඩ / ඪd 100% / d 73%, dh 27%d 99% / dh 70%, d 30%
ණn 100%n 100%
ඬnd 83%, d 17%nd 91%, d 9%
ත / ථth 93%, t 7% / th 100%th 51%, t 49% / th 96%, t 4%
ද / ධd 99% / dh 69%, d 31%d 97%, dh 3% / dh 94%, d 6%
ඳnd 91%, d 9%nd 82%, d 12%, dh 4%
ඵ / භp 56%, ph 44% / bh 91%, b 9%ph 83%, p 17% / bh 89%, b 11%
ඹmb 88%, b 11%mb 93%, b 7%
වw 72%, v 28%v 83%, w 17%
ශ / ෂsh 85%, s 15% / sh 91%, s 9%s 53%, sh 47% / sh 52%, s 48%
ළl 100%l 100%
ෆf 87%, ph 13%f 90%, ph 10%
inherent aa 99%a 100%
ාa 97%, aa 3%a 95%, aa 5%
ැ / ඇe 64%, a 36%, ae ≈0% / a 60%, e 40%, ae ≈0%a 45%, ae 43%, e 12% / a 53%, ae 39%, e 8%
ෑe 68%, a 29%, aa 3%a 49%, ae 36%, e 10%
ී / ඊi 58%, ee 38%, ii 2% / i 72%, ee 27%i 83%, ee 15% / i 99%
ූ / ඌu 73%, oo 22%, uu 5% / u 94%, uu 6%u 93%, oo 6% / u 100%
ේ / ඒe 100% / e 99%, ee 1%e 99% / e 100%
ෝ / ඕo 98%, oo 2% / o 97%, oo 3%o 100% / o 100%
ෘru 93%, r 7%r 55%, ru 45%
ෛ / ඓai 99%, ei 1% / ai 89%, ei 11%ai 99% / ai 100%
ෞ / ඖau 97%, ou 3% / au 89%, ow 7%, ou 4%au 97%, ou 2%, ow 1% / au 100%
ංn 91%, ng 6%, m 3%n 60%, m 34%, ng 6%

අවවාද:

  • මේවා ඉල්ලීම මත සැලකිල්ලෙන් රෝමානුකරණය කළ Wikipedia වාක්‍ය මිස කතාබහ පෙළ නොවේ. කතාබහේදී ස්වර බොහෝ වැඩියෙන් අතහැරේ (§2b).
  • ශබ්දකෝෂයේ ත සඳහා th/t ආසන්න වශයෙන් 50/50 ලෙස බෙදේ. එබැවින් සමහර විවරණකරුවන් (annotators) ත සඳහා ISO වැනි සාමාන්‍ය t යොදා ඇත.

2b. Singlish නැවත සිංහලට හැරවීම පිළිබඳ පර්යේෂණ පත්‍රිකා ​

  1. Athukorala & Sumanathilaka, "Swa Bhasha: Message-Based Singlish to Sinhala Transliteration" (2022 / 2024). https://arxiv.org/abs/2404.13350
    • ලියන්නන් ස්වර අතහරිති. එක් වචනයක් kiyanna, kianna, kynna, kynn සහ kiynna ලෙස දිස් වේ.
    • කතුවරුන් මෙය සංඛ්‍යාත්මක අකුරු කේත සහ අවිනිශ්චිත ගැළපීම (fuzzy matching) මගින් විසඳති.
    • නීති පදනම් කරගත් පරිවර්තකවලට ස්වර ලියා තිබීම අවශ්‍ය බව ඔවුහු සඳහන් කරති. තම ක්‍රමය දැනට පවතින මෙවලම් සමඟද සසඳති.
  2. Perera, Prabhath, Sumanathilaka, Anuradha, "IndoNLP 2025 Shared Task: Romanized Sinhala to Sinhala Reverse Transliteration Using BERT" (2025). https://aclanthology.org/2025.indonlp-1.16.pdf
    • ඔවුන් මෙම රෝමානුකරණය හඳුන්වන්නේ "ad-hoc" ලෙසයි. එහි ස්වර අතහැර ලියයි. උදාහරණයක් ලෙස තාත්තා යන්න Thaaththaa, Thaththa, Thattha, Thatta හෝ Tatta ලෙස ලියයි.
    • ඔවුන්ගේ ක්‍රමය ශබ්දකෝෂයක්, ශබ්දකෝෂයේ නැති වචන සඳහා නීති, සහ අපැහැදිලි තැන් සඳහා BERT එකට යොදයි.
    • 2 වන පරීක්ෂණ කට්ටලය බොහෝ දුරට ස්වර රහිත ආදානයෙන් සමන්විතය.
  3. Perera & Sumanathilaka, "Evaluating Transliteration Ambiguity in Adhoc Romanized Sinhala" (RANLP 2025). https://aclanthology.org/2025.ranlp-1.107.pdf
    • සිංහල වචන දෙකකට බැගින් ගැළපෙන රෝමානු වචන 22ක්.
    • උදාහරණ: nthi නීති/නැති · mta මට/මීට · es ඇස/එසේ · eda ඇද/එදා · bala බල/බාල · badu බඩු/බදු · ud උඩ/උදේ · dnna දන්නා/දෙන්නා · oya ඔය/ඔයා.
    • මේවායින් කරුණු තුනක් පෙනේ: ස්වර දිග සලකුණු නොකිරීම, ඇ සහ එ එකම ලිවීමකට එක්වීම, සහ d යනු ඩ අකුරද ද අකුරද යන්න අපැහැදිලි වීම.
  4. Sumanathilaka et al., "Swa-bhasha Resource Hub" (arXiv 2507.09245, 2025). https://arxiv.org/abs/2507.09245
    • 2020–2025 කාලයේ ක්‍රම සහ දත්ත කට්ටල පිළිබඳ සමීක්ෂණයකි.
    • Singlish සම්මතකරණය වී නැත. එහි බොහෝ විට ස්වර අතහැර ලියයි.
    • ස්වර රහිත ආදානයේදී Swa Bhasha, පවතින මෙවලම්වලට සහ නීති පදනම් කරගත් පරිවර්තකවලට වඩා හොඳින් ක්‍රියා කරයි.

2c. එදිනෙදා ලිවීම් ​

mama, oya/oyaa, kohomada (ද සඳහා d), ayubowan, ganna, thiyenawa (ත සඳහා th, දිග ලකුණක් නැත), amma/ammaa, thaththa, api, eka, ekka, mokada, honda (ඳ සඳහා nd), lassana, sinhala/lanka (ං සඳහා n), wenawa/venava, karanna, kiyanna.


3. අකුරෙන් අකුර සැසඳීම ​

තීරු පිළිබඳ සටහන්:

  • ව්‍යඤ්ජන ආවේණික ස්වරය නොමැතිව දක්වා ඇත (ජාතික ක්‍රමයේ සහ ALA-LC මූලාශ්‍රවල එය ලියා ඇත, උදා. ṁa, ca).
  • ISO 7-bit: §1a හි වරහන් තුළ ඇති අගයන්. ISO අගය දැනටමත් සාමාන්‍ය ASCII නම්, 7-bit ආකෘතියද එයම වේ.
  • ශ්‍රී ලංකා ජාතික සහ ALA-LC: මූලාශ්‍ර ලැයිස්තුගත කරන අගයන් පමණි (§1b, §1d). "-" යන්නෙන් අදහස් වන්නේ මෙහි භාවිත කළ මූලාශ්‍ර උපුටනයේ අගයක් නැති බවයි. අකුර නැති බව නොවේ.
  • අවිධිමත්: Dakshina වාක්‍යවල (§2a) වැඩිපුරම යෙදෙන ලිවීම සහ එහි ප්‍රතිශතය. ප්‍රතිශතයක් දී නැති තැන්වල, එම ලිවීම ගෙන ඇත්තේ ප්‍රතිශත ප්‍රකාශ නොකළ, අකුරෙන් අකුර දුන් සාරාංශයෙනි. n = … මගින් ඉතා කුඩා ගණන් දැක්වේ.

ව්‍යඤ්ජන ​

IDසිංහලISO 15919ISO 7-bitශ්‍රී ලංකා ජාතිකALA-LCඅවිධිමත් 🧪
kaකkk--k 99%
khaඛkhkh--kh 71% (k 29%)
gaගgg--g
ghaඝghgh--gh 70% (g 30%)
ngaඞṅ;nṁ-- (no data)
nngaඟn̆g^ngn̆gṅgng 52% (g 48%)
caචcc-cch 95%
chaඡchch-chch 98%
jaජjj--j 100%
jhaඣjhjhq-jh (n = 4)
nyaඤñ~n--n 70% (gn 30%)
jnyaඥjñ ❓-gn-gn 98%
nyjaඦn̆j^njn̆ǰñj- (no data)
ttaටṭ.t--t 99%
tthaඨṭh-ṯ-t 92%
ddaඩḍ---d 100%
ddhaඪḍh---d 73% (dh 27%)
nnaණṇ---n 100%
nnddaඬn̆ḍ^n.dn̆ḍṇḍnd 83% (d 17%)
taතtt--th 93%
thaථthth--th 100%
daදdd--d 99%
dhaධdhdh--dh 69% (d 31%)
naනnn--n
ndaඳn̆d^ndn̆dndnd 91%
paපpp--p
phaඵphph--p 56% (ph 44%)
baබbb--b
bhaභbhbh--bh 91%
maමmm--m
mbaඹm̆b^mbḅṃbmb 88% (b 11%)
yaයyy--y
raරrr--r
laලll--l
vaවvv--w 72% (v 28%)
shaශśshśśsh 85% (s 15%)
ssaෂṣ.sshṣsh 91%
saසss--s
haහhh--h
llaළḷ.l--l 100%
faෆff--f 87% (ph 13%)

ස්වර (ස්වතන්ත්‍ර ස්වරය / ස්වර ලකුණ) සහ ලකුණු ​

IDසිංහලISO 15919ISO 7-bitශ්‍රී ලංකා ජාතිකALA-LCඅවිධිමත් 🧪
aඅ / (ආවේණික)aa--a 99%
aaආ / ාāaa--a 97%
aeඇ / ැæaeæăැ e 64%; ඇ a 60%
aeeඈ / ෑǣaeeǣâe 68% (a 29%)
iඉ / ිii--i
iiඊ / ීīii--i 58% (ee 38%)
uඋ / ුuu--u
uuඌ / ූūuu--u 73% (oo 22%)
ruඍ / ෘr̥,rṛ-ru 93%
ruuඎ / ෲr̥̄,rrṝ-ru (n = 7)
iluඏ / ෟl̥,lḷḷ- (no data)
iluuඐ / ෳl̥̄,llḹḹ- (no data)
eඑ / ෙee--e
eeඒ / ේēee-ēe 100%
aiඓ / ෛaiaiĩ-ai 99%
oඔ / ොoo--o
ooඕ / ෝōoo-ōo 98%
auඖ / ෞauau--au 97%
hal්(නැත)(නැත)--not written (implied at end of word)
anusvaraංṁ;mṅṃ (වර්ගයේ නාසිකය)n 91%
visargaඃḥ.h--h (n = 1)
yansaya්‍ය-y-y-y-y
rakaransaya්‍ර-r-r-r-r
repayaර්‍r-r-r--r

4. සම්මුති (RS-xxx) ​

IDසම්මුතිය / ගැටුමසාක්ෂිවිශ්වාසය
RS-001අවිධිමත් ලිවීමේදී th = ත සහ t = ට වේ: ත 93%ක් th ලෙසත්, ට 99%ක් t ලෙසත් ලියයි. ISO 15919 සලකුණු රහිත t = ත සහ ṭ = ට යොදයි. ශබ්දකෝෂයේ සමහර විවරණකරුවන්ද එය අනුගමනය කරති (ශබ්දකෝෂයේ ත සඳහා th/t ආසන්න වශයෙන් 50/50 ලෙස බෙදේ)§1a, §2aඉහළ
RS-002අවිධිමත් ලිවීමේදී d අපැහැදිලිය. මිනිසුන් ද අකුරට (99%) සහ ඩ අකුරට (100%) යන දෙකටම d ලියති. ISO ඒවා වෙන් කරයි (d = ද, ḍ = ඩ). RANLP යුගලය වන badu බඩු/බදු මෙම අපැහැදිලිතාව ප්‍රායෝගිකව පෙන්වයි§1a, §2a, §2bඉහළ
RS-003dh = ධ. ISO dh = ධ යොදයි. අවිධිමත් ලිවීමද එයට එකඟ වේ (වාක්‍යවල 69%, ශබ්දකෝෂයේ 94%)§1a, §2aඉහළ
RS-004ISO මහාප්‍රාණ අකුරු සලකුණු කරන්නේ මූලික අකුරට h එක් කිරීමෙනි (ch = ඡ, th = ථ). අවිධිමත් ලිවීම මහාප්‍රාණ අකුරු ඒවායේ අල්පප්‍රාණ අකුරුවලින් වෙන් කරන්නේ ඉතා අල්ප වශයෙනි: ථ සහ ත දෙකම th වේ, ඨ බොහෝ විට t වේ, ඪ බොහෝ විට d වේ§1a, §2aඉහළ
RS-005c: ISO සහ ALA-LC c = ච යොදයි. අවිධිමත් ලිවීම ච සඳහා ch (95%) යොදයි, c යොදන්නේ 5%ක් පමණි; ක සඳහා c 1%කි§1a, §1d, §2aමධ්‍යම
RS-006ee: ISO 7-bit හි ee = ē (ඒ). අවිධිමත් ලිවීමේදී ee යනු ī සඳහා බහුලව යෙදෙන ලිවීමකි (ී = ee 38%). ē සඳහා එය කිසිසේත් වාගේ නොයෙදේ (ේ = ee ≈0%)§1a, §2aඉහළ
RS-007oo: ISO 7-bit හි oo = ō (ඕ). අවිධිමත් ලිවීමේදී oo යනු ū සඳහා ලිවීමකි (ූ = oo 22%). ō සඳහා එය යෙදෙන්නේ කලාතුරකිනි (ෝ = oo 2%)§1a, §2aඉහළ
RS-008ඇ: ISO හි æ වන අතර එහි 7-bit ආකෘතිය ae වේ; UN 1972 æ̆, ALA-LC ă, KNAB è. අවිධිමත් ලිවීම බොහෝ විට e හෝ a යොදයි, ae යොදන්නේ කලාතුරකිනි (වාක්‍යවල ැ = ae ≈0%)§1, §2aඉහළ
RS-009අවිධිමත් ලිවීම ස්වර දිග සලකුණු කරන්නේ කලාතුරකිනි (ා = a 97%, ී = i 58%). දිග සන්දර්භයෙන් හෝ ශබ්දකෝෂයකින් සොයාගත යුතුය§2a, §2bඉහළ
RS-010කතාබහ ශෛලියේ Singlish ස්වර විශාල වශයෙන් අතහරියි (nthi, mta, kynna). ප්‍රකාශිත ක්‍රම මෙයට මුහුණ දෙන්නේ ශබ්දකෝෂ, අවිනිශ්චිත ගැළපීම හෝ BERT මගිනි§2bඉහළ
RS-011ව: විධිමත් ක්‍රම v යොදයි. දේශීය භාවිතයේ w ලියන බව KNAB සඳහන් කරයි. අවිධිමත් ලිවීමද වාක්‍යවල w ට වැඩි කැමැත්තක් දක්වයි (72%)§1e, §2aඉහළ
RS-012සඤ්ඤක අකුරු: ISO සහ ජාතික ක්‍රමය ඒවා breve ලකුණකින් (n̆d, m̆b, n̆g) සලකුණු කරයි. KNAB මැද තිතකින් (·mba) සලකුණු කරයි. ALA-LC nda / ṃba / ṅga ලියයි. අවිධිමත් ලිවීම සලකුණු රහිත පොකුරක් යොදයි (nd 91%, mb 88%, ng 52%). එය න්ද, ම්බ, න්ග සමඟ අපැහැදිලිය§1, §2aඉහළ
RS-014ං: ISO ṁ, ජාතික ක්‍රමය ṅ, ALA-LC වර්ගයේ නාසිකය, KNAB ṁ (ń). අවිධිමත් ලිවීම n (91%) යොදයි. එය න් සඳහා යොදන n වලින් වෙන් කර හඳුනාගත නොහැක§1, §2aඉහළ
RS-017අවිධිමත් ලිවීමේදී ෘ ru ලෙස ලියයි (93%, r 7%); ISO r̥ යොදයි. ෘ ru ලෙස ලියන රෝමානුකරණයකට කෘ සහ ක්‍රු වෙන් කළ නොහැක (දෙකම kru වේ)§1a, §2aඉහළ
RS-018ඏ ඐ ෟ ෳ සඳහා අගයන් ඇත්තේ විධිමත් ක්‍රමවල පමණි (ISO l̥ / l̥̄, ජාතික ක්‍රමය සහ ALA-LC ḷ / ḹ). ඒවා ගැන අවිධිමත් දත්ත නැත§1, §2aඉහළ
RS-019හල් ලකුණ සඳහා කිසිවක් නොලියයි. ISO හි ් සඳහා සංකේතයක් නැත. අවිධිමත් ලිවීම ස්වරයක් පසුපසින් නොඑන ව්‍යඤ්ජනයක් කිසිදු සලකුණක් නැතිව තබයි (හල් ලකුණ ගම්‍ය වේ, විශේෂයෙන් වචන අගදී)§1a, §2aඉහළ
RS-020ISO සහ අවිධිමත් ලිවීම යන දෙකේම ආවේණික ස්වරය a ලෙස ලියයි (Dakshina හි 99%). කතාබහ පෙළේ මෙය බිඳ වැටේ (RS-010)§1a, §2aඉහළ
RS-024ශ / ෂ: ISO ś / ṣ, ජාතික ක්‍රමය ś / sh, UN 1972 sh / ṣh, KNAB sha / ṣha. අවිධිමත් ලිවීම දෙකටම sh යොදයි (85% / 91%)§1, §2aඉහළ
RS-025විධිමත් ක්‍රම මූර්ධජ අකුරු යටින් තිතකින් සලකුණු කරයි (ṭ ḍ ṇ ḷ). නාසික සහ පාර්ශ්වික (lateral) අකුරු සඳහා අවිධිමත් ලිවීම කිසිසේත් වෙනසක් නොකරයි (ණ = n 100%, ළ = l 100%)§1a, §2aඉහළ
RS-026ISO හි මෙන්ම අවිධිමත් ලිවීමේද ai = ඓ සහ au = ඖ වේ (ai 99%, au 97%). ජාතික ක්‍රමය දැන් ඓ සඳහා ĩ යොදයි§1a, §1b, §2aඉහළ
RS-029විධිමත් ක්‍රම නාසික අකුරු ගැන එකිනෙක සමඟ එකඟ නොවේ. ISO: ං = ṁ, ඞ = ṅ. ශ්‍රී ලංකා 2018+: ං = ṅ, ඞ = ṁ. ALA-LC: ං වර්ගයේ නාසිකය ගනී§1ඉහළ
RS-030d සම්බන්ධයෙන් යතුරුපුවරු ක්‍රම අවිධිමත් ලිවීමෙන් වෙනස් වේ. Wikimedia ආදාන මෙවලම්වල විවෘත Singlish යතුරු සිතියම (si-singlish, 2012) t ට / th ත රටාවටම d ඩ, dh ද, D ඪ, Dh ධ ලෙස ලියයි. පැරණි යතුරුපුවරු ක්‍රමද එයම භාවිත කරයි. අවිධිමත් ලිවීම d ද ලෙස කියවයි (RS-002), ලිඛිත පාඨයේ ද, ඩ ට වඩා 5 ගුණයක් පමණ සුලබය (CC-12). පරිවර්තකයක් පෙරනිමියෙන් d ද ලෙස ගෙන, යතුරුපුවරු සම්මුතිය විකල්පයක් ලෙස ලබා දිය යුතුය§2a, මූලාශ්‍රඉහළ

5. සම්මුති එකඟ වන තැන්: ශබ්දානුසාරී රෝමානුකරණයක් සඳහා නිර්දේශ ​

  1. විධිමත් සහ අවිධිමත් භාවිතය දැනටමත් පොදුවේ යොදන අගයන් ගන්න:
    • මූලික ව්‍යඤ්ජන ලෙස k g j p b m y r l s h f n
    • මහාප්‍රාණ ලෙස kh gh bh, සහ dh = ධ
    • d = ද (ISO සහ අවිධිමත් ලිවීම එකඟ වේ)
    • කෙටි ස්වර ලෙස a i u e o, සහ ai = ඓ, au = ඖ
    • ආවේණික ස්වරය a ලෙස ලිවීම, හල් ලකුණ නොලිවීම
  2. අවිධිමත් භාවිතය ISO ගෙන් වෙනස් වන තැන්වල, තීරණයක් ගෙන එය පැහැදිලිව සඳහන් කරන්න. වඩාත් පැහැදිලි අවස්ථා:
    • th = ත සහ t = ට (අවිධිමත්) එදිරිව t / ṭ (ISO)
    • ch = ච (අවිධිමත්) එදිරිව c (ISO)
    • ව සඳහා w (අවිධිමත්, KNAB හි දේශීය භාවිතය) එදිරිව v (විධිමත්)
    • ශ සහ ෂ දෙකටම sh (අවිධිමත්) එදිරිව ś / ṣ (විධිමත්)
  3. ස්වර දිග පැහැදිලිව සලකුණු කරන්න. ඒ සඳහා ee/oo නොයොදන්න. ā ī ū සඳහා aa ii uu (ISO 7-bit) යොදන්න. අවිධිමත්ව ලියන අයට ee සහ oo යනු ī/ū වේ. නමුත් ISO 7-bit හි ඒවා ē/ō වේ. එබැවින් ඒවා අපැහැදිලිය.
  4. ඇ / ඈ සඳහා ae / aee යොදන්න. මෙය ISO 7-bit ආකෘතියට ගැළපේ. අවිධිමත් e/a ලිවීම නිසා ඇ අකුර එ සහ අ සමඟ එක් වේ.
  5. රෝමානු පෙළෙන් නැවත එම සිංහල පෙළටම පැමිණිය යුතු නම් (round-trip), සඤ්ඤක අකුරු සහ අනුස්වාරය පැහැදිලිව සලකුණු කරන්න. සලකුණු රහිත nd, mb, ng සහ n යන ඒවා න්ද, ම්බ, න්ග සහ න් සමඟ අපැහැදිලිය. පෙර භාවිතය: ISO breve ලකුණ සහ KNAB හි මැද තිත.
  6. ං සහ ඞ සඳහා එක් සම්මුතියක් තෝරා එය ලේඛනගත කරන්න. මන්ද ISO සහ ජාතික ක්‍රමය ṁ සහ ṅ මාරු කර යොදයි.
  7. අවිධිමත් ලිවීම නොසලකා හරින හිඩැස් ආවරණය කරන්න: ෘ සහ ්‍රු අතර වෙනසක්, සහ ඏ ඐ ෟ ෳ සඳහා අගයන් (පෙර භාවිතය ඇත්තේ ISO සහ ALA-LC හි පමණි).

6. විසඳා නැති ප්‍රශ්න ​

  1. සැබෑ කතාබහ පෙළ (සමාජ මාධ්‍ය) සහ සැලකිල්ලෙන් කළ Dakshina රෝමානුකරණ අතර දිගු ස්වර සහ ඇ භාවිතය වෙනස් වන්නේ කෙසේද? කතාබහ පෙළ සංග්‍රහයක අකුරු අනුව ගණන් කිසිවක් ප්‍රකාශ කර නැත ❓.
  2. Dakshina Hugging Face පිටපත නිල නිකුතුවට සර්වසමද? ❓
  3. ALA-LC වගුව ගෙන ඇත්තේ interscript වෙතින් මිස LoC PDF ගොනුවෙන් නොවේ. 2011 ඇ අගය (ă ද æ ද යන්න) තහවුරු වී නැත ❓.

ඉවත් කළ RS සම්මුති ​

විෂය පථයෙන් බැහැර නිසා ඉවත් කළ ඒවා: RS-013, RS-015, RS-016, RS-021, RS-022, RS-023, RS-027, RS-028, RS-030, RS-031.


මූලාශ්‍ර ​

පෙළ සහ කේතය MIT බලපත්‍රය යටතේ නිකුත් කර ඇත. උපුටා දක්වන්න: doi:10.5281/zenodo.23244126.