06: සිංහල රෝමානුකරණය
මෙම ලේඛනය සිංහල ලතින් අකුරින් ලියන ආකාරය විමසා බලයි. එහි කොටස් දෙකක් ඇත: (a) විධිමත් රෝමානුකරණ ක්රම (ISO 15919 සහ එහි 7-bit ASCII ආකෘතිය, ශ්රී ලංකා ජාතික ක්රමය, UN 1972 වගුව, ALA-LC සහ KNAB), සහ (b) මිනිසුන් සැබවින්ම ලියන අවිධිමත් රෝමානුකරණය ("Singlish"). අවිධිමත් රෝමානුකරණය Dakshina පෙළ සංග්රහයේ (corpus) සිංහල කොටසින් මැන ඇති අතර, Singlish නැවත සිංහලට හැරවීම (back-transliteration) පිළිබඳ ප්රකාශිත පර්යේෂණ ඇසුරෙන් විස්තර කර ඇත. ලේඛනය අවසන් වන්නේ අකුරෙන් අකුර සැසඳීමකින්, සම්මුති මාලාවකින් (RS-xxx) සහ සිංහල ශබ්දානුසාරී රෝමානුකරණයක් සඳහා නිර්දේශවලිනි.
සම්පාදනය කළේ 2026 ඔක්තෝබර් මාසයේදීය.
සංකේත විස්තරය
| ලකුණ | අර්ථය |
|---|---|
| ✅ | ප්රාථමික මූලාශ්රයකින් ගත් දේ (සම්මතය, නිල වාර්තාවක් හෝ ප්රකාශිත සිතියම්ගත කිරීමේ වගුවක්) |
| 🧪 | පෙළ සංග්රහයකින් මැන ගත් දේ (Dakshina සිංහල දත්ත, §2a) |
| ❓ | තහවුරු වී නැත. මූලාශ්රය ඒ ගැන කිසිවක් නොකියයි, නැතහොත් අගය නිගමනයකි. එය සිතියම්ගත කිරීමක් (mapping) ලෙස නොසලකන්න |
| - | මෙහි භාවිත කළ මූලාශ්රවල මෙම අකුර සඳහා අගයක් සටහන් වී නැත |
එක් එක් RS සම්මුතියේ විශ්වාසය: ඉහළ (H) යනු ප්රාථමික මූලාශ්ර කිහිපයක් එකඟ වන බවයි. මධ්යම (M) යනු එක් ප්රාථමික මූලාශ්රයක් හෝ නිගමනයක් පමණක් ඇති බවයි. අඩු (L) යනු අනුමානයක් බවයි.
අකුරු හැඳුනුම් මෙම ගබඩාවේ (repository) අනෙක් ලේඛනවල ක්රමයම අනුගමනය කරයි. ව්යඤ්ජන: ka kha ga gha nga(ඞ) nnga(ඟ) ca cha ja jha nya(ඤ) jnya(ඥ) nyja(ඦ) tta ttha dda ddha nna nndda(ඬ) ta tha da dha na nda(ඳ) pa pha ba bha ma mba(ඹ) ya ra la va sha(ශ) ssa(ෂ) sa ha lla(ළ) fa; ස්වර: a aa ae aee i ii u uu ru ruu ilu iluu e ee ai o oo au; ලකුණු: hal anusvara visarga yansaya rakaransaya repaya.
සාරාංශය
- අවිධිමත් ලිවීමේදී
th= ත සහt= ට වේ. ත ලියන අවස්ථාවලින් 93%කthයෙදේ. ට ලියන අවස්ථාවලින් 99%කtයෙදේ. ISO 15919 ඊට ප්රතිවිරුද්ධවt= ත සහṭ= ට ලෙස යොදයි (RS-001). - අවිධිමත් ලිවීමේදී
dමූලිකවම ද අකුරයි. මිනිසුන් ද අකුරට (99%) සහ ඩ අකුරට (100%) යන දෙකටමdලියති. ධ සඳහා ඔවුහුdh(69%) වෙන් කර තබා ගනිති. මෙය ISO සමඟද එකඟ වේ (RS-002, RS-003). - අවිධිමත්
ee/ooයනු ī/ū මිස ē/ō නොවේ. ී ලියන අවස්ථාවලින් 38%කeeයෙදේ. ේ සඳහා එය කිසිසේත් වාගේ නොයෙදේ. ISO හි 7-bit ආකෘතියee/ooයොදන්නේ ē/ō සඳහාය (RS-006, RS-007). - ස්වර දිග සලකුණු කරන්නේ කලාතුරකිනි. ා ලියන අවස්ථාවලින් 97%ක
aයෙදේ. ී ලියන අවස්ථාවලින් 58%කiයෙදේ (RS-009). - විධිමත් ක්රම නාසික අකුරු ගැන එකඟ නොවේ. ISO, ශ්රී ලංකා ජාතික ක්රමය සහ ALA-LC යන ක්රම තුන ං සහ ඞ එකිනෙකට වෙනස් ලෙස රෝමානුකරණය කරයි (RS-029).
⚠️ වැරදීමට ඉඩ ඇති තැන්
| # | ගැටලුව | සම්මුතිය |
|---|---|---|
| 1 | අවිධිමත් ලිවීමේ kohomada යනු කොහොමද යන්නයි: මෙහි d යනු ද මිස ඩ නොවේ. d ඩ ලෙස කියවුවහොත් වැරදි වචනයක් ලැබේ | RS-002 |
| 2 | අවිධිමත් ලිවීමේ ee යනු ඊ/ී වේ (kireemata, pawathee). ISO 7-bit හි මෙන් ඒ නොවේ | RS-006 |
| 3 | අවිධිමත් ලිවීමේ oo යනු ඌ/ූ වේ (soodanam). ISO 7-bit හි මෙන් ඕ නොවේ | RS-007 |
| 4 | සලකුණු රහිත nd, mb, ng අපැහැදිලිය (ambiguous): න්ද හෝ ඳ, ම්බ හෝ ඹ, න්ග හෝ ඟ හෝ ංග. අවිධිමත් ලිවීමේදී සඤ්ඤක අකුරු සඳහා මේවා යොදයි (ඳ ලියන අවස්ථාවලින් 91%ක nd යෙදේ) | RS-012 |
| 5 | ං සඳහා අවිධිමත්ව යොදන n (91%) න් සඳහා යොදන n වලින් වෙන් කර හඳුනාගත නොහැක | RS-014 |
| 6 | ISO හි c යනු ච වේ. නමුත් අවිධිමත් ලිවීමේදී ච සඳහා ch යොදයි (95%) | RS-005 |
| 7 | කතාබහ (chat) ශෛලියේ Singlish ස්වර අතහරියි (nthi, mta, kynna). එබැවින් එක් ලිවීමකින් වචන කිහිපයක් අදහස් විය හැක | RS-010 |
| 8 | ඏ ඐ ෟ ෳ සඳහා අගයන් ඇත්තේ විධිමත් ක්රමවල පමණි. ඒවා ගැන අවිධිමත් දත්ත නැත | RS-018 |
1. විධිමත් රෝමානුකරණ ක්රම ✅
1a. ISO 15919 (2001) සහ එහි 7-bit ASCII ආකෘතිය
මූලාශ්රය: Wikipedia හි ISO 15919 වගුව, පිටුවේ මූල කේතයෙන් කියවා ඇත. https://en.wikipedia.org/wiki/ISO_15919. 7-bit ASCII ආකෘතිය වරහන් තුළ දැක්වේ.
- ස්වර: අ a · ආ ā (aa) · ඇ æ (ae) · ඈ ǣ (aee) · ඉ i · ඊ ī (ii) · උ u · ඌ ū (uu) · ඍ r̥ (,r) · ඎ r̥̄ (,rr) · ඏ l̥ (,l) · ඐ l̥̄ (,ll) · එ e · ඒ ē (ee) · ඓ ai · ඔ o · ඕ ō (oo) · ඖ au
- ව්යඤ්ජන: ක k · ඛ kh · ග g · ඝ gh · ඞ ṅ (;n) · ඟ n̆g (^ng) · ච c · ඡ ch · ජ j · ඣ jh · ඤ ñ (~n) · ඦ n̆j (^nj) · ට ṭ (.t) · ඨ ṭh · ඩ ḍ · ඪ ḍh · ණ ṇ · ඬ n̆ḍ (^n.d) · ත t · ථ th · ද d · ධ dh · න n · ඳ n̆d (^nd) · ප p · ඵ ph · බ b · භ bh · ම m · ඹ m̆b (^mb) · ය y · ර r · ල l · ළ ḷ (.l) · ව v · ශ ś (sh) · ෂ ṣ (.s) · ස s · හ h · ෆ f
- ලකුණු: ං ṁ (;m) · ඃ ḥ (.h) · ් සඳහා සංකේතයක් නැත
- ඥ වෙනම දක්වා නැත. සාමාන්යයෙන් එය jñ සංයුක්තය ලෙස රෝමානුකරණය කරයි ❓.
1b. ශ්රී ලංකා ජාතික ක්රමය (මිනින්දෝරු දෙපාර්තමේන්තුව; 2018 සැප්තැම්බර් 4 කැබිනට් මණ්ඩලය අනුමත කළ අතර පසුව සංශෝධනය කළේය)
මූලාශ්රය: UNGEGN Working Group on Romanization Systems වාර්තාව, v5.0, 2021 ඔක්තෝබර්. https://arhiiv.eki.ee/wgrs/rom2_si.htm. සිංහල සඳහා තවමත් UN අනුමත ක්රමයක් නොමැති බව වාර්තාවේ සඳහන් වේ.
- ISO මත පදනම් වුවත්, මෙම අගයන් වෙනස්ය:
- ඞ = ṁa සහ ං = ṅ (ISO හි මේවා මාරු වී ඇත)
- ඓ = ĩ (2018 දී එය ai විය)
- ඣ = qa (පෙර එය jha විය)
- ඨ = ṯa (පෙර එය ṭha විය)
- ෂ = sha, ශ = ś
- ඥ = gna
- ඹ = ḅa (පෙර එය m̆ba විය)
- ඦ = n̆ǰa
- ලැයිස්තුගත අනෙක් අගයන්: ඟ n̆ga · ඬ n̆ḍa · ඳ n̆da · ඇ æ · ඈ ǣ · ඏ ḷ · ඐ ḹ · ඍ ṛ · ඎ ṝ
- බැඳි ලකුණු (ligatures): ර් යනු r-, ්ර යනු -r, ්ය යනු -y. මිනින්දෝරු දෙපාර්තමේන්තුවේ මාර්ගගත පරිවර්තකය https://www.survey.gov.lk/RomanizationConverter/ හි ඇත.
1c. UN 1972 "Sharma" වගුව (කිසිදා අනුමත නොවූ)
මූලාශ්රය: interscript සිතියම un-sin-Sinh-Latn-1972. එය 1972 UN සමුළු ලේඛන උපුටා දක්වයි. https://github.com/interscript/maps
- කෙටි ස්වරවලට breve ලකුණක් ඇත: ඇ æ̆ · ඈ æ · එ ĕ · ඒ e · ඔ ŏ · ඕ o
- ච ch · ඡ chh · ශ sh · ෂ ṣh · ං ṁ · ඞ ṅ
1d. ALA-LC (Library of Congress) Sinhalese
මූලාශ්රය: interscript සිතියම් alalc-sin-Sinh-Latn-1997 සහ -2011. LoC PDF ගොනුව පරිශීලනය කර නැත. එබැවින් මෙහි විශ්වාසය මධ්යමය.
| ක්ෂේත්රය | ALA-LC 1997 |
|---|---|
| ස්වර | ඇ ă · ඈ â · ඏ ḷ · ඐ ḹ · ෟ ḷ · ෳ ḹ · දිගු ස්වර සඳහා ē / ō |
| ව්යඤ්ජන | ච ca · ඡ cha · ශ ś · ෂ ṣ |
| අනුස්වාරය | ං ṃ |
| සඤ්ඤක | ඟ ṅga · ඦ ñja · ඬ ṇḍa · ඳ nda · ඹ ṃba |
නීති:
- ALA-LC අනුස්වාරය ලියන්නේ ඊළඟ ව්යඤ්ජනයේ වර්ගයට අයත් නාසිකය ලෙසයි: ṅ, ñ, ṇ, n හෝ m.
- සඤ්ඤක අකුරකට පසු මහාප්රාණ අකුරක් ආවොත්, එය අල්පප්රාණ + මහාප්රාණ ලෙස ලියයි.
2011 පරීක්ෂණ පෙළ ඇ / ඈ සඳහා ă / â යොදයි.
1e. KNAB (එස්තෝනියානු ස්ථාන නාම දත්ත සමුදාය), 1989
මූලාශ්රය: https://arhiiv.eki.ee/knab/lat/kblsi1.pdf
- ස්වර: ඇ è · ඈ ê · එ ĕ · ඒ e
- ව්යඤ්ජන: ච cha · ශ sha · ෂ ṣha
- ං ṁ (ń)
- එය සඤ්ඤක අකුරු මැද තිතකින් සලකුණු කරයි (·mba).
- දේශීය භාවිතයේදී è / ê, e ලෙසත් v, w ලෙසත් ලියන බව එහි සඳහන් වේ.
2. අවිධිමත් Singlish: මිනිසුන් සිංහල ලතින් අකුරින් සැබවින්ම ලියන ආකාරය
2a. මැන ගත් දත්ත: Dakshina පෙළ සංග්රහය, සිංහල කොටස 🧪
පෙළ සංග්රහය: සිංහල මව් බස ලෙස කතා කරන අය රෝමානුකරණය කළ Wikipedia වාක්ය 10,000ක් (Roark et al., LREC 2020), සහ භාවිතයේ හමු වූ ප්රභේද (variants) ඇතුළත් ශබ්දකෝෂයක් (lexicon). භාවිත කළේ නිල Dakshina v1.0 නිකුතුවේ සිංහල ගොනු ය. ඒවා hash අගයකින් ස්ථිර කර ඇත.
ක්රමය: tools/corpus_counts.py (tools/dakshina_counts.py සමඟ) එක් එක් සිංහල වචනය අකුරු සහ ලකුණුවලට බෙදා, එක් එක් අකුරට ඇති පුළුල් ලිවීම් කට්ටලයක් මත ගතික ක්රමලේඛනයෙන් (dynamic programming) එහි රෝමානුකරණය සමඟ පෙළගස්වයි. ලිවීම්වල සම්භාවිතා පෙළගැස්වීම්වලින් වට හතරක් නැවත ඇස්තමේන්තු කරන බැවින්, ගණන් අතින් ලියූ වගුවක පිළිවෙළ මත රඳා නොපවතී. ප්රතිශත යනු එක් එක් අකුරේ පෙළගැසුණු යෙදීම්වලින් කොටසයි (reports/corpus-counts.md හි CC-17 සහ CC-18).
- "වාක්ය" = වාක්යවල ඇති වචන (tokens): 139,154න් 127,072ක් පෙළගැසුණි (ඉලක්කම් හෝ සිංහල අකුරක් නැති ටෝකන ඉවත් කළේය).
- "ශබ්දකෝෂ ප්රභේද" = ශබ්දකෝෂයේ ප්රභේද, ලකුණු කළ අය ගණනින් බර කළ: 93,505න් 88,994ක් පෙළගැසුණි.
| අකුර | වාක්ය | ශබ්දකෝෂ ප්රභේද |
|---|---|---|
| ක | k 99%, c 1% | k 99% |
| ඛ / ඝ | kh 71%, k 29% / gh 70%, g 30% | kh 94%, k 6% / gh 93%, g 7% |
| ඟ | ng 52%, g 48% | ng 85%, g 15% |
| ච / ඡ | ch 95%, c 5% / ch 98%, chh 1% | ch 59%, c 41% / ch 99% |
| ජ | j 100% | j 100% |
| ඤ / ඥ | n 70%, gn 30% / gn 98%, kn 1% | n 82%, gn 16%, kn 1% / gn 94%, ny 4%, gy 2% |
| ට / ඨ | t 99% / t 92%, th 8% | t 99% / th 81%, t 19% |
| ඩ / ඪ | d 100% / d 73%, dh 27% | d 99% / dh 70%, d 30% |
| ණ | n 100% | n 100% |
| ඬ | nd 83%, d 17% | nd 91%, d 9% |
| ත / ථ | th 93%, t 7% / th 100% | th 51%, t 49% / th 96%, t 4% |
| ද / ධ | d 99% / dh 69%, d 31% | d 97%, dh 3% / dh 94%, d 6% |
| ඳ | nd 91%, d 9% | nd 82%, d 12%, dh 4% |
| ඵ / භ | p 56%, ph 44% / bh 91%, b 9% | ph 83%, p 17% / bh 89%, b 11% |
| ඹ | mb 88%, b 11% | mb 93%, b 7% |
| ව | w 72%, v 28% | v 83%, w 17% |
| ශ / ෂ | sh 85%, s 15% / sh 91%, s 9% | s 53%, sh 47% / sh 52%, s 48% |
| ළ | l 100% | l 100% |
| ෆ | f 87%, ph 13% | f 90%, ph 10% |
| inherent a | a 99% | a 100% |
| ා | a 97%, aa 3% | a 95%, aa 5% |
| ැ / ඇ | e 64%, a 36%, ae ≈0% / a 60%, e 40%, ae ≈0% | a 45%, ae 43%, e 12% / a 53%, ae 39%, e 8% |
| ෑ | e 68%, a 29%, aa 3% | a 49%, ae 36%, e 10% |
| ී / ඊ | i 58%, ee 38%, ii 2% / i 72%, ee 27% | i 83%, ee 15% / i 99% |
| ූ / ඌ | u 73%, oo 22%, uu 5% / u 94%, uu 6% | u 93%, oo 6% / u 100% |
| ේ / ඒ | e 100% / e 99%, ee 1% | e 99% / e 100% |
| ෝ / ඕ | o 98%, oo 2% / o 97%, oo 3% | o 100% / o 100% |
| ෘ | ru 93%, r 7% | r 55%, ru 45% |
| ෛ / ඓ | ai 99%, ei 1% / ai 89%, ei 11% | ai 99% / ai 100% |
| ෞ / ඖ | au 97%, ou 3% / au 89%, ow 7%, ou 4% | au 97%, ou 2%, ow 1% / au 100% |
| ං | n 91%, ng 6%, m 3% | n 60%, m 34%, ng 6% |
අවවාද:
- මේවා ඉල්ලීම මත සැලකිල්ලෙන් රෝමානුකරණය කළ Wikipedia වාක්ය මිස කතාබහ පෙළ නොවේ. කතාබහේදී ස්වර බොහෝ වැඩියෙන් අතහැරේ (§2b).
- ශබ්දකෝෂයේ ත සඳහා th/t ආසන්න වශයෙන් 50/50 ලෙස බෙදේ. එබැවින් සමහර විවරණකරුවන් (annotators) ත සඳහා ISO වැනි සාමාන්ය
tයොදා ඇත.
2b. Singlish නැවත සිංහලට හැරවීම පිළිබඳ පර්යේෂණ පත්රිකා
- Athukorala & Sumanathilaka, "Swa Bhasha: Message-Based Singlish to Sinhala Transliteration" (2022 / 2024). https://arxiv.org/abs/2404.13350
- ලියන්නන් ස්වර අතහරිති. එක් වචනයක් kiyanna, kianna, kynna, kynn සහ kiynna ලෙස දිස් වේ.
- කතුවරුන් මෙය සංඛ්යාත්මක අකුරු කේත සහ අවිනිශ්චිත ගැළපීම (fuzzy matching) මගින් විසඳති.
- නීති පදනම් කරගත් පරිවර්තකවලට ස්වර ලියා තිබීම අවශ්ය බව ඔවුහු සඳහන් කරති. තම ක්රමය දැනට පවතින මෙවලම් සමඟද සසඳති.
- Perera, Prabhath, Sumanathilaka, Anuradha, "IndoNLP 2025 Shared Task: Romanized Sinhala to Sinhala Reverse Transliteration Using BERT" (2025). https://aclanthology.org/2025.indonlp-1.16.pdf
- ඔවුන් මෙම රෝමානුකරණය හඳුන්වන්නේ "ad-hoc" ලෙසයි. එහි ස්වර අතහැර ලියයි. උදාහරණයක් ලෙස තාත්තා යන්න Thaaththaa, Thaththa, Thattha, Thatta හෝ Tatta ලෙස ලියයි.
- ඔවුන්ගේ ක්රමය ශබ්දකෝෂයක්, ශබ්දකෝෂයේ නැති වචන සඳහා නීති, සහ අපැහැදිලි තැන් සඳහා BERT එකට යොදයි.
- 2 වන පරීක්ෂණ කට්ටලය බොහෝ දුරට ස්වර රහිත ආදානයෙන් සමන්විතය.
- Perera & Sumanathilaka, "Evaluating Transliteration Ambiguity in Adhoc Romanized Sinhala" (RANLP 2025). https://aclanthology.org/2025.ranlp-1.107.pdf
- සිංහල වචන දෙකකට බැගින් ගැළපෙන රෝමානු වචන 22ක්.
- උදාහරණ:
nthiනීති/නැති ·mtaමට/මීට ·esඇස/එසේ ·edaඇද/එදා ·balaබල/බාල ·baduබඩු/බදු ·udඋඩ/උදේ ·dnnaදන්නා/දෙන්නා ·oyaඔය/ඔයා. - මේවායින් කරුණු තුනක් පෙනේ: ස්වර දිග සලකුණු නොකිරීම, ඇ සහ එ එකම ලිවීමකට එක්වීම, සහ
dයනු ඩ අකුරද ද අකුරද යන්න අපැහැදිලි වීම.
- Sumanathilaka et al., "Swa-bhasha Resource Hub" (arXiv 2507.09245, 2025). https://arxiv.org/abs/2507.09245
- 2020–2025 කාලයේ ක්රම සහ දත්ත කට්ටල පිළිබඳ සමීක්ෂණයකි.
- Singlish සම්මතකරණය වී නැත. එහි බොහෝ විට ස්වර අතහැර ලියයි.
- ස්වර රහිත ආදානයේදී Swa Bhasha, පවතින මෙවලම්වලට සහ නීති පදනම් කරගත් පරිවර්තකවලට වඩා හොඳින් ක්රියා කරයි.
2c. එදිනෙදා ලිවීම්
mama, oya/oyaa, kohomada (ද සඳහා d), ayubowan, ganna, thiyenawa (ත සඳහා th, දිග ලකුණක් නැත), amma/ammaa, thaththa, api, eka, ekka, mokada, honda (ඳ සඳහා nd), lassana, sinhala/lanka (ං සඳහා n), wenawa/venava, karanna, kiyanna.
3. අකුරෙන් අකුර සැසඳීම
තීරු පිළිබඳ සටහන්:
- ව්යඤ්ජන ආවේණික ස්වරය නොමැතිව දක්වා ඇත (ජාතික ක්රමයේ සහ ALA-LC මූලාශ්රවල එය ලියා ඇත, උදා. ṁa, ca).
- ISO 7-bit: §1a හි වරහන් තුළ ඇති අගයන්. ISO අගය දැනටමත් සාමාන්ය ASCII නම්, 7-bit ආකෘතියද එයම වේ.
- ශ්රී ලංකා ජාතික සහ ALA-LC: මූලාශ්ර ලැයිස්තුගත කරන අගයන් පමණි (§1b, §1d). "-" යන්නෙන් අදහස් වන්නේ මෙහි භාවිත කළ මූලාශ්ර උපුටනයේ අගයක් නැති බවයි. අකුර නැති බව නොවේ.
- අවිධිමත්: Dakshina වාක්යවල (§2a) වැඩිපුරම යෙදෙන ලිවීම සහ එහි ප්රතිශතය. ප්රතිශතයක් දී නැති තැන්වල, එම ලිවීම ගෙන ඇත්තේ ප්රතිශත ප්රකාශ නොකළ, අකුරෙන් අකුර දුන් සාරාංශයෙනි.
n = …මගින් ඉතා කුඩා ගණන් දැක්වේ.
ව්යඤ්ජන
| ID | සිංහල | ISO 15919 | ISO 7-bit | ශ්රී ලංකා ජාතික | ALA-LC | අවිධිමත් 🧪 |
|---|---|---|---|---|---|---|
| ka | ක | k | k | - | - | k 99% |
| kha | ඛ | kh | kh | - | - | kh 71% (k 29%) |
| ga | ග | g | g | - | - | g |
| gha | ඝ | gh | gh | - | - | gh 70% (g 30%) |
| nga | ඞ | ṅ | ;n | ṁ | - | - (no data) |
| nnga | ඟ | n̆g | ^ng | n̆g | ṅg | ng 52% (g 48%) |
| ca | ච | c | c | - | c | ch 95% |
| cha | ඡ | ch | ch | - | ch | ch 98% |
| ja | ජ | j | j | - | - | j 100% |
| jha | ඣ | jh | jh | q | - | jh (n = 4) |
| nya | ඤ | ñ | ~n | - | - | n 70% (gn 30%) |
| jnya | ඥ | jñ ❓ | - | gn | - | gn 98% |
| nyja | ඦ | n̆j | ^nj | n̆ǰ | ñj | - (no data) |
| tta | ට | ṭ | .t | - | - | t 99% |
| ttha | ඨ | ṭh | - | ṯ | - | t 92% |
| dda | ඩ | ḍ | - | - | - | d 100% |
| ddha | ඪ | ḍh | - | - | - | d 73% (dh 27%) |
| nna | ණ | ṇ | - | - | - | n 100% |
| nndda | ඬ | n̆ḍ | ^n.d | n̆ḍ | ṇḍ | nd 83% (d 17%) |
| ta | ත | t | t | - | - | th 93% |
| tha | ථ | th | th | - | - | th 100% |
| da | ද | d | d | - | - | d 99% |
| dha | ධ | dh | dh | - | - | dh 69% (d 31%) |
| na | න | n | n | - | - | n |
| nda | ඳ | n̆d | ^nd | n̆d | nd | nd 91% |
| pa | ප | p | p | - | - | p |
| pha | ඵ | ph | ph | - | - | p 56% (ph 44%) |
| ba | බ | b | b | - | - | b |
| bha | භ | bh | bh | - | - | bh 91% |
| ma | ම | m | m | - | - | m |
| mba | ඹ | m̆b | ^mb | ḅ | ṃb | mb 88% (b 11%) |
| ya | ය | y | y | - | - | y |
| ra | ර | r | r | - | - | r |
| la | ල | l | l | - | - | l |
| va | ව | v | v | - | - | w 72% (v 28%) |
| sha | ශ | ś | sh | ś | ś | sh 85% (s 15%) |
| ssa | ෂ | ṣ | .s | sh | ṣ | sh 91% |
| sa | ස | s | s | - | - | s |
| ha | හ | h | h | - | - | h |
| lla | ළ | ḷ | .l | - | - | l 100% |
| fa | ෆ | f | f | - | - | f 87% (ph 13%) |
ස්වර (ස්වතන්ත්ර ස්වරය / ස්වර ලකුණ) සහ ලකුණු
| ID | සිංහල | ISO 15919 | ISO 7-bit | ශ්රී ලංකා ජාතික | ALA-LC | අවිධිමත් 🧪 |
|---|---|---|---|---|---|---|
| a | අ / (ආවේණික) | a | a | - | - | a 99% |
| aa | ආ / ා | ā | aa | - | - | a 97% |
| ae | ඇ / ැ | æ | ae | æ | ă | ැ e 64%; ඇ a 60% |
| aee | ඈ / ෑ | ǣ | aee | ǣ | â | e 68% (a 29%) |
| i | ඉ / ි | i | i | - | - | i |
| ii | ඊ / ී | ī | ii | - | - | i 58% (ee 38%) |
| u | උ / ු | u | u | - | - | u |
| uu | ඌ / ූ | ū | uu | - | - | u 73% (oo 22%) |
| ru | ඍ / ෘ | r̥ | ,r | ṛ | - | ru 93% |
| ruu | ඎ / ෲ | r̥̄ | ,rr | ṝ | - | ru (n = 7) |
| ilu | ඏ / ෟ | l̥ | ,l | ḷ | ḷ | - (no data) |
| iluu | ඐ / ෳ | l̥̄ | ,ll | ḹ | ḹ | - (no data) |
| e | එ / ෙ | e | e | - | - | e |
| ee | ඒ / ේ | ē | ee | - | ē | e 100% |
| ai | ඓ / ෛ | ai | ai | ĩ | - | ai 99% |
| o | ඔ / ො | o | o | - | - | o |
| oo | ඕ / ෝ | ō | oo | - | ō | o 98% |
| au | ඖ / ෞ | au | au | - | - | au 97% |
| hal | ් | (නැත) | (නැත) | - | - | not written (implied at end of word) |
| anusvara | ං | ṁ | ;m | ṅ | ṃ (වර්ගයේ නාසිකය) | n 91% |
| visarga | ඃ | ḥ | .h | - | - | h (n = 1) |
| yansaya | ්ය | -y | -y | -y | - | y |
| rakaransaya | ්ර | -r | -r | -r | - | r |
| repaya | ර් | r- | r- | r- | - | r |
4. සම්මුති (RS-xxx)
| ID | සම්මුතිය / ගැටුම | සාක්ෂි | විශ්වාසය |
|---|---|---|---|
| RS-001 | අවිධිමත් ලිවීමේදී th = ත සහ t = ට වේ: ත 93%ක් th ලෙසත්, ට 99%ක් t ලෙසත් ලියයි. ISO 15919 සලකුණු රහිත t = ත සහ ṭ = ට යොදයි. ශබ්දකෝෂයේ සමහර විවරණකරුවන්ද එය අනුගමනය කරති (ශබ්දකෝෂයේ ත සඳහා th/t ආසන්න වශයෙන් 50/50 ලෙස බෙදේ) | §1a, §2a | ඉහළ |
| RS-002 | අවිධිමත් ලිවීමේදී d අපැහැදිලිය. මිනිසුන් ද අකුරට (99%) සහ ඩ අකුරට (100%) යන දෙකටම d ලියති. ISO ඒවා වෙන් කරයි (d = ද, ḍ = ඩ). RANLP යුගලය වන badu බඩු/බදු මෙම අපැහැදිලිතාව ප්රායෝගිකව පෙන්වයි | §1a, §2a, §2b | ඉහළ |
| RS-003 | dh = ධ. ISO dh = ධ යොදයි. අවිධිමත් ලිවීමද එයට එකඟ වේ (වාක්යවල 69%, ශබ්දකෝෂයේ 94%) | §1a, §2a | ඉහළ |
| RS-004 | ISO මහාප්රාණ අකුරු සලකුණු කරන්නේ මූලික අකුරට h එක් කිරීමෙනි (ch = ඡ, th = ථ). අවිධිමත් ලිවීම මහාප්රාණ අකුරු ඒවායේ අල්පප්රාණ අකුරුවලින් වෙන් කරන්නේ ඉතා අල්ප වශයෙනි: ථ සහ ත දෙකම th වේ, ඨ බොහෝ විට t වේ, ඪ බොහෝ විට d වේ | §1a, §2a | ඉහළ |
| RS-005 | c: ISO සහ ALA-LC c = ච යොදයි. අවිධිමත් ලිවීම ච සඳහා ch (95%) යොදයි, c යොදන්නේ 5%ක් පමණි; ක සඳහා c 1%කි | §1a, §1d, §2a | මධ්යම |
| RS-006 | ee: ISO 7-bit හි ee = ē (ඒ). අවිධිමත් ලිවීමේදී ee යනු ī සඳහා බහුලව යෙදෙන ලිවීමකි (ී = ee 38%). ē සඳහා එය කිසිසේත් වාගේ නොයෙදේ (ේ = ee ≈0%) | §1a, §2a | ඉහළ |
| RS-007 | oo: ISO 7-bit හි oo = ō (ඕ). අවිධිමත් ලිවීමේදී oo යනු ū සඳහා ලිවීමකි (ූ = oo 22%). ō සඳහා එය යෙදෙන්නේ කලාතුරකිනි (ෝ = oo 2%) | §1a, §2a | ඉහළ |
| RS-008 | ඇ: ISO හි æ වන අතර එහි 7-bit ආකෘතිය ae වේ; UN 1972 æ̆, ALA-LC ă, KNAB è. අවිධිමත් ලිවීම බොහෝ විට e හෝ a යොදයි, ae යොදන්නේ කලාතුරකිනි (වාක්යවල ැ = ae ≈0%) | §1, §2a | ඉහළ |
| RS-009 | අවිධිමත් ලිවීම ස්වර දිග සලකුණු කරන්නේ කලාතුරකිනි (ා = a 97%, ී = i 58%). දිග සන්දර්භයෙන් හෝ ශබ්දකෝෂයකින් සොයාගත යුතුය | §2a, §2b | ඉහළ |
| RS-010 | කතාබහ ශෛලියේ Singlish ස්වර විශාල වශයෙන් අතහරියි (nthi, mta, kynna). ප්රකාශිත ක්රම මෙයට මුහුණ දෙන්නේ ශබ්දකෝෂ, අවිනිශ්චිත ගැළපීම හෝ BERT මගිනි | §2b | ඉහළ |
| RS-011 | ව: විධිමත් ක්රම v යොදයි. දේශීය භාවිතයේ w ලියන බව KNAB සඳහන් කරයි. අවිධිමත් ලිවීමද වාක්යවල w ට වැඩි කැමැත්තක් දක්වයි (72%) | §1e, §2a | ඉහළ |
| RS-012 | සඤ්ඤක අකුරු: ISO සහ ජාතික ක්රමය ඒවා breve ලකුණකින් (n̆d, m̆b, n̆g) සලකුණු කරයි. KNAB මැද තිතකින් (·mba) සලකුණු කරයි. ALA-LC nda / ṃba / ṅga ලියයි. අවිධිමත් ලිවීම සලකුණු රහිත පොකුරක් යොදයි (nd 91%, mb 88%, ng 52%). එය න්ද, ම්බ, න්ග සමඟ අපැහැදිලිය | §1, §2a | ඉහළ |
| RS-014 | ං: ISO ṁ, ජාතික ක්රමය ṅ, ALA-LC වර්ගයේ නාසිකය, KNAB ṁ (ń). අවිධිමත් ලිවීම n (91%) යොදයි. එය න් සඳහා යොදන n වලින් වෙන් කර හඳුනාගත නොහැක | §1, §2a | ඉහළ |
| RS-017 | අවිධිමත් ලිවීමේදී ෘ ru ලෙස ලියයි (93%, r 7%); ISO r̥ යොදයි. ෘ ru ලෙස ලියන රෝමානුකරණයකට කෘ සහ ක්රු වෙන් කළ නොහැක (දෙකම kru වේ) | §1a, §2a | ඉහළ |
| RS-018 | ඏ ඐ ෟ ෳ සඳහා අගයන් ඇත්තේ විධිමත් ක්රමවල පමණි (ISO l̥ / l̥̄, ජාතික ක්රමය සහ ALA-LC ḷ / ḹ). ඒවා ගැන අවිධිමත් දත්ත නැත | §1, §2a | ඉහළ |
| RS-019 | හල් ලකුණ සඳහා කිසිවක් නොලියයි. ISO හි ් සඳහා සංකේතයක් නැත. අවිධිමත් ලිවීම ස්වරයක් පසුපසින් නොඑන ව්යඤ්ජනයක් කිසිදු සලකුණක් නැතිව තබයි (හල් ලකුණ ගම්ය වේ, විශේෂයෙන් වචන අගදී) | §1a, §2a | ඉහළ |
| RS-020 | ISO සහ අවිධිමත් ලිවීම යන දෙකේම ආවේණික ස්වරය a ලෙස ලියයි (Dakshina හි 99%). කතාබහ පෙළේ මෙය බිඳ වැටේ (RS-010) | §1a, §2a | ඉහළ |
| RS-024 | ශ / ෂ: ISO ś / ṣ, ජාතික ක්රමය ś / sh, UN 1972 sh / ṣh, KNAB sha / ṣha. අවිධිමත් ලිවීම දෙකටම sh යොදයි (85% / 91%) | §1, §2a | ඉහළ |
| RS-025 | විධිමත් ක්රම මූර්ධජ අකුරු යටින් තිතකින් සලකුණු කරයි (ṭ ḍ ṇ ḷ). නාසික සහ පාර්ශ්වික (lateral) අකුරු සඳහා අවිධිමත් ලිවීම කිසිසේත් වෙනසක් නොකරයි (ණ = n 100%, ළ = l 100%) | §1a, §2a | ඉහළ |
| RS-026 | ISO හි මෙන්ම අවිධිමත් ලිවීමේද ai = ඓ සහ au = ඖ වේ (ai 99%, au 97%). ජාතික ක්රමය දැන් ඓ සඳහා ĩ යොදයි | §1a, §1b, §2a | ඉහළ |
| RS-029 | විධිමත් ක්රම නාසික අකුරු ගැන එකිනෙක සමඟ එකඟ නොවේ. ISO: ං = ṁ, ඞ = ṅ. ශ්රී ලංකා 2018+: ං = ṅ, ඞ = ṁ. ALA-LC: ං වර්ගයේ නාසිකය ගනී | §1 | ඉහළ |
| RS-030 | d සම්බන්ධයෙන් යතුරුපුවරු ක්රම අවිධිමත් ලිවීමෙන් වෙනස් වේ. Wikimedia ආදාන මෙවලම්වල විවෘත Singlish යතුරු සිතියම (si-singlish, 2012) t ට / th ත රටාවටම d ඩ, dh ද, D ඪ, Dh ධ ලෙස ලියයි. පැරණි යතුරුපුවරු ක්රමද එයම භාවිත කරයි. අවිධිමත් ලිවීම d ද ලෙස කියවයි (RS-002), ලිඛිත පාඨයේ ද, ඩ ට වඩා 5 ගුණයක් පමණ සුලබය (CC-12). පරිවර්තකයක් පෙරනිමියෙන් d ද ලෙස ගෙන, යතුරුපුවරු සම්මුතිය විකල්පයක් ලෙස ලබා දිය යුතුය | §2a, මූලාශ්ර | ඉහළ |
5. සම්මුති එකඟ වන තැන්: ශබ්දානුසාරී රෝමානුකරණයක් සඳහා නිර්දේශ
- විධිමත් සහ අවිධිමත් භාවිතය දැනටමත් පොදුවේ යොදන අගයන් ගන්න:
- මූලික ව්යඤ්ජන ලෙස
k g j p b m y r l s h f n - මහාප්රාණ ලෙස
kh gh bh, සහdh= ධ d= ද (ISO සහ අවිධිමත් ලිවීම එකඟ වේ)- කෙටි ස්වර ලෙස
a i u e o, සහai= ඓ,au= ඖ - ආවේණික ස්වරය
aලෙස ලිවීම, හල් ලකුණ නොලිවීම
- මූලික ව්යඤ්ජන ලෙස
- අවිධිමත් භාවිතය ISO ගෙන් වෙනස් වන තැන්වල, තීරණයක් ගෙන එය පැහැදිලිව සඳහන් කරන්න. වඩාත් පැහැදිලි අවස්ථා:
th= ත සහt= ට (අවිධිමත්) එදිරිවt/ṭ(ISO)ch= ච (අවිධිමත්) එදිරිවc(ISO)- ව සඳහා
w(අවිධිමත්, KNAB හි දේශීය භාවිතය) එදිරිවv(විධිමත්) - ශ සහ ෂ දෙකටම
sh(අවිධිමත්) එදිරිව ś / ṣ (විධිමත්)
- ස්වර දිග පැහැදිලිව සලකුණු කරන්න. ඒ සඳහා
ee/ooනොයොදන්න. ā ī ū සඳහාaa ii uu(ISO 7-bit) යොදන්න. අවිධිමත්ව ලියන අයටeeසහooයනු ī/ū වේ. නමුත් ISO 7-bit හි ඒවා ē/ō වේ. එබැවින් ඒවා අපැහැදිලිය. - ඇ / ඈ සඳහා
ae/aeeයොදන්න. මෙය ISO 7-bit ආකෘතියට ගැළපේ. අවිධිමත්e/aලිවීම නිසා ඇ අකුර එ සහ අ සමඟ එක් වේ. - රෝමානු පෙළෙන් නැවත එම සිංහල පෙළටම පැමිණිය යුතු නම් (round-trip), සඤ්ඤක අකුරු සහ අනුස්වාරය පැහැදිලිව සලකුණු කරන්න. සලකුණු රහිත
nd,mb,ngසහnයන ඒවා න්ද, ම්බ, න්ග සහ න් සමඟ අපැහැදිලිය. පෙර භාවිතය: ISO breve ලකුණ සහ KNAB හි මැද තිත. - ං සහ ඞ සඳහා එක් සම්මුතියක් තෝරා එය ලේඛනගත කරන්න. මන්ද ISO සහ ජාතික ක්රමය ṁ සහ ṅ මාරු කර යොදයි.
- අවිධිමත් ලිවීම නොසලකා හරින හිඩැස් ආවරණය කරන්න: ෘ සහ ්රු අතර වෙනසක්, සහ ඏ ඐ ෟ ෳ සඳහා අගයන් (පෙර භාවිතය ඇත්තේ ISO සහ ALA-LC හි පමණි).
6. විසඳා නැති ප්රශ්න
- සැබෑ කතාබහ පෙළ (සමාජ මාධ්ය) සහ සැලකිල්ලෙන් කළ Dakshina රෝමානුකරණ අතර දිගු ස්වර සහ ඇ භාවිතය වෙනස් වන්නේ කෙසේද? කතාබහ පෙළ සංග්රහයක අකුරු අනුව ගණන් කිසිවක් ප්රකාශ කර නැත ❓.
- Dakshina Hugging Face පිටපත නිල නිකුතුවට සර්වසමද? ❓
- ALA-LC වගුව ගෙන ඇත්තේ interscript වෙතින් මිස LoC PDF ගොනුවෙන් නොවේ. 2011 ඇ අගය (ă ද æ ද යන්න) තහවුරු වී නැත ❓.
ඉවත් කළ RS සම්මුති
විෂය පථයෙන් බැහැර නිසා ඉවත් කළ ඒවා: RS-013, RS-015, RS-016, RS-021, RS-022, RS-023, RS-027, RS-028, RS-030, RS-031.
මූලාශ්ර
- ISO 15919: https://en.wikipedia.org/wiki/ISO_15919
- UNGEGN WGRS Sinhala report v5.0 (2021): https://arhiiv.eki.ee/wgrs/rom2_si.htm · මිනින්දෝරු දෙපාර්තමේන්තුවේ පරිවර්තකය: https://www.survey.gov.lk/RomanizationConverter/
- Interscript සිතියම් (UN 1972, ALA-LC 1997 / 2011): https://github.com/interscript/maps
- KNAB 1989: https://arhiiv.eki.ee/knab/lat/kblsi1.pdf
- Dakshina (Roark et al., LREC 2020), v1.0 නිල නිකුතුව: https://github.com/google-research-datasets/dakshina
- Athukorala & Sumanathilaka, Swa Bhasha: https://arxiv.org/abs/2404.13350
- Perera, Prabhath, Sumanathilaka & Anuradha, IndoNLP 2025: https://aclanthology.org/2025.indonlp-1.16.pdf
- Perera & Sumanathilaka, RANLP 2025: https://aclanthology.org/2025.ranlp-1.107.pdf
- Sumanathilaka et al., Swa-bhasha Resource Hub: https://arxiv.org/abs/2507.09245
- Wikimedia jquery.ime, si-singlish keymap (2012): https://github.com/wikimedia/jquery.ime/blob/master/rules/si/si-singlish.js