07: ව්යාකරණානුකූල සිංහල ශබ්දානුසාරී රෝමානුකරණයක්
මෙම ලේඛනය සිංහල සඳහා ශබ්දානුසාරී රෝමානුකරණයක් (phonetic romanization) නිර්වචනය කරයි. එය ලතින් අකුරු අනුක්රම (sequences) සහ පරිවර්තන නීති මාලාවකි. මේවා රෝමානු පෙළ සිංහල අකුරු බවට හරවයි. සෑම ප්රතිඵලයක්ම 00-rules.md හි අක්ෂර වින්යාස නීතිවලට අනුකූල වන ලෙසත්, සිංහල අවිධිමත්ව ලතින් අකුරින් ලියන ආකාරයට (06-romanization.md) සමීප වන ලෙසත් එය සැලසුම් කර ඇත. සම්පාදනය: 2026 ඔක්තෝබර්.
යොමු ක්රියාත්මක කිරීම (reference implementation) src/sinhala_orthography/romanization.py ය. අනුක්රම වගු src/sinhala_orthography/data/{consonants,vowels,specials}.json වේ.
⚠️ ඔබව පුදුමයට පත් කරන කරුණු
| සම්මුතිය | උදාහරණය | |
|---|---|---|
| 1 | කුඩා t මූර්ධජ වන නමුත් කුඩා d දන්තජ වේ. මෙය අවිධිමත් භාවිතයට ගැළපේ | t ට, th ත · d ද, D ඩ |
| 2 | ai සහ au ලියන්නේ ෛ / ෞ ලෙස නොව අර්ධ ස්වරයක් සමඟය | lait → ලයිට්, kauda → කවුද |
| 3 | ව්යඤ්ජනයකට වහාම පසු එන ru / ruu, සුලබ ලිවීම වන ෘ / ෲ ලෙස ලියයි; රකාරාංශය + ු / ූ විකල්පයකි | kruura → කෲර, mrudu → මෘදු, karu → කරු |
| 4 | කණ්ඨජ අකුරකට පෙර කුඩා n, ං බවට පත් වේ | lankaava → ලංකාව |
| 5 | රේඵය පෙරනිමියෙන් සාමාන්ය ර් වේ | karma → කර්ම, kaarya → කාර්ය |
| 6 | නීතියෙන් තහනම් රූපයක් කිසි විටෙක නොනිපදවයි; ඒ වෙනුවට වලංගු ආදේශක රූපයක් යොදයි | kazd → කඳ (ඳ ට හල් නැත), Ba → බ (වචන මුලදී ඹ නැත) |
| 7 | ලොකු/කුඩා අකුරු භේදය වැදගත්ය: ලොකු අකුරු (capitals) මූර්ධජ, මහාප්රාණ, ඇ/ඈ සහ ද්විස්වර (diphthong) අකුරු සලකුණු කරයි | N ණ, L ළ, A ඇ, E ෛ |
1. සැලසුම් මූලධර්ම
- තහනම් අනුක්රමයක් කිසි විටෙක නොනිපදවන්න.
00-rules.mdහි සියලු අනිවාර්ය නීති සෑම ප්රතිදානයකටම අදාළ වේ. මෙය සියලු අවස්ථා ආවරණය වන සේ පරීක්ෂා කර ඇත (§5). - අවසර ඇති සෑම අකුරු රූපයක්ම නිපදවිය හැකිය.
data/validity.jsonඅවසර දෙන අකුරු රූප 791 ම ලිවිය හැකිය. - අපැහැදිලි නොවන තැන්වල, බහුතරයක් අවිධිමත්ව ලියන ආකාරය අනුගමනය කරන්න (
06-romanization.md):thත,tට,dද,w/vව, දිගු e සඳහාee. - අක්ෂර වින්යාසයේ පමණක් ඇති වෙනස්කම් පැහැදිලිව සලකුණු කරන්න. කථිකයන්ට නෑසෙන වෙනස්කම්වලට (මහාප්රාණ බව, ණ/න, ළ/ල, ශ/ෂ, සඤ්ඤක) පැහැදිලි සලකුණක් ලැබේ: ලොකු අකුරක්,
hඑකක් හෝzඋපසර්ගයක්. සලකුණ නැතිනම් සාමාන්ය අකුර ලියයි. එවිට ශබ්දකෝෂයකට (lexicon) සම්මත අක්ෂර වින්යාසය සොයාගත හැකිය (§4). - තාර්කික අනුපිළිවෙළ. රෝමානුකරණය ලියන්නේ උච්චාරණ අනුපිළිවෙළටය. යුනිකේත ගබඩා අනුපිළිවෙළද එයම වේ. එබැවින් ව්යඤ්ජනයට පෙර දර්ශනය වන පිලි (ෙ, ෛ, ො…) නැවත පිළිවෙළ කිරීම අවශ්ය නොවේ.
2. අනුක්රම වගු
මේවා tools/build_spec_tables.py මගින් JSON වගුවලින් ජනනය කර ඇත. සටහන් තීරුව එක් එක් පේළියට පදනම් වූ සම්මුතිය (R-) හෝ නීතිය (G-) දක්වයි. ගැළපීමේදී ලොකු/කුඩා අකුරු භේදය සැලකේ. දිගම අනුක්රමය මුලින් ගැළපේ.
ව්යඤ්ජන
පසුපසින් ස්වරයක් නොමැතිව ලියන ව්යඤ්ජනයට හල් ලකුණ (්) ලැබේ: k → ක්, ka → ක.
| අකුර | රෝමානුකරණය | සටහන් |
|---|---|---|
| ක | k · c | අමතර ලිවීම (alias) |
| ඛ | kh · K · C | අමතර ලිවීම |
| ග | g | |
| ඝ | gh · G | |
| ඞ | X | G-HC-08: හල් සහිතව පමණි |
| ඟ | zg | සඤ්ඤක |
| ච | ch | |
| ඡ | chh | |
| ජ | j | |
| ඣ | jh · J | |
| ඤ | zk | R-12 |
| ඥ | zh | R-12 |
| ඦ | zj | R-14; archaic විකල්පය |
| ට | t | |
| ඨ | T | |
| ඩ | D | R-01 |
| ඪ | Dh | R-01 |
| ණ | N | |
| ඬ | zD | R-01 සඤ්ඤක |
| ත | th | |
| ථ | thh | |
| ද | d · q | R-01; අමතර ලිවීම |
| ධ | dh · dhh | R-01; අමතර ලිවීම |
| න | n | |
| ඳ | zd · zdh · zq | R-01 සඤ්ඤක; අමතර ලිවීම |
| ප | p | |
| ඵ | ph · P | |
| බ | b | |
| භ | bh | |
| ම | m | |
| ඹ | B | සඤ්ඤක |
| ය | y | |
| ර | r | |
| ල | l | |
| ව | w · v · W · V | |
| ශ | sh | |
| ෂ | Sh · S | |
| ස | s | |
| හ | h | |
| ළ | L | |
| ෆ | f |
ස්වර
වචනයක මුලදී ස්වතන්ත්ර ස්වර අකුර යොදයි. ව්යඤ්ජනයකට පසු ස්වරය පිල්ලක් ලෙස ලියයි.
| ස්වරය | ස්වතන්ත්ර | පිල්ල | රෝමානුකරණය | සටහන් |
|---|---|---|---|---|
| a | අ | (ආවේණික) | a | |
| aa | ආ | ◌ා | aa | |
| ae | ඇ | ◌ැ | A · ae | R-04 |
| aee | ඈ | ◌ෑ | Aa · AA · aee | R-04 |
| i | ඉ | ◌ි | i | |
| ii | ඊ | ◌ී | ii · I | R-02 |
| u | උ | ◌ු | u · U | |
| uu | ඌ | ◌ූ | uu · UU · Uu | R-02 |
| ru | ඍ | ◌ෘ | R | R-06 |
| ruu | ඎ | ◌ෲ | RR | R-06 (ස්වතන්ත්ර ඎ archaic විකල්පයේ පමණි) |
| e | එ | ◌ෙ | e | |
| ee | ඒ | ◌ේ | ee | R-02 |
| ai | ඓ | ◌ෛ | E | R-05b |
| o | ඔ | ◌ො | o · O | |
| oo | ඕ | ◌ෝ | oo · OO · Oo | R-02 |
| au | ඖ | ◌ෞ | Au · AU | R-05b |
| ilu | ඏ | ◌ෟ | ~l | R-14; archaic විකල්පය |
| iluu | ඐ | ◌ෳ | ~ll | R-14; archaic විකල්පය |
ලකුණු සහ සම්බන්ධ කිරීම්
| ප්රතිදානය | රෝමානුකරණය | සටහන් |
|---|---|---|
| ං | x | G-NS-01: ස්වර පදනමක් අවශ්යය |
| ං | zn | G-NS-01 |
| ං | M | G-NS-01 |
| ඃ | H | G-NS-05 |
| ඁ | ~n | R-14 / G-NS-06; archaic විකල්පය |
| ස්පර්ශ අකුරු (C ZWJ ් C) | + | R-14 / G-HC-17: C ZWJ ් C; archaic විකල්පය |
3. පරිවර්තන නීති
| # | නීතිය | උදාහරණය | පදනම |
|---|---|---|---|
| C-1 | පසුපසින් ස්වරයක් නැති ව්යඤ්ජනයට හල් ලකුණ ලැබේ | pin → පින් | G-HC-01 |
| C-2 | C + y → යංශය (C ් ZWJ ය), ර ට පසු හැර | vaakya → වාක්ය | G-HC-11, G-HC-14 |
| C-3 | C + r → රකාරාංශය (C ් ZWJ ර), ම න ල හැර හල් ලකුණ ගන්නා සෑම ව්යඤ්ජනයකටම (ම න ල ට සාමාන්ය හල් ලකුණ; classical යටතේ රකාරාංශය) | kramaya → ක්රමය, dumriya → දුම්රිය | G-HC-12, R-07 |
| C-4 | ර + C → සාමාන්ය ර් (repaya_zwj යටතේ ZWJ සහිත රේඵය) | karma → කර්ම | G-HC-13, R-08 |
| C-5 | ද්විත්ව ව්යඤ්ජන (geminates) සහ අනෙක් ව්යඤ්ජන පොකුරු සාමාන්ය හල් ලකුණ යොදයි (classical යටතේ ZWJ සංයුක්ත අකුරු) | amma → අම්ම, akShara → අක්ෂර | G-HC-03, R-10 |
| C-6 | ස්වරයකට පසු එන ස්වරයක් අර්ධ ස්වරයකින් සම්බන්ධ කරයි: පූර්ව ස්වරවලට (front vowels) පසු ය, පශ්චාත් ස්වරවලට (back vowels) පසු ව; a / aa ට පසු කුමන අර්ධ ස්වරයද යන්න ඊළඟ ස්වරය තීරණය කරයි | toppia → ටොප්පිය, dua → දුව, ai → අයි | G-VS-06, R-05 |
| C-7 | ස්වරයකට පසු n + k / kh / g / gh → ං; වචන අවසානයේ ng → ං | ingriisi → ඉංග්රීසි, sing → සිං | G-NS-03, R-11 |
| C-8 | ං ට ස්වර පදනමක් අවශ්යය: x ට පෙර ව්යඤ්ජනය එහි ආවේණික a තබා ගනී; ං ට පසු ස්වරයක් යෙදුණහොත් ං, ම + පිල්ල බවට පත් වේ | kx → කං | G-NS-01, G-NS-04 |
| C-9 | සඤ්ඤක අකුරු සහ ළ කිසි විටෙක හල් නොගනී: ස්වරයක් නැතිනම් ඒවා ආවේණික a තබා ගනී | kaL → කළ | G-HC-06, G-HC-07 |
| C-10 | වචනයක මුලදී සඤ්ඤක අකුරු නැත: ඒ වෙනුවට නාසික නොවන සාමාන්ය ස්පර්ශ අකුර ලියයි | zda → ද | G-PH-01 |
| C-11 | ඞ යෙදෙන්නේ ව්යඤ්ජනයකට පෙර ඞ් ලෙස පමණි; ඞ + ස්වරය → ඟ + පිල්ල; සඤ්ඤක අකුරකට පෙර ං ඉවත් වේ | aXa → අඟ, axzda → අඳ | G-HC-08, G-NS-09 |
| C-12 | ලිවිය නොහැකි අනුක්රමයක් ලතින් අකුරින්ම ඉතිරි වේ | x (පදනමක් නැත) → x | G-NS-01 |
| C-13 | C + r + u / uu → C + ෘ / ෲ, එම රූපය භාවිතයේ හමු වන විට පමණි (validity.json හි valid, loan හෝ rare: මෘ මිස ලෘ නොවේ). නැතහොත් C-3 අදාළ වේ (රකාරාංශය + ු / ූ, ම න ල ට පසු සාමාන්ය හල් ලකුණ). rakaransaya_u යටතේ සෑම විටම රකාරාංශය + ු / ූ; R / RR සෑම විටම ෘ / ෲ ලියයි | kruura → කෲර, mrudu → මෘදු, gruup → ගෲප්, dilrukshi → දිල්රුක්ශි | G-VS-15, R-06 |
විකල්ප
| විකල්පය | බලපෑම | සම්මුතිය |
|---|---|---|
repaya_zwj | ර් + C වෙනුවට ර් + C | R-08 |
classical | ක්ෂ ක්ව ග්ධ ට්ඨ ත්ථ ත්ව ද්ධ ද්ව න්ථ න්ද න්ධ න්ව ඤ්ච සඳහා ZWJ සංයුක්ත අකුරු, සහ ම න ල ට පසු රකාරාංශය (ම්ර න්ර ල්ර) | R-10, G-HC-15, R-07 |
archaic | ඏ ඐ ෟ ෳ (~l, ~ll), තනි ඎ (RR), ඁ (~n), ඦ (zj), ස්පර්ශ අකුරු (+) | R-14 |
rakaransaya_u | C + r + u / uu ලියන්නේ C + ෘ / ෲ ලෙස නොව රකාරාංශය + ු / ූ ලෙසය (ක්රු, ක්රූ). නමේ තේරුම "රකාරාංශය + u" ය: u යනු ු පිල්ලයි. රකාරාංශය සෑම විටම ලියැවේ; මෙම විකල්පය වෙනස් කරන්නේ C + ru / ruu පමණි | R-06 |
retroflex_d | d ඩ · dh ද · D ඪ · Dh ධ · zd ඬ, පැරණි යතුරුපුවරු සම්මුතිය (dhh ධ, zdh ඳ, q ද එලෙසම පවතී) | R-01 |
4. ශබ්දකෝෂයක් මගින් අපැහැදිලිතාව විසඳීම
රෝමානුකරණය එක් අක්ෂර වින්යාසයක් පමණක් ලබා දෙයි. නමුත් සිංහල අකුරු කාණ්ඩ 14 ක් පමණ එක ලෙස උච්චාරණය වේ (G-SP-01). මිනිසුන් ලතින් අකුරින් ලියන විට ස්වර දිග හෝ මහාප්රාණ බව සලකුණු කරන්නේ කලාතුරකිනි. එබැවින් සම්මත අක්ෂර වින්යාසය සොයාගැනීමට බොහෝ විට වචන ලැයිස්තුවක් අවශ්ය වේ. src/sinhala_orthography/lexicon.py:
romanized ──► conversion (§3) ──► one spelling ──► sound key ──► words of a frequency list
│ with the same key,
│ most frequent first
└─ explicit marker present and the
spelling is a word, or a lone
vowel letter → it stays firstශබ්ද යතුර (sound key) පහත වෙනස්කම් මකා දමයි: මහාප්රාණ බව, ණ/න, ළ/ල, ශ/ෂ/ස, ද/ඩ, ඤ/න, ඥ/ග්න, සඤ්ඤක අකුර එදිරිව නාසිකය + ස්පර්ශය, ං/න්, ස්වර දිග, ඇ/එ, ෛ/යි, ෞ/වු, ෘ/්රු සහ ZWJ.
තනි ස්වර අකුරක් එලෙසම රැඳේ. පැහැදිලි සලකුණක් සහිත ආදානයක් තනි ස්වර අකුරක් බවට පරිවර්තනය වන විට (A ඇ, Aa ඈ, R ඍ, E ඓ, Au ඖ), වචන ලැයිස්තුවේ එවැනි වචනයක් නොමැති වුවද එම අකුර පළමුව රැඳේ: තනිව ලියූ අකුරකින් අදහස් කරන්නේ එම අකුරමයි. එසේ නොවුවහොත් සංඛ්යාතය එය සමාන ශබ්දයක් ඇති වචනයක් බවට පත් කරයි (ඍ → රු, ඓ → අයි). සලකුණක් නැති ස්වර තවමත් ශබ්දයෙන් ගැළපේ (e → ඒ).
විකල්ප වචනවලටද අදාළ වේ. වචන ලැයිස්තුවක් සුලබ ආකාරයට ලියා ඇත (කෲර, කර්ම). එබැවින් candidates() එක් එක් වචනය ආපසු දීමට පෙර පරිවර්තක විකල්පවල ආකාරයට නැවත ලියයි (restyle()): rakaransaya_u C + ෘ/ෲ රකාරාංශය + ු/ූ බවට පත් කරයි (ක්රූර), repaya_zwj රේඵය ZWJ සමඟ බඳියි (කර්ම), classical බැඳි අකුරු යුගල බඳියි (අක්ෂර). එසේ නොකළහොත් ශබ්දකෝෂය සෑම වචනයකදීම විකල්ප අහෝසි කරයි. විකල්ප කිසිවක් නැති විට කිසිදු වෙනසක් නොවේ.
ඇගයීම. මිනිසුන් අවිධිමත්ව රෝමානුකරණය කරන ආකාරයට ලියූ එදිනෙදා වචන 27 ක්, University of Moratuwa NLPC සංඛ්යාත ලැයිස්තුව (වචන මිලියන 2.1, ස්ථිර කළ අනුවාදය; reports/corpus-counts.md හි CC-14) සමඟ පරීක්ෂා කර ඇත. එම ලැයිස්තුව මෙහි ඇතුළත් නැත: tools/corpus_counts.py එය බාගත කරන අතර, tests/test_lexicon.py එම වචනම ඕනෑම ලැයිස්තුවක් සමඟ පරීක්ෂා කරයි.
| නිවැරදි අක්ෂර වින්යාසය පළමු ස්ථානයේ | |
|---|---|
| පරිවර්තන නීති පමණක් | 9 / 27 |
| නීති + ශබ්දකෝෂය | 27 / 27 |
| රෝමානු පෙළ | නීති පමණක් | නීති + ශබ්දකෝෂය |
|---|---|---|
honda | හොන්ද | හොඳ |
sinhala | සින්හල | සිංහල |
thiyenawa | තියෙනව | තියෙනවා |
bada | බද | බඩ |
vaidya | වයිද්ය | වෛද්ය |
krushi | කෘශි | කෘෂි |
lamaya | ලමය | ළමයා |
ලැයිස්තුවේ ශබ්ද යතුරුවලින් 17.7% ක් වචන දෙකක් හෝ වැඩි ගණනක් අතර පොදු වේ (උදා. කළ කල කාල කලා; CC-15). එබැවින් සංඛ්යාතයෙන් පමණක් සෑම විටම නිවැරදි වචනය තෝරාගත නොහැකිය. පෙර වචනයේ සන්දර්භය මේ සඳහා උපකාරී වනු ඇත.
5. සත්යාපනය
tools/check_romanization.py (වාර්තාව: reports/romanization-check.md):
| පරීක්ෂාව | ප්රතිඵලය |
|---|---|
ආවරණය: data/validity.json අවසර දෙන අකුරු රූපවලින් නිපදවිය හැකි ඒවා | 791 / 791 |
| ආරක්ෂාව: අනුක්රම 1–3 කින් යුත් ආදාන (හිස්තැනද සමඟ), විකල්ප කට්ටල හයම | ආදාන මිලියන 3.98 ක්, තහනම් රටා 14 න් උල්ලංඝන 0 |
පරීක්ෂණ උදාහරණ (fixtures): tests/test_romanization.py | සියල්ල සමත් |
6. සම්මුති සහ ඒවාට හේතු
| ID | සම්මුතිය | හේතුව |
|---|---|---|
| R-01 | d ද · dh ධ · D ඩ · Dh ඪ; සඤ්ඤක zd ඳ, zD ඬ; q = ද සඳහා අමතර ලිවීමක් | අවිධිමත් ලිවීමේදී ද සඳහා අවස්ථාවලින් 99% ක d ද, ධ සඳහා dh ද යොදයි (G-TY-02). N ණ සහ L ළ මෙන්, ලොකු අකුරු මූර්ධජ අකුරු සලකුණු කරයි. ලිඛිත පාඨයේ ද, ඩ ට වඩා 5 ගුණයක් සුලබය (d-අකුරුවලින් 74% ට එදිරිව 15%, CC-12). එබැවින් ලකුණක් නැති යතුර සුලබ අකුරට හිමි වේ. පැරණි යතුරුපුවරු ක්රම t ට / th ත ට සමාන්තරව d ඩ / dh ද ලියයි (06:RS-030); retroflex_d එම සම්මුතිය ලබා දෙයි |
| R-02 | ee ඒ · oo ඕ · ii ඊ · uu ඌ | ස්වර දිග දැක්වීමට අකුර දෙවරක් ලිවීම ස්ථාවරව යොදයි. අවිධිමත් ee = ී (G-TY-03) ශබ්දකෝෂය මගින් සොයාගනී |
| R-03 | ස්වරයකට පෙර එන nd / mb / ng පොකුරු ලෙස ලියයි; සඤ්ඤක අකුරද (ඳ ඹ ඟ) පොකුරද යන්න ශබ්දකෝෂය තෝරයි | සඤ්ඤකයද පොකුරද යන්න වචනය අනුව තීරණය වේ (G-NS-08). අවිධිමත් ලිවීම දෙකටම nd/mb/ng යොදයි (G-TY-06) |
| R-04 | A / ae ඇ · Aa / AA / aee ඈ | ae ISO 15919 7-bit ට ගැළපේ; A එක් අකුරකින් ලිවිය හැකි රූපයක් ලබා දෙයි |
| R-05 | ai / au → අර්ධ ස්වර සහිත ලිවීම (අයි / අවු, C + යි / C + වු); ෛ ඓ E මගින්, ෞ ඖ Au මගින් | ස්වර දෙකක් කිසි විටෙක එක ළඟ නොලියයි (G-VS-03, G-VS-06). NLPC ලැයිස්තුවේ C + යි සහිත වචන C + ෛ ට වඩා 11:1 ක්ද, C + වු සහිත වචන C + ෞ ට වඩා 1.7:1 ක්ද වේ (CC-05). ෛ හෝ ෞ සහිත වචනයක් සෑම විටම පාහේ එලෙසම ලියැවේ (වෛද්ය 46,508, වයිද්ය 142; CC-06). ශබ්දකෝෂය එය යළි ලබා දෙයි |
| R-06 | C + ru / ruu = C + ෘ / ෲ; R / RR ද ෘ / ෲ ලියයි; rakaransaya_u ඒ වෙනුවට ක්රු / ක්රූ දෙයි; තනිව R = ඍ; ස්වරයකට පසු ru = ර + ු | /Cru(ː)/ සඳහා සංස්කෘත සහ ඉංග්රීසි ණය වචන යන දෙකෙහිම සුලබ ලිවීම ෘ / ෲ ය (G-VS-15): NLPC ලැයිස්තුවේ එකකට වැඩි ආකාරයකින් ලියන වචන 205 න් 155 ක වැඩිපුරම යෙදෙන ලිවීම එයයි (කෲර 1,667, ක්රූර 9; CC-02, CC-03). ගෘහ සහ ග්රහ වෙන්ව පවතී (G-VS-12) |
| R-07 | ම, න, ල හැර, හල් ගන්නා සෑම ව්යඤ්ජනයකටම පසු රකාරාංශය. ම න ල ට පසු ර නව අක්ෂරයක් අරඹන බැවින් සාමාන්ය හල් ලකුණ ගනී (දුම්රිය, හෙන්රි). classical ම්ර (තාම්ර) ලියයි | ලිඛිත පාඨයේ ම්ර / න්ර සාමාන්ය ලෙස ලියැවේ (දුම්රිය 30,800, දුම්රිය 82; 03:HC-052, CC-10). ZWJ යෙදුවහොත් ම යටින් රකාරාංශයක් ඇඳේ. ම්ර හමු වන්නේ සංස්කෘත තත්සම වචනවල පමණි |
| R-08 | රේඵය පෙරනිමියෙන් සාමාන්ය ර් + C වේ | ආකාර දෙකම සම්මත වේ (G-HC-13); NLPC ලැයිස්තුවේ සාමාන්ය ආකාරය ප්රමුඛ වේ (ටෝකන 2,182,087 ට එදිරිව 26,785, CC-07) |
| R-09 | kārya → කාර්ය | R-08 න් පැන නගී; NLPC ලැයිස්තුවේ 18,722 වරක් යෙදේ (CC-08) |
| R-10 | ක්ෂ සහ අනෙක් බැඳි අකුරු පෙරනිමියෙන් සාමාන්ය හල් ලකුණෙන් ලියයි; ZWJ සංයුක්ත අකුරු විකල්පයකි | යංශය/රකාරාංශය හැර අනෙක් සංයුක්ත අකුරු අනිවාර්ය නොවන අතර බොහෝ දුරට සම්භාව්ය වේ (G-HC-15/16) |
| R-11 | n + කණ්ඨජ අකුර → ස්වයංක්රීයව ං; h s sh y r l v ට පෙර ං ද න් ද යන්න ශබ්දකෝෂය තෝරයි | G-NS-03; ස ට පෙර දේශීය සහ සංස්කෘත වචන වෙනස් වේ (පන්සල එදිරිව සංසාරය) |
| R-12 | ny → න්ය; gn → ග්න; ඥ = zh; ඤ = zk | න්ය සහ ග්න සුලබ කියවීම් වේ (G-NS-12/13); ඥ සහ ඤ ශබ්දකෝෂය මගින් සොයාගනී |
| R-13 | ලොකු/කුඩා අකුරු භේදය සලකයි | අක්ෂර වින්යාසයේ පමණක් ඇති වෙනස්කම් ලොකු අකුරු මගින් දැක්වේ (4 වන මූලධර්මය) |
| R-14 | පුරාතන අකුරු සහ ස්පර්ශ අකුරු archaic විකල්පය යටතේ පමණි | නූතන සිංහලයේ මේවා භාවිත නොවේ (G-VS-08, G-HC-17, G-NS-06) |
| R-15 | අක්ෂර වින්යාසයේ පමණක් ඇති වෙනස්කම් සංඛ්යාත ශබ්දකෝෂයක් මගින් විසඳයි | G-SP-01: ශබ්දයෙන් ඒවා තීරණය කළ නොහැකිය |
7. සීමාවන්
- අපැහැදිලිතාව විසඳීමේ ගුණාත්මකභාවය වචන ලැයිස්තුව මත රඳා පවතී. NLPC ලැයිස්තුව පුවත් පෙළින් ගෙන ඇති නිසා විධිමත් වචන කථන වචනවලට වඩා ඉහළින් පෙළගැසේ (ඔයා ට පෙර ඔය). එහි සමහර පිටපත්වල ZWJ නැති වී ඇත; පූරණය කරන විට
normalize()යංශය සහ රකාරාංශය නිවැරදි කරයි. එය ක්රියා කරන්නේ කිසිදු ZWJ ක් නැති ලැයිස්තුවක පමණි, මන්ද එයට වචන මායිම් නොපෙනෙන අතර බවත් + ය → බවත්ය ලෙසද සම්බන්ධ කරයි. - එක් එක් ව්යඤ්ජනයට අදාළ වලංගුභාව වගුව (
data/validity.json) මූලාශ්රවල සංශ්ලේෂණයකි. එය පෙළ සංග්රහයකින් කළ ගණනයක් නොවේ (00-rules.md§10). - අවිධිමත් රෝමානුකරණය බොහෝ විට ස්වර සම්පූර්ණයෙන්ම අතහරියි (G-TY-05). ඒවා සොයාගැනීමට ආසන්න ගැළපීම (fuzzy matching) අවශ්ය වේ. එය මෙහි විෂය පථයෙන් බැහැරය.