අන්තර්ගතයට යන්න
මෙය ඉංග්‍රීසි මුල් ලේඛනයේ පරිවර්තනයකි. දෙකෙහි වෙනසක් ඇත්නම් ඉංග්‍රීසි පිටපත නිවැරදි යැයි සලකන්න.

07: ව්‍යාකරණානුකූල සිංහල ශබ්දානුසාරී රෝමානුකරණයක් ​

මෙම ලේඛනය සිංහල සඳහා ශබ්දානුසාරී රෝමානුකරණයක් (phonetic romanization) නිර්වචනය කරයි. එය ලතින් අකුරු අනුක්‍රම (sequences) සහ පරිවර්තන නීති මාලාවකි. මේවා රෝමානු පෙළ සිංහල අකුරු බවට හරවයි. සෑම ප්‍රතිඵලයක්ම 00-rules.md හි අක්ෂර වින්‍යාස නීතිවලට අනුකූල වන ලෙසත්, සිංහල අවිධිමත්ව ලතින් අකුරින් ලියන ආකාරයට (06-romanization.md) සමීප වන ලෙසත් එය සැලසුම් කර ඇත. සම්පාදනය: 2026 ඔක්තෝබර්.

යොමු ක්‍රියාත්මක කිරීම (reference implementation) src/sinhala_orthography/romanization.py ය. අනුක්‍රම වගු src/sinhala_orthography/data/{consonants,vowels,specials}.json වේ.


⚠️ ඔබව පුදුමයට පත් කරන කරුණු ​

සම්මුතියඋදාහරණය
1කුඩා t මූර්ධජ වන නමුත් කුඩා d දන්තජ වේ. මෙය අවිධිමත් භාවිතයට ගැළපේt ට, th ත · d ද, D ඩ
2ai සහ au ලියන්නේ ෛ / ෞ ලෙස නොව අර්ධ ස්වරයක් සමඟයlait → ලයිට්, kauda → කවුද
3ව්‍යඤ්ජනයකට වහාම පසු එන ru / ruu, සුලබ ලිවීම වන ෘ / ෲ ලෙස ලියයි; රකාරාංශය + ු / ූ විකල්පයකිkruura → කෲර, mrudu → මෘදු, karu → කරු
4කණ්ඨජ අකුරකට පෙර කුඩා n, ං බවට පත් වේlankaava → ලංකාව
5රේඵය පෙරනිමියෙන් සාමාන්‍ය ර් වේkarma → කර්ම, kaarya → කාර්ය
6නීතියෙන් තහනම් රූපයක් කිසි විටෙක නොනිපදවයි; ඒ වෙනුවට වලංගු ආදේශක රූපයක් යොදයිkazd → කඳ (ඳ ට හල් නැත), Ba → බ (වචන මුලදී ඹ නැත)
7ලොකු/කුඩා අකුරු භේදය වැදගත්ය: ලොකු අකුරු (capitals) මූර්ධජ, මහාප්‍රාණ, ඇ/ඈ සහ ද්විස්වර (diphthong) අකුරු සලකුණු කරයිN ණ, L ළ, A ඇ, E ෛ

1. සැලසුම් මූලධර්ම ​

  1. තහනම් අනුක්‍රමයක් කිසි විටෙක නොනිපදවන්න. 00-rules.md හි සියලු අනිවාර්ය නීති සෑම ප්‍රතිදානයකටම අදාළ වේ. මෙය සියලු අවස්ථා ආවරණය වන සේ පරීක්ෂා කර ඇත (§5).
  2. අවසර ඇති සෑම අකුරු රූපයක්ම නිපදවිය හැකිය. data/validity.json අවසර දෙන අකුරු රූප 791 ම ලිවිය හැකිය.
  3. අපැහැදිලි නොවන තැන්වල, බහුතරයක් අවිධිමත්ව ලියන ආකාරය අනුගමනය කරන්න (06-romanization.md): th ත, t ට, d ද, w/v ව, දිගු e සඳහා ee.
  4. අක්ෂර වින්‍යාසයේ පමණක් ඇති වෙනස්කම් පැහැදිලිව සලකුණු කරන්න. කථිකයන්ට නෑසෙන වෙනස්කම්වලට (මහාප්‍රාණ බව, ණ/න, ළ/ල, ශ/ෂ, සඤ්ඤක) පැහැදිලි සලකුණක් ලැබේ: ලොකු අකුරක්, h එකක් හෝ z උපසර්ගයක්. සලකුණ නැතිනම් සාමාන්‍ය අකුර ලියයි. එවිට ශබ්දකෝෂයකට (lexicon) සම්මත අක්ෂර වින්‍යාසය සොයාගත හැකිය (§4).
  5. තාර්කික අනුපිළිවෙළ. රෝමානුකරණය ලියන්නේ උච්චාරණ අනුපිළිවෙළටය. යුනිකේත ගබඩා අනුපිළිවෙළද එයම වේ. එබැවින් ව්‍යඤ්ජනයට පෙර දර්ශනය වන පිලි (ෙ, ෛ, ො…) නැවත පිළිවෙළ කිරීම අවශ්‍ය නොවේ.

2. අනුක්‍රම වගු ​

මේවා tools/build_spec_tables.py මගින් JSON වගුවලින් ජනනය කර ඇත. සටහන් තීරුව එක් එක් පේළියට පදනම් වූ සම්මුතිය (R-) හෝ නීතිය (G-) දක්වයි. ගැළපීමේදී ලොකු/කුඩා අකුරු භේදය සැලකේ. දිගම අනුක්‍රමය මුලින් ගැළපේ.

ව්‍යඤ්ජන ​

පසුපසින් ස්වරයක් නොමැතිව ලියන ව්‍යඤ්ජනයට හල් ලකුණ (්) ලැබේ: k → ක්, ka → ක.

අකුරරෝමානුකරණයසටහන්
කk · cඅමතර ලිවීම (alias)
ඛkh · K · Cඅමතර ලිවීම
ගg
ඝgh · G
ඞXG-HC-08: හල් සහිතව පමණි
ඟzgසඤ්ඤක
චch
ඡchh
ජj
ඣjh · J
ඤzkR-12
ඥzhR-12
ඦzjR-14; archaic විකල්පය
ටt
ඨT
ඩDR-01
ඪDhR-01
ණN
ඬzDR-01 සඤ්ඤක
තth
ථthh
දd · qR-01; අමතර ලිවීම
ධdh · dhhR-01; අමතර ලිවීම
නn
ඳzd · zdh · zqR-01 සඤ්ඤක; අමතර ලිවීම
පp
ඵph · P
බb
භbh
මm
ඹBසඤ්ඤක
යy
රr
ලl
වw · v · W · V
ශsh
ෂSh · S
සs
හh
ළL
ෆf

ස්වර ​

වචනයක මුලදී ස්වතන්ත්‍ර ස්වර අකුර යොදයි. ව්‍යඤ්ජනයකට පසු ස්වරය පිල්ලක් ලෙස ලියයි.

ස්වරයස්වතන්ත්‍රපිල්ලරෝමානුකරණයසටහන්
aඅ(ආවේණික)a
aaආ◌ාaa
aeඇ◌ැA · aeR-04
aeeඈ◌ෑAa · AA · aeeR-04
iඉ◌ිi
iiඊ◌ීii · IR-02
uඋ◌ුu · U
uuඌ◌ූuu · UU · UuR-02
ruඍ◌ෘRR-06
ruuඎ◌ෲRRR-06 (ස්වතන්ත්‍ර ඎ archaic විකල්පයේ පමණි)
eඑ◌ෙe
eeඒ◌ේeeR-02
aiඓ◌ෛER-05b
oඔ◌ොo · O
ooඕ◌ෝoo · OO · OoR-02
auඖ◌ෞAu · AUR-05b
iluඏ◌ෟ~lR-14; archaic විකල්පය
iluuඐ◌ෳ~llR-14; archaic විකල්පය

ලකුණු සහ සම්බන්ධ කිරීම් ​

ප්‍රතිදානයරෝමානුකරණයසටහන්
ංxG-NS-01: ස්වර පදනමක් අවශ්‍යය
ංznG-NS-01
ංMG-NS-01
ඃHG-NS-05
ඁ~nR-14 / G-NS-06; archaic විකල්පය
ස්පර්ශ අකුරු (C ZWJ ් C)+R-14 / G-HC-17: C ZWJ ් C; archaic විකල්පය

3. පරිවර්තන නීති ​

#නීතියඋදාහරණයපදනම
C-1පසුපසින් ස්වරයක් නැති ව්‍යඤ්ජනයට හල් ලකුණ ලැබේpin → පින්G-HC-01
C-2C + y → යංශය (C ් ZWJ ය), ර ට පසු හැරvaakya → වාක්‍යG-HC-11, G-HC-14
C-3C + r → රකාරාංශය (C ් ZWJ ර), ම න ල හැර හල් ලකුණ ගන්නා සෑම ව්‍යඤ්ජනයකටම (ම න ල ට සාමාන්‍ය හල් ලකුණ; classical යටතේ රකාරාංශය)kramaya → ක්‍රමය, dumriya → දුම්රියG-HC-12, R-07
C-4ර + C → සාමාන්‍ය ර් (repaya_zwj යටතේ ZWJ සහිත රේඵය)karma → කර්මG-HC-13, R-08
C-5ද්විත්ව ව්‍යඤ්ජන (geminates) සහ අනෙක් ව්‍යඤ්ජන පොකුරු සාමාන්‍ය හල් ලකුණ යොදයි (classical යටතේ ZWJ සංයුක්ත අකුරු)amma → අම්ම, akShara → අක්ෂරG-HC-03, R-10
C-6ස්වරයකට පසු එන ස්වරයක් අර්ධ ස්වරයකින් සම්බන්ධ කරයි: පූර්ව ස්වරවලට (front vowels) පසු ය, පශ්චාත් ස්වරවලට (back vowels) පසු ව; a / aa ට පසු කුමන අර්ධ ස්වරයද යන්න ඊළඟ ස්වරය තීරණය කරයිtoppia → ටොප්පිය, dua → දුව, ai → අයිG-VS-06, R-05
C-7ස්වරයකට පසු n + k / kh / g / gh → ං; වචන අවසානයේ ng → ංingriisi → ඉංග්‍රීසි, sing → සිංG-NS-03, R-11
C-8ං ට ස්වර පදනමක් අවශ්‍යය: x ට පෙර ව්‍යඤ්ජනය එහි ආවේණික a තබා ගනී; ං ට පසු ස්වරයක් යෙදුණහොත් ං, ම + පිල්ල බවට පත් වේkx → කංG-NS-01, G-NS-04
C-9සඤ්ඤක අකුරු සහ ළ කිසි විටෙක හල් නොගනී: ස්වරයක් නැතිනම් ඒවා ආවේණික a තබා ගනීkaL → කළG-HC-06, G-HC-07
C-10වචනයක මුලදී සඤ්ඤක අකුරු නැත: ඒ වෙනුවට නාසික නොවන සාමාන්‍ය ස්පර්ශ අකුර ලියයිzda → දG-PH-01
C-11ඞ යෙදෙන්නේ ව්‍යඤ්ජනයකට පෙර ඞ් ලෙස පමණි; ඞ + ස්වරය → ඟ + පිල්ල; සඤ්ඤක අකුරකට පෙර ං ඉවත් වේaXa → අඟ, axzda → අඳG-HC-08, G-NS-09
C-12ලිවිය නොහැකි අනුක්‍රමයක් ලතින් අකුරින්ම ඉතිරි වේx (පදනමක් නැත) → xG-NS-01
C-13C + r + u / uu → C + ෘ / ෲ, එම රූපය භාවිතයේ හමු වන විට පමණි (validity.json හි valid, loan හෝ rare: මෘ මිස ලෘ නොවේ). නැතහොත් C-3 අදාළ වේ (රකාරාංශය + ු / ූ, ම න ල ට පසු සාමාන්‍ය හල් ලකුණ). rakaransaya_u යටතේ සෑම විටම රකාරාංශය + ු / ූ; R / RR සෑම විටම ෘ / ෲ ලියයිkruura → කෲර, mrudu → මෘදු, gruup → ගෲප්, dilrukshi → දිල්රුක්ශිG-VS-15, R-06

විකල්ප ​

විකල්පයබලපෑමසම්මුතිය
repaya_zwjර් + C වෙනුවට ර්‍ + CR-08
classicalක්‍ෂ ක්‍ව ග්‍ධ ට්‍ඨ ත්‍ථ ත්‍ව ද්‍ධ ද්‍ව න්‍ථ න්‍ද න්‍ධ න්‍ව ඤ්‍ච සඳහා ZWJ සංයුක්ත අකුරු, සහ ම න ල ට පසු රකාරාංශය (ම්‍ර න්‍ර ල්‍ර)R-10, G-HC-15, R-07
archaicඏ ඐ ෟ ෳ (~l, ~ll), තනි ඎ (RR), ඁ (~n), ඦ (zj), ස්පර්ශ අකුරු (+)R-14
rakaransaya_uC + r + u / uu ලියන්නේ C + ෘ / ෲ ලෙස නොව රකාරාංශය + ු / ූ ලෙසය (ක්‍රු, ක්‍රූ). නමේ තේරුම "රකාරාංශය + u" ය: u යනු ු පිල්ලයි. රකාරාංශය සෑම විටම ලියැවේ; මෙම විකල්පය වෙනස් කරන්නේ C + ru / ruu පමණිR-06
retroflex_dd ඩ · dh ද · D ඪ · Dh ධ · zd ඬ, පැරණි යතුරුපුවරු සම්මුතිය (dhh ධ, zdh ඳ, q ද එලෙසම පවතී)R-01

4. ශබ්දකෝෂයක් මගින් අපැහැදිලිතාව විසඳීම ​

රෝමානුකරණය එක් අක්ෂර වින්‍යාසයක් පමණක් ලබා දෙයි. නමුත් සිංහල අකුරු කාණ්ඩ 14 ක් පමණ එක ලෙස උච්චාරණය වේ (G-SP-01). මිනිසුන් ලතින් අකුරින් ලියන විට ස්වර දිග හෝ මහාප්‍රාණ බව සලකුණු කරන්නේ කලාතුරකිනි. එබැවින් සම්මත අක්ෂර වින්‍යාසය සොයාගැනීමට බොහෝ විට වචන ලැයිස්තුවක් අවශ්‍ය වේ. src/sinhala_orthography/lexicon.py:

romanized ──► conversion (§3) ──► one spelling ──► sound key ──► words of a frequency list
                                                       │            with the same key,
                                                       │            most frequent first
                                                       └─ explicit marker present and the
                                                          spelling is a word, or a lone
                                                          vowel letter → it stays first

ශබ්ද යතුර (sound key) පහත වෙනස්කම් මකා දමයි: මහාප්‍රාණ බව, ණ/න, ළ/ල, ශ/ෂ/ස, ද/ඩ, ඤ/න, ඥ/ග්න, සඤ්ඤක අකුර එදිරිව නාසිකය + ස්පර්ශය, ං/න්, ස්වර දිග, ඇ/එ, ෛ/යි, ෞ/වු, ෘ/්‍රු සහ ZWJ.

තනි ස්වර අකුරක් එලෙසම රැඳේ. පැහැදිලි සලකුණක් සහිත ආදානයක් තනි ස්වර අකුරක් බවට පරිවර්තනය වන විට (A ඇ, Aa ඈ, R ඍ, E ඓ, Au ඖ), වචන ලැයිස්තුවේ එවැනි වචනයක් නොමැති වුවද එම අකුර පළමුව රැඳේ: තනිව ලියූ අකුරකින් අදහස් කරන්නේ එම අකුරමයි. එසේ නොවුවහොත් සංඛ්‍යාතය එය සමාන ශබ්දයක් ඇති වචනයක් බවට පත් කරයි (ඍ → රු, ඓ → අයි). සලකුණක් නැති ස්වර තවමත් ශබ්දයෙන් ගැළපේ (e → ඒ).

විකල්ප වචනවලටද අදාළ වේ. වචන ලැයිස්තුවක් සුලබ ආකාරයට ලියා ඇත (කෲර, කර්ම). එබැවින් candidates() එක් එක් වචනය ආපසු දීමට පෙර පරිවර්තක විකල්පවල ආකාරයට නැවත ලියයි (restyle()): rakaransaya_u C + ෘ/ෲ රකාරාංශය + ු/ූ බවට පත් කරයි (ක්‍රූර), repaya_zwj රේඵය ZWJ සමඟ බඳියි (කර්‍ම), classical බැඳි අකුරු යුගල බඳියි (අක්‍ෂර). එසේ නොකළහොත් ශබ්දකෝෂය සෑම වචනයකදීම විකල්ප අහෝසි කරයි. විකල්ප කිසිවක් නැති විට කිසිදු වෙනසක් නොවේ.

ඇගයීම. මිනිසුන් අවිධිමත්ව රෝමානුකරණය කරන ආකාරයට ලියූ එදිනෙදා වචන 27 ක්, University of Moratuwa NLPC සංඛ්‍යාත ලැයිස්තුව (වචන මිලියන 2.1, ස්ථිර කළ අනුවාදය; reports/corpus-counts.md හි CC-14) සමඟ පරීක්ෂා කර ඇත. එම ලැයිස්තුව මෙහි ඇතුළත් නැත: tools/corpus_counts.py එය බාගත කරන අතර, tests/test_lexicon.py එම වචනම ඕනෑම ලැයිස්තුවක් සමඟ පරීක්ෂා කරයි.

නිවැරදි අක්ෂර වින්‍යාසය පළමු ස්ථානයේ
පරිවර්තන නීති පමණක්9 / 27
නීති + ශබ්දකෝෂය27 / 27
රෝමානු පෙළනීති පමණක්නීති + ශබ්දකෝෂය
hondaහොන්දහොඳ
sinhalaසින්හලසිංහල
thiyenawaතියෙනවතියෙනවා
badaබදබඩ
vaidyaවයිද්‍යවෛද්‍ය
krushiකෘශිකෘෂි
lamayaලමයළමයා

ලැයිස්තුවේ ශබ්ද යතුරුවලින් 17.7% ක් වචන දෙකක් හෝ වැඩි ගණනක් අතර පොදු වේ (උදා. කළ කල කාල කලා; CC-15). එබැවින් සංඛ්‍යාතයෙන් පමණක් සෑම විටම නිවැරදි වචනය තෝරාගත නොහැකිය. පෙර වචනයේ සන්දර්භය මේ සඳහා උපකාරී වනු ඇත.


5. සත්‍යාපනය ​

tools/check_romanization.py (වාර්තාව: reports/romanization-check.md):

පරීක්ෂාවප්‍රතිඵලය
ආවරණය: data/validity.json අවසර දෙන අකුරු රූපවලින් නිපදවිය හැකි ඒවා791 / 791
ආරක්ෂාව: අනුක්‍රම 1–3 කින් යුත් ආදාන (හිස්තැනද සමඟ), විකල්ප කට්ටල හයමආදාන මිලියන 3.98 ක්, තහනම් රටා 14 න් උල්ලංඝන 0
පරීක්ෂණ උදාහරණ (fixtures): tests/test_romanization.pyසියල්ල සමත්

6. සම්මුති සහ ඒවාට හේතු ​

IDසම්මුතියහේතුව
R-01d ද · dh ධ · D ඩ · Dh ඪ; සඤ්ඤක zd ඳ, zD ඬ; q = ද සඳහා අමතර ලිවීමක්අවිධිමත් ලිවීමේදී ද සඳහා අවස්ථාවලින් 99% ක d ද, ධ සඳහා dh ද යොදයි (G-TY-02). N ණ සහ L ළ මෙන්, ලොකු අකුරු මූර්ධජ අකුරු සලකුණු කරයි. ලිඛිත පාඨයේ ද, ඩ ට වඩා 5 ගුණයක් සුලබය (d-අකුරුවලින් 74% ට එදිරිව 15%, CC-12). එබැවින් ලකුණක් නැති යතුර සුලබ අකුරට හිමි වේ. පැරණි යතුරුපුවරු ක්‍රම t ට / th ත ට සමාන්තරව d ඩ / dh ද ලියයි (06:RS-030); retroflex_d එම සම්මුතිය ලබා දෙයි
R-02ee ඒ · oo ඕ · ii ඊ · uu ඌස්වර දිග දැක්වීමට අකුර දෙවරක් ලිවීම ස්ථාවරව යොදයි. අවිධිමත් ee = ී (G-TY-03) ශබ්දකෝෂය මගින් සොයාගනී
R-03ස්වරයකට පෙර එන nd / mb / ng පොකුරු ලෙස ලියයි; සඤ්ඤක අකුරද (ඳ ඹ ඟ) පොකුරද යන්න ශබ්දකෝෂය තෝරයිසඤ්ඤකයද පොකුරද යන්න වචනය අනුව තීරණය වේ (G-NS-08). අවිධිමත් ලිවීම දෙකටම nd/mb/ng යොදයි (G-TY-06)
R-04A / ae ඇ · Aa / AA / aee ඈae ISO 15919 7-bit ට ගැළපේ; A එක් අකුරකින් ලිවිය හැකි රූපයක් ලබා දෙයි
R-05ai / au → අර්ධ ස්වර සහිත ලිවීම (අයි / අවු, C + යි / C + වු); ෛ ඓ E මගින්, ෞ ඖ Au මගින්ස්වර දෙකක් කිසි විටෙක එක ළඟ නොලියයි (G-VS-03, G-VS-06). NLPC ලැයිස්තුවේ C + යි සහිත වචන C + ෛ ට වඩා 11:1 ක්ද, C + වු සහිත වචන C + ෞ ට වඩා 1.7:1 ක්ද වේ (CC-05). ෛ හෝ ෞ සහිත වචනයක් සෑම විටම පාහේ එලෙසම ලියැවේ (වෛද්‍ය 46,508, වයිද්‍ය 142; CC-06). ශබ්දකෝෂය එය යළි ලබා දෙයි
R-06C + ru / ruu = C + ෘ / ෲ; R / RR ද ෘ / ෲ ලියයි; rakaransaya_u ඒ වෙනුවට ක්‍රු / ක්‍රූ දෙයි; තනිව R = ඍ; ස්වරයකට පසු ru = ර + ු/Cru(ː)/ සඳහා සංස්කෘත සහ ඉංග්‍රීසි ණය වචන යන දෙකෙහිම සුලබ ලිවීම ෘ / ෲ ය (G-VS-15): NLPC ලැයිස්තුවේ එකකට වැඩි ආකාරයකින් ලියන වචන 205 න් 155 ක වැඩිපුරම යෙදෙන ලිවීම එයයි (කෲර 1,667, ක්‍රූර 9; CC-02, CC-03). ගෘහ සහ ග්‍රහ වෙන්ව පවතී (G-VS-12)
R-07ම, න, ල හැර, හල් ගන්නා සෑම ව්‍යඤ්ජනයකටම පසු රකාරාංශය. ම න ල ට පසු ර නව අක්ෂරයක් අරඹන බැවින් සාමාන්‍ය හල් ලකුණ ගනී (දුම්රිය, හෙන්රි). classical ම්‍ර (තාම්‍ර) ලියයිලිඛිත පාඨයේ ම්ර / න්ර සාමාන්‍ය ලෙස ලියැවේ (දුම්රිය 30,800, දුම්‍රිය 82; 03:HC-052, CC-10). ZWJ යෙදුවහොත් ම යටින් රකාරාංශයක් ඇඳේ. ම්‍ර හමු වන්නේ සංස්කෘත තත්සම වචනවල පමණි
R-08රේඵය පෙරනිමියෙන් සාමාන්‍ය ර් + C වේආකාර දෙකම සම්මත වේ (G-HC-13); NLPC ලැයිස්තුවේ සාමාන්‍ය ආකාරය ප්‍රමුඛ වේ (ටෝකන 2,182,087 ට එදිරිව 26,785, CC-07)
R-09kārya → කාර්යR-08 න් පැන නගී; NLPC ලැයිස්තුවේ 18,722 වරක් යෙදේ (CC-08)
R-10ක්ෂ සහ අනෙක් බැඳි අකුරු පෙරනිමියෙන් සාමාන්‍ය හල් ලකුණෙන් ලියයි; ZWJ සංයුක්ත අකුරු විකල්පයකියංශය/රකාරාංශය හැර අනෙක් සංයුක්ත අකුරු අනිවාර්ය නොවන අතර බොහෝ දුරට සම්භාව්‍ය වේ (G-HC-15/16)
R-11n + කණ්ඨජ අකුර → ස්වයංක්‍රීයව ං; h s sh y r l v ට පෙර ං ද න් ද යන්න ශබ්දකෝෂය තෝරයිG-NS-03; ස ට පෙර දේශීය සහ සංස්කෘත වචන වෙනස් වේ (පන්සල එදිරිව සංසාරය)
R-12ny → න්‍ය; gn → ග්න; ඥ = zh; ඤ = zkන්‍ය සහ ග්න සුලබ කියවීම් වේ (G-NS-12/13); ඥ සහ ඤ ශබ්දකෝෂය මගින් සොයාගනී
R-13ලොකු/කුඩා අකුරු භේදය සලකයිඅක්ෂර වින්‍යාසයේ පමණක් ඇති වෙනස්කම් ලොකු අකුරු මගින් දැක්වේ (4 වන මූලධර්මය)
R-14පුරාතන අකුරු සහ ස්පර්ශ අකුරු archaic විකල්පය යටතේ පමණිනූතන සිංහලයේ මේවා භාවිත නොවේ (G-VS-08, G-HC-17, G-NS-06)
R-15අක්ෂර වින්‍යාසයේ පමණක් ඇති වෙනස්කම් සංඛ්‍යාත ශබ්දකෝෂයක් මගින් විසඳයිG-SP-01: ශබ්දයෙන් ඒවා තීරණය කළ නොහැකිය

7. සීමාවන් ​

  • අපැහැදිලිතාව විසඳීමේ ගුණාත්මකභාවය වචන ලැයිස්තුව මත රඳා පවතී. NLPC ලැයිස්තුව පුවත් පෙළින් ගෙන ඇති නිසා විධිමත් වචන කථන වචනවලට වඩා ඉහළින් පෙළගැසේ (ඔයා ට පෙර ඔය). එහි සමහර පිටපත්වල ZWJ නැති වී ඇත; පූරණය කරන විට normalize() යංශය සහ රකාරාංශය නිවැරදි කරයි. එය ක්‍රියා කරන්නේ කිසිදු ZWJ ක් නැති ලැයිස්තුවක පමණි, මන්ද එයට වචන මායිම් නොපෙනෙන අතර බවත් + ය → බවත්‍ය ලෙසද සම්බන්ධ කරයි.
  • එක් එක් ව්‍යඤ්ජනයට අදාළ වලංගුභාව වගුව (data/validity.json) මූලාශ්‍රවල සංශ්ලේෂණයකි. එය පෙළ සංග්‍රහයකින් කළ ගණනයක් නොවේ (00-rules.md §10).
  • අවිධිමත් රෝමානුකරණය බොහෝ විට ස්වර සම්පූර්ණයෙන්ම අතහරියි (G-TY-05). ඒවා සොයාගැනීමට ආසන්න ගැළපීම (fuzzy matching) අවශ්‍ය වේ. එය මෙහි විෂය පථයෙන් බැහැරය.

පෙළ සහ කේතය MIT බලපත්‍රය යටතේ නිකුත් කර ඇත. උපුටා දක්වන්න: doi:10.5281/zenodo.23244126.