| Regex | ||
|---|---|---|
|
spicey
23. avg 2007 21:08:23
Pridružen od: 2. avg 2007 70 objav 87 3 3 |
#1
Moje znanje regexov je bilo do nedavnega nekako omejeno na osnove (razni a-z 0-9 mogoče še kakšen \w in \s), ampak zaradi potrebe po parsanju ne ravno prijetnih spakedrank je bilo treba rahlo bolj se poglobiti v to. Šlo je, če odštejemo porodne težave, kar precej gladko, do tegale:
Najde sicer 90% vrstic, ki jih iščem, nekaj pa jih pade ven. Recimo tale:
Čas za lepotne popravke pride kasneje, ampak tukaj res ne vidim razloga, da stvar ne bi ustrezala. Edit: gre za PHP |
|
|
Vini
24. avg 2007 09:08:03
Pridružen od: 1. sep 2006 6612 objav 5234 611 56 |
#2
Ce uporabljas UTF-8, poskusaj vkljuciti modifier u:
Glede naslednjega sicer nisem povsem preprican, ampak vprasanje je, kateri collation uporablja PHP za te regexp funkcije, verjetno tistega iz sistemskega locale-a dolocenega s setlocale(), ki so pa za slovenscino veckrat povsem neuporabni kot ne... Vem vsaj za freebsd, da za sl_SI.UTF-8 uporablja kar ameriski collation... zalostno... bo treba porihtat enkrat za UTF-8, za Latin2 je, za freebsd, collation prispeval ze moj prijatelj Simon. Zakaj to govorim? Ker nisem povsem preprican, da se tisti [a-ž] obnasa povsem tako, kot bi si ti zelel :) Lahko pa se tudi motim, nisem preverjal... |
|
|
spicey
27. avg 2007 12:08:04
Pridružen od: 2. avg 2007 70 objav 87 3 3 |
#3
Kljub temu, da je vračal vse možne šumnike, je po tem, ko sem pred parsanjem z icnovom dal vse v utf-8, vrnil vse kakor je treba. Rahlo čudno, ampak ok :) |
|
|
Vini
27. avg 2007 13:08:30
Pridružen od: 1. sep 2006 6612 objav 5234 611 56 |
#4
spicey, niti ni cudno, ce nisi vklopil tistega utf-8 switcha, se zadeva ni obnasala tako, da bi razumela, da uporabljas multi-byte charset... in je tiste tvoje sumnike interpretirala povsem po svoje :) |
|