Добрый день, уважаемые.Подскажите пожалуйста почему Perl не парсит рег.выражения на русском вида [а-яА-Я] при использовании UTF8. Хотя с CP1251 проблем нет(если делаю iconv + использую setlocale(LC_CTYPE,"ru_RU.CP1251");
Имею:
$ locale
LANG=ru_RU.UTF-8
LC_CTYPE="ru_RU.UTF-8"
LC_NUMERIC="ru_RU.UTF-8"
LC_TIME="ru_RU.UTF-8"
LC_COLLATE="ru_RU.UTF-8"
LC_MONETARY="ru_RU.UTF-8"
LC_MESSAGES="ru_RU.UTF-8"
LC_PAPER="ru_RU.UTF-8"
LC_NAME="ru_RU.UTF-8"
LC_ADDRESS="ru_RU.UTF-8"
LC_TELEPHONE="ru_RU.UTF-8"
LC_MEASUREMENT="ru_RU.UTF-8"
LC_IDENTIFICATION="ru_RU.UTF-8"
LC_ALL=
Файл, к-ый хочу пропарсить имеет строки вида:
"Администратор" "Марфа Васильевна"
Естественно он сохранен в UTF-8
Мой скрипт:
#!/usr/bin/perl
use strict;
use warnings;
open(DATA,'file.txt');
my $infile = <DATA>;
close DATA;
while($infile =~ m/([А-Яа-я]+)/gi) {
print "$1\n";
}
На выходе получаю:
$ perl report.pl
Админи
а
о
Ма
а
Ва
ил
евна
В чем трабла?
На википедии написано что с юникодом проблем не должно быть:
"Для использования последовательностей букв необходимо установить правильную кодовую страницу в которой эти последовательности будут идти в порядке от и до указанных символов. Для русского языка это Windows-1251, ISO 8859-5 и Юникод, так как в DOS-855, DOS-866 и KOI8-R русские буквы не идут одной целой группой или не упорядочены по алфавиту."