The OpenNET Project
 
Поиск (ключи):    ПРОГРАММЫ СТАТЬИ СОВЕТЫ ФОРУМ
  WIKI НОВОСТИ (+) MAN'ы ДОКУМЕНТАЦИЯ

форумы  помощь  поиск  регистрация  майллист  вход/выход  слежка  RSS
"regexp  + UTF-8 = не работает"
Вариант для распечатки  
Пред. тема | След. тема 
Форумы Программирование под UNIX (Public)
Изначальное сообщение [ Отслеживать ]

"regexp  + UTF-8 = не работает"  
Сообщение от Аноним (??) on 12-Мрт-09, 19:45 
Добрый день, уважаемые.

Подскажите пожалуйста почему Perl не парсит рег.выражения на русском вида [а-яА-Я] при использовании UTF8. Хотя с CP1251 проблем нет(если делаю iconv + использую setlocale(LC_CTYPE,"ru_RU.CP1251");

Имею:
$ locale
LANG=ru_RU.UTF-8
LC_CTYPE="ru_RU.UTF-8"
LC_NUMERIC="ru_RU.UTF-8"
LC_TIME="ru_RU.UTF-8"
LC_COLLATE="ru_RU.UTF-8"
LC_MONETARY="ru_RU.UTF-8"
LC_MESSAGES="ru_RU.UTF-8"
LC_PAPER="ru_RU.UTF-8"
LC_NAME="ru_RU.UTF-8"
LC_ADDRESS="ru_RU.UTF-8"
LC_TELEPHONE="ru_RU.UTF-8"
LC_MEASUREMENT="ru_RU.UTF-8"
LC_IDENTIFICATION="ru_RU.UTF-8"
LC_ALL=

Файл, к-ый хочу пропарсить имеет строки вида:
"Администратор" "Марфа Васильевна"
Естественно он сохранен в UTF-8

Мой скрипт:
#!/usr/bin/perl

use strict;
use warnings;

open(DATA,'file.txt');
my $infile = <DATA>;
close DATA;

while($infile =~ m/([А-Яа-я]+)/gi) {
        print "$1\n";
}

На выходе получаю:
$ perl report.pl
Админи


а
о
Ма

а
Ва
ил
евна

В чем трабла?
На википедии написано что с юникодом проблем не должно быть:
"Для использования последовательностей букв необходимо установить правильную кодовую страницу в которой эти последовательности будут идти в порядке от и до указанных символов. Для русского языка это Windows-1251, ISO 8859-5 и Юникод, так как в DOS-855, DOS-866 и KOI8-R русские буквы не идут одной целой группой или не упорядочены по алфавиту."

Высказать мнение | Ответить | Правка | Cообщить модератору

 Оглавление

Сообщения по теме [Сортировка по времени | RSS]


1. "regexp  + UTF-8 = не работает"  
Сообщение от angra (ok) on 12-Мрт-09, 20:06 
man perluniintro
man perlunifaq
man perlunitut
man perlunicode
Можно начать с попытки добавлять
use utf8;
use open ':encoding(utf8)';
utf8::upgrade($infile);
Если не получится, то придется таки читать.
Высказать мнение | Ответить | Правка | Наверх | Cообщить модератору

5. "regexp  + UTF-8 = не работает"  
Сообщение от Аноним но другой on 13-Мрт-09, 01:52 
>man perluniintro
>man perlunifaq
>man perlunitut
>man perlunicode
>Можно начать с попытки добавлять
>use utf8;
>use open ':encoding(utf8)';
>utf8::upgrade($infile);
>Если не получится, то придется таки читать.

Добавил, теперь скрипт выглядит так:
$ less report.pl
#!/usr/bin/perl

use utf8;
use open ':encoding(utf8)';
utf8::upgrade($infile);

open(DATA,'file.txt');
my $infile = <DATA>;
close DATA;

while($infile =~ m/([А-Яа-я]+)/gi) {
        print "$1\n";
}

$ less file.txt
"Администратор" "Марфа Васильевна"

$ ./report.pl
Wide character in print at page.analyser_simplified.pl line 12.
Администратор
Wide character in print at page.analyser_simplified.pl line 12.
Марфа
Wide character in print at page.analyser_simplified.pl line 12.
Васильевна

Работает!! Спасибо. Осталось теперь тока разобраться с руганью про wide character.
завтра почитаю. спасибо.

Высказать мнение | Ответить | Правка | Наверх | Cообщить модератору

6. "regexp  + UTF-8 = не работает"  
Сообщение от angra (ok) on 13-Мрт-09, 02:14 
Ну не все же одновременно надо было добавлять. Кроме того utf8::upgrade($infile); перед использованием my $infile вообще не имеет смысла. Используйте use strict дабы избегать таких ошибок.
Попробуйте такой вариант:
#!/usr/bin/perl -w
use strict;

use utf8;

open(DATA,'file.txt');
my $infile = <DATA>;
utf8::decode($infile);
close DATA;

while($infile =~ m/([А-Яа-я]+)/gi) {
  my $s=$1;
  #нельзя напрямую применять encode к $1 иначе получим бред после первой строки
  utf8::encode($s);
  print "$s\n";
}

А вообще работа с юникодом в перле(да и в большинстве других языков) это шаманство, особенно когда много _различных_ потоков ввода/вывода.

Высказать мнение | Ответить | Правка | Наверх | Cообщить модератору

2. "regexp  + UTF-8 = не работает"  
Сообщение от gaa (ok) on 12-Мрт-09, 21:46 
>Мой скрипт:
>#!/usr/bin/perl

В какой кодировке файл скрипта сохранён?

И обычно во всех регекспах есть спецпоследовательность для обозначения любого набора букв. Что-то вроде [[:alnum:]] или \w, уж не знаю как в перле.

Высказать мнение | Ответить | Правка | Наверх | Cообщить модератору

3. "regexp  + UTF-8 = не работает"  
Сообщение от angra (ok) on 13-Мрт-09, 00:54 
>И обычно во всех регекспах есть спецпоследовательность для обозначения любого набора букв.
>Что-то вроде [[:alnum:]] или \w, уж не знаю как в перле.

Это по умолчанию только для английских, причем не только в перле. Кроме того в эти классы цифры тоже входят, а в \w еще и подчеркивание.
Перл позволяет работать с возможностями isalpha для локалей, в том числе и utf8, но для этого нужно явно указывать use locale.


Высказать мнение | Ответить | Правка | Наверх | Cообщить модератору

4. "regexp  + UTF-8 = не работает"  
Сообщение от gaa (ok) on 13-Мрт-09, 01:25 
>>И обычно во всех регекспах есть спецпоследовательность для обозначения любого набора букв.
>>Что-то вроде [[:alnum:]] или \w, уж не знаю как в перле.
>Это по умолчанию только для английских, причем не только в перле.

В тикле под \w и [[:alpha:]] буквы из русской локали тоже подходят. Так что надо читать ман по конкретному языку.

Высказать мнение | Ответить | Правка | Наверх | Cообщить модератору

Архив | Удалить

Индекс форумов | Темы | Пред. тема | След. тема
Оцените тред (1=ужас, 5=супер)? [ 1 | 2 | 3 | 4 | 5 ] [Рекомендовать для помещения в FAQ]


ПОДПИШИСЬ НА ЖУРНАЛ Linux Format 2012!

Журнал "Linux Format" (Линукс Формат)- Единственный в России и странах СНГ журнал на русском языке, посвящённый Linux и свободному ПО. Журнал для IT-директоров, IT-менеджеров, программистов, системных администраторов, учителей школ и преподавателей ВУЗов и всех пользователей ПК. В каждом выпуске: Новости индустрии OpenSource, обзоры новинок свободного ПО, обучающие и методические статьи.

Каждый, кто оформит подписку, получает бонусы и подарки- объёмные наклейки на системный блок, диск с архивом номеров за 2005-2011 г.г. и ежемесячно электронную версию журнала в pdf-формате.

Оформить подписку на год


  Закладки на сайте
  Проследить за страницей
Created 1996-2012 by Maxim Chirkov  
ДобавитьРекламаВебмастеруГИД  
RUNNet TopList