charset: include missing Encode options
authorMischa POSLAWSKY <perl@shiar.org>
Fri, 7 Apr 2017 17:14:19 +0000 (19:14 +0200)
committerMischa POSLAWSKY <perl@shiar.org>
Mon, 24 Apr 2017 23:51:41 +0000 (01:51 +0200)
charset.plp

index 4c673bc..92b918f 100644 (file)
@@ -30,19 +30,33 @@ sub tabinput {
        my $input = shift or return;
 
        state $ALIAS = {
-               default    => [qw(unicode- utf-8 iso-8859-1 -cp1252- --iso-8859-15- cp437 -cp850)],
-               us         => [qw(cp437 -cp863)],
-               westeur    => [qw(iso-8859-1 -cp1252 -MacRoman -cp850)],
-               centeur    => [qw(iso-8859-2 -cp1250 -cp852 -MacCentralEurRoman -MacCroatian -MacRumanian)],
-               cyrillic   => [qw(koi8-f -iso-8859-5 -cp1251 -MacCyrillic -cp855 -cp866)],
-               greek      => [qw(iso-8859-7 -cp1253 -MacGreek -cp737 -cp869)],
-               hebrew     => [qw(iso-8859-8 -cp1255 -MacHebrew -cp862)],
+               default    => [qw(unicode- utf-8 iso-8859-1 -cp1252-- --iso-8859-15-- cp437 -cp850)],
+               us         => [qw( cp437 -cp863 AdobeStandardEncoding gsm0338-- )],
+               ebcdic     => [qw( cp37 cp500  cp875  cp1026  cp1047  posix-bc )],
+               westeur    => [qw( iso-8859-1 --iso-8859-15-- -cp1252-- --iso-8859-14 -cp850 -MacRoman -nextstep --hp-roman8 )],
+               centeur    => [qw( iso-8859-2 --iso-8859-16 -cp1250 -cp852 -MacCentralEurRoman -MacCroatian -MacRomanian )], # MacRumanian only for DB
+               turkish    => [qw( iso-8859-3 -iso-8859-9 -cp857 -cp1254 -MacTurkish )],
+               baltic     => [qw( iso-8859-4 --iso-8859-13 -cp775 -cp1257 )],
+               nordic     => [qw( iso-8859-10 -cp865 --cp861-- -MacIcelandic --MacSami )],
+               cyrillic   => [qw( koi8-f -koi8-r- --koi8-u- -iso-8859-5 -cp1251 -MacCyrillic -cp855 -cp866 )], # MacUkrainian is broken
+               arabic     => [qw( iso-8859-6 --cp1006 -cp864 -cp1256 MacArabic )], # MacFarsi same as MacArabic?
+               greek      => [qw( iso-8859-7 -cp1253 -MacGreek -cp737 -cp869 )],
+               hebrew     => [qw( iso-8859-8 -cp1255 -MacHebrew -cp862 )],
+               thai       => [qw( iso-8859-11 -cp874-- -MacThai )],
+               vietnamese => [qw( viscii cp1258 MacVietnamese )],
+               symbol     => [qw( symbol dingbats MacDingbats AdobeZdingbat AdobeSymbol )],
                # iso-code shorthand
                1 => 'westeur',
                2 => 'centeur',
+               3 => 'turkish',
+               4 => 'baltic',
                5 => 'cyrillic',
+               6 => 'arabic',
                7 => 'greek',
                8 => 'hebrew',
+               9 => 'turkish',
+               10 => 'nordic',
+               11 => 'thai',
        };
        if (my $follow = $ALIAS->{$input}) {
                return map { tabinput($_) } ref $follow ? @{$follow} : $follow;
@@ -56,9 +70,12 @@ sub tabinput {
        elsif ($input =~ s/^-//) {
                $row{offset} = $endpoint > 128 ? 128 : 32;
        }
-       if ($input =~ s/-$//) {
+       if ($input =~ s/--$//) {
                $endpoint = $row{offset} ? $row{offset} < 160 ? 159 : 191 : 127;
        }
+       elsif ($input =~ s/-$//) {
+               $endpoint = 192;
+       }
        if ($row{offset}) {
                $row{setnote} = 'over cp437' if $input eq 'cp850';
                $row{setnote} = 'over iso-8859-1' if $input =~ /^iso-8859-|^cp125/;