文字コード総合スレ Part12

[過去ﾛｸﾞ] 文字コード総合スレ Part12 (1002ﾚｽ)
上下前次 1-新

このｽﾚｯﾄﾞは過去ﾛｸﾞ倉庫に格納されています｡
次ｽﾚ検索歴削→次ｽﾚ栞削→次ｽﾚ過去ﾛｸﾞﾒﾆｭｰ

1: デフォルトの名無しさん [sage] 2018/12/16(日) 12:38:15.61 ID:VlX3xGEw(1/7) AAS
Windows NTは初代からUnicodeがネイティブの文字コードです。cp932ではありません。
プログラマーなら一度は煩わされたことのある文字コードについてのスレ。
UTF-8、Shift_JIS、JIS、EUC、Unicode、UCS、サロゲートペア、コードポイント、文字コード判定、
合成文字、ソート、TRON、外字コード、その他について語り合いましょう。
各言語での文字列の扱いについての質問もOKです。
基本マッターリ、ささ、茶でもどうぞ。

■過去スレ
文字コード総合スレ part1 2chｽﾚ:tech
文字コード総合スレ part2 2chｽﾚ:tech
文字コード総合スレ part3 2chｽﾚ:tech
文字コード総合スレ part4 2chｽﾚ:tech
　（スレ再利用）UnicodeとUTF-8の違いは？ 2chｽﾚ:tech
　（隔離スレ）UnicodeとUTF-8の違いは？　その2 2chｽﾚ:tech
文字コード総合スレ part5 2chｽﾚ:tech
文字コード総合スレ part6 2chｽﾚ:tech
文字コード総合スレ part7 2chｽﾚ:tech
文字コード総合スレ part8 2chｽﾚ:tech
文字コード総合スレ part9 2chｽﾚ:tech
文字コード総合スレ Part10 2chｽﾚ:tech
文字コード総合スレ Part11 2chｽﾚ:tech

2(1): デフォルトの名無しさん [sage] 2018/12/16(日) 12:40:36.99 ID:VlX3xGEw(2/7) AAS
■参考サイト
Unicode Home Page
外部ﾘﾝｸ:www.unicode.org
Java Character Encodings
外部ﾘﾝｸ:www.ingrid.org
euc.JP: tech docs, BeOS tools
外部ﾘﾝｸ:euc.jp
IANA: Character Sets
外部ﾘﾝｸ:www.iana.org
Legacy Encoding Project
外部ﾘﾝｸ:sourceforge.jp
JIS X 4061
日本語文字列照合順番
外部ﾘﾝｸ:www.jisc.go.jp

3: デフォルトの名無しさん [sage] 2018/12/16(日) 12:45:08.07 ID:VlX3xGEw(3/7) AAS
■これまでに行われた議論
・Windows 10のコマンドプロンプトでUTF-8を使用する場合chcp 65001で切替可能。日本語入力等も可
・Shift JIS や EUC-JP や Big5 や GB なんかをUnicode に変換してしまうと、ラウンドトリップは保証されるか
・単一情報をソースの文字コード(or 言語)情報なしに元に戻したい（統計的に文字の出現確率なんかを調べる）
・0x5cをUnicodeにするときにバックスラッシュに置き換えるか円マークに置き換えるかで、逆変換時に結果が変わるの問題
・丸付き数字は機種依存文字か？。Unicodeでは機種依存文字ではない。
・Safari文字コード変換のバグは
・Microsoft文字コード変換のバグは
・U+31F0..U+31FF（アイヌ語表記用小書きカタカナ）が入ってない件
・文字化けに強いishフォーマットでエロ画像を交換する場合、ssより、s7のほうが化けにくい
・SJISとUNICODEの判別はどのようにすればいいですか？BOM。無ければ、統計判断。ライブラリを使うが吉
・ところでケータイのUnicode対応度って実際どうよ？　→　対応済み
・TwitterのWebインターフェイスからだと、サロゲートペアは2文字としてカウント。140字打てない。
・Unicode 5.2で追加されたUnicodeSMP(第1面)、Unicode 5.1で未定義だったSMPのコードポイントや第15、第16面が
　Windows7では表示されない。　→　和田研細丸ゴシック2004ARIBはARIB外字を含んでいる。
・元号を安置する場所はJIS第三で確保済み。ウニコードでブロックを確保は政治力次第。
・元号は個人名ではない。特定の時間軸基準に数える年号を漢字で指す文字。
　陛下の崩御後必ずしも元号が追号になるわけではない。むしろ違う場合が多い。昭和54年法律43号の元号法参照。
・文末でなければ"0"+ASCII7ビット、文末なら"1"+ASCII7ビットというエンコード。　→　ヌル1バイトが貴重な時代からの負の遺産。
・Windows7出荷時に未定義だったコードポイントはフォント入れても豆腐になる。Unicode5.2は表示しない。欝だ。
・Unicode6ドラフトでPILE_OF_POO文字確定。ウニコードがもはやイミフ。SerifとSans-Serifで幅に違いは出る？
・Unicodeのzipが文字化けする。→Windows 7は公式パッチで対応可能。8以降は標準対応

4: デフォルトの名無しさん [sage] 2018/12/16(日) 12:46:00.56 ID:VlX3xGEw(4/7) AAS
・中国語の簡体字では、へんやつくりが簡略化されるなら、その文字も自動的に簡略化して表記する国家規格が有る
・中国語の「噁心」簡化政策によると「恶(U+6076)」に統一。口偏＋恶(U+6076)は普通に使われているがUnicodeにはない
・日本人のニーズが満たせないのも確かなので原規格分離（中国では「曾→曽」は簡体字と繁体字の違いとはみなされていないとか）
・UNICODEを扱うプログラムはサロゲートをぶったぎられた入力が渡されてくる場合にも備えろって→YES
・UnicodeとUTF-8の違いは？
・日本のCJK Ext.D Submissionに{魚針}が含まれてる件
　U+9C75(魚箴)は強烈。いくら何でも違いすぎる。(魚針)
　ひょっとしたら後で実は別字だったとか日本では異体字だが中国では別字とかになるかも知れんぞ。
　中国ではってレベルじゃねーぞ。
・Unicodeは言語情報を直接扱わない。多言語の混在表現は（unicodeでは）できないか
・Unicode文字列リストを各国言語を考慮してソートしたいんですが　→　ムリです。
・Unicodeサニタイズが面倒になるのか

上下前次 1-新書関写板覧索設栞歴

あと 998 ﾚｽあります
ｽﾚ情報赤ﾚｽ抽出画像ﾚｽ抽出歴の未読ｽﾚ AAｻﾑﾈｲﾙ

ぬこの手ぬこTOP 0.008s