文字コード総合スレ part15

文字コード総合スレ part15 (467ﾚｽ)
上下前次1-新
抽出解除ﾚｽ栞

ﾘﾛｰﾄﾞ規制です｡10分ほどで解除するので､他のﾌﾞﾗｳｻﾞへ避難してください｡

18: デフォルトの名無しさん [] 2024/08/31(土)10:12:54.19 ID:oPSFGvVw(1)
毛頭はIIやIIIを好むけど同じ問題だな

95: デフォルトの名無しさん [] 2024/11/18(月)23:18:52.19 ID:cZsx9Sbk(1/2)
UTF-8は世界の誰もが好むわけではない。
どの民族もUTF-8の良いところと悪いところで悩んでいる

191: 188-189 [sage] 01/18(土)12:30:08.19 ID:ZXpOcGU5(1)
>>190
なるほどね納得

不正な文字コードに遭遇したら処理を進めないで即座にエラーにするが良さそう

問題は処理系がちゃんと不正な文字コードを感知するかどうかだけど、
WindowsでA系APIを使っていれば(RawワイドストリングのUTF-16解釈が試みられて)
不正なパラメータエラーとかで(ディレクトリスキャン時などの)早期に発見できそうな気がする

210: デフォルトの名無しさん [sage] 01/20(月)23:35:21.19 ID:fw0guZsp(5/5)
>>208
他言語のStringBuilder等ならそうだけど
OsStringには直接の比較関数等もあるので結合時点以外に選択肢は無いと思う

276(1): デフォルトの名無しさん [sage] 01/31(金)20:45:51.19 ID:B141IEhK(2/4)
そもそも正規化自体は都合に合わせて勝手にやるもんだぜ？
Windowsの.で終わるファイル名を拡張子なしと同一視するのも正規化だし
掲示板への書き込みで行頭のスペースが消えるのも正規化だ
Unicodeで定義されたやつだけが正規化ではないというのは大前提として

字形を変えない範囲で厄介な合成分解で別ファイル扱いになるのを避けたい
というのは他の文字コードからUnicodeへの過渡期では当然の要求だろう
他のOSとのやりとりでトラブルが起きるようになったのはもっと考えるべきだったとは思うが

378(1): デフォルトの名無しさん [sage] 08/01(金)22:01:15.19 ID:wR/jTASQ(2/2)
>>377
> 検索文字列がフォント名とグリフIDのセットで降ってくるとでも思ってるのか？
お前のプログラミング能力はゼロで、文字列検索では具体的に何をしてるのか全く知らない事は分かった
ただこれはプログラマには常識過ぎるので、316のリンク先やこのスレ内でも、誰もわざわざ言及していない
だからお前は付いてこれないままだ
だが、それ以前に、お前は文字列とは何なのかも知らなそうだが
そもそも>>317もまるで理解できてないだろ

理解したければ、プログラミングのイロハから勉強するんだね
多分お前はPDFのヘビーユーザー、おそらくはイラレ使い、てなところか
お前が文字コードの問題まで理解できることは、短期的にはない。ベースの知識が足り無すぎる
そもそも何故お前がこの板にいるのかがかなり謎だが
PDFに不満があるのなら、「出力はAdobe純正ソフトで、マッピング情報等は全部含めて、ファイルは大きくなってもいいから」と依頼すれば、
お前の不満に対しての最適解にはなってるだろうさ

414: デフォルトの名無しさん [sage] 08/17(日)14:45:32.19 ID:2MRCWKC9(1)
康煕部首の「長」と普通の「長」がコピペで混在できる（こともある）PDFを
作ってみましたが、いかがでしょう
https://drive.google.com/file/d/1sqQ6lqQhvfC_zTkL3B4fQ_GV4_376O10/

とりあえずGoogle Driveが立ち上げるPDFビューアではうまくいかない模様w

415: デフォルトの名無しさん [sage] 08/18(月)08:42:57.19 ID:uGdRPz4N(1/2)
ActualTextだとPDF内で該当文字が出てくるたび必要なので煩雑ではあるね

439: デフォルトの名無しさん [sage] 08/21(木)09:07:08.19 ID:4FAr+8B9(1)
>>436
昔のAIにSJISをunicodeに変換するコード書かせたら何故かテーブルもってなくて機械的にシフトと論理演算で変換できますってコード出されたって話を思い出した
お前、そのAIだったりしないか？

上下前次1-新書関写板覧索設栞歴

ｽﾚ情報赤ﾚｽ抽出画像ﾚｽ抽出歴の未読ｽﾚ AAｻﾑﾈｲﾙ

ぬこの手ぬこTOP 0.028s