文字コード総合スレ part15 (469レス)
文字コード総合スレ part15 http://mevius.5ch.net/test/read.cgi/tech/1723861080/
上
下
前次
1-
新
通常表示
512バイト分割
レス栞
抽出解除
レス栞
リロード規制
です。10分ほどで解除するので、
他のブラウザ
へ避難してください。
361: デフォルトの名無しさん [sage] 2025/07/31(木) 12:22:57.59 ID:1FIA24UI >>360 Windowsの標準のフォントしか使ってないので、遭遇した事もないし、聞いた事もないが (ただ、当時はそうなっても「文字化け」としてスルーされてたとも思うが unicodeしか使った事無いゆとり以降は、文字化け=バグ、とか言い出すから別の問題はあるにしても、 文字化けについて厳しくなってるから話題として出てきてるだけかもしれん) しかし結局、文字コード->グリフで多対一写像があり、戻す時にどちらに戻すべきか分からなくなるのが問題なら、 (SJISな当時に)多対一写像がありまくるのはただの糞フォントだとも思うが 平仮名/片仮名は漢字の簡易形であり、当然似たような字形はあるので、 ほぼ全部のフォントでそれらを何となく区別出来るように大きさを変えてあるのが常だし で、unicodeは多対一写像が仕様だから、 1:1写像な以前の世界向けに作られた物が当然誤動作してるだけだろ (さっさと対応しろよ、なのは勿論だが) して、「酷い」と考える奴は結局、後知恵でもいいからどうすべきだったと考えるのだ? 文字コードを埋め込む方式は、見た目同じだが検索に引っかからない、いわゆる正規化の問題が発生してしまう 同じグリフ->同じ文字コードなら、この問題は存在しない だから「検索」と「コピペ」のどちら向けの仕様にするか、であり、PDFが > 検索ができないのは不便だからってんで (>>328) なら、そりゃ検索向けの仕様にするよ (現在のPDFが検索時に正規化して対応してるとしても、 同じグリフに複数の文字コードを与えている糞フォントな場合、 画面なぞって検索したときに、見た目同じなのに引っかからないケースが発生する 同じグリフなら同じコードだ!の旧方式なら、これはない) http://mevius.5ch.net/test/read.cgi/tech/1723861080/361
363: デフォルトの名無しさん [sage] 2025/07/31(木) 13:09:41.59 ID:Ztum1zAi >>361 フォントが1種類しか使われてないと思い込んでるのがお前の妄想の原因なんだよ アラビア語のフォントが一部に使われてるPDFをSJISのテキストにコピペしたらどうなるか想像つくだろ http://mevius.5ch.net/test/read.cgi/tech/1723861080/363
385: デフォルトの名無しさん [sage] 2025/08/02(土) 11:23:02.89 ID:xIFE1Go+ >>384 > 順が なるほどやはりお前は分かってない > 検索文字列がSJISとかUnicodeで与えられた時 実はこれには問題がある。だから注つけるかとも考えたが、 > 画面なぞって (>>361) と既に言及してるし、どのみちunicodeだと手打ちでは無理で、画面なぞるしかない(後述)ので、まあいいかで省略した 賢いお前らなら当然気づくから、いちいち無駄ツッコミはないはずだし > グリフIDと文字コードの対応がPDFに内蔵されてない場合 それは初(ry > 中には文字を それも初(ry 本質的には、unicodeの問題がPDFに輸出されてしまってるんだよ 仮にPDFがhtmlのようにunicode文字コードで構成されてても、正規化の問題は発生するし、 316の例みたいに同じグリフを複数のコードが使用してる場合、「手打ちでの」検索はヒットしないことがあり得る PDFの仕様だと、「画面なぞれば」100%ヒットするだけまだましで、unicodeはこれすら保証できない http://mevius.5ch.net/test/read.cgi/tech/1723861080/385
メモ帳
(0/65535文字)
上
下
前次
1-
新
書
関
写
板
覧
索
設
栞
歴
スレ情報
赤レス抽出
画像レス抽出
歴の未読スレ
AAサムネイル
Google検索
Wikipedia
ぬこの手
ぬこTOP
0.051s