文字コード総合スレ part15 (470レス)
文字コード総合スレ part15 http://mevius.5ch.net/test/read.cgi/tech/1723861080/
上
下
前
次
1-
新
通常表示
512バイト分割
レス栞
219: デフォルトの名無しさん [sage] 2025/01/21(火) 07:42:06.00 ID:4+X4XnDl まあ抽象的なコードポイントの話じゃなくて、エンコーディングの話、例えば > WTF-16(=任意の16bit列) と言ってるから > WTF-8⊃UTF-8となる も8bit列を意図してるのなら、成り立たないな。 WTF-8に関しては、WTF-8(=任意の16bit列)ではなくて、 絵文字などをUTF-8エンコードした8bit列は、WTF-8では不正な8bit列となる。 http://mevius.5ch.net/test/read.cgi/tech/1723861080/219
220: デフォルトの名無しさん [sage] 2025/01/21(火) 07:43:40.53 ID:4+X4XnDl 訂正 WTF-8に関しては、WTF-8(=任意の8bit列)ではなくて、 http://mevius.5ch.net/test/read.cgi/tech/1723861080/220
221: デフォルトの名無しさん [sage] 2025/01/21(火) 08:02:21.62 ID:CGf2GAkC >>219 >>絵文字などをUTF-8エンコードした8bit列は、WTF-8では不正な8bit列となる。 それは君が勘違いしてるよ UTF-8エンコードした8bit列は必ず有効なWTF-8になるが正しい 反論があるならUTF-8がWTF-8とならない場合のプログラム例を出そう http://mevius.5ch.net/test/read.cgi/tech/1723861080/221
222: デフォルトの名無しさん [sage] 2025/01/21(火) 08:06:50.62 ID:6E3WwSvm >>221 それを含めた時が冗長性誕生の瞬間である http://mevius.5ch.net/test/read.cgi/tech/1723861080/222
223: デフォルトの名無しさん [sage] 2025/01/21(火) 08:11:27.09 ID:CGf2GAkC >>222 冗長表現となる事例とその生成プログラム例を出そうよ 世界中で誰も示せていないよ http://mevius.5ch.net/test/read.cgi/tech/1723861080/223
224: デフォルトの名無しさん [sage] 2025/01/21(火) 08:59:02.25 ID:HFAykEjr WTF-8 は定義からして冗長性はない、プログラム以前の問題 WTF-8 は UTF-8 に加えて片サロゲートをUTF-8変換したものが含まれているだけ サロゲート前半とサロゲート後半の連続も許されてない それが混じったらWTF-8じゃない WTF-8∋UTF-8 → ✕ WTF-8⊃UTF-8 → ○ 任意の16bit列 = WTF-16 → ○ (未定義文字などを許す前提) 任意の8bit列 = WTF-8 → ✕ WTF-16 と WTF-8 は冗長性なく1対1対応 → ○ 基本が分かってないやつがいるので議論が噛み合ってないだけのようだ http://mevius.5ch.net/test/read.cgi/tech/1723861080/224
225: デフォルトの名無しさん [sage] 2025/01/21(火) 09:11:27.73 ID:nn8C9EMv >>224 > 基本が分かってないやつ ごめんごめんWTF-8の定義見て来た。 あと>>209見て明らかな脆弱性はないと納得した。 pushでsurrogate pairになってもself.is_known_utf8 = falseにしてるんだな。 http://mevius.5ch.net/test/read.cgi/tech/1723861080/225
226: デフォルトの名無しさん [sage] 2025/01/21(火) 09:23:46.18 ID:snb5MXpj WTF-8に冗長表現は起きず脆弱性はないね 冗長が起きると書き込んでる人は、理解できずに間違った思い込みをしているのか、悔しくてデマを繰り返してるのか、わからんけどさ 冗長表現を生成する具体例を一つ示せば済むのに、ここまで来ても一つも示せていない http://mevius.5ch.net/test/read.cgi/tech/1723861080/226
227: デフォルトの名無しさん [sage] 2025/01/21(火) 10:25:40.02 ID:uiolM7XA 帰れ http://mevius.5ch.net/test/read.cgi/tech/1723861080/227
228: デフォルトの名無しさん [sage] 2025/01/21(火) 11:37:21.93 ID:q2HQSFd2 >>215の言うAにもBにも含まれない「文字」がA+Bに含まれるかもしれない問題、 処理の正しさの観点では(脆弱性の話は置いておいて) NFC/NFDやIVS/IVD/ZWJ絡みで(well formed UTF-8同士の範囲でも)発生する気がするけど 実際にA+Bを作ってからチェックするのが鉄則なのか? 「文字」じゃなくて「文字列」ならA+Bを作るのが普通と思う (それと正規表現なら部分マッチが出来たりする) http://mevius.5ch.net/test/read.cgi/tech/1723861080/228
229: デフォルトの名無しさん [sage] 2025/01/21(火) 12:16:20.66 ID:HFAykEjr >>228 結合文字とか変種指定は機能性の問題なのでさらに一段回上のレイヤーの要件だな 「が」と「か+結合濁点」を同じとみなすか別とみなすかは目的による(文字コード的にはどちらもありえる http://mevius.5ch.net/test/read.cgi/tech/1723861080/229
230: デフォルトの名無しさん [sage] 2025/01/21(火) 12:47:14.29 ID:mXSJj++Z そんなの要件定義考慮漏れで溢れかえってる 何かあったら現状を仕様にする http://mevius.5ch.net/test/read.cgi/tech/1723861080/230
231: デフォルトの名無しさん [sage] 2025/01/21(火) 16:35:46.77 ID:3Vt9EG/U ライブラリ側に問題がないとはいえ過信はよろしくない OsStringでは機能が足りず中身を取り出しての直接処理はよくやられてるし 余計な変換をかましてるせいで考慮することが増えてしまってる一方でアプリ側にはWindowsの特殊事情なんて考慮してないコードも山ほどあろう http://mevius.5ch.net/test/read.cgi/tech/1723861080/231
232: デフォルトの名無しさん [sage] 2025/01/21(火) 17:20:43.69 ID:HFAykEjr >>231 だから最初から WTF-8 は UTF-8 とは別物 混同したら問題、混同しなければ問題はない UTF-8 ではサロゲート断片は許されない WTF-8 ではサロゲートの片側だけ許されるがそのせいで追加の処理が必要 冗長性うんぬんを言い出すのはこの違いが分かってないやつという話題だろ http://mevius.5ch.net/test/read.cgi/tech/1723861080/232
233: デフォルトの名無しさん [sage] 2025/01/21(火) 17:51:44.82 ID:ARY2cBPO Windowsも対応しているRipGrepの場合、OsStringのまま処理してるけど ユーザーアプリレベルでWTF-8は必要なのか? (すぐにpub fn into_string(self) -> Result<String, OsString>してる気がする) http://mevius.5ch.net/test/read.cgi/tech/1723861080/233
234: デフォルトの名無しさん [sage] 2025/01/21(火) 20:27:12.14 ID:81VrkBbA 10年以上経ってv0.1.0な時点でネタライブラリでは http://mevius.5ch.net/test/read.cgi/tech/1723861080/234
235: デフォルトの名無しさん [sage] 2025/01/21(火) 20:36:26.03 ID:vcWEfek9 >>233 OsStringとWTF-8は別物だと理解できてる? OsStringは元が正規ユニコードならUTF-8となり、異なるならUTF-8を含む拡大集合になる、という抽象的な型 たまたまWindows環境の時は内部がWTF-8になるかもしれないがそんなことを意識せずに使えるところがカギ 自分の管轄範囲を処理する多くのアプリでは元がユニコードでなければエラーとして無視できる そのためto_string()で文字列すなわちUTF-8へ変換するがそこで実際に変換する必要がなく変換コストはゼロとなる点が実際の目的 このような特性を備えつつUTF-8にできない場合も元の情報を保つ抽象的な型がOsString そしてWindowsの場合はその内部実装をWTF-8にすると上述の特性群を満たせるというだけの話 http://mevius.5ch.net/test/read.cgi/tech/1723861080/235
236: デフォルトの名無しさん [sage] 2025/01/21(火) 22:03:34.94 ID:HFAykEjr Rust の OsString という基準だと Linux とかだと任意のバイト列なんでそっちがもともとの形だな たまたま Windows 版で効率考えて WTF-8 変換したものを使ってるだけ http://mevius.5ch.net/test/read.cgi/tech/1723861080/236
237: デフォルトの名無しさん [sage] 2025/01/21(火) 22:39:07.66 ID:p3RcK7RU rgは凄く効率を重視してるけどOsStringで扱うしかなくてロスが発生してる (各ファイルを開くのにWTF-16名に戻す処理が必要) http://mevius.5ch.net/test/read.cgi/tech/1723861080/237
238: デフォルトの名無しさん [sage] 2025/01/22(水) 23:14:48.82 ID:qi7PZ6q/ OsStringは異なる環境で統一的に容易にStringと相互変換して扱えるための標準ライブラリ機能 些細なロスすら深刻な影響が出る用途がもし存在するのならば 特定環境に特化した専用のライブラリを用意すればよいだけ 必要な条件を満たすライブラリが既に存在しているかどうかは各自の用途で調べて http://mevius.5ch.net/test/read.cgi/tech/1723861080/238
239: デフォルトの名無しさん [sage] 2025/01/24(金) 18:16:24.35 ID:3xtC4p+Z >>209 今の正しいソースはこっちな githubcom/rust-lang/rust/blob/master/library/std/src/sys_common/wtf8.rs#L357 >>228 結果的にWTF-8でA+B問題は起きるな http://mevius.5ch.net/test/read.cgi/tech/1723861080/239
240: デフォルトの名無しさん [sage] 2025/01/24(金) 21:50:18.47 ID:VaG4uwwC >>239 WTF-8自体を自在に改変するインターフェイスが全くないため、WTF-8独自の問題は発生しない。 WTF-8はWTF-16と1対1に可逆なので、WTF-16で起こる問題は当然WTF-8でも起きる。 WTF-16とはWindows OSが許容している拡張UTF-16、すなわち本来のUTF-16とは異なる16bit列も許す。 したがって、WTF-8を用いて起こる問題は、Windows OSが許容してる範囲内の問題のみであり、新たな問題を持ち込むことはない。 http://mevius.5ch.net/test/read.cgi/tech/1723861080/240
241: デフォルトの名無しさん [sage] 2025/01/25(土) 06:47:37.99 ID:IEhZAzOs >>240 なんでもOSのせいにするのは良くないぞ Windows は片サロゲートどうしを連結することを前提にしてはいない あくまでも連結してるのはアプリの問題 WTF-8 の連結もアプリの問題OSとは独立 http://mevius.5ch.net/test/read.cgi/tech/1723861080/241
242: デフォルトの名無しさん [sage] 2025/01/25(土) 07:40:49.86 ID:oQSzfWfA >>241 もちろんその通りで 当たり前の三つの同値 WTF-8で起こりうること = WTF-16で起こりうること = Windowsで起こりうること これだけの話だな それを理解できずにWTF-8で新たな問題が生じると勘違いしているバカがWTF-8を批判していた http://mevius.5ch.net/test/read.cgi/tech/1723861080/242
243: デフォルトの名無しさん [sage] 2025/01/25(土) 08:02:54.69 ID:IEhZAzOs >>242 いや WTF-8 で起こりうること = WTF-16 で起こりうることは定義上正しいけど = Windows で起こりうること、は正しくないだろという指摘だぞ http://mevius.5ch.net/test/read.cgi/tech/1723861080/243
244: デフォルトの名無しさん [sage] 2025/01/25(土) 08:11:11.01 ID:oQSzfWfA >>243 意図的にUTF-16から逸脱したコードを生成するアプリ次第でWindows上で起こりうるから全く同じ もし違うというならばその差分となる具体例を出してください http://mevius.5ch.net/test/read.cgi/tech/1723861080/244
245: デフォルトの名無しさん [sage] 2025/01/25(土) 11:54:33.53 ID:IEhZAzOs >>244 Linux とかでも意図的に逸脱したコード書けば起きるだろ 違うってなんら Windows 固有にコード示したら? http://mevius.5ch.net/test/read.cgi/tech/1723861080/245
246: デフォルトの名無しさん [sage] 2025/01/25(土) 12:08:02.89 ID:oQSzfWfA >>245 それも正しい WindowsもLinuxも正しいユニコード以外を許容している だからUTF-16やUTF-8を前提としてはいけない そのためWTF-16やWTF-8あるいは何らか他の枠組みの導入でようやく対応できる その時に当たり前の三つの同値 WTF-8で起こりうること = WTF-16で起こりうること = Windowsで起こりうること この事実を理解できるかどうか これを理解できずにWTF-8で新たな問題が生じると勘違いしているバカがWTF-8を批判していた http://mevius.5ch.net/test/read.cgi/tech/1723861080/246
247: デフォルトの名無しさん [sage] 2025/01/25(土) 12:36:14.63 ID:IEhZAzOs >>246 = Windows で起こりうることに拘るのは何でだ? UTF-8 と WTF-8 は別物なのに同じように扱ったら問題が起きる可能性がある OS とは独立 http://mevius.5ch.net/test/read.cgi/tech/1723861080/247
248: デフォルトの名無しさん [sage] 2025/01/25(土) 13:00:31.67 ID:oQSzfWfA >>247 どのOSも正しいユニコード以外を許容している したがってUTF-8/16以外も扱えなければならない そして非UTF-8/16があった時にそれを認識して区別して扱えなければならない その区別ができないと既存のUTF-8/16部分にもうっかり混入させて汚染を広げてしまう この重要性が理解できるかね? RustではUTF-8とWTF-8(など非ユニコード)は明確に別の型となっているため安全性が保証される 両者を扱えつつ型システムにより必ず区別できる http://mevius.5ch.net/test/read.cgi/tech/1723861080/248
メモ帳
(0/65535文字)
上
下
前
次
1-
新
書
関
写
板
覧
索
設
栞
歴
あと 222 レスあります
スレ情報
赤レス抽出
画像レス抽出
歴の未読スレ
Google検索
Wikipedia
ぬこの手
ぬこTOP
0.007s