全文検索エンジン Hyper Estraier 2 (329レス)
1-

146: fumiyas 2008/07/29(火)13:57 AAS
ありゃ? 「&lt;」(実際は半角)とかが「<」に変換されちまった…。
どうしたらいいの? ま、いいか。
147
(1): fumiyas 2008/07/29(火)15:56 AAS
初心者板で聞いてきました。「&amp;amp;」って書くのね…。

pdftotext -enc UTF-8 -htmlmeta "$infile" - 2> "/dev/null" \
|sed '/<pre>/,/<\/pre>/{s/&/\&amp;/g;s/</\&lt;/g;s/>/\&gt;/g}' \
|output

その中に含まれる <, & を &lt;, &gt;, &amp; に変換してくれません(バグ)。
148
(1): 2008/07/30(水)18:50 AAS
>>147

す・すすごい!!できたできました!!(・∀・∀・)
ごっそり抜けちゃってた文章も、タグだと誤解されてしまってたんですね。
きちんとインデックスに戻ってきました、戻ってきましたよ!!щ(゜ロ゜щ) カモ-ン

天才ですかfumiyasさま… (シ_ _)シ ネ申 >>147
ほんにありがとうございます。

確かにインデックスの方には <pre> が単語化されているようですが、
これはもう、しょうがないですよ…ね…?

はぁぁ、感動しちゃいました。(;∀; )
149: fumiyas 2008/08/01(金)01:35 AAS
>>148
解決されたようでなによりです。
「pre」が気になるようなら、上で書いたように estfxpdftohtml
の代わりに estfxpdftotext でもどうぞ。estcmd の -fx オプションの
値を変更するのを忘れないように。
150: HE@SHE 2008/09/27(土)02:48 AAS
Hyper Estraierで、URI属性をフレーズ検索の対象とする方法はありますでしょうか。
151: 2008/10/02(木)13:47 AAS
すみません教えてください。
ファイルサーバ(Xとか入れてません)として使っているetchにHyper Estraierを入れてわりと経つのですが、
pdfの日本語がインデックスに入っていないことに気付きました。
いろいろ調べて、ひとまずpdftotextが日本語を変換してくれてないのだ、と分かりました。

degas@debian:~$ pdftotext 日本語入りのpdf.pdf
Error: Unknown character collection 'Adobe-Japan1'
 :
Error: Unknown character collection 'Adobe-Japan1'

ってな状況ですorz。xpdfはapt-getでhyperestraierをインストールするときに
推奨パッケージでxpdf-utilsを入れたので、大丈夫だと思っているのですが…。
念のためいまxpdfも入れてみましたが、同じエラーが出ます。
指針が有ればお願いしますm(_ _)m。
152: 2008/10/02(木)14:23 AAS
Unknown character collection 'Adobe-Japan1' でググっても解決しないの?
xpdf-japanese とやらを入れてる?
153: 2008/10/02(木)14:29 AAS
外部リンク[html]:www.foolabs.com
にある
xpdf-japanese.tar.gz
は入れた?
154: 2008/10/02(木)15:11 AAS
ありがとうございます。
xpdf-japaneseはapt-getだと入らないのですよ…何でか分からないけど。
155: 2008/10/02(木)15:19 AAS
そうですか。私にも何でか分かりません。
156: 151,153 2008/10/02(木)16:59 AAS
解決しました。

xpdf-commonをapt-getでインストール、
cmap-adobe-japan1を取ってきてdpkgでインストール、
さらに/etc/xpdf/xpdfrcに
include /etc/xpdf/xpdfrc-japanese.dpkg-new
を書き加えればOKでした。

apt-getしか使えない男にお付き合いいただきありがとうございました。
お邪魔しました。
157: 2008/10/02(木)17:05 AAS
ファイルを指定ディレクトリに置くだけだからapt-getイラネですよ。
DLしてtar xvfzしてREADMEだかINSTALLだか読めば分かると思う。
158
(2): 2008/10/20(月)15:21 AAS
tokyo estraierはここ以外で存在が話題になっていないんだけど
商用、あるいは公用の検索システムに勝手に使っちゃっていいんだろうか
159
(1): fumiyas 2008/10/27(月)11:44 AAS
>>158
GPL と LGPL だし、問題ないでしょ。(たぶん :-)
で、tokyo estraier どんなくらい試しました?
160: 2008/10/28(火)18:27 AAS
>>159
>>158じゃないけれど
普通にインデックスして普通に検索出来て普通に遊べて…
これ、本当にインデックス時にTokyoCabinet使ってるのか不安になってきた
161
(1): 2008/10/28(火)18:40 AAS
データベースファイルの先頭バイトを覗いたら、[depot]って書かれてたりして
162
(1): 2008/10/28(火)21:50 AAS
>>161
う…_attrフォルダの中に「depot」ファイルがあるんだが
163
(1): 2008/10/29(水)10:07 AAS
過去のバージョンと、Windows版のバイナリパッケージのページが落ちてるようなんだが。
UNIX板でアレだけどWin版の1.4.10持ってる人だれか上げてくれないかな…
164
(1): 2008/10/29(水)11:16 AAS
>>163
外部リンク[html]:www2.uploda.org
165
(1): 2008/10/29(水)11:38 AAS
ディレクトリ一覧がデフォルトでは表示されなくなっただけなので
正確なファイル名が分かるとか、検索サイト等のキャッシュから手繰るとかで
落とせますよ。

外部リンク[zip]:hyperestraier.sourceforge.net
166: 2008/10/29(水)11:47 AAS
>>164
>>165
ディレクトリ一覧が表示されないだけだったのか。
ありがとう、助かりました。
お早いレスで俺涙目。
167
(1): 2008/10/29(水)18:47 AAS
Tokyo Estraierってどこにあるの?
168: 2008/10/30(木)00:44 AAS
Windows環境でMecabを使いたいんですけど、可能ですか?
試した手順は、下記になります。
前提:WindowsXP、Cygwin環境
1、Mecab0.97と辞書のビルド
2、下記サイトを参考にし、qdbmとHyperEstraierのビルド
外部リンク[html]:www.shinonon.dyndns.org
HyperEstraierのビルドで--enable-mecabとしましたが、
その後のmakeでエラーとなります。
169
(1): 2008/10/30(木)14:21 AAS
>>167
外部リンク[gz]:hyperestraier.sourceforge.net

ベースはHyper Estraier1.4.13
ソース見ると確かにTokyo Cabinetのincludeが入ってるんだが
実際に使われてるのかちと分からん
QDBMも一緒に入ってないとエラー出るし

ところで100万以上の文書を対象にインデックス作ると想像以上に遅いんだな…
1秒以下でパパッと結果が表示されるのは何件くらいが限度なんだろ
170: fumiyas 2008/10/30(木)18:22 AAS
TE コンパイルしてみた。`estcmd create db` だけ試した。

>>162
_idx 以外は QDBM を使ってるんで、_idx だけ見てごらん。

$ /usr/local/tokyoestraier/bin/estcmd crete db
$ strings db/_idx/0001
ToKyO CaBiNeT
1.0:510

>>169
HE ソースとの diff とってみればわかるけど、一部のみ TC, ほかは QDBM。
ちなみに、`estcmd repair db` 時に _idx 以下は何もしないようになっている。
いいのか? いまのところ DB の構成を把握していないのでよくわからんが、
_idx が転置インデックス? ほかは? 知っている人、教えて…。

あと 100万以上の文書は試したことないんでアレなんだけど、
参考までにハードウェアの構成とか、estcmd create に
指定したオプション (estcmd を使っているなら。-xh 付けたの?)、
estmaster の _conf の設定等を教えてもらえると嬉しいです。
171
(1): 2008/12/08(月)22:30 AAS
Hyper Estraierについて質問させてください。

Windowsで一回動かしたんですが、cygwinのパスで結果が表示されてしまうので、
うれしくないと思い、VMware2.5.1 build-126130 でUbuntu7.10を動かし、
そちらでestcmd gather を走らせました。Hyper Estraier1.4.9です。

Apacheはxamppを使いました。外部リンク:localhost は正常に表示されてると
思います。1.6.8aと出ています。あとphp5もスタートさせました。

でも、外部リンク[cgi]:localhost にアクセスすると、
Error: the configration file is misshing.とか出ます。

/opt/lampp/cgi-bin/estseek.cgi と同じフォルダに estseek.confは置いてます。
estcmd search casket 'ほげほげ'
とかはちゃんとHITして結果が出てきます。

Errorが出てくる原因は何でしょうか。分かる方教えてください。
172: 171 2008/12/09(火)22:34 AAS
自己レスです。よく分かりませんが
estseek.conf
estseek.tmpl
estseek.top
をchmod 744 したら動きました。失礼しました。
173
(3): 2008/12/12(金)00:50 AAS
>>53
すげー遅レス失礼。
HEの情報収集中→WikipediaのHEのエントリ→ >>53 の製品ページ
って感じでその製品を知ったんだけど、GPLって書いてるくせに
ソースコードダウンロードのリンクをたどってもソースコードがないんだけど、
これってどうなの?

外部リンク:www.osstech.co.jp

つーか、会社概要見たけど、中の人がこのスレにいるのか。
174
(1): 2008/12/12(金)01:21 AAS
>>173
別に公開する必要は無い。
会社側からするとChimera Searchのバイナリとあわせてソースコードを提供する、
もしくはバイナリにソースコードの入手方法が明記された文書を添えておけばいい。

GPLv2での3-aと3-bね。
175: 173 2008/12/12(金)19:40 AAS
>>174
そうなんだ。どうもありがと。
Webページ見たけど個人お断りみたいな事書いてあったな。

関係ないけどGPL v2日本語訳の原文へのリンクが間違ってるね(v3にリンクされてる)。
176: 2008/12/12(金)20:12 AAS
GPLはちゃんと読んでない人は世間の評判から誤解しやすいライセンスだから、
批判するんだったらちゃんと読んで理解してからにした方がいい。
177: 2008/12/16(火)17:55 AAS
>>173
これ読むといいよ。
外部リンク[html]:web.archive.org
178: 2009/02/01(日)02:03 AAS
>>47にも書いてるけど,属性検索ができない.
Wikipediaの全文検索デモページで試してみたけど効果なし...
179: 2009/02/08(日)23:47 AAS
疑似ノードマスタって、認証なしなの?
通常のノードマスタみたいにユーザとパスを設定できないの?
180: 2009/02/09(月)01:33 AAS
estcmd outで文書の一括削除はできますか?
181: 2009/02/13(金)23:47 AAS
Windows版のバイナリ落としてindexだけはコマンドで作ってみたんですが
JavaのAPI使ってファイル検索や全文検索を行うサンプルコードが載って
いるサイトとかってないですかね?
web環境ないのでSwingから直で操作したいのですがAPIの使い方がよくわかりません・・
初歩的な質問ですいません。
182
(2): 2009/02/23(月)06:47 AAS
Unix板なのに申し訳ないのですが、Ubuntu Intrepid64bit版を使っています。
mecabを組み込みたかったのでソースからビルドしましたが、ライブラリとしてregexp.hだけ認識されないのでビルドできません。
32bitの時も同様だったのですが、こちらはネットでダウンロードしたライブラリをつっこんでインストール迄無事に成功しました。
aptitude search lib | grep -i regexp などで見つけたものを次々インストールしてみましたが全くお手上げです。
必要なライブラリについてご存知の方いませんか?
183
(1): 2009/02/23(月)09:04 AAS
>>182
やったの去年だからよく覚えてないけど
ふつーのUbuntuならソフトウェアの一覧に普通に入っていた気がする
184
(1): 2009/02/23(月)17:49 AAS
aptで入るね
185: 182 2009/02/24(火)06:22 AAS
>>183-184
レス有難うございます、結局手順を忘れていただけで、32bit版でと同様の事をすればいいだけですんなりビルド成功。
aptでlibc-dev(これですよね?)を入れてもlibregex.aがないので、外部リンク:arglist.comからregex3.8a.tar.gzを落してビルドし~/lib ~/includeに放り込む。
似たような事で困っている方は試してみて下さい。
どうもお騒がせしました。
186
(1): 2009/08/28(金)12:40 AAS
作者ページのタイトルがうざくなってるんだが、改ざんされたのかな
187: 2009/08/28(金)13:43 AAS
特に変わったようには見えないが。
> Last-Modified: Tue, 25 Dec 2007 01:47:27 GMT
だし。
188: 2009/08/28(金)20:25 AAS
>>186
ソースみてみ。アクセスしたタイミングで表示されるものが変わるようになってる。
しかし作者タソはmixiに就職してからH.E.のほうには全然顔出さなくなったな。
189: 2009/08/28(金)22:37 AAS
ソース見てみた、何じゃこりゃ。

> case 59: name = "ちょwwwおまwwwいごww"; break;
> case 61: name = "どう見ても超迷子です本当にありがとうございました"; break;
190: 2009/08/31(月)10:17 AAS
> From: [783] 名無しさん@お腹いっぱい。 <sage>
> Date: 2006/09/17(日) 07:52:41
>
> case 59: name = "ちょwwwおまwwwいごww"; break;
> case 61: name = "どう見ても超迷子です本当にありがとうございました"; break;
191: 2009/11/09(月)16:22 AAS
検索してもHitしないってことはなにが考えられるのかな?
登録文書に検索語句は確実にあるし、DBも壊れていない・・・
192
(1): 2009/11/09(月)18:02 AAS
ごめん、壊れてたみたい。
estcmd inform で壊れてるかどうかわかんないんだよなあ・・・
193
(1): 2009/11/15(日)00:49 AAS
>>192
そうなの?おれもestcmd inform で情報出てきたら平気だと思ってた。
どうやって壊れてる判定したの?
194: 2009/11/15(日)01:54 AAS
>>193
絶対に登録文書にある文字列を検索しても出てこなかったので。
再構築で直りました。
インデックスが壊れているかどうか調べるコマンドが欲しい。
195
(1): 2009/11/18(水)06:15 AAS
estcmd repair を、時々やらないと駄目ってことですかね。
(-_-;ウーン たまに治らないときもあるし..

-- 追記お願いします m(_ _"m)ペコリ---------
【テク1】ノードマスタが再起動しない・・正常に停止しないとこうなる
 サーバールートDirの _pid _stop の削除

【テク2】DBが?でるっぽい
#estcmd repair index_path

ex.ノードサーバー利用時は(サーバールートをcasketなら)
#estcmd repair casket/_node/ノード名

【テク3】estwaver crawl時の「could not open」エラーの解決法
クローラールートディレクトリを crawl_dir と仮定して Code:
#cd crawl_dir
#estcmd repair _index
#dpmgr repair _trace/0001/depot
#dpmgr repair _trace/0002/depot
#dpmgr repair _trace/0003/depot
196: 2009/11/18(水)16:56 AAS
>>195
>>estcmd repair を、時々やらないと駄目ってことですかね。
repairを一回やってみたんだ。直ったかなと思って、それでも念の為に
もう一回repairしてみたんだ。登録文書がごっそり減ったんだ。
repairを繰り返す度に減っていくんだ・・・

あきらめて再構築したよ。
197
(1): 2009/11/19(木)05:41 AAS
>repairを繰り返す度に減っていくんだ・・・

((( ;゚Д゚)))ガクガクブルブル 

「特定のキーワードにヒットしたを、DBから削除する」 なんてことできますか?

「特定のキーワードにヒットさせない」でもいいかなー
198
(2): 2009/11/20(金)08:54 AAS
Estraierで2chのログファイルを全文検索してJaneで表示できないでしょうか。
DATファイルを全文検索に入れるだけじゃなくて、名前やスレタイで絞り込めれば最高なのですが。

DesktopHEで利用しようとしております。
199: 2009/11/20(金)14:16 AAS
>>197
私も探してみたけど、そのものは無いみたい。
よくやる作業ならcgiとか作るんじゃないかな。

コマンドから手作業するときは、例えばこんな感じ。
消したいやつを検索して
estcmd search -vu -attr '@uri STRINC /path/to/del/' _index BadWord
OKなら上のコマンドに以下を追加
|awk '$1 ~ /^[0-9]+/{print $1}' |while read id; do estcmd out -cl _index $id; done
200
(1): 2009/11/20(金)16:26 AAS
>>198
出来ないことはないと思うけど、面倒くさいかもね。dat2htmlのフィルタ作って読みこませて、
DesktopHEの関連付けはjaneにすればいいみたいな。

私はhtmlに変換してブラウザで全文検索してる。そういう人の方が多いと思うけど。
201
(1): 2009/11/20(金)22:49 AAS
>>200
速レスありがとう。
htmlに変換してって毎日巡回するたびにdat2html走らせてるの?
それとも真夜中にバッチ処理?

いずれにせよ、HDD容量が倍必要ですよね?
202
(1): 2009/11/21(土)12:31 AAS
>>201
>>毎日巡回するたびにdat2html走らせてるの?
そうだよ。1時間ごとにdat2htmlを走らせてる。ロードアベレージを見て負荷が大きいときは処理しないようにしている。
ログは8GBくらいある。datファイルは定期的に削除している。
ウェブブラウザから検索できるので、LAN内で利用出来て重宝している。
203: 2009/11/21(土)23:28 AAS
>>202
うちもログは6Gぐらいあります。
全部変換するとなると15gぐらいいきそうですよねorz

Windowsだからロードアベレージ監視できないのと、指定したコテハンがNASDAQについて
レスした発言とかを知りたくても特定がとてつもなく難しいのがネックになりそう。

Threadsearchと併用しないと駄目ですかね。
204: 2009/11/27(金)00:40 AAS
XREAで設置しようとしたけど、インストールの段階で躓いたorz
cannot find -liconvとかでてきてるし・・・

libiconvの入れ方に問題があるのかなぁ・・・。
205: 2010/01/07(木)21:28 AAS
某サイト丸ごと吸い上げようと、
クローラーの設定seeddepthを50にしたら、5時間かかっても1つもインデックスできなかった...

種文書を全部吸い上げてからインデックスするとは知らんかった。
seeddepth1〜2でよさそうね。
206
(1): 2010/01/15(金)16:12 AAS
Hyper Estraier のwinを使っている方に質問です。

当方初心者。
インストール、インデックス作成まではできました。なんとか。

しかし、estseek.confの内容変更の段で(だと思ってるんですが・・・)つまづいています。
replaceの行の変更はどのようにしたらよろしいのか教えていただけないでしょうか?

何卒よろしくお願いいたします。
207: 2010/01/16(土)02:43 AAS
>>206
win版も使ったことはありますが、それだけでは何がなんだか分かりません。
estcmd inform casket は通りますか?
Hyper Estraier の画面は出るのですか?
表示のどこかに不満があるのですか?
どうなって欲しくて、現状どうなっているのか書いてください。
208: 2010/01/18(月)15:45 AAS
ゴミのような2chのログも、こいつを使うと宝の山になる。
はらしょー
209
(1): 2010/02/05(金)14:01 AAS
Hyper Estraier 1.4.10(Win)を利用している者です。

ブラウザの検索結果画面のリンクをクリックしてもジャンプしないという経験をした方はいないでしょうか?
今、その状態です。

検索結果画面のソースを丸々コピーしたhtmlファイルを作成し、それをブラウザに表示し、リンクをクリックすれば目的の文書にジャンプします。
すごく不思議な感じです。ブラウザはIE、sleipnirで確認しました。

どのようにすればジャンプするようになるかおわかりの方、教えていただけないでしょうか?
これは、もうhtmlの問題に過ぎないような気もしますが、よろしくお願いいたします。
210
(1): 2010/02/05(金)22:04 AAS
文字コードの問題じゃね?
211
(1): 2010/02/07(日)17:19 AAS
鯖、HEてよりは、ブラウザ、クライアントの問題ぽく聞こえる。
212: 209 2010/02/08(月)08:11 AAS
>>211
ブラウザは、他にオペラも試しました。同じ結果でした。
クライアントも4人分のLAN接続しているPCから試しました。同じ結果でした。

>>210
仮に文字コードの問題なら、対処法はありますでしょうか?

何卒よろしくお願いいたします。
213
(1): 2010/02/08(月)20:12 AAS
まずは、本当に文字コードの問題かどうかを確かめるべきです
フォルダ名からファイル名まで完全に英数文字だけのファイルをわざと検索結果として出して
それをブラウザから開くことができれば、文字コードの問題だと思います
214: 209,212 2010/02/09(火)08:13 AAS
>>213
>フォルダ名からファイル名まで完全に英数文字だけのファイルをわざと検索結果として出し

やってみました。ダメでした。相変わらずジャンプしてくれません。

考えるに、estseek.conf の replace設定なのかな、と。
これについては、自分でも自信がなかったので、下記に示します。
当方の場合、c:\の直下に「server」のフォルダを作成し、そこに「estseek.cgi」、「casket」等を入れております。

−−−−−−−−−−−−−−−−−−−−−−−−−−−
replace: ^file:///c:\server\{{!}}外部リンク:127.0.0.1
replace: /index\.html?${{!}}/
−−−−−−−−−−−−−−−−−−−−−−−−−−−
このような記載でよろしいのでしょうか?
215: 209,212,214 2010/02/09(火)16:47 AAS
追記します。

estseek.conf のreplace設定を見直してみました。
試行錯誤の結果、
−−−−−−−−−−−−−−−−−−−−−−−−−−−
replace: file:///c|/server/{{!}}http://サーバPCのIPアドレス/
replace: /index\.html?${{!}}/
−−−−−−−−−−−−−−−−−−−−−−−−−−−
とすることによりまして、
検索結果の画面に緑色で表示される、ヒットした文書ファイルの所在の表示が、

http://サーバPCのIPアドレス/|http://サーバPCのIPアドレス/・・・・・

となりました。
この、「|」を挟んで繰り返される「http://サーバPCのIPアドレス/」の最初の方、および「|」が消えるようになれば、正常動作するような気がします。

これらを消す、なにか良い方法がありましたら教えていただければ助かります。
216
(1): 2010/02/09(火)20:47 AAS
replaceの設定は元の設定で問題ない感じがします。

むしろ、showlrealの設定が falseの設定になっていると、
当該現象が発生するように思われます。こちらでも、
同様の現象を確認しました。unix で 1.4.13ですが。
217
(1): 2010/02/09(火)21:38 AAS
こちらでは、ジャンプしない現象も、その後に改善した状況も確認できました。

replace行を拝見すると、C:\server\ 部分のエスケープがされてないようです。
正しくは、C:\\server\\ではないでしょうか?

そして、C:\\server\\の配下に、実際の検索したいデータが存在する必要があります。estseek.cgiや indexファイルではありません。

showlrealの変更で、ジャンプの可否が確認できたら、この行を修正する必要があります。

以下マニュアルより
-------------
replaceは正規表現によってURIを変換するのに使います。複数回指定できます。
先頭にマッチする「^」を駆使すれば接頭辞(ディレクトリ)の変換ができますし、末尾にマッチする

「$」を駆使すれば接尾辞(拡張子)の変換ができます。例えば、「\.htm${{!}}.html」とすると、末尾の「.htm」を「.html」に変換できます。

「{{!}}」の前の部分は正規表現なので、「\」や「.」にはエスケープ文字「\」を前置する必要があることに注意してください。「{{!}}」の後の置換文字列は正規表現ではないので、エスケープは必要ありません。
--------------
218: 209,212,214,215 2010/02/10(水)07:57 AAS
>>216
showlreal を「true」にしてみましたが、状況は変わりませんでした。
ジャンプする、しないの問題でいえば、pdfの文書ファイルはジャンプすることが確認されました。
.htmがなぜかジャンプしないのです。

>>217
C:\\server\\と記載し、やってみました。
すると、検索結果の画面に緑色で表示される、ヒットした文書ファイルの所在の表示が、
c:\server\search\・・・・・
となりました。

htmの文書へは、ジャンプしてくれません。
仮にジャンプしてくれても、LAN内のPCからアクセスした場合、当該文書にアクセスできません。
やはり、http://サーバPCのIPアドレス/・・・のように表示されなくてはならないと思います。

まだまだ試行錯誤中・・・
219: 2010/02/10(水)08:56 AAS
つーかさ、やってることの意味分かってやってる?
別に「そうしないと君のためにならないよ」なんてくだらない説教をしたいからではなく、
何が分かって何が分からなかったのかを言ってくれないと、どこから説明すればいいのか、
どこを質問すればいいのかを、こっちは全部エスパーしなくちゃならないんだよ。
困ってるのは分かってるから、せめて情報の出し惜しみはしないでくれ。

# 素直に読むと、何も分かってない、replace行の動作の意味や正規表現とはなんぞやを
# すべて説明しなくちゃならないように思えるんだけど..... もしかしてそうなの?
220: 2010/02/23(火)20:50 AAS
これって英語の検索もはやくなるの?
221: 2010/02/24(水)00:09 AAS
もちろん早くなるけど、普通に使うと hyper で hyper estraier には引っかかるけど、hyperestraier には引っかかりません
そういうのを引っかけるようにするにはワイルドカードを使うなど工夫しなくてはなりません
222: 2010/02/24(水)12:18 AAS
外部リンク:www.seg.rmit.edu.au
英語で使うだけならこっちの方が速かったりする?
223: 2010/02/24(水)12:50 AAS
なんだ、宣伝かよ
224: 2010/02/24(水)16:57 AAS
日本語で最速なのはこれっぽいけど
英語で最速なのがどれなにか知りたかったんだ
225: 2010/03/08(月)21:40 AAS
亀レスにもほどがあるがズバリそのものがあります。

>>198
Datファイル全文検索ソフト
外部リンク:frozenlib.net
>DatEはHyperEstraierを使用してJaneのログを高速に検索するソフトです。
226: 2010/03/16(火)22:31 AAS
「file size limit exceeded」で、いきなりダウンしたよ。

システムによって2Gとかのファイル制限あるから、
logファイルの大きさには注意しましょ。
ログの記録レベルを煽りましょう〜
227: 2010/03/25(木)00:58 AAS
indexサイズが小さくて、もれなく検索できればいい。
あと書庫内検索。重要度順位は入らんから不足無しで出るのが良い。
web用途ではなくデスクトップで使うには
書庫内と不足なしが大事。
順位は無くて良い。開いてみれば済むからな。
これはそういう使い方出来る?
228: 2010/03/25(木)01:06 AAS
複雑なアルゴリズムはいらない。
Grepの手助け程度で良い。
書庫に対応する。
いいやつ無いですか?
229: 2010/03/25(木)02:01 AAS
フィルタ書けばいいじゃん。
230: 2010/03/25(木)07:11 AAS
全文検索では全角か半角はどちらかに変換した方がいいと思うのですが。
UTF8や16では、全角のアルファベットは世界共通の配置になってますか。
言語ごとに異なる位置にありますか。
統一した方が良いと思いますが。コード位置がわかりません、
231
(1): 2010/03/25(木)07:29 AAS
N-gramするうえで文字単位にするかバイト単位にするかはどうすればいいですか。
このソフトはどっちですか。
日本語だと一文字で2バイトか3バイトになります。英語は1バイトにります。
文字単位では日本語一文字と英語一文字の価値が同等になりますが
実際の情報量は日本語の方が大きいです。
英語の2文字か3文字くらいの情報量がありそう。
バイト単位にすると、N=2の時に英字一文字の検索がしにくくなります。
232: 2010/03/25(木)07:31 AAS
何が言いたいのかさっぱり分かりません!\( ̄∧ ̄)/

# 思いついた単語を羅列してるだけみたいだけど在日?
233: 2010/03/25(木)10:19 AAS
脊髄反射で在日とか言うネトウヨ?
234: 2010/03/26(金)11:17 AAS
ということにしたいのですね。
235: 2010/03/26(金)12:04 AAS
いいえ、自分が理解できないだけなのを認めたくないだけです。
236: 2010/03/26(金)13:35 AAS
ということにしたいのですね。
237: 2010/03/26(金)13:56 AAS
はい。
238
(1): 2010/03/26(金)14:41 AAS
>>231
外部リンク[html]:hyperestraier.sourceforge.net
バイト単位ではなく文字単位2-gram
ただし英語はデフォルトで空白区切り、インデックス作成時に英語も文字単位2-gram指定可能
また英語空白区切りでインデックスを作ってもアルファベット一文字の検索は可能、2文字は不可

こんぐらい教えてやれよ、無能なやつばっかだな
239: 2010/03/26(金)15:22 AAS
分かってんならすぐに教えてやれよ、ノロマだな

という煽りは置いといて、元々の問いは本当にその答えを望んでいたのか?
もしそうだとしても、たぶんその答えの前に「HE内部では全ての文字はUTF-8で扱う」という大前提が必要では?

元々の問い(かどうかも分からない)は、N-gramのアルゴリズムには詳しそうなんだけど、それでいて「日本語は
英語の2文字か3文字くらいの情報量がありそう」とか言い出すし、UTF-8のことを知ってそうだけど知らなそうだし、
N-gramのアルゴリズムにそれだけ詳しいんならユーザガイドをちらっと読めば>>238の答えはすぐに分かるはずだし
ほんと、よく何を言ってるのか分かったね、すごいよあんた >>238
240: 2010/03/26(金)20:42 AAS
サンクス
いまローカルでgrep手助け用検索開発してる
もれないようにUTF8をバイナリとみてすべての2バイトを記録してみる。
241: 2010/03/26(金)23:42 AAS
ちょwまて
漏れなしバイナリ検索ならgrepで十分だろ
インデックス化するメリットないぞ
242: 2010/03/26(金)23:58 AAS
数ギガ、数十ギガとデータあったらどうする?
243: 2010/03/27(土)00:22 AAS
もうその話あきた。よそでやれ
244: 2010/04/14(水)09:33 AAS
mixiで公開してる東京なんとか
とかいう奴はこれの上位版?
245: 2010/04/14(水)11:36 AAS
TokyoCabinetは検索エンジンというよりそのバックエンド、かな?
1-
あと 84 レスあります
スレ情報 赤レス抽出 画像レス抽出 歴の未読スレ AAサムネイル

ぬこの手 ぬこTOP 0.045s