全文検索エンジン Hyper Estraier 2 (333レス)
上下前次1-新
238(1): 2010/03/26(金)14:41 AAS
>>231
外部リンク[html]:hyperestraier.sourceforge.net
バイト単位ではなく文字単位2-gram
ただし英語はデフォルトで空白区切り、インデックス作成時に英語も文字単位2-gram指定可能
また英語空白区切りでインデックスを作ってもアルファベット一文字の検索は可能、2文字は不可
こんぐらい教えてやれよ、無能なやつばっかだな
239: 2010/03/26(金)15:22 AAS
分かってんならすぐに教えてやれよ、ノロマだな
という煽りは置いといて、元々の問いは本当にその答えを望んでいたのか?
もしそうだとしても、たぶんその答えの前に「HE内部では全ての文字はUTF-8で扱う」という大前提が必要では?
元々の問い(かどうかも分からない)は、N-gramのアルゴリズムには詳しそうなんだけど、それでいて「日本語は
英語の2文字か3文字くらいの情報量がありそう」とか言い出すし、UTF-8のことを知ってそうだけど知らなそうだし、
N-gramのアルゴリズムにそれだけ詳しいんならユーザガイドをちらっと読めば>>238の答えはすぐに分かるはずだし
ほんと、よく何を言ってるのか分かったね、すごいよあんた >>238
240: 2010/03/26(金)20:42 AAS
サンクス
いまローカルでgrep手助け用検索開発してる
もれないようにUTF8をバイナリとみてすべての2バイトを記録してみる。
241: 2010/03/26(金)23:42 AAS
ちょwまて
漏れなしバイナリ検索ならgrepで十分だろ
インデックス化するメリットないぞ
242: 2010/03/26(金)23:58 AAS
数ギガ、数十ギガとデータあったらどうする?
243: 2010/03/27(土)00:22 AAS
もうその話あきた。よそでやれ
244: 2010/04/14(水)09:33 AAS
mixiで公開してる東京なんとか
とかいう奴はこれの上位版?
245: 2010/04/14(水)11:36 AAS
TokyoCabinetは検索エンジンというよりそのバックエンド、かな?
246: 2010/05/01(土)16:32 AAS
これはなんでこんな速いんだ
転置インデックスだけの速さじゃないよね
247: 2010/05/19(水)20:34 AAS
hyper estraierで3000報の論文を検索しまくったら
予想外に研究が進んで、凶授どもが俺のことを
天才と勘違いしてやがるw
こんなダメ人間に希望を与えてくれた作者氏に
頭が下がる思いです。
248: 2010/05/21(金)21:40 AAS
公式メーリングリストは敷居が高いのと、
若干過疎気味なので、こちらで質問させてください。
windows開発環境で、ドキュメントファイル(doc,xls,ppt,pdf)は
インデックスを作成し、検索できるようになりました。
後は掲示板のデータベースの検索が残っています。
SQLという言語で読み書きしてるらしいのですが、
hyper estraierでデータベースのインデックスを
作成するにはどうすればよいのでしょうか?
検索してみたのですが、windows環境での方法は
見つかりませんでした。
省6
249(2): 2010/05/24(月)12:53 AAS
たぶん一番普通の方法はwebクローラーを使ってインデックスを作成
外部リンク[html]:hyperestraier.sourceforge.net
うまく行かないようであればスクリプトとかでインデックス追加スクリプトを自作
いろんな方法があってC,Java,Rubu,Perl,Pythonとか
ざっくり言うとプログラム中で @uri,@title,@mdate,本文を作って検索インデックスに追加。
頑張ればcsvデータ→シェルスクリプト+estcmdでもできなくはないと思う。
250: 2010/05/26(水)02:11 AAS
>>249
248です。
ありがとうございました。
まだわかっていない部分があるので、
まずはwebクローラーを使って試行してみます。
251(2): 2010/06/01(火)20:00 AAS
数が増えるとフラッシュしまくりで速度低下するんですが。
解決方法ありますか。
252(1): 2010/06/02(水)19:06 AAS
複数ファイルの書庫をディレクトリと認識するエンジンありますか
253: 2010/06/03(木)13:20 AAS
>>252
書庫の中身をドラフト形式で渡すフィルタ書けばいいんじゃないかな。
254: 2010/06/03(木)16:48 AAS
サンクス
255: 2010/06/04(金)20:57 AAS
AA省
256: 2010/06/05(土)22:13 AAS
>>249
結局、SQLコマンドでデータを取ってきて、
インデックス作成するプログラムを作りました。
ありがとうございました。
257: 2010/06/14(月)16:45 AAS
すみません、教えてください。
Hyper Estraierを使い始めましたが、
Hyper Estraierで文章の中身だけでなく、
ファイル名やファイルパスも検索のキーワードに
同時にヒットさせたいです。
インデックスの作成や、検索時になにか
オプションで指定するなど、なにか方法がありますか。
よろしくお願いします。
258: 2010/06/28(月)10:43 AAS
クローラーで拾ってきたURLだけの検索ってので改造したけど、随分前のことなの忘れちゃった。
他に
259(1): 2010/08/05(木)03:31 AAS
引き継いで開発してくれる有志っていないの?
低スキルなので、私はだめだけど..
260: 2010/08/05(木)04:16 AAS
>>259
なんか問題あるっけ?
TCに移行すればいいじゃない。
261: 2010/08/05(木)17:19 AAS
TCって、KVSじゃないの?
262(1): 2010/08/15(日)12:35 AAS
TCは全文検索できるよ。
263(2): 2010/09/22(水)22:13 AAS
最近使い始めたものです。
簡便書式で検索した場合、
例えば、「a*」とした場合と「ab*」とした場合に
なぜか「ab*」の方がヒット件数が多くなります。
一応、公式サイト見てきましたが、
それらしいことは書いてありませんでした。
なにか心当たりがある方がいれば、
教えてください。
よろしくお願いします。
264(1): 2010/09/22(水)22:16 AAS
>>262
データ量多くなるとまともに使えなくなるけどなw
265(1): 2010/09/23(木)01:38 AAS
>>264
mixiの全データ検索に使用されているからそれはないのでは?
なにか運用間違えているとか?
266: 2010/09/23(木)02:49 AAS
TCの全文検索ってQ-GRAMインデックスのことだろ?
データ量増えるとホント糞みたいに重くなって使い物にならんぞ。
267: 2010/09/23(木)19:36 AAS
作ってる本人も遅いって言ってた気がする。
上下前次1-新書関写板覧索設栞歴
あと 66 レスあります
スレ情報 赤レス抽出 画像レス抽出 歴の未読スレ AAサムネイル
ぬこの手 ぬこTOP 0.025s