![]() ![]() |
2.05.2009г. в 14:39ч.
Коментар:
#1
|
|
|
Новак ![]() Група: Потребители Съобщения: 23 Дата на регистрация: 20.12.2008г. Потребител # 6 325 |
Здравейте чувал сам за Search Maker Pro и съм чел ,че с нея се правят доста добри търсачи.Та искам да ви попитам да ли е възможно да се направи такава търсачка като гугъл или някоя друга знам ,че като гугъл е почти невъзможно ,но по-проста да си индексира страници и да може да се търси през нея не за сайт която да индексира само моя сайт ,а примерно всички сайтове в България и най-известните сайтове в света.Малко не ми се вярва ,че това може да стане с програма ,но само питам може да се пробвам да направя една.Да ли има такава програма очаквам вие да ми кажете. Благодаря ви предварително. |
|
|
7.05.2009г. в 19:58ч.
Коментар:
#2
|
|
![]() Доктор - уроци ![]() ![]() ![]() ![]() ![]() ![]() Група: Потребители Съобщения: 836 Дата на регистрация: 15.11.2008г. Потребител # 6 111 |
А да не очакваш, че всички, които работят за Google всеки ден неуморно се опитват да намерят все нови и нови сайтове, с които да попълнят търсачката си?
|
|
|
13.07.2009г. в 15:30ч.
Коментар:
#3
|
|
![]() Потребител ![]() ![]() Група: Потребители Съобщения: 96 Дата на регистрация: 20.04.2007г. Потребител # 2 661 |
ЦИТАТ(fakeuser @ 7.05.2009г. в 19:58ч.) ![]() А да не очакваш, че всички, които работят за Google всеки ден неуморно се опитват да намерят все нови и нови сайтове, с които да попълнят търсачката си? Мдааа... Писал съм такъв паяк, използващ теория на графите, който ми извлече информацията от стотици сайтове, и после пуснах още един, който ми отся, редактира и премахна невалидните e-mail адреси... Моя беше доста простичък - задаваш му начална страница и нива на които да слезе надолу (BFS) и оттам вече следи по страниците за href="" таг. Има по-добри сигурно, но моят си ми свърши работата (като за еднократна употреба беше перфектно даже) |
|
|
13.07.2009г. в 23:55ч.
Коментар:
#4
|
|
![]() Доктор - уроци ![]() ![]() ![]() ![]() ![]() ![]() Група: Потребители Съобщения: 836 Дата на регистрация: 15.11.2008г. Потребител # 6 111 |
hm... Доста ми е интересно какво имаш в предвид с това, че си пуснал и втори паяк. Как точно позна кои e-mail-и са невалидни и как редактира другите?
П.с. на какъв език написа паяка? |
|
|
14.07.2009г. в 12:08ч.
Коментар:
#5
|
|
![]() Потребител ![]() ![]() Група: Потребители Съобщения: 96 Дата на регистрация: 20.04.2007г. Потребител # 2 661 |
Първият паяк събираше кода (HTML кода) на страниците и ги запазваше във файлов формат на машината.
Вторият паяк вече обхождаше събраните кодове и извличаше всички имейли, слагаше ги във вектор и премахваше повтарящите се елементи. После минаваха през още една програмка за премахване на адреси като този adres@server [email protected] adres@ и т.н, които очевидно са невалидни, и поправяше някои които са сбъркани от сорта на [email protected]. <- демек ако има втора точка накрая и т.н Цялото това беше писано на PHP + c++ приложения (конзолни програмки писани от мен, понеже ми е по-лесно да оперирам със стрингове на този език). |
|
|
14.07.2009г. в 23:37ч.
Коментар:
#6
|
|
![]() Доктор - уроци ![]() ![]() ![]() ![]() ![]() ![]() Група: Потребители Съобщения: 836 Дата на регистрация: 15.11.2008г. Потребител # 6 111 |
Хитра комбинация... А замислял ли си се да го направиш 3 в 1? Например: една нишка търси страници, а втора нишка извлича мейлове, като преди да ги драсне в листа освен проверката за повторение /нямаше ли set в C++?/ маха ненужните символи. Иначе напълно разбирам избора ти на C++ за манипулации пред PHP
|
|
|
14.07.2009г. в 23:51ч.
Коментар:
#7
|
|
![]() Потребител ![]() ![]() Група: Потребители Съобщения: 96 Дата на регистрация: 20.04.2007г. Потребител # 2 661 |
има сет, но сета е удобен в случаите в които работя с integer. Когато работя със стринг е ужасно, понеже трябва да се задават позиции + това вмъкването е log(n) и т.н... Като цяло не ме бърка толкова колко бързо ще работи, но самата работа със сет от стрингове не е си работа... Не съм мислил много по това да го комбинирам, понеже ми трябваше еднократно, след което зарязах проекта и продължих нататък както се казва
|
|
|
15.07.2009г. в 00:09ч.
Коментар:
#8
|
|
![]() Доктор - уроци ![]() ![]() ![]() ![]() ![]() ![]() Група: Потребители Съобщения: 836 Дата на регистрация: 15.11.2008г. Потребител # 6 111 |
Аз обикновено ползвам XML парсъри, за да се оправям с HTML-a... За валиден XHTML се справят прекрасно, за стандартен HTML има някои малки модификации, но пак си е доста приятна работа - бачкаш си само с обекти... Тука обаче споменаваш нещо, дето така и не намерих време да си изясня - как точно определи сложността на алгоритъма като log(n) и как въобще я определяш за някой не съвсем очевиден алгоритъм? (да изключим обикновения цикъл от 1 до n..)
|
|
|
15.07.2009г. в 13:43ч.
Коментар:
#9
|
|
![]() Потребител ![]() ![]() Група: Потребители Съобщения: 96 Дата на регистрация: 20.04.2007г. Потребител # 2 661 |
Това не е сложността на алгоритъма а сложността на всяко едно вмъкване при използване на сет.
Това е защото го поддържа сортиран след всяко едно вмъкване и прави bsearch да намери къде трябва да сложи елемента, ако е нужно. Това е при integer. При стринг немога да кажа със сигурност как стоят нещата... |
|
|
![]() ![]() |