Reply to this topicStart new topic
> Търсачка за цялостно индексиране
bgigrite
публикация 2.05.2009г. в 14:39ч.
Коментар: #1


Новак
*

Група: Потребители
Съобщения: 23
Дата на регистрация: 20.12.2008г.
Потребител # 6 325





Здравейте чувал сам за Search Maker Pro и съм чел ,че с нея се правят доста добри търсачи.Та искам да ви попитам да ли е възможно да се направи такава търсачка като гугъл или някоя друга знам ,че като гугъл е почти невъзможно ,но по-проста да си индексира страници и да може да се търси през нея не за сайт която да индексира само моя сайт ,а примерно всички сайтове в България и най-известните сайтове в света.Малко не ми се вярва ,че това може да стане с програма ,но само питам може да се пробвам да направя една.Да ли има такава програма очаквам вие да ми кажете. Благодаря ви предварително. cool.gif
Go to the top of the page
 
+Quote Post
fakeuser
публикация 7.05.2009г. в 19:58ч.
Коментар: #2


Доктор - уроци
******

Група: Потребители
Съобщения: 836
Дата на регистрация: 15.11.2008г.
Потребител # 6 111




А да не очакваш, че всички, които работят за Google всеки ден неуморно се опитват да намерят все нови и нови сайтове, с които да попълнят търсачката си? laugh.gif разбира се, че се прави с програма, наричана от повечето хора spider /паяк/. Паячето се разхожда по сайтовете, които са регистрирани в Google /дам, там се регистрираш laugh.gif / и се ориентира по meta-таговете сложени из страницата, по файла robots.txt и т.н., понякога следва линковете, излизащи от тази страница... За Google се твърди, че изобретиха изкуствения интелект CADIE, за да подобрят процеса. Предполагам, че има безплатни кодове на spider енджини, макар че ми звучи по-забавно човек да си напише сам smile.gif
Go to the top of the page
 
+Quote Post
wyand
публикация 13.07.2009г. в 15:30ч.
Коментар: #3


Потребител
**

Група: Потребители
Съобщения: 96
Дата на регистрация: 20.04.2007г.
Потребител # 2 661




ЦИТАТ(fakeuser @ 7.05.2009г. в 19:58ч.) *
А да не очакваш, че всички, които работят за Google всеки ден неуморно се опитват да намерят все нови и нови сайтове, с които да попълнят търсачката си? laugh.gif разбира се, че се прави с програма, наричана от повечето хора spider /паяк/. Паячето се разхожда по сайтовете, които са регистрирани в Google /дам, там се регистрираш laugh.gif / и се ориентира по meta-таговете сложени из страницата, по файла robots.txt и т.н., понякога следва линковете, излизащи от тази страница... За Google се твърди, че изобретиха изкуствения интелект CADIE, за да подобрят процеса. Предполагам, че има безплатни кодове на spider енджини, макар че ми звучи по-забавно човек да си напише сам smile.gif

Мдааа... Писал съм такъв паяк, използващ теория на графите, който ми извлече информацията от стотици сайтове, и после пуснах още един, който ми отся, редактира и премахна невалидните e-mail адреси...
Моя беше доста простичък - задаваш му начална страница и нива на които да слезе надолу (BFS) и оттам вече следи по страниците за href="" таг. Има по-добри сигурно, но моят си ми свърши работата (като за еднократна употреба беше перфектно даже)
Go to the top of the page
 
+Quote Post
fakeuser
публикация 13.07.2009г. в 23:55ч.
Коментар: #4


Доктор - уроци
******

Група: Потребители
Съобщения: 836
Дата на регистрация: 15.11.2008г.
Потребител # 6 111




hm... Доста ми е интересно какво имаш в предвид с това, че си пуснал и втори паяк. Как точно позна кои e-mail-и са невалидни и как редактира другите? smile.gif

П.с. на какъв език написа паяка?
Go to the top of the page
 
+Quote Post
wyand
публикация 14.07.2009г. в 12:08ч.
Коментар: #5


Потребител
**

Група: Потребители
Съобщения: 96
Дата на регистрация: 20.04.2007г.
Потребител # 2 661




Първият паяк събираше кода (HTML кода) на страниците и ги запазваше във файлов формат на машината.
Вторият паяк вече обхождаше събраните кодове и извличаше всички имейли, слагаше ги във вектор и премахваше повтарящите се елементи. После минаваха през още една програмка за премахване на адреси като този adres@server [email protected] adres@ и т.н, които очевидно са невалидни, и поправяше някои които са сбъркани от сорта на [email protected]. <- демек ако има втора точка накрая и т.н
Цялото това беше писано на PHP + c++ приложения (конзолни програмки писани от мен, понеже ми е по-лесно да оперирам със стрингове на този език).
Go to the top of the page
 
+Quote Post
fakeuser
публикация 14.07.2009г. в 23:37ч.
Коментар: #6


Доктор - уроци
******

Група: Потребители
Съобщения: 836
Дата на регистрация: 15.11.2008г.
Потребител # 6 111




Хитра комбинация... А замислял ли си се да го направиш 3 в 1? Например: една нишка търси страници, а втора нишка извлича мейлове, като преди да ги драсне в листа освен проверката за повторение /нямаше ли set в C++?/ маха ненужните символи. Иначе напълно разбирам избора ти на C++ за манипулации пред PHP biggrin.gif
Go to the top of the page
 
+Quote Post
wyand
публикация 14.07.2009г. в 23:51ч.
Коментар: #7


Потребител
**

Група: Потребители
Съобщения: 96
Дата на регистрация: 20.04.2007г.
Потребител # 2 661




има сет, но сета е удобен в случаите в които работя с integer. Когато работя със стринг е ужасно, понеже трябва да се задават позиции + това вмъкването е log(n) и т.н... Като цяло не ме бърка толкова колко бързо ще работи, но самата работа със сет от стрингове не е си работа... Не съм мислил много по това да го комбинирам, понеже ми трябваше еднократно, след което зарязах проекта и продължих нататък както се казва smile.gif А в c++ манипулирането на html страници не съм сигурен дали ми е по силите - става със handle-и, които са грозна работа. Писал съм такива, но само за отваряне на дадена страница в браузъра, който е избран по default... Вместо да се мъча така седнах и за има няма ден-два всичко беше направено, че даже и забравено biggrin.gif
Go to the top of the page
 
+Quote Post
fakeuser
публикация 15.07.2009г. в 00:09ч.
Коментар: #8


Доктор - уроци
******

Група: Потребители
Съобщения: 836
Дата на регистрация: 15.11.2008г.
Потребител # 6 111




Аз обикновено ползвам XML парсъри, за да се оправям с HTML-a... За валиден XHTML се справят прекрасно, за стандартен HTML има някои малки модификации, но пак си е доста приятна работа - бачкаш си само с обекти... Тука обаче споменаваш нещо, дето така и не намерих време да си изясня - как точно определи сложността на алгоритъма като log(n) и как въобще я определяш за някой не съвсем очевиден алгоритъм? (да изключим обикновения цикъл от 1 до n..)
Go to the top of the page
 
+Quote Post
wyand
публикация 15.07.2009г. в 13:43ч.
Коментар: #9


Потребител
**

Група: Потребители
Съобщения: 96
Дата на регистрация: 20.04.2007г.
Потребител # 2 661




Това не е сложността на алгоритъма а сложността на всяко едно вмъкване при използване на сет.
Това е защото го поддържа сортиран след всяко едно вмъкване и прави bsearch да намери къде трябва да сложи елемента, ако е нужно. Това е при integer. При стринг немога да кажа със сигурност как стоят нещата...
Go to the top of the page
 
+Quote Post



Reply to this topicStart new topic
1 потребители преглеждат тази тема в момента (1 гости, 0 анонимни потребители)
Потребители, преглеждащи темата в момента:

 

RSS Олекотена Версия Сега е: 06:56 - 25.08.2026г.

Калдейта Ком ЕООД - © 2003-. Всички права запазени.