Street-smarts

Statistika

Pridružen/a:
30 avg 2011, 16:31
Zadnjič aktiven:
Prispevki:
Teme:
28 | Vse teme
510
23
1
#3

Ja, prav si razumel. Drugač pa to sem že ugotovil, da načeloma strežniki take requeste zavrnejo. Še vedno mi pa ne gre v glavo, kako je pol možno, da v terminalu stvar deluje?



Našel sem workaround, da si setupam svoj strežnik, na katerem mi php file fetchne source kodo neke druge strani, hkrati pa ima še allow tag za avtomatične poizvedbe. Potem pa pač preko posredništva mojega strežnika lahko poscrapam karkoli želim.



Mi je pa to taka butasta rešitev, ki zahteva svoj dedicated server, česar bi se vsaj zaenkrat rad izognil. Pa tudi sicer mi ni jasno, kako profesionalen scraperski softver rešuje ta problem? Je pa ful pomembno, da stvar nardim znotraj html-ja z javascriptom, če je to sploh možno.



Aja, sem probal dat v head. Še vedno mi ne deluje.


všeč(0) ni všeč(0) spam(0)
#

Lep pozdrav vsem.



Naletel sem na problem, kjer želim v javascriptu z moduloma 'cheerio' in 'request' poscrapat source kodo neke spletne strani. Zadeva mi je celo uspela, ampak mi deluje samo v terminalu na lokalnem pc-ju, ne pa tudi, če isto kodo zalaufam z browserjem.



test.js (deluje):




var request = require('request');

var cheerio = require('cheerio');



console.log("bla1");



request('https://news.ycombinator.com', function (error, response, html) {



console.log(html);



});




test.html (ne deluje):




<html>

<head>

</head>

<body>

<script>



document.write("bla1");



var request = require('request');

var cheerio = require('cheerio');



document.write("bla2");



request('https://news.ycombinator.com', function (error, response, html) {



document.write(html);



});

</script>

</body>

</html>




(koda je identična, edino console.log funkcije so zamenjane z document.write, ker želim izpisovat v browserju, ne pa v terminalu)



Z navadnimi document.write("blabla") sem testiral, na kateri točki se zatakne, in ugotovil, da pri importanju knjižnic (tam kjer sta request in cheerio).



Zanima me:




  • Kako sploh pravilno importat knjižnice? V .js fajlu mi ista stvar gre, v .html pa ne.

  • So morda v browserju kakšne omejitve, ki mi preprečujejo scrapanje?

  • Sem ga kje drugje zeznil?



Mogoče se sliši butasto, ampak prvič imam opravka z Javascriptom in že da mi je preko terminala ratalo, sem zapravil cel dan.



Much appreciated!


všeč(0) ni všeč(0) spam(0)
#1

Odlično! Sem iskal nekaj takega vse odkar mi je Ubuntu One iz neznanega razloga crknil (ponovna vzpostavitev bi najverjetneje zahtevala vnovično inštalacijo celotnega sistema). Zadeva je imela 5 giga, kar je bilo bistveno več od konkurentov, in kar super za backup najpomembnejših fajlov.



Until now that is. No, bomo videli, kako se obnese. Kar se pa varnosti datotek in nasploh zanesljivosti cloud-based storitev tiče, ki jih ljudje tako radi kritizirajo, pa eh. Se bojo kar pošteno morali stegnit, da mi zlomijo rar enkripcijo s 13 mestnimi passwordi. Če pa jim je tolk do moj fajlov, da se bojo s superračunalnikom lotili, pol naj jih pa kar majo.



(It's just some porn anyway. Pa nekaj delovnih fajlov. Sam ti ne vzamejo tolk. :P)


všeč(6) ni všeč(0) spam(0)
#8

Še en glas za Dreamweaver. Ko delam stvari iz čiste nule, jih še najhitreje naredim v design viewu. Potem za končne podrobnosti pa vedno preklopim v tekstovni način in delam skorajda izključno le v njem. Bo pa kar držalo, da je v tem primeru treba spucat ven kar dosti navlake, ki ti jo program nastelje.



Še vedno pa sem na ta način bistveno bolj produktiven, kot če bi že v štartu pisal kodo na roke.


všeč(1) ni všeč(0) spam(0)
#1958



Prva stran Googla, 21.12.2013 (danes).



Včeraj na treningu so me očitno fejst morali nabutat v glavo, da take videvam.



edit: haha, so me prehiteli :)


všeč(0) ni všeč(0) spam(0)
#5

Kar se tiče unikatnosti vsebin, bi se zadevo lahko zvezalo s Copyscape. Potem pa po principu prvi zaznan poskus submittanja duplicirane vsebine = warning. Drugi = tempban. In tako naprej. To naj bo prvi sloj zaščite.



Ampak to še vedno ne reši problema spun vsebine. Tako da naj bo drugi sloj ročni pregled z omejitvijo 5 objav na uporabniški račun. Torej ko nek uporabnik odda 5 člankov v ročni pregled, se mu začasno odvzame možnost dodajanja novih. To je zato, da se moderatorjem čez noč ne nabere vrh glave dela. Pa tud nekdo, ki bi objavljal vsebine fulltime, skor ziher ne bo objavil več kot 5 člankov na dan, v kolikor cilja na to, da bodo le-ti kvalitetni.



Vse bi šlo skozi ročni pregled. Na začetku tako ali tako ne bo problem. Ko pa se zadeva razširi, bo pa že verjetno nosla tolk revenue-ja, da ne bo problem outsourcat dodatnih moderatorjev.


všeč(4) ni všeč(0) spam(0)
#95

sivolasi:

Je pa vsekakor veliko bolj moralno napičiti nekoga, ki pozna predpise, zakone, vendar jih ne upošteva, ima veliko denarja, služi na neumnosti ljudi, ki mu poleg vsega še nosijo v pušico (ustvarjajo vsebino),



kot (figurativno) udariti po glavi kakšnega starčka, ki je v poštni hranilnici dvignil 100 evrov, kajne?




Sivolasi, samo nekaj. A mi lahko prosim razložiš kakšno vezo ima finančno stanje posameznika z odgovornostjo za njegova dejanja?


všeč(0) ni všeč(0) spam(0)
#26

mare1411:

nekje je dobro napisano:"Ljudje ne klikajo več oglasov. Če vidijo izdelek v oglasu, odprajo nov zavihek v googlu in ga poiščejo."




Kar je vbistvu spet priložnost zate, da z novim člankom/stranjo rangiraš za kw name tega izdelka, v kolikor je to seveda smiselno (dovolj iskanja, švoh konkurenca). :)



Po pravici povedano sem sam imel še največ uspeha z 'product name' keywordi. Taki obiskovalci so ponavadi že zelo globoko v nakupovalnem procesu. Iščejo dodatne informacije o izdelku, saj se odločajo o nakupu. That's where you come in.


všeč(0) ni všeč(0) spam(0)
#6663

Pomoje da se ne. Bo kar držalo, vsaj po lastnih izkušnjah sodeč. :)



Nekaj tednov nazaj sem na roke napisal 500 besed angleški članek, pa 2x sem ga pregledal za slovnico in te zadeve, pa vseeno ni šlo skozi. Probal sem kar skozi domač ip, pa mi ga je kar zaklenilo.



Če me spomin ne vara, se je v tej temi govorilo o postanju skozi proxyje kot optimalni strategiji. Hehe, smo očitno res postali squidoo mafija, da nas kar skenslajo na podlagi ip-ja.



Po pravici povedano, tudi, če še zdaj v tem trenutku deluje skoz proxyje... moje zaupanje so si s takim odnosom že zdavnaj zapravili.



Dosti forumov ima tako narejeno, da vse outbound linke avtomatično preusmeri skozi anonimizer. Bi tudi mi morali tako delat. Sam zdaj je itak že prepozno.


všeč(0) ni všeč(0) spam(0)
#13

Sploh pa admini in modi niso pokonci 24/7, da bi prežali na tako in podobno sporno vsebino, ki se lahko gor pojavi kadarkoli. Samo pomislit treba, koliko je je vbistvu že gor. Kdo bo vse to pregledoval za nazaj? Edina praktična rešitev je izbris vseh obstoječih komentarjev, vse naslednje pa dat na ročno odobritev, ali pa nasploh izklopit (pomnit treba, da moderacija zahteva človeške resurse, ki pač stanejo.)



Da samo ne omenjam, kam takšni in podobni posegi v našo svobodo potencialno lahko vodijo. To je prvi korak, naslednji je lahko cenzura. Ali res toliko zaupamo v naše politične sile, da bi jih to dovolili? Veš, kako to gre. Jim odstopiš prstek, odrežejo ti pa roko.


všeč(0) ni všeč(0) spam(0)