| python parsanje | ||
|---|---|---|
|
stargirl505
28. jan 2014 16:27:40
Pridružen od: 28. jan 2014 7 objav 0 0 0 |
#1
Pozdravljeni. stran=urllib.request.urlopen('http://www-lp.fmf.uni-lj.si/urnik/urnikhtm.exe?Izbira=Ucilnica&ucilnica=2.01') table = soup.find('table') print(seznam) Vendar nevem kako naj nadaljujem. Prosim za pomoč. LP |
|
|
stargirl505
28. jan 2014 18:26:26
Pridružen od: 28. jan 2014 7 objav 0 0 0 |
#2
koda strani je pa nekaj takega : |
|
|
FrEaKmAn
28. jan 2014 18:30:32
Pridružen od: 2. dec 2007 303 objav 175 59 0 |
#3
Malo več logike je...osebno bi rešil drugače
Upam da je jasno, če ne pa spišemo kodo.. |
|
|
stargirl505
28. jan 2014 18:44:15
Pridružen od: 28. jan 2014 7 objav 0 0 0 |
||
|
iztoks
28. jan 2014 19:35:13
Pridružen od: 16. apr 2012 161 objav 246 25 3 |
#5
Jaz bi enostavno uporabil html parser knjižnico ali nekaj podobnega |
|
|
stargirl505
1. feb 2014 18:46:19
Pridružen od: 28. jan 2014 7 objav 0 0 0 |
#6
Hvala, vendar bi raje z bs4, saj se html parser zaradi opustitve ne uporablja več toliko. To s slovarji je zelo dobra ideja, vendar ne vem čisto točno kako napisati kodo. Ali lahko kdo pomaga... |
|
|
mkramb
4. feb 2014 01:06:13
Pridružen od: 31. jul 2011 18 objav 34 3 0 |
#7
To je dokaj splosen problem (da moras gledat rowspan in colspan) Anyway kot prvo, ne mores poloopat po vseh TRjih ker je HTML broken. Nimas <TR>, razen prvega. To lahko sama uredis. Npr. odpres svoj HTML v crome in v inspectorju skopiras source ali pa kako automatiziras ta postopek. Kodo & popravljen HTML pa imas tukaj: lp |
|
|
stargirl505
5. feb 2014 11:39:43
Pridružen od: 28. jan 2014 7 objav 0 0 0 |
#8
Hvala ti. Zanima me še kako se koda spremeni če spremenim html kodo takole in uporabim bs4.
|
|
|
mkramb
5. feb 2014 12:16:20
Pridružen od: 31. jul 2011 18 objav 34 3 0 |
#9
Lahko samo uporabis lxml podporo za BeautifulSoup Nevem zakaj vztrajas pri Soup samo drugace pa poglej dokumentacijo (nima xpath tako da moras ta dela narediti "rocno"). Mimogrede lxml je hitrejski od BS. |
|