Jak přebírat články přes RSS (a nejen ze Zvědavce)
3.5.2005 Technická poradna Témata: Technika 701 slov
Toto je technický článek, který asi nikomu, kromě několika webmasterů, nic neřekne. Rozhodl jsem se k sepsání této kuchařky poté, co jsem měl drobnou rozmíšku s jistým serverem, který přebíral články ze Zvědavce tak nějak "načerno". Podotýkám, že mi nevadí, převezme-li jiný server článek / články odsud (ostatně sám to dělám také), jen bych rád o tom věděl. A při přebírání je nutno zachovat jméno autora a odkaz na původní zdroj. Provozujete-li vlastní webové stránky a nechce se vám párat se s nějakými otravnými žádostmi a následným kopírováním toho kterého článku, je pro vás ideální automatické přebírání pouze odkazů na posledních zhruba 20 článků přes RSS/XML.
Můj redakční systém automaticky generuje při každém vložení / opravě článku dva nové RSS soubory ve formátu XML: Ten první ve verzi 0.92, ten druhý ve verzi 1.0. Liší se nejen formátem, ale i obsahem. První soubor odkazuje pouze na hlavní články, druhý odkazuje na hlavní články a na články z rubriky Ve zkratce.
A teď jak zpracovat RSS soubor a převést data v něm uložena do formátu html. Potřebujete tzv. parser RSS. Na internetu lze sehnat několik hotových parserů. Mně se osvědčil parser LastRSS napsaný v PHP Vojtěchem Semeckým a nabízeným v rámci obecně veřejné licence GNU.
Stáhněte si zdrojový kód a rozbalte do adresáře, odkud jej budete volat. V místě, kde se mají objevovat poslední články ze Zvědavce, vložte následující kód:
// include lastRSS require_once ("lastRSS.php"); // Vytvorit lastRSS objekt $rss =& new lastRSS; $rss->cache_dir = '/tmp'; // Jakykoliv adresar na serveru, // ale musi mit pristupova prava 777 // (tzn. kazdy do nej muze zapisovat) $rss->cache_time = 6400; // obnovit kazde dve hodiny $rss->CDATA='content'; // Tento parametr je v pripade Zvedavce nutno pouzit $rss->items_limit=0; // Zpracuj vsechny polozky $rssurl='http://www.zvedavec.org/zvedavec_rdf_100.xml'; if ($rs = $rss->get($rssurl)) { foreach($rs['items'] as $item) { echo "<h1><a href="$item[link]" class="rss" target="_blank">".StripSlashes($item['title'])."</a></h1>n"; if (isset($item['description'])) echo "<p>".StripSlashes($item['description'])."</p>n"; } } else { echo "Chyba. Soubor $rssurl je nedostupny..."; }
Oblast můžete ohraničit tagem <div>, popř. umístit do tabulky. Tyhle podrobnosti už nechám na vás.
A samozřejmě, že uvedený postup můžete použít i pro kterýkoliv jiný RSS soubor kterékoliv jiné stránky. Stačí změnit odkaz v poli $rssurl. LastRSS "rozumí" verzím 0.9, 1.0 a 2.0.
RSS je dobrá technologie, ale i fyzické přebírání článků má smysl a nemělo by být opomíjeno. A to hlavně proto, že se zajistí existence důležitých článků v případě, že by Zvědavec zmizel z internetové scény. Takže znovu opakuji, chcete-li převzít kterýkoliv článek, můžete to udělat, jen mi, prosím, dejte vědět, a nezapomeňte uvést autora a odkaz na původní zdroj.
Jak jistě víte, uveřejňuji už více než rok na titulní stránce odkazy na poslední články z Britských listů. Používám k tomu výše popsaný postup. A nedá mi to, abych si u té příležitosti neposteskl nad arogancí a nedostatkem profesionalismu webmastera Britských listů (nebudu jmenovat, je podepsán na BL). Po celou tu dobu, co titulky z BL přebírám, není tento člověk schopen opravit množství syntaktických a konverzních chyb v jejich vlastním RSS souboru. Nejen že jimi dodávaný soubor porušuje pravidla konstrukce RSS (v rámci položky <item> nemá položka <autor> co dělat - a takových nesmyslů je tam více), ale ještě k tomu obsah titulků článků, údajně ve znakové sadě ISO-8859-2, často obsahuje znaky, které v této sadě neexistují. Výsledkem jsou "pušvejci" - nečitelné znaky v jejich textu a zavlečené syntaktické chyby na mé vlastní webové stránce a na každé stránce, která by soubor z BL zobrazovala.
Webmasterovi BL zjevně nějaká ta chyba na jeho vlastních stránkách nevadí (v dnešním vydání obsahuje titulní stránka BL 293 syntaktických chyb a prohřešků), ale jak si může dovolit ignorovat syntaktické chyby v souboru, který nabízí jiným (a který vlastně slouží BL jako reklama), to skutečně nechápu.
Psal jsem webmasterovi BL asi před rokem s kopií panu Čulíkovi a upozorňoval je na nedostatky v jejich RSS, ale neuznali mě za hodna odpovědi. A chyby také do dneška neodstranili.