Jak přebírat články přes RSS (a nejen ze Zvědavce)

Článek na Zvědavci (https://zvedavec.news)

URL adresa článku:
https://zvedavec.news/techpor/2005/05/1188-jak-prebirat-clanky-pres-rss-a-nejen-ze-zvedavce.htm

Vladimír Stwora

Toto je technický článek, který asi nikomu, kromě několika webmasterů, nic neřekne. Rozhodl jsem se k sepsání této kuchařky poté, co jsem měl drobnou rozmíšku s jistým serverem, který přebíral články ze Zvědavce tak nějak "načerno". Podotýkám, že mi nevadí, převezme-li jiný server článek / články odsud (ostatně sám to dělám také), jen bych rád o tom věděl. A při přebírání je nutno zachovat jméno autora a odkaz na původní zdroj. Provozujete-li vlastní webové stránky a nechce se vám párat se s nějakými otravnými žádostmi a následným kopírováním toho kterého článku, je pro vás ideální automatické přebírání pouze odkazů na posledních zhruba 20 článků přes RSS/XML.

Můj redakční systém automaticky generuje při každém vložení / opravě článku dva nové RSS soubory ve formátu XML: Ten první ve verzi 0.92, ten druhý ve verzi 1.0. Liší se nejen formátem, ale i obsahem. První soubor odkazuje pouze na hlavní články, druhý odkazuje na hlavní články a na články z rubriky Ve zkratce.

A teď jak zpracovat RSS soubor a převést data v něm uložena do formátu html. Potřebujete tzv. parser RSS. Na internetu lze sehnat několik hotových parserů. Mně se osvědčil parser LastRSS napsaný v PHP Vojtěchem Semeckým a nabízeným v rámci obecně veřejné licence GNU.

Stáhněte si zdrojový kód a rozbalte do adresáře, odkud jej budete volat. V místě, kde se mají objevovat poslední články ze Zvědavce, vložte následující kód:

// include lastRSS
require_once ("lastRSS.php");

// Vytvorit lastRSS objekt
$rss =& new lastRSS;

$rss->cache_dir = '/tmp';	// Jakykoliv adresar na serveru, 
				// ale musi mit pristupova prava 777 
				// (tzn. kazdy do nej muze zapisovat)
$rss->cache_time = 6400; 	// obnovit kazde dve hodiny
$rss->CDATA='content';	 	// Tento parametr je v pripade Zvedavce nutno pouzit
$rss->items_limit=0;		// Zpracuj vsechny polozky

$rssurl='http://www.zvedavec.org/zvedavec_rdf_100.xml';

if ($rs = $rss->get($rssurl)) {
  foreach($rs['items'] as $item) {
    echo "<h1><a href="$item[link]"
	class="rss" target="_blank">".StripSlashes($item['title'])."</a></h1>n";
    if (isset($item['description']))
	echo "<p>".StripSlashes($item['description'])."</p>n";
  }
}
else { echo "Chyba. Soubor $rssurl je nedostupny..."; }

Oblast můžete ohraničit tagem <div>, popř. umístit do tabulky. Tyhle podrobnosti už nechám na vás.

A samozřejmě, že uvedený postup můžete použít i pro kterýkoliv jiný RSS soubor kterékoliv jiné stránky. Stačí změnit odkaz v poli $rssurl. LastRSS "rozumí" verzím 0.9, 1.0 a 2.0.

RSS je dobrá technologie, ale i fyzické přebírání článků má smysl a nemělo by být opomíjeno. A to hlavně proto, že se zajistí existence důležitých článků v případě, že by Zvědavec zmizel z internetové scény. Takže znovu opakuji, chcete-li převzít kterýkoliv článek, můžete to udělat, jen mi, prosím, dejte vědět, a nezapomeňte uvést autora a odkaz na původní zdroj.

Jak jistě víte, uveřejňuji už více než rok na titulní stránce odkazy na poslední články z Britských listů. Používám k tomu výše popsaný postup. A nedá mi to, abych si u té příležitosti neposteskl nad arogancí a nedostatkem profesionalismu webmastera Britských listů (nebudu jmenovat, je podepsán na BL). Po celou tu dobu, co titulky z BL přebírám, není tento člověk schopen opravit množství syntaktických a konverzních chyb v jejich vlastním RSS souboru. Nejen že jimi dodávaný soubor porušuje pravidla konstrukce RSS (v rámci položky <item> nemá položka <autor> co dělat - a takových nesmyslů je tam více), ale ještě k tomu obsah titulků článků, údajně ve znakové sadě ISO-8859-2, často obsahuje znaky, které v této sadě neexistují. Výsledkem jsou "pušvejci" - nečitelné znaky v jejich textu a zavlečené syntaktické chyby na mé vlastní webové stránce a na každé stránce, která by soubor z BL zobrazovala.

Webmasterovi BL zjevně nějaká ta chyba na jeho vlastních stránkách nevadí (v dnešním vydání obsahuje titulní stránka BL 293 syntaktických chyb a prohřešků), ale jak si může dovolit ignorovat syntaktické chyby v souboru, který nabízí jiným (a který vlastně slouží BL jako reklama), to skutečně nechápu.

Psal jsem webmasterovi BL asi před rokem s kopií panu Čulíkovi a upozorňoval je na nedostatky v jejich RSS, ale neuznali mě za hodna odpovědi. A chyby také do dneška neodstranili.

Článek byl publikován 3.5.2005