From f8cbc755de98ef432b7689e4fb7308e6d9f499f0 Mon Sep 17 00:00:00 2001 From: Jim Miller Date: Thu, 1 Nov 2012 10:23:52 -0500 Subject: [PATCH] Tidy some more poor HTML on fictionalley.org --- fanficdownloader/adapters/adapter_fictionalleyorg.py | 11 ++++++++++- 1 file changed, 10 insertions(+), 1 deletion(-) diff --git a/fanficdownloader/adapters/adapter_fictionalleyorg.py b/fanficdownloader/adapters/adapter_fictionalleyorg.py index 2e671d4..d655a78 100644 --- a/fanficdownloader/adapters/adapter_fictionalleyorg.py +++ b/fanficdownloader/adapters/adapter_fictionalleyorg.py @@ -223,7 +223,16 @@ class FictionAlleyOrgSiteAdapter(BaseSiteAdapter): if not data or not text: raise exceptions.FailedToDownload("Error downloading Chapter: %s! Missing required element!" % url) - + + # not sure how, but we can get html, etc tags still in some + # stories. That breaks later updates because it confuses + # epubutils.py + for tag in text.findAll('head'): + tag.extract() + + for tag in text.findAll('body') + text.findAll('html'): + tag.name = 'div' + return self.utf8FromSoup(url,text) def getClass():