From 15b246c21e1fd2e1008faca7daa832b1fbf625ca Mon Sep 17 00:00:00 2001 From: asbjorn grandt Date: Fri, 23 Jan 2015 22:57:19 +0100 Subject: [PATCH] Google Books don't like the garbeled HTML comments that could come from hpfanficarchive, removing all comments --- .../adapters/adapter_hpfanficarchivecom.py | 11 ++++++++--- 1 file changed, 8 insertions(+), 3 deletions(-) diff --git a/fanficdownloader/adapters/adapter_hpfanficarchivecom.py b/fanficdownloader/adapters/adapter_hpfanficarchivecom.py index b2fa720..c415cc3 100644 --- a/fanficdownloader/adapters/adapter_hpfanficarchivecom.py +++ b/fanficdownloader/adapters/adapter_hpfanficarchivecom.py @@ -217,8 +217,13 @@ class HPFanficArchiveComAdapter(BaseSiteAdapter): selfClosingTags=('br','hr')) # otherwise soup eats the br/hr tags. div = soup.find('div', {'id' : 'story'}) - + if None == div: raise exceptions.FailedToDownload("Error downloading Chapter: %s! Missing required element!" % url) - - return self.utf8FromSoup(url,div) + + # Comments can get garbled later in the process, preventing inport into some readers (specifically seen on Google Books) + # This will remove all html comemnts from the text body. + body = self.utf8FromSoup(url,div) + body = re.sub(r'', r'', body) + + return body