davideisinger.com

My personal website
Log | Files | Refs | README

commit 91b2863e34f4bf0ea593931ba250a1a16643d3dc
parent fd86fe4bcab63c1394a7b88af841407c3a32bd52
Author: David Eisinger <[email protected]>
Date:   Tue, 30 Jan 2024 10:27:00 -0500

Unescape HTML titles in archive script

Diffstat:
Mbin/archive | 13++++++++-----
1 file changed, 8 insertions(+), 5 deletions(-)

diff --git a/bin/archive b/bin/archive @@ -1,5 +1,6 @@ #!/usr/bin/env ruby +require "cgi" require "uri" require "digest" require "time" @@ -18,11 +19,13 @@ urls.each do |url| text_content = `w3m -dump -T text/html -o display_link_number=1 #{url}` begin - title = page_content - .scan(/<title[^>]*>(.*?)<\/title>/mi) - .first - .first - .strip + title = CGI.unescapeHTML( + page_content + .scan(/<title[^>]*>(.*?)<\/title>/mi) + .first + .first + .strip + ) rescue => ex warn "Title error (#{ex}; #{url})" exit 1