commit 91b2863e34f4bf0ea593931ba250a1a16643d3dc
parent fd86fe4bcab63c1394a7b88af841407c3a32bd52
Author: David Eisinger <[email protected]>
Date: Tue, 30 Jan 2024 10:27:00 -0500
Unescape HTML titles in archive script
Diffstat:
1 file changed, 8 insertions(+), 5 deletions(-)
diff --git a/bin/archive b/bin/archive
@@ -1,5 +1,6 @@
#!/usr/bin/env ruby
+require "cgi"
require "uri"
require "digest"
require "time"
@@ -18,11 +19,13 @@ urls.each do |url|
text_content = `w3m -dump -T text/html -o display_link_number=1 #{url}`
begin
- title = page_content
- .scan(/<title[^>]*>(.*?)<\/title>/mi)
- .first
- .first
- .strip
+ title = CGI.unescapeHTML(
+ page_content
+ .scan(/<title[^>]*>(.*?)<\/title>/mi)
+ .first
+ .first
+ .strip
+ )
rescue => ex
warn "Title error (#{ex}; #{url})"
exit 1