fix: extract domestic paper titles cleanly without quotes and remove All Overview tab from Publications

This commit is contained in:
2026-07-30 23:04:06 +09:00
parent 764b6479ed
commit 22a31ff409
5 changed files with 90 additions and 233 deletions
@@ -206,10 +206,12 @@ def parse_publications():
intl_pubs = []
intl_items = re.findall(r'<LI>(.*?)</LI>', intl_html, flags=re.S | re.I)
for item in intl_items:
m_title = re.search(r'<U>\s*"(.*?)"\s*<br/?>\s*</U>', item, flags=re.S | re.I)
if not m_title:
m_title = re.search(r'<U>\s*"(.*?)"\s*</U>', item, flags=re.S | re.I)
title = m_title.group(1).replace('\n', ' ').strip() if m_title else ""
m_title = re.search(r'<U>(.*?)</U>', item, flags=re.S | re.I)
if m_title:
raw_t = re.sub(r'<br/?>', '', m_title.group(1), flags=re.I).replace('\n', ' ').strip()
title = re.sub(r'^(?:"|“|”|\s)+|(?:"|“|”|\s)+$', '', raw_t).strip()
else:
title = ""
m_venue = re.search(r'<I>\s*(.*?)\s*</I>', item, flags=re.S | re.I)
venue = m_venue.group(1).replace('\n', ' ').strip() if m_venue else ""
@@ -231,10 +233,12 @@ def parse_publications():
dom_pubs = []
dom_items = re.findall(r'<LI>(.*?)</LI>', dom_html, flags=re.S | re.I)
for item in dom_items:
m_title = re.search(r'<U>\s*"(.*?)"\s*<br/?>\s*</U>', item, flags=re.S | re.I)
if not m_title:
m_title = re.search(r'<U>\s*"(.*?)"\s*</U>', item, flags=re.S | re.I)
title = m_title.group(1).replace('\n', ' ').strip() if m_title else ""
m_title = re.search(r'<U>(.*?)</U>', item, flags=re.S | re.I)
if m_title:
raw_t = re.sub(r'<br/?>', '', m_title.group(1), flags=re.I).replace('\n', ' ').strip()
title = re.sub(r'^(?:"|“|”|\s)+|(?:"|“|”|\s)+$', '', raw_t).strip()
else:
title = ""
m_venue = re.search(r'<I>\s*(.*?)\s*</I>', item, flags=re.S | re.I)
venue = m_venue.group(1).replace('\n', ' ').strip() if m_venue else ""