断滚动的数据和信息流。
她的右手搭在鼠标上,指尖偶尔快速点击或拖动,左手则放在键盘上,随时准备输入指令或切换窗口。
三块屏幕被她分配了不同的功能。
最左边的屏幕,同时打开了十几个终端(Terminal)窗口,黑色的背景上跳跃着绿色的命令行文字,那是她自编的分布式爬虫程序正在不同的目标网站上运行,按照她设定的规则,自动抓取和下载特定时间范围内的网页、文档、压缩包。
有些目标是公开的学术数据库如IEEEXplore、ACMDigitalLibrary、CiteSeerX(那时的版本),有些是大学计算机系的旧版项目存档页面,有些是早已停止更新但服务器仍在运行的早期技术论坛镜像,甚至包括利用WaybackMachine(互联网档案馆)回溯某些可能已消失的个人技术站点。
中间的屏幕最为繁忙,同时平铺着超过二十个浏览器标签页和应用程序窗口。
有PDF阅读器打开着刚下载的古老PDF格式论文(扫描质量参差不齐),有纯文本编辑器显示着从邮件列表存档中解析出的讨论串,有她自编的一个语义分析工具界面,正在对抓取到的文本进行预处理、关键词提取和粗糙的相似度计算。
还有一个Excel表格窗口,实时记录着抓取进度、文件数量、以及初步筛选出的“待深入审查”文献列表及其元数据(标题、作者、来源、日期)。
屏幕下方,即时通讯软件的窗口不断闪烁,是她与临时抽调来辅助的两名IT部得力下属的沟通窗口,她快速分配着细分检索任务,回答技术问题,同步最新发现。
右边的屏幕相对“安静”一些,主要用来进行深度分析和比对。
此时正并排显示着一份TitanTech专利权利要求书的重点段落,和一份刚刚从爬虫结果中筛出的、1998年某欧洲大学实验室的技术报告摘要。
沈绮的目光在两者之间来回移动,手指在键盘上敲击,在旁边的记事本软件里快速记录着初步的比对笔记:“专利Claim1描述‘动态资源映射表’,报告第3.2节提及‘runtimeresourceallocation
本章未完,请点击下一页继续阅读!