研究、开发、测试和评估关键词检索结果

DeepAmbigQA:用于 LLM 答案完整性基准测试的模糊多跳问题

DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...

了解多模式法学硕士中的一致性:综合研究

Understanding Alignment in Multimodal LLMs: A Comprehensive Study

偏好对齐已成为提高大型语言模型 (LLM) 性能的关键组成部分,但其对多模态大型语言模型 (MLLM) 的影响仍相对未得到充分研究。与语言模型类似,用于图像理解任务的 MLLM 也会遇到幻觉等挑战。在 MLLM 中,幻觉不仅可以通过陈述不正确的事实而发生,还可以通过产生与图像内容不一致的响应而发生。 MLLM 对齐的主要目标是鼓励这些模型将响应与图像信息更紧密地对齐。最近...

2026 年承诺法案:批判性评估

The PROMISE Act of 2026: A Critical Evaluation

最好现在就行动,而不是在社会保障信托基金实际耗尽时等待和匆忙。然而,出于多种原因,《承诺法案》并不是正确的解决方案。《2026 年承诺法案:批判性评估》一文首先出现在美国企业研究所 - AEI 上。

伯克利无人机技术陆军研究实验室主办首届无人机挑战赛

Army Research Laboratory, Berkeley Drone Technologies host inaugural drone challenge

加利福尼亚州里士满 — 美国陆军唯一的基础研究实验室和伯克利无人机技术公司最近主办了首届多无人机优化...

陆军研究员计划为学生进入政府职业铺平道路

Army Fellows program paves the way for students’ path to government career

从弗吉尼亚大学获得统计学硕士学位后,Neal Pillai 一直在寻找一种特定类型的机会。“我当时...

宾夕法尼亚州警卫队测试情报、无人机系统能力

Pennsylvania Guard tests intelligence, UAS capabilities

宾夕法尼亚州印第安敦加普堡 – 第 556 军事情报连、第 56 机动旅战斗队的士兵于 8 月 1 日进行了多域演习...

白沙导弹靶场推出窄带测试设施,实现重大现代化里程碑

White Sands Missile Range Unveils Narrow Band Test Facility in Major Modernization Milestone

2026 年 8 月 4 日上午,白沙导弹靶场在生存中心 21241 号大楼举行剪彩仪式,标志着一个重要的里程碑。

美国陆军尤马试验场人员测试T-11国内外互操作性

U.S. Army Yuma Proving Ground personnel test T-11 interoperability at home and abroad

对于占领敌后深处的孤立机场很有用,然后可以用来接收和部署更多的部队和武器,这是大规模战术...

碳捕获税收抵免:改进联邦管理和税收支出评估所需采取的行动

Carbon Capture Tax Credit: Actions Needed to Improve Federal Administration and Evaluation of Tax Expenditure

GAO 的发现碳氧化物封存抵免 (45Q) 是针对在排放源或直接从空气中捕获并储存在地下或用于生产产品的某些碳氧化物提供的税收抵免。该信贷已多次修订,其中包括 2022 年通货膨胀削减法案 (IRA),该法案增加了新的信贷功能。最近,《一大美丽法案》在捕获的碳的使用中创造了信用价值的平等。截至 2026 年 3 月,美国已有 33 个碳捕集设施,并计划建设更多设施。根据 IRS 的数据,从 2019 年到 2023 年,45Q 信贷索赔数量增加了两倍多。国税局 (IRS) 已采取多项行动来管理 45Q 信贷并减少潜在的违规行为。然而,使用碳生产产品的纳税人在申请税收抵免时面临着合规负担、延误和

乌兹别克斯坦:评估米尔济约耶夫十年的统治

Uzbekistan: assessing 10 years of rule under Mirziyoyev

乌兹别克斯坦:评估米尔济约耶夫领导下的十年统治 2026 年 9 月 23 日 — 14:00 至 15:00 BST匿名(未经验证)2026 年 8 月 4 日 在线聆听专家讲述米尔济约耶夫总统领导下的乌兹别克斯坦经济和改革议程的成功、缺点和未来方向。聆听专家讲述米尔济约耶夫总统领导下的乌兹别克斯坦经济和改革议程的成功、缺点和未来方向。米尔济约耶夫上台十年后,乌兹别克斯坦加强了区域合作,开放了经济,扩大了国际参与。但政治改革进展较为有限。独裁制度的保留继续阻碍改革进程,引发对该国未来发展道路的质疑。本次活动讨论:米尔济约耶夫执政十年是否兑现了改革承诺?俄罗斯对乌克兰的战争如何影响乌兹别克斯坦

艾德丽安·马歇尔 (Adrienne Marshall) 因西部积雪研究荣获 NSF 职业奖

Adrienne Marshall wins NSF CAREER Award for study of Western snowpack

科罗拉多矿业学院研究员艾德丽安·马歇尔 (Adrienne Marshall) 因研究美国西部积雪、改善水资源和气候适应能力的长期预测而获得了美国国家科学基金会 (NSF) 职业奖。

研究项目需要项目经理

Projektmanager für Forschungsprojekte gesucht

我们正在寻找一名研究项目项目经理,作为产假替代的一部分。

日本海军、日本自卫队在 JXR 26 期间对双边救灾能力进行压力测试

USFJ, JSDF stress-test bilateral disaster relief capabilities during JXR 26

日本横田空军基地 — 7 月 20 日至 24 日,驻日美军人员参加了 2026 年日本自卫队联合作战司令部联合救援演习 (JXR),为理论预测成为灾难性现实的那一天进行训练。在为期一周的演习中,联盟伙伴进行了大规模的双边人道主义援助和救灾模拟,旨在检验和加强其应急反应能力。

1Password 的研究警告称,人工智能在 74% 的情况下未能正确修补软件缺陷

AI failed to properly patch software flaws 74% of the time, 1Password's study warns

我们可能渴望将人工智能融入网络安全防御的各个领域,但新的研究揭示了为什么我们应该退缩。

这款 LG OLED 电视是我测试过的最令人印象深刻的电视之一 - 而且折扣 700 美元

This LG OLED TV is one of the most impressive I've tested - and it's $700 off

LG C6 是该品牌旗舰 OLED 电视的强大更新,现在在 Best Buy,您可以以 26% 的折扣购买 65 英寸版本。

2026 年最佳 75 英寸电视:专家测试

The best 75-inch TVs of 2026: Expert tested

75 英寸电视为您提供大屏幕体验,而又不会占用空间。我们测试了三星、索尼、LG 等公司的最佳产品,帮助您找到适合您预算的产品。

研究人员发现吸烟、糖尿病和高血压可能对阿尔茨海默病和血管性痴呆产生不同的影响

Researchers found how smoking, diabetes and high blood pressure may affect Alzheimer's and vascular dementia differently

新研究表明痴呆症风险因素对大脑的影响是独特的。常见的血管风险会损害脑血管和白质。糖尿病和较低的体重指数与阿尔茨海默氏症蛋白质有关。这项研究强调了痴呆症的多种原因和机制。健康的习惯可以通过多种途径保护大脑。

2011年,研究人员发现了活检样本错误识别的案例,现在亚特兰大妇女声称她被错误诊断为癌症,并因组织标记错误而接受了不必要的子宫切除术

In 2011, researchers found cases of biopsy sample misidentification, now Atlanta woman claims she was wrongly diagnosed with cancer, underwent unneeded hysterectomy due to tissue labelling mistake

根据 2011 年的一篇研究论文,研究前列腺癌的研究人员在两年内发现了三起活检样本错误识别的案例。