注意:如果请求单个建筑物中少于 4 个位置的使用数据,系统将提示用户确认所有帐号。如果用户请求单个建筑物中 4 个或更多位置的使用数据,则需要提供其中一个帐号。此处将进行另一项检查,以确保不会将同一位置添加到多个建筑物中。
摘要 - 中等定位和映射系统是在手持和机器人应用中定位的关键推动剂。过去几年中组织的希尔蒂大满贯挑战在基准以高准确性为世界上最好的大满贯系统基准测试。但是,这些系统的更多功能尚待探索,例如在各种传感器套房和多课程大满贯之间的平台不可知论。这些因素间接用作现实应用程序中鲁棒性和易于部署的指标。没有公开可用的数据集和基准组合,这考虑了这些因素的总和。HILTI SLAM挑战2023数据集和基准测试解决了此问题。此外,我们提出了一种新型的效果标记设计,以从地面上的预先调查点进行预测,从安装在机器人上的架子上的激光雷达和算法可以估算其在MM级准确性上的位置。挑战的结果表明,整体参与的增加,单课大满贯系统变得越来越准确,在不同的传感器套件中成功运行,但相对较少的参与者进行了多课大满贯。数据集URL:https://www.hilti-challenge.com/dataset-2023.html
摘要 - 随着机器智能的发展,需要测试和比较不同AI模型的问题解决能力的需求。但是,当前的基准通常很简单,允许模型均匀地表现良好,并且很难区分其功能。此外,基准通常依赖于模型可能记住或猜测的静态问答对。为了解决这些局限性,我们引入了动态智能评估(DIA),这是一种使用动态问题模板测试AI模型的新方法,并改善了多个学科的指标,例如数学,密码学,网络安全性和计算机科学。随附的数据集,Dia-Bench包含各种挑战模板的集合,这些挑战模板具有各种形式的可变参数,包括文本,PDF,编译的二进制文件,视觉难题和CTF风格的网络安全挑战。我们的框架介绍了四个新指标,以评估多次尝试的模型的可靠性和信心。这些指标表明,以不同形式摆姿势时,即使是简单的问题也经常被错误地回答,从而突出了模型的可靠性中的显着差距。值得注意的是,像GPT-4O这样的API模型通常高估了其数学功能,而ChatGpt-4O由于有效的工具使用而显示出更好的性能。在自我评估的Openai的O1-Mini中,证明其应尝试解决哪些任务是最好的判断。我们使用DIA-Bench评估了25个最先进的LLMS,这表明当前的模型在复杂的任务中遇到了困难,并且即使有更简单的问题也表现出意外的较低信心。DIA框架设定了一个新标准,不仅可以评估解决问题的问题,还设定了模型的自适应智能和评估其局限性的能力。该数据集在项目页面上公开可用:https://github.com/dia-bench。索引术语 - 手工智能,大语言模型,动态基准测试,性能指标,可靠性
多机构增强学习(MARL)的领域目前正面临生产性危机。虽然已经提出了用于解决该问题的标准化报告解决方案,但我们仍然缺乏一个实现标准化和可重复性的基准测试工具,同时利用了尖端的加固学习(RL)实现。在本文中,我们介绍了台式,这是创建的第一个MARL培训库,目的是在不同的al-gorithm,模型和环境中启用标准化的基准测试。Benchmarl使用Torchrl作为后端,授予其高性能并维护最先进的实现,同时解决Marl Pytorch用户的广泛社区。其设计启用系统配置和报告,从而使用户可以通过简单的单行输入创建和运行复杂的基准测试。Benchmarl在github上开源:https://github.com/facebookresearch/benchmarl。
Rank Producer Name TWh Rank Producer Name TWh Rank Producer Name TWh Rank Producer Name TWh 1 NextEra Energy 228.5 26 PSEG 32.1 51 NE Public Pow er District 14.7 76 Osaka Gas 10.1 2 Duke 218.0 27 The Carlyle Group 31.5 52 RWE Group 14.5 77 CPP Investments 10.0 3 Constellation 199.1 28 Salt River Project 29.2 53 Low er CO River Authority 13.9 78 East Kentucky Pow er Coop 10.0 4 Southern 183.4 29 PG&E 28.9 54 Portland General Electric 13.8 79 Beal Bank 9.8 5 Vistra Energy 161.5 30 Oglethorpe 28.0 55 OGE 13.6 80 El Paso Electric 9.5 6 Tennessee Valley Authority 136.6 31 Pinnacle West 27.5 56 Buckeye Pow er 13.5 81 PUD No 1 of Chelan County 9.5 7 Berkshire Hathaw ay Energy 129.9 32 New York Pow er Authority 26.9 57 NextEra Energy Partners 13.0 82 Omaha Public Pow er District 9.3 8 Entergy 115.5 33 CPS Energy 26.0 58 Dow Chemical 12.5 83 Austin Energy 9.3 9 Dominion 112.5 34 Invenergy 25.2 59 Exxon Mobil 12.5 84 Brookfield Renew able Partners 9.2 10 Energy Capital Partners 108.4 35 Alliant Energy 25.2 60 IDACORP 12.0 85 JEA 9.0 11 AEP 79.2 36 Associated Electric Coop 24.6 61 Orsted 11.9 86 Brookfield 8.9 12 Xcel 74.9 37 Avangrid 22.6 62 Fortis 11.8 87 Los Angeles City 8.9 13 US Corps of Engineers 69.3 38 AES 22.3 63 Algonquin Pow er 11.7 88 Tri-State 8.8 14 ArcLight Capital 46.4 39 Ares 21.6 64 Edison International 11.5 89 Clearw ay Energy 8.6 15 Energy Harbor 44.9 40 CLECO 20.3 65 Capital Pow er 11.5 90 South Field Energy 8.5 16 NRG 44.8 41 Basin Electric Pow er Coop 19.6 66 ALLETE 11.2 91 Rainbow Energy Center 8.4 17 DTE Energy 40.1 42 ENEL 19.5 67 Puget Holdings 11.1 92美国市政权力ER 8.3 18 Evergy 37.9 43 Emera 19.4 68 Conedison 10.8 93 Argo Infrastructure Partners 8.3 19 Ameren 37.8 44 Santee Cooper 18.8 69 69 69 69 Minicipal Elec。auth。of GA 10.8 94 ENGIE 8.3 20 Riverstone 36.2 45 Starw ood Energy 18.4 70 Occidental 10.7 95 NiSource 8.2 21 LS Pow er 35.4 46 EDF 18.4 71 Arkansas Electric Coop 10.6 96 Avista 8.1 22 US Bureau of Reclamation 35.2 47 FirstEnergy 17.9 72 John Hancock 10.3 97 Brazos Electric Pow er Coop 7.9 23 WEC Energy Group 33.0 48黑石集团17.3 73 Seminole Electric Coop 10.2 98 PNM资源7.7 24 PPL 32.8 49 EDP 15.5 74 Grant County 10.2 99 NC公共Pow ER 7.1 25 CMS Energe 32.4 50 tenaska 15.2 75 Encorm northw es
摘要 查尔斯王子医院 (TPCH) 于 2024 年 5 月启动了一项有关其心脏和肺移植服务的外部基准测试,以确定优势和改进领域,以确保该计划始终处于移植护理的最前沿。 2024 年 7 月,成立了一个由来自澳大利亚各地医疗机构的临床专家组成的小组,这些专家对移植具有特定的专业知识和兴趣,负责对这些移植服务进行独立评估。 该小组的目标是确保这些服务按照当代最佳实践运行。 该小组发现,查尔斯王子医院 (TPCH) 的心脏和肺移植服务对于继续支持昆士兰人的健康至关重要,但也有一些可以改进的地方,尤其是在心脏移植服务方面。 该小组制定了一份报告,其中包含支持提高移植服务生产力和有效性的建议,总体目标是改善当前和未来患者的后续结果。 这些建议涉及新技术、研究和培训的关键主题;以患者为中心和循证的护理和临床管理模式、人员配备和资源;以及员工福祉。总体而言,专家们承认移植是一个复杂的临床过程,需要有生活经验的消费者以及医院许多团队和部门在移植前、移植中和移植后的意见。这需要一个灵活且支持性的工作环境,鼓励团队合作,并公开承诺和负责实践组织的价值观。新技术、研究和培训建议心脏移植服务采用额外的当代捐献器官采购技术(如 X-VIVO 心脏盒)。报告建议更多地关注机械循环支持和先进技术。专家组建议加强 TPCH 目前的合作研究项目。护理模式和临床治理我们提出的一些建议与心脏移植服务中的护理模式和改进的临床治理流程有关。这些建议包括更新移植过程各个阶段以患者为中心的本地循证协议、途径和指南,改进数据收集和结果报告,增强多学科团队会议的功能,以及改进文档和报告。专家建议在进行这些改进的同时继续提供移植服务。为了支持持续的可持续发展和改进,建议为心肺移植服务制定五年计划。专家们还建议进行治理变革,以便更好地与医院的合作服务相结合。人员和资源总体而言,专家指出,服务资源需要与临床需求和护理的复杂性相匹配,并建议在移植科和相关临床科室增加专科医疗、外科、护理和相关卫生人员,以支持移植前、移植期间对患者的复杂护理
摘要:基于基于视觉的驾驶政策具有挑战性。一方面,带有实际数据的开环评估很容易,但是这些结果并不能反映闭环性能。在另一个闭环评估中是可以在模拟中进行的,但是由于其巨大的计算需求,很难扩展。此外,当今可用的模拟器显示出对真实数据的较大域间隙。这导致无法从端到端自动驾驶的迅速发展的研究体系中得出明确的结论。在本文中,我们提出了NAVSIM,这是这些评估范式之间的中间立场,在该范式中,我们将大型数据集与非反应模拟器结合使用来启用大型现实基准测试。具体来说,我们通过展开鸟类的眼睛视图抽象来收集基于模拟的指标,例如进度和碰撞的时间,以进行简短的模拟视野。我们的仿真无反应,即,评估的政策和环境不会相互影响。正如我们从经验上证明的那样,这种去耦允许开环计算,同时比传统的位移误差更好地与闭环评估保持一致。NAVSIM可以在一系列具有挑战性的情况下基准驾驶政策,从而产生一些新的见解。我们观察到具有中等计算要求(例如接送器)的简单方法可以匹配最近大规模的端到端驱动体系结构,例如UniaD。我们的框架可能会通过新的数据集,数据策略和指标来扩展,并将不断维护。我们的代码可在https://github.com/autonomousousvision/navsim上找到。
基于视觉的驾驶政策基于基准测试是具有挑战性的。一方面,带有实际数据的开环评估很容易,但是这些结果并不能反映闭环性能。在另一个闭环评估中是可以在模拟中进行的,但是由于其巨大的计算需求,很难扩展。此外,当今可用的模拟器显示出对真实数据的较大域间隙。这导致无法从端到端自动驾驶的迅速发展的研究体系中得出明确的结论。在本文中,我们提出了NAVSIM,这是这些评估范式之间的中间立场,在该范式中,我们将大型数据集与非反应模拟器结合使用来启用大型现实基准测试。具体来说,我们通过展开鸟类的眼睛视图抽象来收集基于模拟的指标,例如进度和碰撞的时间,以进行简短的模拟视野。我们的仿真无反应,即,评估的政策和环境不会相互影响。正如我们从经验上证明的那样,这种去耦允许开环计算,同时比传统的位移误差更好地与闭环评估保持一致。NAVSIM启用了在CVPR 2024举行的一项新比赛,其中143支球队提交了463个参赛作品,从而产生了一些新的见解。在一系列具有挑战性的情况下,我们观察到具有适度计算要求(例如接送器)的简单方法可以匹配最近的大型端到端驱动体系结构,例如UniaD。我们的代码可在https://github.com/autonomousousvision/navsim上找到。我们的模块化框架可能会通过新的数据集,数据策略和指标来扩展,并将不断维护以承受未来的挑战。
大型语言模型 (LLM) 在各个领域都变得至关重要,这强调了在代表性不足的语言中建立高质量模型的紧迫性。本研究探讨了低资源语言面临的独特挑战,例如数据稀缺、模型选择、评估和计算限制,特别关注土耳其语。我们进行了深入分析,以评估训练策略、模型选择和数据可用性对为代表性不足的语言设计的 LLM 性能的影响。我们的方法包括两种方法:(i) 调整最初用英语预训练的现有 LLM 以理解土耳其语;(ii) 使用土耳其语预训练数据从头开始开发模型,这两种方法均辅以在新的土耳其语指令调整数据集上进行监督微调,旨在增强推理能力。通过创建新的土耳其语 LLM 排行榜来评估这些方法的相对性能,其中包含评估不同推理和知识技能的基准。此外,我们在预训练和微调期间对数据和模型扩展进行了实验,同时强调跨语言知识迁移的能力,并解决在不同语言上微调时遇到的灾难性遗忘的挑战。我们的目标是提供在低资源语言环境中推进 LLM 框架的详细指南,从而使自然语言处理 (NLP) 的好处在全球范围内更容易获得。
回答现实世界中的复杂查询,例如复杂的产品搜索,通常需要从涉及非结构化(例如,产品的文本描述)和结构化(例如,产品关系)的半结构知识基础中进行准确检索。但是,许多以前的作品将文本和关系检索任务研究为独立的主题。为了解决差距,我们开发了st a rk,这是一个大规模的SEMI结构检索基准,并在t the t t and t and rational k newledge基础上。我们的基准涵盖了三个领域:产品搜索,学术纸搜索和精密医学的查询。我们设计了一条新颖的管道,以合成现实的用户查询,以整合各种关系信息和复杂的文本属性以及其基础真相(项目)。我们进行严格的人类评估以验证合成查询的质量。我们通过高质量的人类生成的查询进一步增强基准,以提供真实的参考。s rk是一个全面的测试床,用于评估大型语言模型(LLMS)驱动的检索系统的性能。我们的实验表明,ST A RK对当前检索和LLM系统提出了重大挑战,强调了对更有能力的半结构检索系统的需求。
