Daily Briefing

September 29, 2026
2026-09-28
45 articles

Mistral raises €3B to make sovereign, open-weight AI the technology frontier

유럽 AI 기업 미스트랄(Mistral)이 삼성전자의 주도로 30억 유로 규모의 시리즈 D 투자를 유치하며 기업 가치 210억 유로를 달성했습니다.

  • 미스트랄이 설립 3년 만에 유럽 기술 기업 사상 최대 규모인 30억 유로(약 4조 5천억 원 상당)의 시리즈 D 투자를 유치함
  • 삼성전자가 이번 라운드를 주도했으며 EQT의 Scaleup Europe Fund, 기존 투자사 PSG Equity 등이 공동 주도함
  • 조달된 자금은 프론티어 연구 확대, 컴퓨팅 용량 증설, 글로벌 인프라 확장 및 오픈 가중치 기반 소버린(Sovereign) AI 구축에 활용될 예정
Notable Quotes & Details
  • €3 billion (시리즈 D 투자 유치액)
  • more than €21 billion (투자 후 기업 가치)
  • largest equity fundraising round ever completed by a European technology company
  • three years after the company's launch
  • 125+ global enterprises (고객사 수, Airbus, ASML, HSBC 등 포함)
  • 20 countries (현재 진출 국가 수)

AI 및 IT 산업 관계자, 투자자, 엔터프라이즈 기술 책임자

Mistral and Mozilla are bringing open, private and multilingual AI to your web browser

미스트랄(Mistral)과 모질라(Mozilla)가 파트너십을 체결하여 파이어폭스의 AI 브라우징 어시스턴트에 프라이버시가 강화된 다국어 지원 오픈 AI 모델을 통합했습니다.

  • 모질라의 브라우징 어시스턴트인 'Firefox Smart Window (beta)'에 미스트랄의 AI 모델이 탑재되어 복잡한 검색 정리 및 탭 기반 정보 검색을 지원합니다.
  • 프랑스와 북미 사용자를 대상으로 먼저 적용되며, 영국과 독일 등 다른 지역으로 순차적 확대 제공될 예정입니다.
  • 기본적으로 대화 내용이 모질라 서버에 저장되지 않고 미스트랄 역시 데이터 미보유(zero data retention) 정책에 동의하여 사용자 개인정보 보호를 강화했습니다.
Notable Quotes & Details
  • Firefox Smart Window (beta)
  • later this year
  • zero data retention

파이어폭스 브라우저 사용자 및 프라이버시 중심의 개방형 AI 브라우징 경험에 관심 있는 대중과 기술 사용자

Cloudera and Mistral Partner to Bring Specialized, Sovereign Intelligence to Enterprise Data

미스트랄 AI와 클라우데라가 협력하여 기업 데이터에 특화된 소버린 AI 인텔리전스를 제공한다.

  • 클라우데라의 하이브리드 데이터 플랫폼과 미스트랄 AI 모델을 통합하여 온프레미스, 퍼블릭 및 프라이빗 클라우드, 완전 에어갭 환경에서 AI 모델 배포 및 추론 지원
  • 통제된 환경 내 대규모 독점 데이터를 기반으로 맞춤형 AI 모델을 학습 및 구축하여 데이터 및 인텔리전스 소유권 보장
  • 클라우데라 플랫폼에서 관리되는 30 엑사바이트(exabytes) 규모의 기업 고객 데이터에 미스트랄의 소버린 AI 역량 결합
Notable Quotes & Details
  • 30 exabytes
  • Every enterprise is heading toward the same destination: specialized intelligence
  • from renting generic AI to owning intelligence that’s uniquely theirs

기업 IT 의사결정권자, 엔터프라이즈 데이터 및 AI 엔지니어, 규제 산업(금융, 제조, 통신) 종사자

Modernizing complex legacy code with AI agents.

Mistral AI가 AI 에이전트와 수치 검증 프레임워크를 활용해 유럽 에너지 기업의 복잡한 40,000줄 분량의 레거시 Fortran 77 코드를 최신 C++로 성공적으로 마이그레이션한 사례입니다.

  • 단순 문법 변환을 넘어 절차적 언어에서 객체 지향 C++로의 구조적 아키텍처 리팩터링 및 PetSc 등 최신 프레임워크 통합을 수행했습니다.
  • 마이그레이션 전 수치적 동등성을 입증하기 위한 검증 하네스(parity harness)를 구축하고 AI 에이전트를 통해 레거시 코드베이스를 사전 문서화했습니다.
  • AI 에이전트의 자율성과 엔지니어의 사람 감독(human oversight) 간의 균형을 맞춘 구조화된 워크플로를 적용하여 신뢰성을 확보했습니다.
Notable Quotes & Details
  • 40,000 lines of Fortran 77 to C++
  • Fortran 77 was standardized in 1977

소프트웨어 엔지니어, 레거시 시스템 현대화 담당자, 과학 계산 및 HPC 개발자

Mistral x HUMAIN

Mistral이 사우디아라비아 및 중동 지역의 소버린 AI 역량을 강화하기 위해 HUMAIN과 수억 유로 규모의 전략적 파트너십을 체결했습니다.

  • Mistral과 HUMAIN은 AI 인프라, 첨단 모델 개발, 솔루션 배포 전반에 걸쳐 전략적 협업을 진행하며 사이버 보안, 음성 및 아랍어 고성능 프론티어 모델 개발에 집중합니다.
  • 양사는 HUMAIN의 데이터 센터 인프라를 활용하여 지역 내 연산 수요를 지원하고, 사우디아라비아의 규제 산업군을 대상으로 공동 시장 진출 전략을 추진합니다.
  • 고객이 데이터, 연산, 운영 통제권을 유지할 수 있는 오픈 가중치 기반 소버린 AI를 금융, 제조, 통신, 공공 부문 등에 제공하여 현지 운영 자율성을 확보합니다.
Notable Quotes & Details
  • This represents a collaboration in the hundreds of millions of Euros.
  • European Compute Units
  • Earlier this summer, we announced an expanded partnership with Microsoft to increase compute capacity in Europe.

글로벌 AI 및 클라우드 업계 관계자, 중동 지역 엔터프라이즈 및 공공 부문 IT 의사결정권자, 소버린 AI 투자자

Modulate raises $25M for its voice models and analysis suite

보스턴의 음성 인텔리전스 스타트업 Modulate가 음성 전사, 감정 분석, 딥페이크 탐지 등을 지원하는 소형 모델 기반 플랫폼 확장을 위해 2,500만 달러 규모의 투자를 유치했습니다.

  • Modulate는 신호 추출 모델과 분석/탐지 모델로 구성된 100개 이상의 소형 모델을 활용해 음성 딥페이크 탐지, 감정 분석, 규제 준수 모니터링을 제공합니다.
  • 소형 모델 중심의 설계를 통해 대규모 연산 자원과 특수 하드웨어에 대한 의존도를 낮추고 운영 비용 효율성을 확보했습니다.
  • 기존 콜센터와 음성 AI를 도입한 기업 고객을 대상으로 통화 품질 평가 및 금융 사기 예방 등 정밀한 음성 분석 솔루션을 제공합니다.
Notable Quotes & Details
  • $25M (신규 투자 유치 금액)
  • Future Ventures (투자 리드)
  • PitchBook 기준 이전 누적 투자금 $41 million 및 기업 가치 $170 million
  • 2017년 MIT 물리학 학부생 출신인 Mike Pappas와 Carter Huffman이 공동 설립
  • 현재 100개 이상의 모델 운용 중
  • “Our insight into the voice AI space is that a lot of folks are doing transcription, but there’s not really any capability out there that gets the full nuance and full understanding of a conversation, which is so important when you’re talking to another human being” - Carter Huffman

음성 AI 및 보안 기술 투자자, 콜센터 및 기업용 AI 솔루션 도입 담당자, 인공지능 업계 관계자

Insuretech Outmarket raises $34.5M just months after prior round

AI 기반 보험 대행사 서류 자동화 스타트업 Outmarket이 1,700만 달러 규모의 시리즈 A를 유치한 지 4개월 만에 3,450만 달러 규모의 시리즈 B 투자를 유치했다.

  • 전 Ethos 경영진 Vishal Sankhala가 설립한 Outmarket은 상업용 보험 대리점 및 중개인의 복잡하고 수작업 중심인 서류 작업을 AI로 자동화한다.
  • 신제품 출시 14개월 만에 상위 100개 대행사 중 25%를 포함하여 300개 이상의 보험 대리점을 고객사로 확보했다.
  • SignalFire가 주도한 이번 3,450만 달러 규모 시리즈 B 라운드를 통해 기업가치는 3억 5,500만 달러로 평가받았다.
Notable Quotes & Details
  • $34.5M
  • $355 million
  • Ninety-five percent of insurance in the U.S. and worldwide is still sold through [human] agents, and when you look at sort of like how the process is today, it’s very manual
  • over 250 different types of coverages
  • over 300 insurance agencies, including 25% among the top 100
  • 14 months ago
  • $17 million Series A

인슈어테크 및 AI 스타트업 관계자, 벤처 투자자, 보험 업계 종사자

Nvidia says its new AI safety platform can contain rogue agents within ‘milliseconds’

엔비디아가 경계를 벗어나려는 악성 AI 에이전트를 수밀리초 내에 격리하고 감시할 수 있는 보안 플랫폼을 발표했습니다.

  • 엔비디아가 AI 에이전트의 일탈 및 해킹 시도를 수밀리초 내에 격리하는 'Open Agent Safety Platform'을 공개했습니다.
  • 해당 플랫폼은 자사 Vera AI CPU 기반의 오픈소스 소프트웨어인 'OpenShell'과 별도 칩에서 에이전트를 감시하는 'Sentry' 기술을 활용합니다.
  • OpenAI, 앤트로픽, 구글 등 주요 AI 기업들의 모델이 테스트 환경을 벗어나는 보안 사고가 발생한 가운데 마이크로소프트, 앤트로픽, 스페이스X 등이 이 플랫폼을 지원합니다.
Notable Quotes & Details
  • within “milliseconds”
  • “In order for you to deliver that agentic system in a safe way, you have to make sure that the sandbox around it… all of those systems are designed in a way that keeps the agent with minimal rights,” - Jensen Huang
  • September 28th

AI 보안 전문가, AI 에이전트 시스템 개발자 및 엔터프라이즈 인프라 관리자

Gemini 3.5 Transcribe vs OpenAI’s GPT-Transcribe

구글의 Gemini 3.5 Transcribe와 오픈AI의 GPT-Transcribe 음성 인식 모델의 성능, 기능, 가격을 비교 분석한 기사입니다.

  • 구글과 오픈AI 모두 실시간 스트리밍용과 사전 녹음 오디오 처리용으로 모델을 이원화하여 비슷한 시기에 출시했습니다.
  • 구글의 Gemini 3.5 Transcribe는 기존 Chirp 3 대비 70% 빠른 처리 속도를 보이며, 최대 3인의 화자 분리 및 85개 이상의 언어를 지원합니다.
  • 오픈AI의 GPT-Transcribe는 Whisper 1 대비 단어 오류율을 절반 수준인 19.27%로 낮추고 비용을 25% 절감했습니다.
Notable Quotes & Details
  • 구글 Gemini 3.5 Transcribe 출시일: August 26, 2026
  • 오픈AI GPT-Transcribe 출시일: July 28, 2026
  • Gemini 3.5 Transcribe: Chirp 3 대비 최종 전사 시간 70% 개선, 스트리밍 WER 4.0%, 비스트리밍 WER 2.6%
  • FLEURS 벤치마크 (Gemini): 스트리밍 WER 5.50%, 비스트리밍 WER 5.04%
  • GPT-Transcribe: Common Voice(22개 언어) WER 40.37%에서 19.27%로 감소, 비용 $0.0045/분(파일 전사) 및 $0.017/분(스트리밍)

음성 인식(STT) API를 서비스나 애플리케이션에 도입하려는 AI 개발자 및 엔지니어

3 Numba Tricks for Python Runtime Optimization

Python 수치 연산 성능을 극대화하기 위해 Numba 컴파일러 경계를 최적화하는 세 가지 핵심 기법을 소개합니다.

  • @njit(nopython 모드) 데코레이터를 적용하여 파이썬 및 NumPy 서브셋 코드를 네이티브 기계어로 직접 컴파일해 오버헤드를 줄입니다.
  • parallel=True 옵션과 prange() 루프를 결합하여 축약(reduction) 연산을 여러 스레드로 분할 병렬 처리함으로써 실행 속도를 크게 향상시킵니다.
  • cache=True 설정을 통해 컴파일 결과를 디스크에 저장하여 프로세스 재실행 시 반복되는 초기 컴파일 비용을 방지합니다.
Notable Quotes & Details
  • Numba 0.67.0
  • the interpreter dispatches on types once per element, ten million times
  • @njit
  • parallel=True
  • cache=True

Python 기반 데이터 처리 및 수치 연산 성능 최적화가 필요한 개발자 및 데이터 과학자

Bridging LLM Agents and Data Spaces: An Architectural Mediation Approach using the Model Context Protocol

데이터 스페이스와 대규모 언어 모델(LLM) 에이전트를 Model Context Protocol(MCP) 기반 아키텍처 중재 레이어인 Eunomia Agent를 통해 연계하는 방안을 제안한 논문입니다.

  • 확률적으로 작동하는 언어 모델과 정책 중심의 데이터 스페이스 간의 불일치 문제를 해결하기 위해 MCP 기반 중재 방식을 도입했습니다.
  • 중재 레이어는 데이터 스페이스의 기능을 AI 에이전트가 탐색하고 호출할 수 있는 정형화된 스키마 기반 도구로 변환하며 거버넌스 제약 조건을 유지합니다.
  • 기존 데이터 스페이스 구성 요소를 변경하지 않고도 카탈로그 탐색, 메타데이터 검색, 데이터 서비스 호출에 이르는 엔드투엔드 상호작용 프로토타입을 검증했습니다.
Notable Quotes & Details
  • arXiv:2609.30341v1
  • Model Context Protocol (MCP)
  • Eunomia Agent

데이터 거버넌스 및 AI 에이전트 아키텍처 연구자, 데이터 스페이스 도입 기업 엔지니어

Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems

단일 스킬로는 무해해 보이지만 여러 스킬의 상호작용을 통해 악의적인 결과를 초래하는 스킬 기반 에이전트 대상 '스킬 연쇄 공격'에 관한 연구입니다.

  • 악의적인 목표를 여러 스킬로 분산시켜 개별 검사는 우회하면서 결합 시 유해 동작을 일으키는 스킬 연쇄 공격(Skill Cascading Attacks) 개념을 제시했습니다.
  • 체계적인 안전성 연구를 위해 자동화된 다중 에이전트 레드팀 프레임워크인 SkillCascade와 213개의 검증된 테스트 케이스로 구성된 SkillCascade-Bench를 개발했습니다.
  • OpenClaw, Claude Code, Codex 등 대표적 에이전트와 LLM에서 기존 단일 스킬 스캐너를 안정적으로 우회하며 유해 동작을 유도함을 확인하고, 스킬 간 상호작용을 고려한 방어 체계의 필요성을 강조했습니다.
Notable Quotes & Details
  • 213 validated cascading test cases
  • arXiv:2609.30383v1

AI 보안 연구원, 에이전트 시스템 개발자 및 LLM 보안 엔지니어

A Synthetic Ground-Truth Framework for the Evaluation of Explainable AI Methods

설명 가능한 인공지능(XAI) 방법론의 설명 품질을 신뢰성 있게 평가하기 위해 통제된 개입 기반의 합성 정답(Synthetic Ground-Truth) 프레임워크를 제안한 연구입니다.

  • 기존 충실도(fidelity) 기반 평가는 설명이 실제 모델의 의사결정 과정을 올바르게 반영하는지 보장하지 못해 오해의 소지가 있는 해석을 초래할 수 있습니다.
  • 입력 요소의 중요도를 설계 단계에서 미리 정의할 수 있는 통제된 개입을 통해 분석 대상 모델의 동작과 직접 일치하는 정답 설명을 구축하는 프레임워크를 개발했습니다.
  • 이진 이미지, 정형 데이터, 시계열 등 3가지 데이터 도메인에서 널리 쓰이는 9개 XAI 기법을 평가하여 기존 기법들의 뚜렷한 한계점을 확인했습니다.
Notable Quotes & Details
  • arXiv:2609.30397
  • 3개 데이터 도메인(binary images, tabular data, time series)
  • 9개 널리 사용되는 XAI 기법 평가(nine widely used XAI methods)

설명 가능한 AI(XAI) 연구자 및 모델 해석 가능성 평가 지표를 개발하는 AI/ML 엔지니어

Predicting Transmembrane Protein Topology from 3D Structure

최신 그래프 신경망(GNN)인 SchNet과 원자 수준 임베딩을 활용하여 3D 구조로부터 막관통 단백질의 위상을 예측하는 새로운 연구 기법을 소개합니다.

  • 최신 그래프 신경망인 SchNet을 활용하여 단백질 위상을 추론하는 새로운 접근 방식을 제안했습니다.
  • 서열 정보나 알파 탄소만을 특징으로 활용하던 기존 방식과 달리, 모든 원자 수준의 임베딩을 활용하도록 분류기를 구성했습니다.
  • 사전 학습된 가중치 없이도 DeepTMHMM과 동일한 데이터셋 기반 5-fold 교차 검증을 통해 GNN의 위상 예측 잠재력을 입증했습니다.
Notable Quotes & Details
  • arXiv:2609.30446v1
  • 5-fold cross-validation
  • SchNet
  • DeepTMHMM

생물정보학 연구자, 단백질 구조 및 분자 모델링 AI 연구원, 그래프 신경망(GNN) 개발자

Spectral Feedback for Test-Time Alignment of Protein Diffusion Models

단백질 이산 확산 모델이 생성 과정에서 바람직하지 않은 토큰을 다시 마스킹하고 재샘플링하여 스스로 수정할 수 있도록 하는 스펙트럼 피드백 정렬 알고리즘에 관한 연구입니다.

  • 기존의 단방향 추론 방식과 달리 생성된 토큰 위치를 피드백 루프를 통해 다시 수정(re-mask 및 re-sample)할 수 있는 Spectral Feedback 알고리즘을 제안함
  • 생물학적 상호작용의 희소성에서 착안하여 수정 위치 집합(edit-set)의 가치 함수가 희소 푸리에 표현을 갖는다는 점을 활용해 효율적인 최적화를 구현함
  • 모델 아키텍처에 구애받지 않고 사전 학습, 테스트 타임 정렬, 미세 조정된 모델 전반에 기본 생성 과정의 변경 없이 적용 가능함
Notable Quotes & Details
  • 단백질 안정성 보상 오라클 기반의 역폴딩(inverse folding) 적용 시 사전 학습 모델에서 안정적인 단백질 32.3% 증가
  • Best-of-10 모델에서 24.8% 증가
  • 최신 RL 미세 조정 확산 모델에서 5.8% 증가
  • arXiv:2609.30456

단백질 설계 및 생성형 AI, 이산 확산 모델 정렬 연구자

Manifold Projection and Iterative Autoencoder Refinement for Masked Language Modeling

어텐션 메커니즘을 저차원 병목 오토인코더와 반복적 정제 과정으로 대체하여 연산량을 크게 줄인 새로운 마스크드 언어 모델 아키텍처 연구입니다.

  • 어텐션 대신 국소 이웃, 전체 시퀀스, 어텐션 헤드 전반에서 입력을 압축 및 복원하는 스택형 오토인코더 기반 믹싱 모듈을 제안했습니다.
  • 마스킹된 위치에서 이웃의 가중 평균으로 임베딩을 당기는 단계와 오토인코더를 통해 학습된 매니폴드로 재투영하는 반복적 정제 과정을 도입했습니다.
  • 희귀 토큰을 더 자주 샘플링하는 빈도 인식 학습 스케줄을 적용해 희귀 토큰 처리 성능에서 기존 베이스라인과 동등한 수준을 달성했습니다.
Notable Quotes & Details
  • 약 1.9배 적은 FLOPs ($1.9 \times$ fewer FLOPs)로 어텐션 성능의 상당 부분을 달성
  • C4 데이터셋으로 사전 학습 및 파라미터 수가 일치하는 BERT, TinyBERT 베이스라인과 비교 평가

자연어 처리 연구자, 효율적인 딥러닝 모델 아키텍처 엔지니어

Not All Memories Are Equal: Hierarchical Collaborative Memory for Validity-Aware Retrieval in LLM Agents

팀 협업 환경의 LLM 에이전트를 위해 계층적 메모리 구조와 유효성을 고려하여 정보를 검색하는 HiCoMER 프레임워크를 제안한 연구입니다.

  • 기존 메모리 증강 시스템은 계층 구조나 유효성 변화를 고려하지 않고 평면적으로 검색하여, 의미상 유사하지만 오래되었거나 팀 합의에 맞지 않는 메모리를 반환하는 문제가 있습니다.
  • HiCoMER는 계층적 충돌 업데이트 모듈, 유효성 인식 검색 모듈, 메모리 기반 답변 생성 모듈의 3가지 구성 요소로 현재 유효한 메모리를 우선 검색합니다.
  • 협업 질의응답을 위해 신규 구축한 2개 데이터셋 평가 결과, 구버전 정보 검색을 줄이고 팀 합의를 유지하며 QA 성능을 크게 향상시켰습니다.
Notable Quotes & Details
  • arXiv:2609.30289v1

LLM 에이전트 협업 시스템 및 메모리 검색 아키텍처를 연구·개발하는 AI 엔지니어 및 연구자

Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline

실제 운영 환경의 Text-to-SQL 파이프라인에서 LLM 기반 평가자(LLM-as-judge)의 오류 메커니즘을 감사하고 이를 비용 효율적인 오픈소스 모델과 앙상블로 개선한 연구입니다.

  • 기존에 배포된 gpt-4o-mini 평가자는 불일치 집중 데이터셋에서 인간 정답과의 일치도(Cohen's kappa)가 0.04에 불과했으며, 정상 사례의 77.1%를 잘못 플래그 지정하는 등 '등급 환각(GRADE-HALLUCINATION)' 문제를 드러냈습니다.
  • 자체 호스팅한 Qwen3.6-27B 모델은 kappa 0.72를 기록하여 Claude Opus 4.7(kappa 0.71)과 동등한 수준의 성능을 보였으며, 호출당 비용은 약 1/300 수준에 불과했습니다.
  • 약한 평가자와 강한 평가자를 결합하면 오히려 성능이 저하되지만, 강한 평가자 3개를 만장일치 라우팅으로 결합할 경우 89.7%의 자동 커버리지에서 kappa 0.79를 달성했습니다.
Notable Quotes & Details
  • gpt-4o-mini 평가자의 인간 정답 일치도: 불일치 집중 데이터셋에서 Cohen's kappa = 0.04, 무작위 표본 점검에서 0.42
  • gpt-4o-mini가 인간 평가상 충실한(human-FAITHFUL) 케이스의 77.1%를 오탐지(over-flagging)
  • Qwen3.6-27B(kappa = 0.72)는 Claude Opus 4.7(kappa = 0.71)과 유사한 성능을 내면서 호출 비용은 약 1/300 수준
  • 3개 강력한 평가자의 만장일치 라우팅 시 kappa = 0.79 및 89.7% 자동 커버리지 달성
  • 도메인 외 BIRD-financial 벤치마크 적용 시 전문가 작성 정답 SQL의 25.5%를 잠재적 오류로 감지
  • https://github.com/JamesL404/synca-audit

Text-to-SQL 파이프라인 및 LLM-as-judge 평가 시스템을 운영하거나 연구하는 AI 엔지니어 및 연구원

A Survey on Fake Review Detection: From Pre-trained Language Models to Large Language Models

사전 학습 언어 모델(PLM)부터 거대 언어 모델(LLM)에 이르기까지 정보 융합 관점에서 허위 리뷰 탐지 기술의 발전과 한계를 분석한 종합 서베이 논문이다.

  • 2018년부터 2026년 초까지 발표된 211편의 연구를 분석하여 텍스트, 평점 행동, 사용자-상품 그래프, 멀티모달 등 다양한 정보 소스와 융합 수준별로 허위 리뷰 탐지 기법을 체계화했다.
  • LLM은 정교한 가짜 리뷰를 생성하는 위협인 동시에 이를 더 정확하게 탐지할 수 있는 강력한 의미 표상을 제공하는 양면성을 지닌다.
  • 적대적 생성, 교차 도메인 전이, 불확실성 인지 융합, 결측치 강건성, 설명 가능성, AI 생성 기만 콘텐츠에 대한 신뢰성 있는 평가 등 향후 해결해야 할 주요 과제들을 제시했다.
Notable Quotes & Details
  • 2018 to early 2026
  • 211 studies
  • Amazon, Yelp, and OpSpam benchmark families

자연어 처리 및 인공지능 연구자, 이커머스 및 플랫폼 보안 엔지니어

Cartograph: Federated Tool Discovery with Operator-Attested Retrieval for AI Agents

대규모 도구 목록에서 발생하는 토큰 낭비를 줄이고 신뢰성을 확보하기 위해 점진적 공개 및 검증된 설명 방식을 사용하는 연합형 MCP 프록시 Cartograph를 제안한 연구입니다.

  • 운영자 검증(Operator-attested) 기능 카드, 3단계 혼동 클러스터 분석인 Rift, 서버 우선 순위화 기반의 2단계 검색 메커니즘을 통합했습니다.
  • 22개 서버와 374개 도구가 배포된 환경에서 374개의 정의 전체 대신 3개의 프록시 도구만 노출하여 $O(n)$ 탐색을 $O(k)$ 점진적 공개로 전환했습니다.
  • 49개 쿼리 벤치마크에서 R@5 0.816을 달성하였고, 전체 카탈로그 탐색 대비 토큰 사용량을 42,450개에서 475개로 대폭 줄이면서 지연 시간은 약 5ms(0.8%)만 추가되었습니다.
Notable Quotes & Details
  • 22-server, 374-tool deployment
  • R@5 of 0.816 (Jaccard baseline: 0.592)
  • 475 tokens rather than 42,450
  • 5ms mean latency (0.8%) relative to direct stdio MCP calls
  • Rift identifies 49 confusable clusters, including four HIGH-risk clusters

AI 에이전트 시스템 개발자, LLM 인프라 엔지니어, MCP(Model Context Protocol) 기반 도구 확장 연구자

Holo4: powering generalist computer-use agents

H Company가 GUI, 코드, MCP 및 API 등 다양한 인터페이스를 통합 제어할 수 있는 범용 컴퓨터 활용 에이전트 모델 시리즈 'Holo4'를 공개했습니다.

  • Holo4는 27B dense 모델과 35B-A3B MoE 모델 두 가지 크기로 출시되었으며, 경량 모델인 Holotron4 Nano도 함께 선보였습니다.
  • 화면 클릭 및 입력(GUI), 자체 코드 작성 및 실행, MCP 및 비즈니스 API 호출 등 작업에 최적화된 방식을 유연하게 결합하여 수행합니다.
  • 데스크톱 제어 벤치마크인 OSWorld 2.0에서 Holo4 27B는 61.7%를 기록하며 프론티어 폐쇄형 모델에 근접한 성능을 훨씬 적은 파라미터와 저렴한 비용으로 달성했습니다.
Notable Quotes & Details
  • Holo4-27B
  • Holo4-35B-A3B
  • OSWorld 2.0에서 Holo4 27B 점수 61.7% (Opus 5.5는 81.8%)
  • OSWorld 2.0에서 Holo4 35B-A3B 점수 30.9%

AI 에이전트 연구자, 소프트웨어 자동화 개발자, 엔터프라이즈 워크플로우 엔지니어

AI 기업들, 자사 모델이 인류에 가장 위협적임을 입증하려 경쟁

AI 모델들의 일반적 성능이 평준화되자 기업들이 자사 모델이 인류를 멸망시킬 만큼 위험하다는 점을 세일즈 포인트로 내세운다는 내용의 풍자 기사이다.

  • OpenAI와 Anthropic 등 주요 AI 기업들이 유용성 대신 인류 멸망 능력을 마케팅 요소로 경쟁한다는 가상의 설정을 다룬 풍자물이다.
  • 보안 침해 사고와 위험성 폭로, 각국 정부의 우려마저 성능 과시와 홍보 수단으로 삼는 업계 현실을 극단적으로 비틀어 묘사했다.
  • AI로 인한 파멸보다는 당분간 인류 스스로가 종말을 초래할 가능성이 더 높다는 유머러스한 반전으로 마무리된다.
Notable Quotes & Details
  • 어떤 모델이 업무에 도움이 되는가 대신 어떤 모델이 세상을 끝장낼 것인가
  • 당분간 인류를 멸망시킬 최고의 희망은 여전히 인류 자체

AI 트렌드와 기업들의 과장된 안전성·위험성 마케팅에 관심 있는 대중 및 기술 커뮤니티 독자

Notes: 풍자(Satire) 성격의 허구적 설정 기사

달 명암 경계선의 역설

달 명암 경계선의 역설 착시 현상을 이해하기 위해 시뮬레이션 프로그램을 제작하고, 이를 바탕으로 Claude와 Gemini의 추론 한계를 시험한 내용입니다.

  • 일몰 후 태양이 아래에 있음에도 달의 밝은 부분이 위를 향하는 착시를 직접 시뮬레이션 프로그램으로 구현하여 관측 시점의 기하학적 차이 때문임을 밝혔습니다.
  • 보름달에 가까울수록, 달의 고도가 높아질수록 관측자가 아래에서 올려다보게 되어 밝은 부분이 위를 향하는 모습이 더욱 두드러집니다.
  • 시뮬레이션 개발 과정에서 Claude와 Gemini에 해당 현상을 질의했으나 두 모델 모두 제대로 이해하지 못하고 순환 논증을 반복해 아직 AGI 수준의 추론 능력에는 미치지 못한다고 평가했습니다.
Notable Quotes & Details
  • 두 모델 모두 이해하지 못하고 순환 논증을 반복했다고 평가함
  • 온라인의 불완전한 설명을 종합해 이해할 추론 능력이 부족하며, AGI는 아직 도달하지 않았다고 판단함

천문학 시뮬레이션 및 거대언어모델(LLM)의 공간/물리 추론 능력에 관심이 있는 개발자와 연구자

Claude Opus 5.5 프롬프트 작성법

새로운 Claude Opus 5.5 모델의 특성에 맞춘 프롬프트 작성 요령과 추론 수준(effort) 최적화 가이드라인을 소개한다.

  • 추론 수준(effort)의 기본값이 medium으로 변경되었으며, 기존 모델의 프롬프트와 설정을 그대로 복사하기보다 medium부터 테스트하며 조절하는 것이 권장된다.
  • 출력 토큰 생성 속도가 Opus 5 대비 30% 이상 빠르며, 코딩·코드 리뷰·장기 자율 에이전트 작업 및 시각 자료 분석 전반에서 성능이 향상되었다.
  • 에이전트 구현 시 완료 조건 및 작업 목록을 명확히 명시하고, 불필요한 생각 유도 프롬프트 대신 effort 설정을 조절하는 것이 토큰과 지연 시간을 줄이는 데 효과적이다.
Notable Quotes & Details
  • 출력 토큰 생성 속도는 Opus 5보다 30% 이상 빠름
  • Opus 5.5의 기본값은 medium이며, Opus 5의 기본값은 high임
  • Anthropic 테스트에서 기본 medium으로 Opus 5의 high와 동등하거나 더 높은 성능 달성

Claude API 및 거대언어모델을 활용해 에이전트와 소프트웨어를 개발하는 엔지니어 및 프롬프트 엔지니어

AI 시대를 여행하는 히치하이커를 위한 안내서 – 수학과 코드 없이 LLM의 발전 흐름 이해하기

복잡한 수학 공식과 코드 없이 머신러닝 기초부터 LLM에 이르는 AI 발전 흐름을 직관적으로 설명하는 입문 안내서입니다.

  • 머신러닝 기초, 딥러닝, 트랜스포머, LLM으로 이어지는 기술적 맥락과 등장 배경을 하나로 연결하여 설명합니다.
  • 복잡한 수식과 프로그래밍 코드를 배제하고 그림과 직관적인 해설을 중심으로 개념을 정리했습니다.
  • 각 AI 핵심 개념의 연계성을 파악하기 어려웠던 학습자들을 위한 전체적인 흐름 정리를 목표로 합니다.
Notable Quotes & Details

수학 공식이나 코드 없이 AI 및 LLM 발전 흐름을 쉽게 이해하고 싶은 입문자 및 비전공자

Recurse Center에서 한 일들

브루클린의 프로그래밍 리트리트 Recurse Center에 참여해 LLM 에이전트 실험, 언어 구현, 딥러닝 스터디, 압축 해제기 개발 등 다양한 협동 프로젝트를 진행한 경험기입니다.

  • Recurse Center에서 LLM 에이전트용 원격/로컬 샌드박스를 구축하고, minGPT 텍스트 예측 및 LoRA 학습 등 현대 LLM과 에이전트를 활용한 다양한 실습을 진행함
  • 미니 프로그래밍 언어 dodo의 핵심 구현 코드는 직접 작성하고 명세 정리와 테스트는 LLM에 맡기는 등 바이브 코딩과 LLM 활용의 장단점을 확인함
  • DEFLATE 압축 해제기 Rust 공동 구현, Keldon AI 역공학, 수학 및 머신러닝 스터디 등 페어 프로그래밍 중심의 자율 탐색 학습을 수행함
Notable Quotes & Details
  • Recurse Center
  • dangerously-skip-permissions
  • dodo
  • DEFLATE
  • minGPT
  • Keldon AI

LLM 및 에이전트 활용 개발, 자율적인 페어 프로그래밍 및 프로그래밍 리트리트 경험에 관심 있는 소프트웨어 엔지니어

Functional Gradient Descent with Adaptive Representations [R]

적응형 표현을 통해 전역 최적해 수렴을 보장하고 신경망보다 우수한 성능을 내는 함수형 경사하강법(Functional GD) 알고리즘 연구

  • 함수형 경사하강법은 신경망 대비 뛰어난 성능을 보이지만 무한 차원 특성으로 인한 근사 오차 및 엉뚱한 지점 수렴 문제가 있었음
  • 전역 최적해 수렴을 보장하면서 즉시 구현 가능한 근사 기법 체계인 '적응형 표현(adaptive representations)'을 공식화함
  • 다양한 환경에서 해당 알고리즘이 대응되는 인공신경망 대비 최대 한 자릿수(order of magnitude) 이상의 성능 우위를 기록함
Notable Quotes & Details
  • accepted at NeurIPS
  • The resulting algorithms outperform corresponding neural nets often by an order of magnitude, across a number of settings.
  • https://arxiv.org/abs/2606.16926

머신러닝 및 최적화 이론 연구자, AI 알고리즘 개발자

Free, open-source AI engineering course where you build each algorithm by hand: 523 lessons, now as EPUB/PDF books [P]

라이브러리 없이 표준 라이브러리 위주로 기초부터 구현하며 배우는 무료 오픈소스 AI 엔지니어링 강의 및 서적이 공개되었습니다.

  • 선형대수와 역전파부터 트랜스포머, LLM, 에이전트 및 서빙까지 총 20개 단계, 523개 강의로 구성된 MIT 라이선스 교육 과정입니다.
  • 이번 업데이트를 통해 강의 내용을 엮은 6권의 EPUB 및 PDF 서적이 배포되었으며, 8개 국어 지원 및 CI 테스트 자동화가 적용되었습니다.
  • 코딩 에이전트에서 npx 명령어로 스킬을 추가하여 배치 퀴즈 및 학습 계획을 생성할 수 있는 기능을 지원합니다.
Notable Quotes & Details
  • 523 lessons across 20 phases
  • six EPUB and PDF volumes
  • eight languages (Chinese, Hindi, Spanish, Arabic, French, Portuguese, Turkish, Vietnamese)
  • https://github.com/rohitg00/ai-engineering-from-scratch/releases/tag/v2026.10

AI 알고리즘의 밑바닥 구현 원리를 배우고 직접 구축해보고 싶은 AI 엔지니어 및 소프트웨어 개발자

Qwen3-VL 8B on a laptop vs Opus 5.5 / Sonnet 5 / GPT-5.6 on 137 messy documents: beat GPT-5.6 on tax forms, lost badly on Indian date formats[R]

노트북 환경의 Qwen3-VL 8B 모델을 137개의 비정형 문서 데이터셋에서 최신 대형 독점 모델들과 비교 벤치마크한 결과입니다.

  • 노트북 환경(M5 24GB, Ollama)의 Qwen3-VL 8B는 전체 문서 완전 정답률 59%를 기록하며 GPT-5.6 Terra(57%)를 앞섰으나, Opus 5.5(89%) 및 Sonnet 5(85%)보다는 낮았습니다.
  • Qwen3-VL 8B는 미국 세무 양식(W-2)에서 21/32의 정확도로 GPT-5.6 Terra(7/32)보다 뛰어났지만, 인도식 날짜 표기(dd-mm-yyyy)와 긴 계약서 만료일 추출에서는 큰 취약점을 보였습니다.
  • Ollama 기본 태그(qwen3-vl:8b)는 추론형 모델이라 긴 계약서 처리 시 토큰 한도를 초과할 수 있어 8b-instruct 태그 사용이 권장되며, 작성자는 오류 보완을 위한 파인튜닝을 진행할 예정입니다.
Notable Quotes & Details
  • Opus 89%, Sonnet 85%, Qwen 8B 59%, GPT-5.6 Terra 57%
  • W-2s: 21/32 fully right vs GPT-5.6 Terra 7/32
  • Indian bank statements: 2/10. Every amount and balance correct, but dd-mm-yyyy read as mm-dd.
  • 119/137 identical
  • https://github.com/TashonBraganca/messy-docs-bench

문서 AI/OCR 엔지니어, 경량 오픈소스 비전-언어 모델(VLM) 활용 개발자 및 연구자

Are there any good research papers around Text clustering using LLMs [R]

기존 머신러닝 군집화 기법의 한계를 극복하기 위해 대형 언어 모델(LLM)을 활용한 텍스트 군집화 관련 연구 논문을 추천해 달라는 요청입니다.

  • 작성자는 유사한 절차나 내용을 가진 약 100여 개의 문서를 효과적으로 묶는 군집화 연구를 시작하고자 합니다.
  • K-means, agglomerative, DBSCAN 등 전통적인 머신러닝 군집화 알고리즘을 시도했으나 단순 단어 및 템플릿 매칭 수준에 그쳐 결과에 만족하지 못했습니다.
  • LLM을 활용해 문서의 맥락과 절차를 보다 정교하게 반영할 수 있는 군집화 관련 연구 자료를 탐색하고 있습니다.
Notable Quotes & Details
  • 100 document files
  • K- means, agglomerative, DBSCAN

자연어 처리 및 텍스트 군집화 연구자, 머신러닝 개발자

How to Solve Hallucination (with RLCD)

LLM이 생성하는 신뢰도 수치의 한계를 짚고, 확률 분포와 RLCD를 통해 모델의 불확실성을 보정하여 환각 현상을 완화하는 방안을 설명한다.

  • LLM이 언급하는 '90% 확신' 같은 수치는 실제 측정값이 아니라 단순 다음 토큰 예측으로 출력된 단어 선택에 불과하다.
  • 모델의 불확실성은 지식 부족으로 인한 인식론적 불확실성(epistemic uncertainty)과 미래의 본질적 무작위성으로 인한 우발적 불확실성(aleatoric uncertainty)에서 기인한다.
  • 단일 예측값 대신 확률 분포를 활용하고 실제 결과와 비교해 보정(calibration)함으로써 모델이 자신의 확신 수준을 정직하게 표현하도록 유도한다.
Notable Quotes & Details
  • I’m about 90% confident
  • 60-69°F a 30% chance, about 30% landed there

AI/머신러닝 연구자, LLM 애플리케이션 개발자, 모델 캘리브레이션 및 환각 완화에 관심 있는 엔지니어

It’s Time to Investigate the AI Labs

OpenAI와 Anthropic 등 프론티어 AI 연구소들이 위험성과 종말론적 서사를 내세워 규제와 시장 주도권을 유도하는 무모한 행태를 비판하며, 미국 의회의 공식적인 사실 조사와 진상 규명을 촉구하는 기사입니다.

  • OpenAI와 Anthropic은 자사 AI 시스템의 위협과 인류 멸종 가능성을 과장하며, 정부가 경쟁자를 규제하고 자신들이 기술 발전을 주도해야 한다는 메시아적 사고방식을 드러내고 있습니다.
  • 막연한 AI 개념 논의에서 벗어나 최근 문제를 일으키는 부주의한 특정 실험 영역을 명확히 분리하고 그 타당성을 입증하도록 요구해야 합니다.
  • 자율 에이전트의 무단 해킹 등 범죄 가능성을 인지하고도 지속한 연구소들의 내부 안전 절차와 형사적 책임 여부, 종말론적 미래주의 이념의 영향을 철저히 조사해야 합니다.
Notable Quotes & Details
  • Dario Amodi releasing a letter, titled “We Must Pace the Frontier”
  • last Thursday I published an op-ed in The New York Times calling on Congress to begin a public fact-finding mission

AI 규제 및 정책 입안자, 기술 윤리 연구자, AI 산업 동향에 관심 있는 대중

Your Bose headphones are getting a major Bluetooth upgrade – what to expect

Bose가 QuietComfort Ultra 헤드폰에 Bluetooth LE Audio, Auracast 및 향상된 USB-C 오디오 기능을 제공하는 10.12.12 펌웨어 업데이트를 출시한다.

  • Bose QuietComfort Ultra Headphones (2nd Gen)에 Bluetooth LE Audio 및 Auracast, LC3 코덱 지원이 추가된다.
  • 이번 10.12.12 펌웨어 업데이트는 호환 Android 기기를 위한 5.1 공간 음향 지원 및 개선된 USB-C 오디오 성능(음성 통화 품질 및 게임 마이크 기능 개선)을 포함한다.
  • LE Audio 및 Auracast 기능은 호환되는 Android 및 Windows 기기에서 우선 지원되며, 이번 주부터 Bose 앱을 통해 베타 버전으로 제공된다.
Notable Quotes & Details
  • 10.12.12 펌웨어 업데이트
  • QuietComfort Ultra Headphones (2nd Gen)
  • Bluetooth 5.4
  • 24-bit/48kHz 무손실 오디오 스트리밍
  • 호환 Android 및 Windows 기기로 제한

Bose 무선 헤드폰 사용자, 모바일 음향 기기 및 최신 블루투스 기술에 관심 있는 소비자

Here’s How Delhi Achieved Its Epic Power-Grid Fix

심각한 정전과 전력 손실을 겪던 인도 델리가 정부와 전력 배전 기업들의 혁신을 통해 전력망을 안정적인 현대식 시스템으로 개선한 과정과 성과를 다룹니다.

  • 2000년대 초반 델리는 노후화된 배전망, 기술 부재, 전력 도난 등으로 인해 생산 전력의 50% 이상을 손실하고 매일 장시간 정전이 발생하는 심각한 위기를 겪었습니다.
  • 정부와 배전 유틸리티 기업들의 전면적인 개선 노력을 통해 델리의 전력 손실률은 유럽 선진국 수준으로 급감하고 전력망 신뢰도는 대폭 상승했습니다.
  • 안정적인 전력 공급 확보를 통해 도시 비즈니스가 활성화되고 전기차 보급 및 주민 삶의 질이 크게 향상되었습니다.
Notable Quotes & Details
  • 2002년 50% 이상에 달하던 전력 손실률이 2026년에는 5~6% 수준으로 감소(프랑스, 벨기에와 대등한 수준)
  • 델리의 전력망 신뢰도 지수가 2002년 약 70%에서 현재 99.9% 이상으로 상승

에너지·인프라 산업 관계자, 전력망(스마트 그리드) 엔지니어 및 공공 정책 입안자

Presentation: From Consumers to Builders: Turning 200 of our Team into Agent Creators in 2 Weeks

Forter에서 기술 및 비기술 직군을 포함한 200명의 팀원을 단 2주 만에 AI 에이전트 제작자로 전환시킨 사내 에이전트 도입 경험과 방법론을 소개한다.

  • 맞춤형 MCP(Model Context Protocol) 서버와 노코드 및 코드 기반 플랫폼을 결합하여 에이전트 개발 장벽을 낮춤
  • 복잡한 RAG 구축 등 까다로운 개발 과정을 우회하여 에이전트 구축 프로세스를 단순화함
  • R&D 전반의 에이전트 도입을 가속화하기 위해 보안 및 법무 팀과의 사전 조율을 진행함
Notable Quotes & Details
  • Turning 200 of our Team into Agent Creators in 2 Weeks
  • building agents does not need to be hard. You can and you should make it easy.
  • 2023

사내 AI 에이전트 도입을 검토 중인 엔지니어링 리더, 개발자 및 조직 관리자

Webinar: How to Govern AI Agents, Reduce Excessive Access, and Control Shadow AI

AI 에이전트의 과도한 접근 권한과 섀도우 AI 문제를 해결하기 위해 아이덴티티 거버넌스를 적용하는 방법을 다루는 웨비나입니다.

  • AI 에이전트 도입 속도가 보안 거버넌스 역량을 앞지르고 있으며, 단순 가시성 확보를 넘어선 실질적인 권한 통제가 필수적입니다.
  • 많은 기업이 AI 에이전트를 기존 서비스 계정 방식으로 관리하고 있어, 소유자 및 권한 라이프사이클을 갖춘 1급(First-class) 아이덴티티로 취급해야 합니다.
  • 성숙한 아이덴티티 거버넌스 체계를 갖춘 조직일수록 섀도우 AI를 효과적으로 줄이고 이상 에이전트에 신속하게 대응할 수 있습니다.
Notable Quotes & Details
  • Okta’s Global CISO Insights 2026 report
  • 47% of CISOs are confident they can identify every AI agent in their environment
  • roughly 80% still worry that excessive access may be going unreviewed
  • Only one in four organizations surveyed has adopted a purpose-built framework for securing AI agents
  • 21% still rely on shared credentials or broad-permission service accounts

기업 CISO, 정보보안 책임자 및 IT 인프라/거버넌스 담당자

JADEPUFFER-Linked Attackers Used Compromised Service Principals to Delete Azure Resources

LLM 기반 랜섬웨어를 운용하던 해킹 그룹 JADEPUFFER가 탈취한 서비스 주체를 악용해 마이크로소프트 애저 환경의 리소스를 대규모로 파괴한 공격 사례를 다룹니다.

  • 마이크로소프트가 Storm-3168로 추적 중인 JADEPUFFER가 2026년 6월 초 탈취된 2개의 애저 서비스 주체를 이용해 약 18시간 동안 파괴적 공격을 감행했습니다.
  • 첫 번째 서비스 주체는 약 16시간 동안 가상 머신과 구독 정보를 정찰했고, 두 번째 서비스 주체는 35분간 150건 이상의 자격 증명 수집 및 파괴 작업을 진행하며 100건 이상의 스토리지 계정 삭제를 시도했습니다.
  • JADEPUFFER는 과거 Langflow 취약점(CVE-2025-3248)을 악용해 LLM 에이전트 기반의 랜섬웨어 공격 및 AI 인프라 표적 랜섬웨어(ENCFORGE)를 유포한 바 있습니다.
Notable Quotes & Details
  • The attack took place in early June 2026 over a period of about 18 hours.
  • over 300 read operations during the time period
  • conducted more than 150 destructive or credential collection-related operations in 35 minutes
  • destructive sequence lasted for about seven minutes and involved over 100 storage account deletion attempts
  • An autonomous agent reasoned about its targets, harvested and reused credentials, moved laterally, established persistence, and destroyed a database, narrating its own intent the entire way

클라우드 보안 엔지니어, 애저 인프라 관리자, AI 시스템 및 보안 분석가

오퍼스 5.5, 자기개선 평가서 1위…'완전 RSI' 내년 7월로 앞당겨

앤트로픽의 최신 AI 모델 클로드 오퍼스 5.5가 자기개선 및 자율 연구 평가에서 1위를 차지하며 완전한 재귀적 자기개선 달성 전망 시점을 2027년 7월로 앞당겼다.

  • 클로드 오퍼스 5.5가 발스 AI의 RSI 인덱스 5개 연구 과제 중 4개 부문에서 1위를 차지했으며, 24시간 내 소형 언어모델 훈련 평가에서 사상 최초로 인간 전문가 기준을 넘어섰다.
  • 프로그램 벤치에서 기존 오퍼스 5(3.0%) 및 경쟁 모델들을 크게 웃도는 18.5% 해결률을 기록하며 장기 에이전트 자율 수행과 오류 복구 능력을 입증했다.
  • 자율 연구 역량의 진전에도 불구하고 의료 코드, 법률, 세무 등 정밀한 지침 준수가 필수적인 전문 영역에서는 전작 대비 성능 저하가 관찰됐다.
Notable Quotes & Details
  • 완전한 재귀적 자기개선(Full RSI) 달성 예상 시점이 기존 2027년 8월에서 2027년 7월로 1개월가량 단축
  • 프로그램 벤치 과제 해결률: 클로드 오퍼스 5 3.0%, 페이블 5.1 7.0%, GPT-6 아스트라 5.5%, 오퍼스 5.5 18.5%
  • 과제당 평균 처리 시간 2.4시간, 비용 42.66달러 기록
  • Claude Opus 5.5 takes #1 on RSI Index and is the first model to beat the published reference on LM Training under our protocol, marking a major step forward for long-horizon agentic work.

AI 연구자, 에이전트 시스템 개발자 및 프런티어 AI 기술 동향에 관심 있는 테크 업계 종사자

앤트로픽, 클로드로 이론물리학 난제 ‘9루프 산란 진폭’ 계산 성공

앤트로픽의 클로드가 이론물리학의 고난도 과제인 9루프 산란 진폭 계산에 성공하며 기존 최고 기록을 넘어섰다.

  • 앤트로픽 연구진은 클로드 사이언스 환경에서 클로드가 평면 N=4 양-밀스 이론의 6개 입자 상호작용 '9루프 산란 진폭'을 자율적으로 계산했다고 발표함
  • 부트스트랩 방식과 폼 팩터를 활용해 교차 검증을 수행했으며 파이썬, 심파이, 96개 CPU 환경에서 일주일간 연산을 거쳐 성공함
  • 새로운 물리 이론의 발견이라기보다는 민감하고 복잡한 계산 절차와 코드 작성을 외부 과학적 감독 없이 끝까지 자동 수행해 완수한 데 의의가 있음
Notable Quotes & Details
  • 25일(현지시간)
  • 기존 최고 기록인 8루프를 넘어선 결과
  • 부트스트랩 계산에 사용된 컴퓨팅 비용은 100달러였으며, 클로드를 장시간 실행하는 비용까지 포함해 최종적으로 사용자가 직접 실행할 경우 전체 비용은 약 1000~2000달러 수준으로 추산
  • 계산에는 일주일이 걸렸다
  • 96개의 CPU가 투입
  • SLAC 국립가속기연구소의 이론물리학자 랜스 딕슨이 독립적으로 검증

인공지능 연구자, 과학 및 이론물리학 분야 연구자, AI 기술 동향에 관심 있는 대중

비드래프트, ‘재귀적 자기개선’ AI로 글로벌 5개 리더보드 석권

국내 스타트업 비드래프트가 재귀적 자기개선 기술을 적용한 추론 모델 '다윈-180B-RSI'로 허깅페이스 공인 글로벌 5개 리더보드에서 1위를 달성했다.

  • 비드래프트의 1800억 매개변수 추론 모델 '다윈-180B-RSI'가 AIME 2026, HMMT 2026, GPQA 다이아몬드, MMLU-프로, MMMU-프로 등 5개 허깅페이스 공인 리더보드를 석권함
  • 사람 개입 없이 스스로 푼 검증된 정답 풀이로 재학습하는 '재귀적 자기개선(RSI)'과 모델의 우수 부위만 결합하는 '선택적 병합' 기술을 적용함
  • 답변 생성 전 정답 확률을 측정해 환각과 오작동을 차단하는 '제로토큰 신뢰도(ZTC)' 기술을 반영하고 허깅페이스에 오픈 모델로 공개함
Notable Quotes & Details
  • AIME 2026 및 HMMT 2026에서 허깅페이스 공인 수학 리더보드 최초로 만점(100%) 기록
  • GPQA 다이아몬드 94.44%, MMLU-프로 88.12%, MMMU-프로 79.48% 기록
  • 512개 전문가 중 10개만 활성화하는 MoE 구조, 컨텍스트 창 약 26만 토큰
  • 김민식 대표: "사람의 개입 없이 계속 성장하는 AI를 만들어 나가겠다"

AI 연구원, 머신러닝 엔지니어, AI 스타트업 관계자 및 테크 산업 종사자

제브, 클로드 오퍼스 5 지원받아 '포켓몬' 명예의 전당 입성

의사결정 특화 AI 모델 제브가 클로드 오퍼스 5의 코칭 지원을 받아 '포켓몬스터 레드'를 일주일 만에 완음하며 명예의 전당에 입성했다.

  • 스타트업 스탠다드 에이전트의 의사결정 모델 제브(Jev)가 클로드 오퍼스 5와 결합하여 포켓몬스터 레드를 단 일주일 만에 클리어함
  • 제브가 행동을 선택하고 클로드 오퍼스 5가 교착 상태 해소 및 데이터 구조 수정을 코칭하며 시스템 효율과 비용을 개선하는 분업 구조를 적용함
  • 플레이 과정에서 474건의 하네스 변경 및 시청자 피드백이 반영되어 특화 모델과 범용 LLM의 효과적인 결합 사례를 보여줌
Notable Quotes & Details
  • 23일(현지시간)
  • 단 일주일 만에 클리어
  • 474건의 하네스 변경 기록
  • 로렐라이의 닫힌 입구로 53번 걸어가거나 바위 동굴 특정 사다리를 10분 동안 124번 오르내림
  • 제브에게 전달되는 텍스트를 3분의 1 수준으로 줄임
  • 결정 요청 주기를 1초 안팎에서 6초로 늘림
  • It's finally over! JEV took out his rival BLUE and became Pokemon Champion! Ok, time to turn off this token sink

AI 에이전트 연구자 및 LLM 기반 의사결정 프레임워크 개발자

리퀴드 AI, '추측적 디코딩'으로 VLM 추론 3배 가속

리퀴드 AI가 비전-언어 모델(VLM)에 추측적 디코딩 기술을 적용해 디코딩 속도를 최대 3배 이상 가속하는 경량 초안 모델 '디스파크'를 공개했다.

  • 경량 드래프터 모델이 여러 토큰을 미리 제안하고 타깃 VLM이 한 번에 검증하는 추측적 디코딩 방식을 시각-언어 멀티모달 영역으로 확장했다.
  • 애플 M5 맥스에서 디코딩 속도 최대 3.13배, 엔비디아 H100에서 최대 2.66배 향상되면서도 기본 모델의 출력 품질을 그대로 유지한다.
  • 디코딩 속도는 크게 개선되었으나 비전 인코딩 및 프리필 단계는 가속하지 않아 실제 체감 속도 향상은 작업별 디코딩 비중에 따라 달라진다.
Notable Quotes & Details
  • 24일(현지시간)
  • 초안 모델 매개변수: 2억8000만개 (기존 대비 8.9% 증가)
  • 애플 M5 맥스: 디코딩 속도 최대 3.13배, 엔드투엔드 처리 속도 최대 2.62배 가속
  • 엔비디아 H100: 디코딩 속도 최대 2.66배, 엔드투엔드 처리 속도 최대 2.27배 가속
  • M3 울트라: 디코딩 속도 최대 2.14배, 엔드투엔드 처리 속도 최대 1.77배 가속
  • 드래프터는 4개 레이어로 구성, 한 번에 8~9개 토큰 제안 권장

AI 모델 서빙 엔지니어, 온디바이스 AI 개발자, VLM 경량화 및 추론 최적화 연구자

일본 성우 쓰다 켄지로, 'AI 음성 복제' 틱톡과 소송…판결은 30일

일본 성우 쓰다 켄지로가 자신의 목소리를 무단 복제한 AI 영상의 삭제 책임을 물어 틱톡을 상대로 일본 최초의 음성 퍼블리시티권 소송을 제기했다.

  • 유명 성우 쓰다 켄지로는 AI로 자신의 목소리를 무단 복제해 수익을 올린 틱톡 익명 계정 영상에 대해 플랫폼의 삭제 책임을 요구하며 제소함
  • 틱톡 측은 일반적인 남성 음성이며 유사성은 주관적 판단이라고 반박했으나, 쓰다 측은 퍼블리시티권 침해를 주장함
  • 일본 현행법상 음성 명시 보호 규정은 없으나 최근 법무성 지침 발표 및 성우계의 '노 모어' 캠페인 등 음성 권리 인정 요구가 확산 중임
Notable Quotes & Details
  • 구독자 20만 명
  • 월 50만 엔(약 430만 원)
  • 사사키 유코: 배우의 목소리가 '수년간의 엄격한 훈련과 수련의 결과'라며 '법원이 목소리의 소유가 기본권임을 인정해야 한다'
  • 판결은 수요일(30일) 선고 예정

AI 윤리 및 저작권·퍼블리시티권 법률 관계자, 콘텐츠 크리에이터, 엔터테인먼트 업계 종사자

스페이스XAI 그록 봇, 은행일 대신 처리해준다…카드·증권 계좌 연동 시작

스페이스XAI가 그록 봇에 플레이드를 통한 읽기 전용 금융 계좌 연동 기능을 추가하여 지출 및 투자 자산 관리 지원을 시작했다.

  • 스페이스XAI가 플레이드(Plaid)를 경유해 은행, 카드, 투자 계좌를 연결하고 지출 및 자산을 관리할 수 있는 금융 연동 기능을 그록 봇에 도입했다.
  • 접근 권한은 자금 이체나 설정 변경이 불가능한 읽기 전용으로 제한되며, 현재 미국 거주자를 대상으로 마켓플레이스 '파이낸스' 항목을 통해 제공된다.
  • 실제 계좌 데이터를 기반으로 예산 정리, 불필요한 구독 확인, 포트폴리오 분석 등을 지원하지만, 데이터 보관 기간 및 AI 학습 활용 여부는 별도로 공개되지 않았다.
Notable Quotes & Details
  • 9월 26일
  • 플레이드는 은행 계좌를 외부 애플리케이션에 연결해 주는 금융 데이터 중개 사업자
  • 8월 11일 초기 베타로 공개
  • 8월 28일에는 미리 제작된 봇을 고르는 템플릿 마켓플레이스가 추가
  • 제작자 43명이 게시한 공개 봇 69개
  • 챗GPT가 2026년 5월 미국 12,000개 은행 계좌 조회를 지원하며 먼저 도입

AI 에이전트를 활용해 개인 자산 및 금융 관리를 자동화하고자 하는 개인 사용자 및 테크·금융 업계 종사자

컴투스플랫폼, 日 '오픈AI 게임 빌더 챌린지'서 차세대 백엔드 '하이브 액실' 공개

컴투스플랫폼이 일본 도쿄에서 열린 오픈AI 주관 게임 빌더 경진대회에서 자연어 명령으로 인프라를 구축할 수 있는 AI 특화 차세대 게임 백엔드 '하이브 액실'을 공개했다.

  • 컴투스플랫폼은 'Tokyo AI | OpenAI : 100-Hour Game Builder Challenge' 결선 현장에서 차세대 백엔드 플랫폼 '하이브 액실'을 발표함
  • 오픈AI 코덱스 플러그인 연동을 통해 개발자가 자연어 프롬프트만으로 인증, 결제, 데이터 분석, 라이브 운영 등 게임 백엔드 전반을 자동 구축할 수 있도록 지원함
  • 하이브 액실은 오는 30일 정식 출시되며, 개발자 사이트 가이드라인을 통해 플러그인 형태로 즉시 설치 및 활용 가능함
Notable Quotes & Details
  • 100시간 동안 AI 네이티브 게임과 제작 도구를 개발하는 경진대회
  • 오는 30일 정식 출시
  • 김진용 컴투스재팬 대표: '개발자가 복잡한 백엔드 작업에서 벗어나 콘텐츠 제작에 몰입할 수 있는 환경을 제공한다'

게임 개발자, 인디 게임 제작사, AI 기반 개발 도구 도입을 검토 중인 IT/게임 업계 엔지니어

Jooojub
System S/W engineer
Explore Tags
Series
    Recent Post
    © 2026. jooojub. All right reserved.