본문으로 건너뛰기

Research

총 44개 기사최근 업데이트: 2026-09-22

research 관련 AI 뉴스와 분석 기사를 모아놓은 토픽 페이지입니다.

로컬 프런티어 AI, 작은 연구실의 반격

Tim Dettmers의 dlab은 소수 GPU와 로컬 장비로 125B·550B급 모델, 장기 에이전트, 자율 연구를 시연하겠다고 예고했다. 과감한 성능 주장과 작은 연구실의 전략을 검증 관점에서 분석한다.

작은 연구실의 경쟁력은 대규모 사전학습이 아니라 압축·추론·에이전트 하네스를 결합해 값싼 문제를 빠르게 푸는 데 있다. 다만 공개 전 성능 주장은 코드·모델·평가셋으로 재현돼야 한다.

수학·AI 자문그룹, 결과 공개의 규칙을 묻다

세계적 수학자 9명이 독립 자문그룹을 만들고 AI 기업의 수학 연구 발표와 대량 결과 공개에 공개 권고를 내놓기로 했다. 검증·귀속·우선권을 함께 다룰 새 연구 거버넌스를 분석한다.

AI가 수학 결과를 대량 생산하는 순간 병목은 발견에서 검증과 공개 순서로 이동한다. 독립 자문은 기업 발표의 신뢰를 높일 수 있지만 권고·근거·이해관계를 공개해야 실질적 제도가 된다.

Transformer Explainer, 어텐션을 만져 배우다

Georgia Tech 연구진의 Transformer Explainer는 GPT-2의 토큰화부터 어텐션·MLP·다음 토큰 확률까지 브라우저에서 풀어낸다. 생성형 AI 교육과 모델 감사에 필요한 시각적 문해력을 분석한다.

생성형 AI의 신뢰는 모델이 낸 문장을 설명하는 데서 끝나지 않는다. 입력이 토큰·벡터·확률로 변하는 과정을 사용자가 직접 조작할 수 있어야 모델의 가능성과 한계를 함께 이해할 수 있다.

TinyBrains, 작은 신경망을 게임 실력으로 겨룬다

TinyBrains는 8KiB부터 크기 등급을 나눠 ONNX 신경망이 전략 게임을 플레이하게 한다. 모델 규모가 아닌 byte당 실력과 재현성을 경쟁 지표로 삼는다.

TinyBrains의 흥미로운 점은 최고 점수보다 제한된 bytes 안에서의 실력을 묻는 데 있다. 효율 경쟁은 모델 크기와 평가 환경을 함께 고정할 때 의미가 생긴다.

두 기원의 뇌, AI가 배울 것은 구조적 겸손이다

New Scientist가 소개한 발달생물학 연구는 뇌의 앞뒤 영역이 서로 다른 progenitor cell에서 나온다고 전한다. AI가 뇌 은유를 쓸 때 더 조심해야 할 이유다.

뇌를 단일 계산 장치로 보는 은유는 점점 거칠어지고 있다. 발달 경로의 복잡성은 AI 연구가 생물학을 빌려올 때 필요한 겸손을 상기시킨다.

무한 파라미터 LLM, 문맥을 가중치로 쓴다

Infinite-Parameter LLM 논문은 실시간 데이터를 프롬프트에 반복해 넣는 대신 하이퍼네트워크가 가중치 변조로 컴파일하는 구조를 제안한다.

긴 문맥과 RAG의 다음 질문은 정보를 어디에 저장하느냐다. 실시간 데이터를 가중치 변조로 바꾸는 접근은 에이전트 메모리의 계산 비용을 다시 설계한다.

Never Give Up, RL은 어려운 문제를 다시 배운다

LLM RL 사후학습의 Matthew Effect는 쉬운 문제만 더 쉬워지는 현상을 드러낸다. NGU는 어려운 문제에 계산을 되돌리는 설계다.

RL 성능 향상 평균값은 쉬운 문제의 개선을 과대대표할 수 있다. 어려운 문제에 신호를 되돌리는 샘플링 정책이 다음 경쟁 축이다.

연구 에이전트는 왜 벤치마크에만 과적합하지 않나

Amazon Science는 연구 에이전트가 압축 가능한 전략을 학습하기 때문에 단순 암기보다 일반화가 가능하다고 설명한다. 벤치마크 경쟁의 새 해석이다.

연구 에이전트가 과적합하지 않는다는 주장은 낙관론이 아니라 평가 설계의 숙제다. 압축 가능한 발견과 시험지 암기를 구분해야 한다.

타오의 경고, 좋은 수학 문제도 비재생 자원이다

테런스 타오는 AI가 좋은 공개 수학 문제를 비재생 방식으로 채굴할 수 있다고 경고했다. 연구 자동화의 병목은 풀이 능력만이 아니라 의미 있는 문제를 만드는 사회적 과정이다.

AI가 연구 문제를 빠르게 풀수록 진짜 희소해지는 것은 답이 아니라 좋은 질문이다. 과학 에이전트 시대에는 문제 발굴, 검증, 출처 기록이 연구 인프라가 된다.

SweepLED, 몰카 탐지를 온디바이스 AI로 낮추다

KAIST 등이 발표한 SweepLED는 1만원 LED와 스마트폰, 딥러닝으로 숨은 카메라를 5초 안에 찾는다. 생활 안전 AI의 제품화 조건을 보여준다.

생활 안전 AI는 거대한 범용 모델보다 싸고 반복 가능한 센서 설계에서 먼저 제품화된다. SweepLED의 핵심은 AI 모델 자체보다 빛을 움직여 구분 가능한 신호를 만드는 하드웨어-소프트웨어 결합이다.

테런스 타오의 수학 설명, AI 교육의 기준

테런스 타오가 여섯 가지 수학 개념을 설명한 영상은 AI 튜터 경쟁에서 정답 생성보다 개념 연결과 사고 과정 설계가 더 중요하다는 점을 보여준다.

AI 튜터의 품질은 문제를 빨리 푸는 능력보다 학생이 개념 사이의 관계를 이해하게 만드는 설명 설계에서 갈린다. 최고 연구자의 설명 영상은 모델 평가에도 좋은 기준점이 된다.

수학 발견 에이전트, 논문보다 검증 로그가 중요하다

Station 논문은 다중 에이전트가 수학 발견을 시도한 사례를 공개했다. 성과보다 중요한 것은 원시 대화, 증명, 검증 코드를 함께 공개했다는 연구 운영 방식이다.

수학 발견 에이전트의 가치는 새 기록 자체보다 추론 과정과 검증 산출물을 공개할 때 커진다. 기업 R&D 에이전트도 결과 보고서보다 재현 가능한 로그와 실패 기록을 제품화해야 한다.

Material Discovery Bench, AI 과학자의 성과보다 실험 가능성을 묻다

Discovered Materials의 벤치마크는 AI가 500개 이상 신소재 후보를 찾았지만 합성 경로는 1개만 그럴듯했다고 보고한다. 검증이 승부처다.

Material Discovery Bench의 핵심은 AI가 후보를 많이 냈다는 낙관이 아니라 실험 가능한 경로를 거의 만들지 못했다는 냉정한 검증이다. AI 과학 제품의 경쟁력은 생성량이 아니라 실험실과 평가 하네스를 통과하는 비율에서 갈린다.

LLM 자기성찰 연구, 의식 논쟁보다 안전 도구에 가깝다

Emergent Introspective Awareness in Large Language Models는 모델이 일부 상황에서 내부 활성 상태를 감지하고 보고할 수 있음을 보인다. 의미는 인공지능 의식 선언보다, 내부 상태를 안전 평가와 해석 가능성에 활용할 수 있는지에 있다.

모델이 내부 상태를 일부 보고할 수 있다는 결과는 'AI가 의식이 있다'는 결론이 아니라 새로운 측정 도구의 가능성이다. 자기보고를 믿는 것이 아니라, 활성 조작과 행동 변화를 함께 보며 안전 평가 신호로 다루는 태도가 필요하다.

WorldClaw, 3D 월드 생성이 에이전트 파이프라인이 되다

Tencent Hunyuan의 WorldClaw는 텍스트에서 대규모 3D 월드를 만드는 과정을 계획, 지형, 지역별 객체 생성으로 나눈다. 게임과 로봇 시뮬레이션의 생성형 제작 방식이 단일 모델에서 에이전트 워크플로로 이동하고 있다.

WorldClaw의 핵심은 3D 생성을 한 번에 끝내는 모델이 아니라 계획, 지형, 객체 배치, 렌더 검수를 나눈 에이전트 시스템으로 본다는 점이다. 생성형 콘텐츠 제작의 병목은 픽셀 품질보다 편집 가능한 구조와 제작 파이프라인 통합으로 옮겨가고 있다.

Ars Notoria, 즉석 지식 욕망의 긴 역사

중세 Ars Notoria 이야기는 AI 학습 도구가 파는 즉석 지식의 약속이 새롭지 않으며, 비용·접근성·검증 문제가 반복된다는 점을 보여준다.

AI 튜터의 가장 오래된 경쟁자는 교과서가 아니라 지름길의 욕망이다. Ars Notoria는 지식을 빠르게 얻고 싶다는 욕망이 언제나 검증, 의례, 권위의 문제와 함께 왔음을 보여준다.

개구리 SVG 벤치마크, 평가의 작은 반란

Habsburg jaw 개구리 SVG 실험은 작은 프롬프트가 모델의 시각적 추론, 지시 준수, 과잉해석을 드러내는 평가 도구가 될 수 있음을 보여준다.

작은 장난처럼 보이는 프롬프트가 모델 평가에서 중요한 이유는 정답률보다 실패 양상을 드러내기 때문이다. 에이전트 제품팀은 거대한 점수표와 함께 이런 현미경형 테스트를 가져야 한다.

Astra 논쟁, 수학 성과와 AGI 착시

OpenAI Astra의 10개 수학·이론컴퓨터과학 성과를 둘러싼 논쟁은 검증 가능한 영역의 진전과 범용지능 서사를 구분해야 함을 보여준다.

Astra의 성과가 크더라도 수학적 검증 가능성이 곧 범용 신뢰성을 뜻하지는 않는다. AI 제품과 연구팀은 능력의 확장을 말할 때 도메인, 실패율, 검증 비용을 함께 공개해야 한다.

Burau 표현 증명, AI 수학 검증의 새 시험지

n=4 braid group의 Burau representation faithful 증명은 순수수학 뉴스지만 AI 시대에는 형식검증과 정리 증명 모델의 좋은 장기 벤치마크가 된다.

AI 수학의 다음 벤치마크는 새 정리를 맞혔다는 선언보다 인간 증명을 기계가 검증 가능한 형태로 옮기는 능력이다. Burau 표현 논문은 그 간극을 보여주는 좋은 실전 과제다.

2026-08-02원본